Artificial Intelligence
Programming Languages
È in grado di modificare? Valutazione della capacità dei modelli linguistici di grandi dimensioni di seguire le istruzioni di modifica del codice
Author
Venue
Conferenza sulla modellizzazione linguistica (COLM) 2024
Abstract
Una parte significativa della ricerca è incentrata sullo sviluppo e la valutazione di modelli linguistici di grandi dimensioni per una varietà di attività di sintesi del codice. Queste includono la sintesi del codice dal linguaggio naturale, la sintesi dei test dal codice e la sintesi delle spiegazioni del codice. Al contrario, il comportamento della modifica del codice istruttivo con i modelli linguistici di grandi dimensioni (LLM) è poco studiato. Si tratta di attività in cui al modello viene fornito un blocco di codice e un'istruzione per modificarlo. L'istruzione di modifica può richiedere l'aggiunta o la rimozione di una funzionalità, descrivere un bug e richiedere una correzione, oppure richiedere un diverso tipo di soluzione. Introduciamo un benchmark accuratamente elaborato di attività di modifica del codice e lo utilizziamo per valutare diversi LLM all'avanguardia. La nostra valutazione mette in luce un divario significativo tra le capacità dei modelli open source e closed source all'avanguardia. Ad esempio, anche GPT-3.5-Turbo è migliore del miglior modello open source nelle attività di modifica del codice. Introduciamo inoltre un nuovo set di dati di addestramento, accuratamente curato e con licenza permissiva, relativo a attività di modifica del codice abbinate a istruzioni in linguaggio naturale. Utilizzando questo set di dati di addestramento, dimostriamo che è possibile mettere a punto i modelli LLM di codice aperti per migliorarne significativamente le capacità di modifica del codice, colmando il divario tra modelli aperti e chiusi. Tutto il codice, i dati e i modelli sono disponibili all'indirizzo https://github.com/nuprl/CanItEdit.
