I contenuti di questo sito sono stati tradotti mediante intelligenza artificiale (IA) o tecnologia di traduzione automatica e potrebbero contenere errori.

Skip to content
Artificial Intelligence
Programming Languages

È in grado di modificare? Valutazione della capacità dei modelli linguistici di grandi dimensioni di seguire le istruzioni di modifica del codice

Author

Federico Cassano (Northeastern University), Luisa Li (Northeastern University), Akul Sethi (Northeastern University), Noah Shinn (Northeastern University), Abby Brennan-Jones (Wellesley College), Jacob Ginesin (Northeastern University), Edward Berman (Northeastern University), George Chakhnashvili (Northeastern University), Anton Lozhkov (HuggingFace), Carolyn Jane Anderson (Wellesley College), Arjun Guha (Roblox + Northeastern University)

Venue

Conferenza sulla modellizzazione linguistica (COLM) 2024

Abstract

Una parte significativa della ricerca è incentrata sullo sviluppo e la valutazione di modelli linguistici di grandi dimensioni per una varietà di attività di sintesi del codice. Queste includono la sintesi del codice dal linguaggio naturale, la sintesi dei test dal codice e la sintesi delle spiegazioni del codice. Al contrario, il comportamento della modifica del codice istruttivo con i modelli linguistici di grandi dimensioni (LLM) è poco studiato. Si tratta di attività in cui al modello viene fornito un blocco di codice e un'istruzione per modificarlo. L'istruzione di modifica può richiedere l'aggiunta o la rimozione di una funzionalità, descrivere un bug e richiedere una correzione, oppure richiedere un diverso tipo di soluzione. Introduciamo un benchmark accuratamente elaborato di attività di modifica del codice e lo utilizziamo per valutare diversi LLM all'avanguardia. La nostra valutazione mette in luce un divario significativo tra le capacità dei modelli open source e closed source all'avanguardia. Ad esempio, anche GPT-3.5-Turbo è migliore del miglior modello open source nelle attività di modifica del codice. Introduciamo inoltre un nuovo set di dati di addestramento, accuratamente curato e con licenza permissiva, relativo a attività di modifica del codice abbinate a istruzioni in linguaggio naturale. Utilizzando questo set di dati di addestramento, dimostriamo che è possibile mettere a punto i modelli LLM di codice aperti per migliorarne significativamente le capacità di modifica del codice, colmando il divario tra modelli aperti e chiusi. Tutto il codice, i dati e i modelli sono disponibili all'indirizzo https://github.com/nuprl/CanItEdit.