Le contenu de ce site a été traduit à l'aide de l'intelligence artificielle (IA) ou d'une technologie de traduction automatique, et peut contenir des erreurs.

Skip to content
Artificial Intelligence
Programming Languages

Peut-il éditer ? Évaluation de la capacité des grands modèles linguistiques à suivre des instructions d'édition de code

Author

Federico Cassano (Université Northeastern), Luisa Li (Université Northeastern), Akul Sethi (Université Northeastern), Noah Shinn (Université Northeastern), Abby Brennan-Jones (Wellesley College), Jacob Ginesin (Université Northeastern), Edward Berman (Université Northeastern), George Chakhnashvili (Université Northeastern), Anton Lozhkov (HuggingFace), Carolyn Jane Anderson (Wellesley College), Arjun Guha (Roblox + Université Northeastern)

Venue

Conférence sur la modélisation linguistique (COLM) 2024

Abstract

De nombreuses recherches se concentrent sur le développement et l'évaluation de grands modèles linguistiques pour diverses tâches de synthèse de code. Celles-ci comprennent la synthèse de code à partir du langage naturel, la synthèse de tests à partir de code et la synthèse d'explications de code. En revanche, le comportement de l'édition de code par instruction avec les grands modèles linguistiques est peu étudié. Il s'agit de tâches dans lesquelles le modèle reçoit un bloc de code et une instruction pour modifier ce code. L'instruction d'édition peut demander l'ajout ou la suppression d'une fonctionnalité, décrire un bug et demander une correction, ou demander un autre type de solution. Nous présentons un ensemble de référence soigneusement élaboré de tâches d'édition de code et l'utilisons pour évaluer plusieurs LLM de pointe. Notre évaluation met en évidence un écart significatif entre les capacités des modèles ouverts et fermés de pointe. Par exemple, même GPT-3.5-Turbo est plus performant que le meilleur modèle ouvert pour les tâches d'édition de code. Nous présentons également un nouvel ensemble de données d'entraînement soigneusement sélectionné et sous licence permissive, composé de tâches d'édition de code associées à des instructions en langage naturel. À l'aide de cet ensemble de données d'entraînement, nous montrons qu'il est possible d'affiner les LLM de code ouverts afin d'améliorer considérablement leurs capacités d'édition de code, comblant ainsi l'écart entre les modèles ouverts et fermés. L'ensemble du code, des données et des modèles est disponible sur https://github.com/nuprl/CanItEdit.