Artificial Intelligence
Programming Languages
Peut-il éditer ? Évaluation de la capacité des grands modèles linguistiques à suivre des instructions d'édition de code
Author
Venue
Conférence sur la modélisation linguistique (COLM) 2024
Abstract
De nombreuses recherches se concentrent sur le développement et l'évaluation de grands modèles linguistiques pour diverses tâches de synthèse de code. Celles-ci comprennent la synthèse de code à partir du langage naturel, la synthèse de tests à partir de code et la synthèse d'explications de code. En revanche, le comportement de l'édition de code par instruction avec les grands modèles linguistiques est peu étudié. Il s'agit de tâches dans lesquelles le modèle reçoit un bloc de code et une instruction pour modifier ce code. L'instruction d'édition peut demander l'ajout ou la suppression d'une fonctionnalité, décrire un bug et demander une correction, ou demander un autre type de solution. Nous présentons un ensemble de référence soigneusement élaboré de tâches d'édition de code et l'utilisons pour évaluer plusieurs LLM de pointe. Notre évaluation met en évidence un écart significatif entre les capacités des modèles ouverts et fermés de pointe. Par exemple, même GPT-3.5-Turbo est plus performant que le meilleur modèle ouvert pour les tâches d'édition de code. Nous présentons également un nouvel ensemble de données d'entraînement soigneusement sélectionné et sous licence permissive, composé de tâches d'édition de code associées à des instructions en langage naturel. À l'aide de cet ensemble de données d'entraînement, nous montrons qu'il est possible d'affiner les LLM de code ouverts afin d'améliorer considérablement leurs capacités d'édition de code, comblant ainsi l'écart entre les modèles ouverts et fermés. L'ensemble du code, des données et des modèles est disponible sur https://github.com/nuprl/CanItEdit.
