El contenido de este sitio se ha traducido mediante inteligencia artificial (IA) o tecnología de traducción automática, y puede contener errores.

Skip to content
Artificial Intelligence
Programming Languages

¿Es capaz de editar? Evaluación de la capacidad de los grandes modelos de lenguaje para seguir instrucciones de edición de código

Author

Federico Cassano (Universidad Northeastern), Luisa Li (Universidad Northeastern), Akul Sethi (Universidad Northeastern), Noah Shinn (Universidad Northeastern), Abby Brennan-Jones (Wellesley College), Jacob Ginesin (Universidad Northeastern), Edward Berman (Universidad Northeastern), George Chakhnashvili (Universidad Northeastern), Anton Lozhkov (HuggingFace), Carolyn Jane Anderson (Wellesley College), Arjun Guha (Roblox + Universidad Northeastern)

Venue

Conferencia sobre Modelado del Lenguaje (COLM) 2024

Abstract

Una parte significativa de la investigación se centra en el desarrollo y la evaluación de modelos de lenguaje a gran escala para diversas tareas de síntesis de código. Entre ellas se incluyen la síntesis de código a partir del lenguaje natural, la síntesis de pruebas a partir del código y la síntesis de explicaciones del código. Por el contrario, el comportamiento de la edición de código instructiva con modelos de lenguaje a gran escala (LLM) no se ha estudiado lo suficiente. Se trata de tareas en las que se proporciona al modelo un bloque de código y una instrucción para modificarlo. La instrucción de edición puede solicitar que se añada o elimine una característica, describir un error y pedir una solución, o solicitar un tipo diferente de solución. Presentamos un conjunto de pruebas de referencia cuidadosamente elaborado de tareas de edición de código y lo utilizamos para evaluar varios LLM de vanguardia. Nuestra evaluación pone de manifiesto una brecha significativa entre las capacidades de los modelos abiertos y cerrados de última generación. Por ejemplo, incluso GPT-3.5-Turbo es mejor que el mejor modelo abierto en tareas de edición de código. También presentamos un nuevo conjunto de datos de entrenamiento, cuidadosamente seleccionado y con una licencia permisiva, de tareas de edición de código combinadas con instrucciones en lenguaje natural. Utilizando este conjunto de datos de entrenamiento, demostramos que podemos ajustar los LLM de código abiertos para mejorar significativamente sus capacidades de edición de código, reduciendo la brecha entre los modelos abiertos y los cerrados. Todo el código, los datos y los modelos están disponibles en https://github.com/nuprl/CanItEdit.