Artificial Intelligence
Programming Languages
Kan het bewerken? Evaluatie van het vermogen van grote taalmodellen om instructies voor het bewerken van code op te volgen
Author
Venue
Conferentie over taalmodellering (COLM) 2024
Abstract
Een aanzienlijk deel van het onderzoek richt zich op het ontwikkelen en evalueren van grote taalmodellen voor diverse taken op het gebied van codesynthese. Hiertoe behoren het synthetiseren van code uit natuurlijke taal, het synthetiseren van tests uit code en het synthetiseren van uitleg over code. Daarentegen is er nog maar weinig onderzoek gedaan naar het gedrag van instructieve codebewerking met LLM's. Dit zijn taken waarbij het model een blok code en een instructie krijgt om de code aan te passen. De bewerkingsinstructie kan vragen om een functie toe te voegen of te verwijderen, een bug te beschrijven en om een oplossing te vragen, of om een ander soort oplossing te vragen. We introduceren een zorgvuldig samengestelde benchmark van code-bewerkingstaken en gebruiken deze om verschillende geavanceerde LLM's te evalueren. Onze evaluatie legt een aanzienlijke kloof bloot tussen de mogelijkheden van state-of-the-art open en gesloten modellen. Zo presteert zelfs GPT-3.5-Turbo beter dan het beste open model bij code-bewerkingstaken. We introduceren ook een nieuwe, zorgvuldig samengestelde, vrij gelicentieerde trainingsdataset van code-bewerkingstaken in combinatie met instructies in natuurlijke taal. Met behulp van deze trainingsdataset laten we zien dat we open Code LLM's kunnen verfijnen om hun code-bewerkingsmogelijkheden aanzienlijk te verbeteren, waardoor de kloof tussen open en gesloten modellen wordt gedicht. Alle code, gegevens en modellen zijn beschikbaar op https://github.com/nuprl/CanItEdit.
