Die Inhalte dieser Website wurden mithilfe künstlicher Intelligenz (KI) oder maschineller Übersetzungstechnologie übersetzt und können Fehler enthalten.

Skip to content
Artificial Intelligence
Programming Languages

Kann es bearbeiten? Bewertung der Fähigkeit großer Sprachmodelle, Anweisungen zur Code-Bearbeitung zu befolgen

Author

Federico Cassano (Northeastern University), Luisa Li (Northeastern University), Akul Sethi (Northeastern University), Noah Shinn (Northeastern University), Abby Brennan-Jones (Wellesley College), Jacob Ginesin (Northeastern University), Edward Berman (Northeastern University), George Chakhnashvili (Northeastern University), Anton Lozhkov (HuggingFace), Carolyn Jane Anderson (Wellesley College), Arjun Guha (Roblox + Northeastern University)

Venue

Konferenz zur Sprachmodellierung (COLM) 2024

Abstract

Ein Großteil der Forschung konzentriert sich auf die Entwicklung und Bewertung großer Sprachmodelle für eine Vielzahl von Aufgaben der Codesynthese. Dazu gehören die Synthese von Code aus natürlicher Sprache, die Synthese von Tests aus Code und die Synthese von Erklärungen zu Code. Im Gegensatz dazu ist das Verhalten bei der Bearbeitung von Anweisungscode mit LLMs noch wenig erforscht. Dabei handelt es sich um Aufgaben, bei denen dem Modell ein Code-Block und eine Anweisung zur Änderung des Codes bereitgestellt werden. Die Bearbeitungsanweisung kann das Hinzufügen oder Entfernen einer Funktion verlangen, einen Fehler beschreiben und nach einer Korrektur fragen oder eine andere Art von Lösung verlangen. Wir stellen einen sorgfältig ausgearbeiteten Benchmark für Code-Bearbeitungsaufgaben vor und nutzen ihn zur Bewertung mehrerer modernster LLMs. Unsere Auswertung deckt eine erhebliche Lücke zwischen den Fähigkeiten von Open-Source- und proprietären Modellen auf dem neuesten Stand der Technik auf. So ist beispielsweise sogar GPT-3.5-Turbo bei Code-Bearbeitungsaufgaben besser als das beste Open-Source-Modell. Wir stellen außerdem einen neuen, sorgfältig zusammengestellten und unter einer freizügigen Lizenz stehenden Trainingsdatensatz für Code-Bearbeitungsaufgaben vor, der mit Anweisungen in natürlicher Sprache gekoppelt ist. Anhand dieses Trainingsdatensatzes zeigen wir, dass wir offene Code-LLMs feinabstimmen können, um ihre Code-Bearbeitungsfähigkeiten deutlich zu verbessern und so die Lücke zwischen offenen und geschlossenen Modellen zu schließen. Der gesamte Code, alle Daten und Modelle sind unter https://github.com/nuprl/CanItEdit verfügbar.