Die Inhalte dieser Website wurden mithilfe künstlicher Intelligenz (KI) oder maschineller Übersetzungstechnologie übersetzt und können Fehler enthalten.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: Ein Benchmark für von Studierenden verfasste Eingabeaufforderungen für große Sprachmodelle für Code

View Publication

Author

Arjun Guha (Northeastern University + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Northeastern University), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Ergebnisse der Association for Computational Linguistics (ACL) 2024

Abstract

Code-LLMs werden derzeit in rasantem Tempo eingesetzt, und es gibt Hinweise darauf, dass sie die Produktivität professioneller Programmierer steigern können. Aktuelle Benchmarks für die Codegenerierung messen, ob Modelle bei einer von Experten vorgegebenen Eingabe korrekte Programme generieren. In diesem Artikel stellen wir einen neuen Benchmark vor, der mehrere Eingaben pro Aufgabe enthält, die von einer bestimmten Gruppe von Nicht-Experten verfasst wurden: Programmieranfängern. StudentEval enthält 1.749 Eingabeaufforderungen für 48 Probleme, verfasst von 80 Studierenden, die erst ein Semester Python-Programmierung absolviert haben. Unsere Studierenden verfassten diese Eingabeaufforderungen während der interaktiven Arbeit mit einem Code-LLM, und wir beobachteten sehr unterschiedliche Erfolgsraten. Wir verwenden StudentEval zur Bewertung von 5 Code-LLMs und stellen fest, dass StudentEval die Modellleistung besser unterscheidet als bestehende Benchmarks. Wir analysieren die Eingabeaufforderungen und stellen erhebliche Unterschiede in den Eingabetechniken der Studierenden fest. Wir stellen außerdem fest, dass nicht-deterministisches LLM-Sampling die Studierenden zu der Annahme verleiten könnte, ihre Eingabeaufforderungen seien effektiver (oder weniger effektiv) als sie tatsächlich sind, was Auswirkungen darauf hat, wie mit Code-LLMs unterrichtet werden sollte.