StudentEval: Ein Benchmark für von Studierenden verfasste Eingabeaufforderungen für große Sprachmodelle für Code
Author
Venue
Ergebnisse der Association for Computational Linguistics (ACL) 2024
Abstract
Code-LLMs werden derzeit in rasantem Tempo eingesetzt, und es gibt Hinweise darauf, dass sie die Produktivität professioneller Programmierer steigern können. Aktuelle Benchmarks für die Codegenerierung messen, ob Modelle bei einer von Experten vorgegebenen Eingabe korrekte Programme generieren. In diesem Artikel stellen wir einen neuen Benchmark vor, der mehrere Eingaben pro Aufgabe enthält, die von einer bestimmten Gruppe von Nicht-Experten verfasst wurden: Programmieranfängern. StudentEval enthält 1.749 Eingabeaufforderungen für 48 Probleme, verfasst von 80 Studierenden, die erst ein Semester Python-Programmierung absolviert haben. Unsere Studierenden verfassten diese Eingabeaufforderungen während der interaktiven Arbeit mit einem Code-LLM, und wir beobachteten sehr unterschiedliche Erfolgsraten. Wir verwenden StudentEval zur Bewertung von 5 Code-LLMs und stellen fest, dass StudentEval die Modellleistung besser unterscheidet als bestehende Benchmarks. Wir analysieren die Eingabeaufforderungen und stellen erhebliche Unterschiede in den Eingabetechniken der Studierenden fest. Wir stellen außerdem fest, dass nicht-deterministisches LLM-Sampling die Studierenden zu der Annahme verleiten könnte, ihre Eingabeaufforderungen seien effektiver (oder weniger effektiv) als sie tatsächlich sind, was Auswirkungen darauf hat, wie mit Code-LLMs unterrichtet werden sollte.
