De content op deze site is vertaald met behulp van kunstmatige intelligentie (AI) of machinevertalingstechnologie en kan fouten bevatten.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: Een benchmark van door studenten geschreven prompts voor grote taalmodellen voor code

View Publication

Author

Arjun Guha (Northeastern University + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Northeastern University), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Bevindingen van de Association for Computational Linguistics (ACL) 2024

Abstract

Code LLM's worden in hoog tempo ingezet en er zijn aanwijzingen dat ze professionele programmeurs productiever kunnen maken. Huidige benchmarks voor codegeneratie meten of modellen correcte programma's genereren op basis van een prompt van een expert. In dit artikel presenteren we een nieuwe benchmark met meerdere prompts per probleem, geschreven door een specifieke groep niet-deskundige prompters: beginnende programmeurs. StudentEval bevat 1.749 prompts voor 48 problemen, geschreven door 80 studenten die slechts één semester Python-programmering hebben gevolgd. Onze studenten schreven deze prompts terwijl ze interactief met een Code LLM werkten, en we constateerden zeer uiteenlopende succespercentages. We gebruiken StudentEval om 5 Code LLM's te evalueren en constateren dat StudentEval een betere indicator is voor modelprestaties dan bestaande benchmarks. We analyseren de prompts en constateren aanzienlijke variatie in de prompttechnieken van studenten. We constateren ook dat niet-deterministische LLM-sampling studenten zou kunnen misleiden door hen te laten denken dat hun prompts effectiever (of minder effectief) zijn dan ze in werkelijkheid zijn, wat implicaties heeft voor de manier waarop met Code LLM's wordt lesgegeven.