StudentEval: Een benchmark van door studenten geschreven prompts voor grote taalmodellen voor code
Author
Venue
Bevindingen van de Association for Computational Linguistics (ACL) 2024
Abstract
Code LLM's worden in hoog tempo ingezet en er zijn aanwijzingen dat ze professionele programmeurs productiever kunnen maken. Huidige benchmarks voor codegeneratie meten of modellen correcte programma's genereren op basis van een prompt van een expert. In dit artikel presenteren we een nieuwe benchmark met meerdere prompts per probleem, geschreven door een specifieke groep niet-deskundige prompters: beginnende programmeurs. StudentEval bevat 1.749 prompts voor 48 problemen, geschreven door 80 studenten die slechts één semester Python-programmering hebben gevolgd. Onze studenten schreven deze prompts terwijl ze interactief met een Code LLM werkten, en we constateerden zeer uiteenlopende succespercentages. We gebruiken StudentEval om 5 Code LLM's te evalueren en constateren dat StudentEval een betere indicator is voor modelprestaties dan bestaande benchmarks. We analyseren de prompts en constateren aanzienlijke variatie in de prompttechnieken van studenten. We constateren ook dat niet-deterministische LLM-sampling studenten zou kunnen misleiden door hen te laten denken dat hun prompts effectiever (of minder effectief) zijn dan ze in werkelijkheid zijn, wat implicaties heeft voor de manier waarop met Code LLM's wordt lesgegeven.
