StudentEval: un benchmark di prompt scritti dagli studenti per modelli linguistici di grandi dimensioni dedicati al codice
Author
Venue
Risultati dell'Associazione di Linguistica Computazionale (ACL) 2024
Abstract
I modelli LLM di codice stanno venendo implementati rapidamente e ci sono prove che possano rendere i programmatori professionisti più produttivi. Gli attuali benchmark per la generazione di codice misurano se i modelli generano programmi corretti a fronte di un prompt fornito da un esperto. In questo articolo, presentiamo un nuovo benchmark contenente più prompt per ogni problema, scritti da una popolazione specifica di autori di prompt non esperti: i programmatori principianti. StudentEval contiene 1.749 prompt per 48 problemi, scritti da 80 studenti che hanno completato solo un semestre di programmazione in Python. I nostri studenti hanno scritto questi prompt mentre lavoravano in modo interattivo con un LLM di codice e abbiamo osservato tassi di successo molto variabili. Utilizziamo StudentEval per valutare 5 LLM di codice e abbiamo riscontrato che StudentEval è un discriminatore delle prestazioni del modello migliore rispetto ai benchmark esistenti. Analizziamo i prompt e riscontriamo una variazione significativa nelle tecniche di prompting degli studenti. Abbiamo inoltre riscontrato che il campionamento non deterministico degli LLM potrebbe indurre gli studenti a pensare che i loro prompt siano più (o meno) efficaci di quanto non siano in realtà, il che ha implicazioni su come insegnare con i Code LLM.
