I contenuti di questo sito sono stati tradotti mediante intelligenza artificiale (IA) o tecnologia di traduzione automatica e potrebbero contenere errori.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: un benchmark di prompt scritti dagli studenti per modelli linguistici di grandi dimensioni dedicati al codice

View Publication

Author

Arjun Guha (Northeastern University + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Northeastern University), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Risultati dell'Associazione di Linguistica Computazionale (ACL) 2024

Abstract

I modelli LLM di codice stanno venendo implementati rapidamente e ci sono prove che possano rendere i programmatori professionisti più produttivi. Gli attuali benchmark per la generazione di codice misurano se i modelli generano programmi corretti a fronte di un prompt fornito da un esperto. In questo articolo, presentiamo un nuovo benchmark contenente più prompt per ogni problema, scritti da una popolazione specifica di autori di prompt non esperti: i programmatori principianti. StudentEval contiene 1.749 prompt per 48 problemi, scritti da 80 studenti che hanno completato solo un semestre di programmazione in Python. I nostri studenti hanno scritto questi prompt mentre lavoravano in modo interattivo con un LLM di codice e abbiamo osservato tassi di successo molto variabili. Utilizziamo StudentEval per valutare 5 LLM di codice e abbiamo riscontrato che StudentEval è un discriminatore delle prestazioni del modello migliore rispetto ai benchmark esistenti. Analizziamo i prompt e riscontriamo una variazione significativa nelle tecniche di prompting degli studenti. Abbiamo inoltre riscontrato che il campionamento non deterministico degli LLM potrebbe indurre gli studenti a pensare che i loro prompt siano più (o meno) efficaci di quanto non siano in realtà, il che ha implicazioni su come insegnare con i Code LLM.