Le contenu de ce site a été traduit à l'aide de l'intelligence artificielle (IA) ou d'une technologie de traduction automatique, et peut contenir des erreurs.

Skip to content
Natural Language Processing
Programming Languages

StudentEval : une référence en matière de prompts rédigés par des étudiants pour les grands modèles linguistiques de code

View Publication

Author

Arjun Guha (Université Northeastern + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Université Northeastern), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Résultats de l'Association for Computational Linguistics (ACL) 2024

Abstract

Les modèles de langage de code (LLM) sont en train d’être déployés à un rythme effréné et il est prouvé qu’ils peuvent améliorer la productivité des programmeurs professionnels. Les benchmarks actuels pour la génération de code évaluent si les modèles génèrent des programmes corrects à partir d’une consigne fournie par un expert. Dans cet article, nous présentons un nouveau benchmark contenant plusieurs consignes par problème, rédigées par un groupe spécifique de rédacteurs non experts : des programmeurs débutants. StudentEval contient 1 749 invites pour 48 problèmes, rédigées par 80 étudiants n'ayant suivi qu'un seul semestre de programmation en Python. Nos étudiants ont rédigé ces invites tout en travaillant de manière interactive avec un LLM de code, et nous avons observé des taux de réussite très variables. Nous utilisons StudentEval pour évaluer 5 LLM de code et constatons que StudentEval est un meilleur indicateur de la performance des modèles que les benchmarks existants. Nous analysons les invites et constatons des variations significatives dans les techniques d'invite des étudiants. Nous constatons également que l'échantillonnage non déterministe des LLM pourrait induire les étudiants en erreur en leur faisant croire que leurs invites sont plus (ou moins) efficaces qu'elles ne le sont en réalité, ce qui a des implications sur la manière d'enseigner avec les LLM de code.