El contenido de este sitio se ha traducido mediante inteligencia artificial (IA) o tecnología de traducción automática, y puede contener errores.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: un punto de referencia de indicaciones escritas por estudiantes para grandes modelos de lenguaje de código

View Publication

Author

Arjun Guha (Universidad Northeastern + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Universidad Northeastern), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Resultados de la Asociación de Lingüística Computacional (ACL) 2024

Abstract

Los modelos de lenguaje grande (LLM) para código se están implementando rápidamente y hay pruebas de que pueden aumentar la productividad de los programadores profesionales. Los benchmarks actuales para la generación de código miden si los modelos generan programas correctos a partir de una indicación dada por un experto. En este artículo, presentamos un nuevo benchmark que contiene múltiples indicaciones por problema, redactadas por un grupo específico de personas sin experiencia en la redacción de indicaciones: programadores principiantes. StudentEval contiene 1.749 indicaciones para 48 problemas, redactadas por 80 estudiantes que solo han completado un semestre de programación en Python. Nuestros estudiantes escribieron estas indicaciones mientras trabajaban de forma interactiva con un LLM de código, y observamos tasas de éxito muy dispares. Utilizamos StudentEval para evaluar 5 LLM de código y constatamos que StudentEval es un mejor discriminador del rendimiento de los modelos que los benchmarks existentes. Analizamos las indicaciones y encontramos una variación significativa en las técnicas de los estudiantes a la hora de introducirlas. También observamos que el muestreo no determinista de los LLM podría llevar a los estudiantes a pensar erróneamente que sus indicaciones son más (o menos) efectivas de lo que realmente son, lo que tiene implicaciones sobre cómo enseñar con los LLM de código.