StudentEval: un punto de referencia de indicaciones escritas por estudiantes para grandes modelos de lenguaje de código
Author
Venue
Resultados de la Asociación de Lingüística Computacional (ACL) 2024
Abstract
Los modelos de lenguaje grande (LLM) para código se están implementando rápidamente y hay pruebas de que pueden aumentar la productividad de los programadores profesionales. Los benchmarks actuales para la generación de código miden si los modelos generan programas correctos a partir de una indicación dada por un experto. En este artículo, presentamos un nuevo benchmark que contiene múltiples indicaciones por problema, redactadas por un grupo específico de personas sin experiencia en la redacción de indicaciones: programadores principiantes. StudentEval contiene 1.749 indicaciones para 48 problemas, redactadas por 80 estudiantes que solo han completado un semestre de programación en Python. Nuestros estudiantes escribieron estas indicaciones mientras trabajaban de forma interactiva con un LLM de código, y observamos tasas de éxito muy dispares. Utilizamos StudentEval para evaluar 5 LLM de código y constatamos que StudentEval es un mejor discriminador del rendimiento de los modelos que los benchmarks existentes. Analizamos las indicaciones y encontramos una variación significativa en las técnicas de los estudiantes a la hora de introducirlas. También observamos que el muestreo no determinista de los LLM podría llevar a los estudiantes a pensar erróneamente que sus indicaciones son más (o menos) efectivas de lo que realmente son, lo que tiene implicaciones sobre cómo enseñar con los LLM de código.
