StudentEval: Uma referência de prompts escritos por estudantes para grandes modelos de linguagem de código
Author
Venue
Resultados da Associação de Linguística Computacional (ACL) 2024
Abstract
Os LLMs de código estão sendo rapidamente implantados e há evidências de que podem tornar os programadores profissionais mais produtivos. Os benchmarks atuais para geração de código medem se os modelos geram programas corretos a partir de um prompt fornecido por um especialista. Neste artigo, apresentamos um novo benchmark contendo múltiplos prompts por problema, escritos por um grupo específico de criadores de prompts não especialistas: programadores iniciantes. O StudentEval contém 1.749 prompts para 48 problemas, escritos por 80 estudantes que concluíram apenas um semestre de programação em Python. Nossos estudantes escreveram esses prompts enquanto trabalhavam interativamente com um LLM de código, e observamos taxas de sucesso muito variadas. Utilizamos o StudentEval para avaliar 5 LLMs de código e constatamos que o StudentEval é um melhor discriminador do desempenho do modelo do que os benchmarks existentes. Analisamos as instruções e constatamos uma variação significativa nas técnicas de criação de instruções dos alunos. Também descobrimos que a amostragem não determinística de LLMs pode induzir os alunos a pensar que suas instruções são mais (ou menos) eficazes do que realmente são, o que tem implicações sobre como ensinar com LLMs de código.
