O conteúdo deste site foi traduzido usando inteligência artificial (IA) ou tecnologia de tradução automática e pode conter erros.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: Uma referência de prompts escritos por estudantes para grandes modelos de linguagem de código

View Publication

Author

Arjun Guha (Universidade Northeastern + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Universidade Northeastern), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Resultados da Associação de Linguística Computacional (ACL) 2024

Abstract

Os LLMs de código estão sendo rapidamente implantados e há evidências de que podem tornar os programadores profissionais mais produtivos. Os benchmarks atuais para geração de código medem se os modelos geram programas corretos a partir de um prompt fornecido por um especialista. Neste artigo, apresentamos um novo benchmark contendo múltiplos prompts por problema, escritos por um grupo específico de criadores de prompts não especialistas: programadores iniciantes. O StudentEval contém 1.749 prompts para 48 problemas, escritos por 80 estudantes que concluíram apenas um semestre de programação em Python. Nossos estudantes escreveram esses prompts enquanto trabalhavam interativamente com um LLM de código, e observamos taxas de sucesso muito variadas. Utilizamos o StudentEval para avaliar 5 LLMs de código e constatamos que o StudentEval é um melhor discriminador do desempenho do modelo do que os benchmarks existentes. Analisamos as instruções e constatamos uma variação significativa nas técnicas de criação de instruções dos alunos. Também descobrimos que a amostragem não determinística de LLMs pode induzir os alunos a pensar que suas instruções são mais (ou menos) eficazes do que realmente são, o que tem implicações sobre como ensinar com LLMs de código.