Natural Language Processing
Programming Languages
StudentEval:针对代码生成大型语言模型的学生自拟提示词基准测试
Author
Venue
2024年计算语言学协会(ACL)会议成果
Abstract
代码大型语言模型(Code LLMs)正被迅速部署,且有证据表明它们能提升专业程序员的工作效率。当前的代码生成基准测试主要衡量模型在给定专家提示时能否生成正确的程序。本文提出了一项新的基准测试,其中每个问题包含多个提示,这些提示由特定群体——即非专家提示者(初学编程者)——编写。 StudentEval 包含针对 48 个问题的 1,749 条提示,由仅完成一学期 Python 编程课程的 80 名学生编写。我们的学生在与代码 LLM 进行交互式操作时撰写了这些提示,我们观察到其成功率参差不齐。我们利用 StudentEval 对 5 种代码 LLM 进行评估,并发现 StudentEval 比现有基准更能有效区分模型性能。 我们对提示词进行了分析,发现学生们的提示技巧存在显著差异。此外,我们还发现,大语言模型(LLM)的非确定性采样可能会误导学生,使其认为自己的提示词比实际效果更好(或更差),这对如何利用代码大语言模型进行教学具有重要启示。
