Natural Language Processing
Programming Languages
StudentEval:針對程式碼大型語言模型之學生撰寫提示詞的基準測試
Author
Venue
計算語言學協會(ACL)2024年會研究成果
Abstract
程式碼大型語言模型(Code LLMs)正迅速被部署,且有證據顯示它們能提升專業程式設計師的工作效率。當前程式碼生成的基準測試,主要衡量模型在收到專家提示時能否生成正確的程式。本文提出了一套新的基準測試,其中每個問題包含多個提示,這些提示是由特定群體的非專家提示者——初學程式設計師——所撰寫。 StudentEval 包含針對 48 個問題的 1,749 個提示,由僅完成一學期 Python 程式設計課程的 80 名學生撰寫。我們的學生在與程式碼大型語言模型互動的過程中撰寫這些提示,我們觀察到成功率參差不齊。我們利用 StudentEval 評估 5 種程式碼大型語言模型,並發現 StudentEval 比現有基準更能有效區分模型表現。 我們分析了這些提示語,發現學生在提示技巧上存在顯著差異。我們還發現,非確定性 LLM 採樣可能會誤導學生,使其認為自己的提示語比實際情況更有效(或更無效),這對如何運用程式碼 LLM 進行教學具有重要啟示。
