本網站內容使用人工智慧(AI)或機器翻譯技術翻譯,可能存在錯誤。

Skip to content
Natural Language Processing
Programming Languages

StudentEval:針對程式碼大型語言模型之學生撰寫提示詞的基準測試

View Publication

Author

阿琼·古哈(東北大學 + Roblox)、漢娜·麥克林·貝貝(奧伯林學院)、雪梨·阮(韋爾斯利學院)、子陽天(東北大學)、莫莉·Q·費爾德曼(奧伯林學院)、卡羅琳·珍·安德森(韋爾斯利學院)

Venue

計算語言學協會(ACL)2024年會研究成果

Abstract

程式碼大型語言模型(Code LLMs)正迅速被部署,且有證據顯示它們能提升專業程式設計師的工作效率。當前程式碼生成的基準測試,主要衡量模型在收到專家提示時能否生成正確的程式。本文提出了一套新的基準測試,其中每個問題包含多個提示,這些提示是由特定群體的非專家提示者——初學程式設計師——所撰寫。 StudentEval 包含針對 48 個問題的 1,749 個提示,由僅完成一學期 Python 程式設計課程的 80 名學生撰寫。我們的學生在與程式碼大型語言模型互動的過程中撰寫這些提示,我們觀察到成功率參差不齊。我們利用 StudentEval 評估 5 種程式碼大型語言模型,並發現 StudentEval 比現有基準更能有效區分模型表現。 我們分析了這些提示語,發現學生在提示技巧上存在顯著差異。我們還發現,非確定性 LLM 採樣可能會誤導學生,使其認為自己的提示語比實際情況更有效(或更無效),這對如何運用程式碼 LLM 進行教學具有重要啟示。