StudentEval: มาตรฐานอ้างอิงของโจทย์ที่เขียนโดยนักเรียนสำหรับโมเดลภาษาขนาดใหญ่ของโค้ด
Author
Venue
ผลการวิจัยของสมาคมภาษาศาสตร์เชิงคำนวณ (ACL) ประจำปี 2024
Abstract
โค้ด LLMs กำลังถูกนำไปใช้อย่างรวดเร็ว และมีหลักฐานว่าพวกมันสามารถทำให้โปรแกรมเมอร์มืออาชีพมีประสิทธิภาพมากขึ้นได้ เกณฑ์มาตรฐานปัจจุบันสำหรับการสร้างโค้ดวัดว่าโมเดลสามารถสร้างโปรแกรมที่ถูกต้องตามคำแนะนำของผู้เชี่ยวชาญได้หรือไม่ ในบทความนี้ เราขอนำเสนอเกณฑ์มาตรฐานใหม่ที่มีคำแนะนำหลายข้อต่อปัญหาหนึ่ง ซึ่งเขียนโดยกลุ่มผู้ให้คำแนะนำที่ไม่ใช่ผู้เชี่ยวชาญ: โปรแกรมเมอร์มือใหม่ StudentEval ประกอบด้วยคำแนะนำจำนวน 1,749 ข้อ สำหรับปัญหา 48 ข้อ ซึ่งเขียนโดยนักเรียน 80 คน ที่เพิ่งจบการศึกษาในภาคการศึกษาเดียวของวิชาการเขียนโปรแกรม Python นักเรียนของเราเขียนคำแนะนำเหล่านี้ในขณะที่ทำงานร่วมกับ Code LLM แบบโต้ตอบ และเราสังเกตเห็นอัตราความสำเร็จที่หลากหลายมาก เราใช้ StudentEval เพื่อประเมิน Code LLM จำนวน 5 ตัว และพบว่า StudentEval เป็นตัวชี้วัดที่ดีกว่าในการแยกแยะประสิทธิภาพของแบบจำลองเมื่อเทียบกับมาตรฐานที่มีอยู่ เราวิเคราะห์คำแนะนำและพบความแตกต่างอย่างมีนัยสำคัญในเทคนิคการให้คำแนะนำของนักเรียน นอกจากนี้เรายังพบว่าการสุ่มตัวอย่าง LLM ที่ไม่กำหนดแน่นอนอาจทำให้นักเรียนเข้าใจผิดว่าคำแนะนำของพวกเขามีประสิทธิภาพมากกว่า (หรือน้อยกว่า) ที่แท้จริง ซึ่งส่งผลต่อวิธีการสอนด้วย Code LLM
