เนื้อหาในเว็บไซต์นี้ได้รับการแปลโดยใช้ปัญญาประดิษฐ์ (AI) หรือเทคโนโลยีการแปลด้วยเครื่อง และอาจมีข้อผิดพลาด

Skip to content
Natural Language Processing
Programming Languages

StudentEval: มาตรฐานอ้างอิงของโจทย์ที่เขียนโดยนักเรียนสำหรับโมเดลภาษาขนาดใหญ่ของโค้ด

View Publication

Author

อรชุน กูฮา (มหาวิทยาลัยนอร์ทอีสเทิร์น + Roblox), ฮันนาห์ แมคลีน เบเบ (วิทยาลัยโอเบอร์ลิน), ซิดนีย์ เหงียน (วิทยาลัยเวลเลสลีย์), หยางเทียน จื่อ (มหาวิทยาลัยนอร์ทอีสเทิร์น), มอลลี่ คิว เฟลด์แมน (วิทยาลัยโอเบอร์ลิน), แครอลีน เจน แอนเดอร์สัน (วิทยาลัยเวลเลสลีย์)

Venue

ผลการวิจัยของสมาคมภาษาศาสตร์เชิงคำนวณ (ACL) ประจำปี 2024

Abstract

โค้ด LLMs กำลังถูกนำไปใช้อย่างรวดเร็ว และมีหลักฐานว่าพวกมันสามารถทำให้โปรแกรมเมอร์มืออาชีพมีประสิทธิภาพมากขึ้นได้ เกณฑ์มาตรฐานปัจจุบันสำหรับการสร้างโค้ดวัดว่าโมเดลสามารถสร้างโปรแกรมที่ถูกต้องตามคำแนะนำของผู้เชี่ยวชาญได้หรือไม่ ในบทความนี้ เราขอนำเสนอเกณฑ์มาตรฐานใหม่ที่มีคำแนะนำหลายข้อต่อปัญหาหนึ่ง ซึ่งเขียนโดยกลุ่มผู้ให้คำแนะนำที่ไม่ใช่ผู้เชี่ยวชาญ: โปรแกรมเมอร์มือใหม่ StudentEval ประกอบด้วยคำแนะนำจำนวน 1,749 ข้อ สำหรับปัญหา 48 ข้อ ซึ่งเขียนโดยนักเรียน 80 คน ที่เพิ่งจบการศึกษาในภาคการศึกษาเดียวของวิชาการเขียนโปรแกรม Python นักเรียนของเราเขียนคำแนะนำเหล่านี้ในขณะที่ทำงานร่วมกับ Code LLM แบบโต้ตอบ และเราสังเกตเห็นอัตราความสำเร็จที่หลากหลายมาก เราใช้ StudentEval เพื่อประเมิน Code LLM จำนวน 5 ตัว และพบว่า StudentEval เป็นตัวชี้วัดที่ดีกว่าในการแยกแยะประสิทธิภาพของแบบจำลองเมื่อเทียบกับมาตรฐานที่มีอยู่ เราวิเคราะห์คำแนะนำและพบความแตกต่างอย่างมีนัยสำคัญในเทคนิคการให้คำแนะนำของนักเรียน นอกจากนี้เรายังพบว่าการสุ่มตัวอย่าง LLM ที่ไม่กำหนดแน่นอนอาจทำให้นักเรียนเข้าใจผิดว่าคำแนะนำของพวกเขามีประสิทธิภาพมากกว่า (หรือน้อยกว่า) ที่แท้จริง ซึ่งส่งผลต่อวิธีการสอนด้วย Code LLM