Artificial Intelligence
Programming Languages
มันสามารถแก้ไขได้หรือไม่? การประเมินความสามารถของโมเดลภาษาขนาดใหญ่ในการปฏิบัติตามคำแนะนำการแก้ไขโค้ด
Author
Venue
การประชุมว่าด้วยการสร้างแบบจำลองภาษา (COLM) ประจำปี 2024
Abstract
งานวิจัยจำนวนมากมุ่งเน้นไปที่การพัฒนาและประเมินโมเดลภาษาขนาดใหญ่สำหรับงานสังเคราะห์โค้ดหลากหลายประเภท ซึ่งรวมถึงการสังเคราะห์โค้ดจากภาษาธรรมชาติ การสังเคราะห์ชุดทดสอบจากโค้ด และการสังเคราะห์คำอธิบายของโค้ด ในทางตรงกันข้าม พฤติกรรมการแก้ไขโค้ดเชิงการสอนโดยใช้ LLM ยังได้รับการศึกษาไม่เพียงพอ งานเหล่านี้เป็นงานที่โมเดลจะได้รับบล็อกของโค้ดและคำแนะนำให้แก้ไขโค้ดดังกล่าว คำแนะนำในการแก้ไขอาจขอให้เพิ่มหรือลบฟีเจอร์, อธิบายข้อบกพร่องและขอให้แก้ไข, หรือขอวิธีแก้ปัญหาประเภทอื่น เราขอแนะนำเกณฑ์มาตรฐานที่ออกแบบอย่างพิถีพิถันสำหรับงานแก้ไขโค้ด และใช้เกณฑ์นี้ในการประเมินประสิทธิภาพของ LLM ชั้นนำหลายตัว การประเมินของเราเผยให้เห็นช่องว่างที่สำคัญระหว่างความสามารถของโมเดลแบบเปิดและแบบปิดที่ทันสมัยที่สุด ตัวอย่างเช่น แม้แต่ GPT-3.5-Turbo ก็ยังทำได้ดีกว่าโมเดลแบบเปิดที่ดีที่สุดในงานแก้ไขโค้ด เรายังแนะนำชุดข้อมูลการฝึกอบรมใหม่ที่ได้รับการคัดสรรอย่างพิถีพิถันและมีใบอนุญาตแบบอนุญาตอย่างกว้างขวาง ซึ่งประกอบด้วยงานแก้ไขโค้ดควบคู่กับคำแนะนำในรูปแบบภาษาธรรมชาติ โดยใช้ชุดข้อมูลการฝึกอบรมนี้ เราแสดงให้เห็นว่าเราสามารถปรับแต่งโมเดล Code LLM แบบเปิดให้มีความสามารถในการแก้ไขโค้ดได้ดีขึ้นอย่างมีนัยสำคัญ ช่วยลดช่องว่างระหว่างโมเดลแบบเปิดและแบบปิด โค้ด ข้อมูล และโมเดลทั้งหมดสามารถดูได้ที่ https://github.com/nuprl/CanItEdit
