StudentEval: Một tiêu chuẩn đánh giá các lời nhắc do sinh viên viết cho các mô hình ngôn ngữ lớn về mã nguồn
Author
Venue
Kết quả của Hiệp hội Ngôn ngữ học Tính toán (ACL) 2024
Abstract
Các mô hình ngôn ngữ lớn (LLMs) về mã nguồn đang được triển khai nhanh chóng và có bằng chứng cho thấy chúng có thể giúp các lập trình viên chuyên nghiệp làm việc hiệu quả hơn. Các tiêu chuẩn đánh giá hiện tại về sinh mã nguồn đo lường xem các mô hình có thể tạo ra các chương trình chính xác khi được cung cấp một lời nhắc chuyên gia hay không. Trong bài báo này, chúng tôi giới thiệu một tiêu chuẩn đánh giá mới chứa nhiều lời nhắc cho mỗi bài toán, được viết bởi một nhóm người dùng không chuyên: các lập trình viên mới bắt đầu. StudentEval bao gồm 1.749 lời nhắc cho 48 bài toán, được viết bởi 80 sinh viên chỉ mới hoàn thành một học kỳ học lập trình Python. Các sinh viên của chúng tôi đã viết các lời nhắc này trong quá trình làm việc tương tác với một mô hình ngôn ngữ lớn (LLM) về mã nguồn, và chúng tôi quan sát thấy tỷ lệ thành công rất đa dạng. Chúng tôi sử dụng StudentEval để đánh giá 5 mô hình ngôn ngữ lớn (LLM) về mã nguồn và phát hiện ra rằng StudentEval là một tiêu chuẩn đánh giá hiệu suất mô hình tốt hơn so với các tiêu chuẩn hiện có. Chúng tôi phân tích các lời nhắc và phát hiện sự biến động đáng kể trong kỹ thuật tạo lời nhắc của sinh viên. Chúng tôi cũng nhận thấy rằng việc lấy mẫu không xác định của LLM có thể khiến sinh viên hiểu lầm rằng lời nhắc của họ hiệu quả hơn (hoặc kém hiệu quả hơn) so với thực tế, điều này có ý nghĩa đối với cách giảng dạy sử dụng các mô hình ngôn ngữ lớn (LLM) về lập trình.
