StudentEval: معيار مرجعي للمطالبات المكتوبة من قبل الطلاب لنماذج اللغة الكبيرة الخاصة بالكود
Author
Venue
نتائج مؤتمر جمعية اللغويات الحاسوبية (ACL) 2024
Abstract
يتم نشر نماذج اللغة الكبيرة (LLM) الخاصة بالكود بسرعة، وهناك أدلة على أنها يمكن أن تجعل المبرمجين المحترفين أكثر إنتاجية. تقيس المعايير الحالية لتوليد الكود ما إذا كانت النماذج تولد برامج صحيحة بناءً على موجه من خبير. في هذه الورقة، نقدم معيارًا جديدًا يحتوي على موجهات متعددة لكل مشكلة، كتبها مجموعة محددة من الموجِّهات غير الخبراء: المبرمجون المبتدئون. يحتوي StudentEval على 1,749 توجيهًا لـ 48 مشكلة، كتبها 80 طالبًا أكملوا فصلًا دراسيًا واحدًا فقط في برمجة Python. كتب طلابنا هذه التوجيهات أثناء العمل التفاعلي مع نموذج LLM للكود، ولاحظنا معدلات نجاح متفاوتة للغاية. نستخدم StudentEval لتقييم 5 نماذج LLM للكود ووجدنا أن StudentEval هو مقياس أفضل لأداء النموذج مقارنة بالمعايير الحالية. نقوم بتحليل المطالبات ونجد تباينًا كبيرًا في تقنيات المطالبة لدى الطلاب. وجدنا أيضًا أن أخذ العينات غير الحتمية من نماذج اللغة الكبيرة (LLM) قد يضلل الطلاب ويجعلهم يعتقدون أن مطالباتهم أكثر (أو أقل) فعالية مما هي عليه في الواقع، مما يؤثر على كيفية التدريس باستخدام نماذج اللغة الكبيرة (LLM) الخاصة بالبرمجة.
