تمت ترجمة المحتوى الموجود على هذا الموقع باستخدام الذكاء الاصطناعي (AI) أو تقنية الترجمة الآلية، وقد تحتوي على أخطاء.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: معيار مرجعي للمطالبات المكتوبة من قبل الطلاب لنماذج اللغة الكبيرة الخاصة بالكود

View Publication

Author

أرجون غوها (جامعة نورث إيسترن + روبلوكس)، هانا ماكلين بابي (كلية أوبرلين)، سيدني نغوين (كلية ويلسلي)، يانغتيان زي (جامعة نورث إيسترن)، مولي كيو. فيلدمان (كلية أوبرلين)، كارولين جين أندرسون (كلية ويلسلي)

Venue

نتائج مؤتمر جمعية اللغويات الحاسوبية (ACL) 2024

Abstract

يتم نشر نماذج اللغة الكبيرة (LLM) الخاصة بالكود بسرعة، وهناك أدلة على أنها يمكن أن تجعل المبرمجين المحترفين أكثر إنتاجية. تقيس المعايير الحالية لتوليد الكود ما إذا كانت النماذج تولد برامج صحيحة بناءً على موجه من خبير. في هذه الورقة، نقدم معيارًا جديدًا يحتوي على موجهات متعددة لكل مشكلة، كتبها مجموعة محددة من الموجِّهات غير الخبراء: المبرمجون المبتدئون. يحتوي StudentEval على 1,749 توجيهًا لـ 48 مشكلة، كتبها 80 طالبًا أكملوا فصلًا دراسيًا واحدًا فقط في برمجة Python. كتب طلابنا هذه التوجيهات أثناء العمل التفاعلي مع نموذج LLM للكود، ولاحظنا معدلات نجاح متفاوتة للغاية. نستخدم StudentEval لتقييم 5 نماذج LLM للكود ووجدنا أن StudentEval هو مقياس أفضل لأداء النموذج مقارنة بالمعايير الحالية. نقوم بتحليل المطالبات ونجد تباينًا كبيرًا في تقنيات المطالبة لدى الطلاب. وجدنا أيضًا أن أخذ العينات غير الحتمية من نماذج اللغة الكبيرة (LLM) قد يضلل الطلاب ويجعلهم يعتقدون أن مطالباتهم أكثر (أو أقل) فعالية مما هي عليه في الواقع، مما يؤثر على كيفية التدريس باستخدام نماذج اللغة الكبيرة (LLM) الخاصة بالبرمجة.