StudentEval: कोड के लिए बड़े भाषा मॉडल के छात्र-लिखित प्रॉम्प्ट्स का एक बेंचमार्क
Author
Venue
कंप्यूटेशनल भाषाविज्ञान संघ (ACL) 2024 के निष्कर्ष
Abstract
कोड एलएलएम को तेजी से तैनात किया जा रहा है और ऐसे सबूत हैं कि वे पेशेवर प्रोग्रामरों को अधिक उत्पादक बना सकते हैं। कोड जेनरेशन के लिए वर्तमान बेंचमार्क यह मापते हैं कि विशेषज्ञ प्रॉम्प्ट दिए जाने पर मॉडल सही प्रोग्राम बनाते हैं या नहीं। इस पेपर में, हम एक नया बेंचमार्क प्रस्तुत करते हैं जिसमें प्रति समस्या कई प्रॉम्प्ट होते हैं, जो गैर-विशेषज्ञ प्रॉम्प्टर के एक विशिष्ट समूह: शुरुआती प्रोग्रामरों द्वारा लिखे गए हैं। StudentEval में 48 समस्याओं के लिए 1,749 प्रॉम्प्ट्स शामिल हैं, जो 80 छात्रों द्वारा लिखे गए हैं जिन्होंने पाइथन प्रोग्रामिंग का केवल एक सेमेस्टर पूरा किया है। हमारे छात्रों ने ये प्रॉम्प्ट्स एक कोड एलएलएम (Code LLM) के साथ इंटरैक्टिव रूप से काम करते हुए लिखे, और हमने बहुत मिली-जुली सफलता दर देखी। हम 5 कोड एलएलएम का मूल्यांकन करने के लिए StudentEval का उपयोग करते हैं और पाते हैं कि StudentEval मौजूदा बेंचमार्क की तुलना में मॉडल के प्रदर्शन का बेहतर विभेदक है। हम प्रॉम्प्ट्स का विश्लेषण करते हैं और छात्रों की प्रॉम्प्टिंग तकनीकों में महत्वपूर्ण भिन्नता पाते हैं। हम यह भी पाते हैं कि गैर-निर्धारित एलएलएम सैंपलिंग छात्रों को यह सोचने के लिए गुमराह कर सकती है कि उनके प्रॉम्प्ट वास्तव में जितने प्रभावी हैं, उससे कहीं अधिक (या कम) प्रभावी हैं, जिसका कोड एलएलएम के साथ पढ़ाने के तरीकों पर प्रभाव पड़ता है।
