या साइटवरील सामग्री कृत्रिम बुद्धिमत्ता (AI) किंवा मशीन भाषांतर तंत्रज्ञानाचा वापर करून भाषांतरित केली आहे आणि त्यात त्रुटी असू शकतात.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: कोडसाठी मोठ्या भाषा मॉडेल्ससाठी विद्यार्थ्यांनी लिहिलेल्या प्रॉम्प्ट्सचे एक बेंचमार्क

View Publication

Author

अर्जुन गुहा (नॉर्थईस्टर्न युनिव्हर्सिटी + रॉब्लॉक्स), हॅना मॅक्लीन बेब (ओबर्लिन कॉलेज), सिडनी गुयेन (वेलेस्ली कॉलेज), यांगटियान झी (नॉर्थईस्टर्न युनिव्हर्सिटी), मॉली क्यू. फेल्डमॅन (ओबर्लिन कॉलेज), कॅरोलिन जेन अँडरसन (वेलेस्ली कॉलेज)

Venue

कंप्युटेशनल भाषाशास्त्र संघटना (ACL) 2024 चे निष्कर्ष

Abstract

कोड एलएलएम झपाट्याने तैनात केले जात आहेत आणि असे पुरावे आहेत की ते व्यावसायिक प्रोग्रामरना अधिक उत्पादक बनवू शकतात. सध्याच्या कोड जनरेशन बेंचमार्कमध्ये मॉडेल्स तज्ज्ञ प्रॉम्प्ट दिल्यास अचूक प्रोग्राम तयार करतात का हे मोजले जाते. या पेपरमध्ये, आम्ही एका विशिष्ट गैर-तज्ज्ञ प्रॉम्प्टर गटाने—प्रारंभिक प्रोग्रामरने—लिहिलेले, प्रत्येक समस्येसाठी अनेक प्रॉम्प्ट्स असलेले नवीन बेंचमार्क सादर करतो. StudentEval मध्ये 48 समस्यांसाठी 1,749 प्रॉम्प्ट्स आहेत, जे फक्त पायथन प्रोग्रामिंगचा एक सेमिस्टर पूर्ण केलेल्या 80 विद्यार्थ्यांनी लिहिले आहेत. आमच्या विद्यार्थ्यांनी हे प्रॉम्प्ट्स Code LLM सोबत इंटरॅक्टिव्हपणे काम करताना लिहिले, आणि आम्ही खूपच मिश्रित यश दर पाहिले. आम्ही 5 Code LLMs चे मूल्यांकन करण्यासाठी StudentEval वापरतो आणि आढळले की StudentEval विद्यमान बेंचमार्कच्या तुलनेत मॉडेलच्या कामगिरीचे चांगले भेद करणारे आहे. आम्ही प्रॉम्प्टचे विश्लेषण करतो आणि विद्यार्थ्यांच्या प्रॉम्प्टिंग तंत्रात लक्षणीय विविधता आढळून आणतो. आम्हाला असेही आढळले की नॉन-डेटर्मिनिस्टिक LLM सॅम्पलिंगमुळे विद्यार्थ्यांना त्यांच्या प्रॉम्प्ट्स प्रत्यक्षात जितके प्रभावी आहेत त्यापेक्षा जास्त (किंवा कमी) प्रभावी असल्याचा गैरसमज होऊ शकतो, ज्याचा कोड LLM वापरून शिकवण्याच्या पद्धतींवर परिणाम होतो.