StudentEval: कोडसाठी मोठ्या भाषा मॉडेल्ससाठी विद्यार्थ्यांनी लिहिलेल्या प्रॉम्प्ट्सचे एक बेंचमार्क
Author
Venue
कंप्युटेशनल भाषाशास्त्र संघटना (ACL) 2024 चे निष्कर्ष
Abstract
कोड एलएलएम झपाट्याने तैनात केले जात आहेत आणि असे पुरावे आहेत की ते व्यावसायिक प्रोग्रामरना अधिक उत्पादक बनवू शकतात. सध्याच्या कोड जनरेशन बेंचमार्कमध्ये मॉडेल्स तज्ज्ञ प्रॉम्प्ट दिल्यास अचूक प्रोग्राम तयार करतात का हे मोजले जाते. या पेपरमध्ये, आम्ही एका विशिष्ट गैर-तज्ज्ञ प्रॉम्प्टर गटाने—प्रारंभिक प्रोग्रामरने—लिहिलेले, प्रत्येक समस्येसाठी अनेक प्रॉम्प्ट्स असलेले नवीन बेंचमार्क सादर करतो. StudentEval मध्ये 48 समस्यांसाठी 1,749 प्रॉम्प्ट्स आहेत, जे फक्त पायथन प्रोग्रामिंगचा एक सेमिस्टर पूर्ण केलेल्या 80 विद्यार्थ्यांनी लिहिले आहेत. आमच्या विद्यार्थ्यांनी हे प्रॉम्प्ट्स Code LLM सोबत इंटरॅक्टिव्हपणे काम करताना लिहिले, आणि आम्ही खूपच मिश्रित यश दर पाहिले. आम्ही 5 Code LLMs चे मूल्यांकन करण्यासाठी StudentEval वापरतो आणि आढळले की StudentEval विद्यमान बेंचमार्कच्या तुलनेत मॉडेलच्या कामगिरीचे चांगले भेद करणारे आहे. आम्ही प्रॉम्प्टचे विश्लेषण करतो आणि विद्यार्थ्यांच्या प्रॉम्प्टिंग तंत्रात लक्षणीय विविधता आढळून आणतो. आम्हाला असेही आढळले की नॉन-डेटर्मिनिस्टिक LLM सॅम्पलिंगमुळे विद्यार्थ्यांना त्यांच्या प्रॉम्प्ट्स प्रत्यक्षात जितके प्रभावी आहेत त्यापेक्षा जास्त (किंवा कमी) प्रभावी असल्याचा गैरसमज होऊ शकतो, ज्याचा कोड LLM वापरून शिकवण्याच्या पद्धतींवर परिणाम होतो.
