StudentEval: কোডের বৃহৎ ভাষামডেলের জন্য ছাত্র-লিখিত প্রম্পটগুলির একটি বেঞ্চমার্ক
Author
Venue
কম্পিউটেশনাল ভাষাবিজ্ঞান সমিতি (ACL) 2024-এর ফলাফল
Abstract
কোড এলএলএমগুলো দ্রুত মোতায়েন করা হচ্ছে এবং প্রমাণ রয়েছে যে এগুলো পেশাদার প্রোগ্রামারদের আরও উৎপাদনশীল করে তুলতে পারে। বর্তমান কোড জেনারেশনের বেঞ্চমার্কগুলো পরিমাপ করে যে মডেলগুলো বিশেষজ্ঞ প্রম্পট দিলে সঠিক প্রোগ্রাম তৈরি করে কিনা। এই প্রবন্ধে, আমরা একটি নতুন বেঞ্চমার্ক উপস্থাপন করছি, যেখানে প্রতি সমস্যার জন্য একাধিক প্রম্পট রয়েছে, যা অ-বিশেষজ্ঞ প্রম্পটারদের একটি নির্দিষ্ট জনগোষ্ঠী—নবীন প্রোগ্রামারদের—দ্বারা লেখা হয়েছে। StudentEval-এ ৪৮টি সমস্যার জন্য ১,৭৪৯টি প্রম্পট রয়েছে, যা শুধুমাত্র এক সেমিস্টার পাইথন প্রোগ্রামিং সম্পন্ন করা ৮০ জন শিক্ষার্থী লিখেছেন। আমাদের শিক্ষার্থীরা একটি কোড এলএলএম-এর সাথে ইন্টার্যাক্টিভভাবে কাজ করার সময় এই প্রম্পটগুলো লিখেছিল, এবং আমরা খুবই মিশ্র সাফল্যের হার লক্ষ্য করেছি। আমরা ৫টি কোড এলএলএম মূল্যায়ন করতে StudentEval ব্যবহার করি এবং দেখতে পাই যে বিদ্যমান বেঞ্চমার্কগুলোর তুলনায় StudentEval মডেল কর্মক্ষমতার আরও সঠিক পার্থক্য নির্ধারণ করতে পারে। আমরা প্রম্পটগুলো বিশ্লেষণ করে শিক্ষার্থীদের প্রম্পটিং কৌশলে উল্লেখযোগ্য বৈচিত্র্য পাই। আমরা আরও পাই যে অনিশ্চিত (nondeterministic) LLM স্যাম্পলিং শিক্ষার্থীদের বিভ্রান্ত করতে পারে, ফলে তারা ভাবতে পারে তাদের প্রম্পটগুলো প্রকৃতপক্ষে যতটা কার্যকর তার থেকে বেশি (বা কম) কার্যকর, যা Code LLM দিয়ে শেখানোর পদ্ধতিতে প্রভাব ফেলে।
