এই সাইটের বিষয়বস্তু কৃত্রিম বুদ্ধিমত্তা (AI) বা মেশিন অনুবাদ প্রযুক্তি ব্যবহার করে অনুবাদ করা হয়েছে এবং ত্রুটি থাকতে পারে।

Skip to content
Natural Language Processing
Programming Languages

StudentEval: কোডের বৃহৎ ভাষামডেলের জন্য ছাত্র-লিখিত প্রম্পটগুলির একটি বেঞ্চমার্ক

View Publication

Author

অর্জুন গুহ (নর্থইস্টার্ন ইউনিভার্সিটি + Roblox), হান্না ম্যাকলিন বেব (ওবারলিন কলেজ), সিডনি নগুয়েন (ওয়েলেসলি কলেজ), ইয়াংতিয়ান জি (নর্থইস্টার্ন ইউনিভার্সিটি), মলি কিউ. ফেল্ডম্যান (ওবারলিন কলেজ), ক্যারোলিন জেন অ্যান্ডারসন (ওয়েলেসলি কলেজ)

Venue

কম্পিউটেশনাল ভাষাবিজ্ঞান সমিতি (ACL) 2024-এর ফলাফল

Abstract

কোড এলএলএমগুলো দ্রুত মোতায়েন করা হচ্ছে এবং প্রমাণ রয়েছে যে এগুলো পেশাদার প্রোগ্রামারদের আরও উৎপাদনশীল করে তুলতে পারে। বর্তমান কোড জেনারেশনের বেঞ্চমার্কগুলো পরিমাপ করে যে মডেলগুলো বিশেষজ্ঞ প্রম্পট দিলে সঠিক প্রোগ্রাম তৈরি করে কিনা। এই প্রবন্ধে, আমরা একটি নতুন বেঞ্চমার্ক উপস্থাপন করছি, যেখানে প্রতি সমস্যার জন্য একাধিক প্রম্পট রয়েছে, যা অ-বিশেষজ্ঞ প্রম্পটারদের একটি নির্দিষ্ট জনগোষ্ঠী—নবীন প্রোগ্রামারদের—দ্বারা লেখা হয়েছে। StudentEval-এ ৪৮টি সমস্যার জন্য ১,৭৪৯টি প্রম্পট রয়েছে, যা শুধুমাত্র এক সেমিস্টার পাইথন প্রোগ্রামিং সম্পন্ন করা ৮০ জন শিক্ষার্থী লিখেছেন। আমাদের শিক্ষার্থীরা একটি কোড এলএলএম-এর সাথে ইন্টার‍্যাক্টিভভাবে কাজ করার সময় এই প্রম্পটগুলো লিখেছিল, এবং আমরা খুবই মিশ্র সাফল্যের হার লক্ষ্য করেছি। আমরা ৫টি কোড এলএলএম মূল্যায়ন করতে StudentEval ব্যবহার করি এবং দেখতে পাই যে বিদ্যমান বেঞ্চমার্কগুলোর তুলনায় StudentEval মডেল কর্মক্ষমতার আরও সঠিক পার্থক্য নির্ধারণ করতে পারে। আমরা প্রম্পটগুলো বিশ্লেষণ করে শিক্ষার্থীদের প্রম্পটিং কৌশলে উল্লেখযোগ্য বৈচিত্র্য পাই। আমরা আরও পাই যে অনিশ্চিত (nondeterministic) LLM স্যাম্পলিং শিক্ষার্থীদের বিভ্রান্ত করতে পারে, ফলে তারা ভাবতে পারে তাদের প্রম্পটগুলো প্রকৃতপক্ষে যতটা কার্যকর তার থেকে বেশি (বা কম) কার্যকর, যা Code LLM দিয়ে শেখানোর পদ্ধতিতে প্রভাব ফেলে।