Konten di situs ini telah diterjemahkan menggunakan kecerdasan buatan (AI) atau teknologi penerjemahan mesin, dan mungkin terdapat kesalahan.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: Tolok Ukur Prompt yang Ditulis Mahasiswa untuk Model Bahasa Besar dalam Kode

View Publication

Author

Arjun Guha (Universitas Northeastern + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Universitas Northeastern), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Temuan dari Association of Computational Linguistics (ACL) 2024

Abstract

Model Bahasa Besar (LLM) untuk kode sedang diterapkan dengan cepat, dan ada bukti bahwa model ini dapat meningkatkan produktivitas programmer profesional. Tolok ukur saat ini untuk pembangkitan kode mengukur apakah model dapat menghasilkan program yang benar berdasarkan prompt dari ahli. Dalam makalah ini, kami memperkenalkan tolok ukur baru yang berisi beberapa prompt per masalah, yang ditulis oleh kelompok tertentu dari pembuat prompt non-ahli: programmer pemula. StudentEval berisi 1.749 prompt untuk 48 masalah, yang ditulis oleh 80 mahasiswa yang baru menyelesaikan satu semester pemrograman Python. Mahasiswa kami menulis prompt ini sambil berinteraksi secara langsung dengan LLM kode, dan kami mengamati tingkat keberhasilan yang sangat bervariasi. Kami menggunakan StudentEval untuk mengevaluasi 5 LLM kode dan menemukan bahwa StudentEval merupakan penilai kinerja model yang lebih baik daripada tolok ukur yang ada. Kami menganalisis prompt-prompt tersebut dan menemukan variasi yang signifikan dalam teknik penulisan prompt para mahasiswa. Kami juga menemukan bahwa pengambilan sampel LLM yang tidak deterministik dapat menyesatkan mahasiswa sehingga mereka mengira bahwa prompt mereka lebih (atau kurang) efektif daripada yang sebenarnya, yang memiliki implikasi terhadap cara mengajar dengan Code LLM.