StudentEval: Büyük Dil Modelleri için Öğrenciler Tarafından Yazılmış Komut Satırlarının Karşılaştırmalı Değerlendirmesi
Author
Venue
Hesaplamalı Dilbilim Derneği (ACL) 2024'ün bulguları
Abstract
Kod LLM'leri hızla yaygınlaşmaktadır ve bunların profesyonel programcıların verimliliğini artırabileceğine dair kanıtlar bulunmaktadır. Kod üretimi için mevcut karşılaştırma ölçütleri, modellerin uzman bir komutla doğru programlar üretip üretmediğini ölçer. Bu makalede, uzman olmayan bir grup olan yeni başlayan programcılar tarafından yazılmış, her problem için birden fazla komut içeren yeni bir karşılaştırma ölçütü sunuyoruz. StudentEval, Python programlama konusunda sadece bir dönemlik eğitim almış 80 öğrenci tarafından yazılmış, 48 problem için 1.749 komut içerir. Öğrencilerimiz bu komutları bir Kod LLM ile etkileşimli olarak çalışırken yazdılar ve başarı oranlarında büyük farklılıklar gözlemledik. StudentEval'i 5 Kod LLM'yi değerlendirmek için kullanıyoruz ve StudentEval'in mevcut karşılaştırma ölçütlerinden daha iyi bir model performans ayırt edici olduğunu tespit ediyoruz. Komutları analiz ettik ve öğrencilerin komut verme tekniklerinde önemli farklılıklar olduğunu gördük. Ayrıca, belirsiz LLM örneklemesinin, öğrencileri komutlarının gerçekte olduğundan daha etkili (veya daha az etkili) olduğunu düşünmeye yöneltebileceğini tespit ettik; bu durum, Code LLM'lerle öğretim yöntemleri üzerinde bazı etkileri olacaktır.
