Bu sitedeki içerik yapay zeka (AI) veya makine çeviri teknolojisi kullanılarak çevrilmiştir ve hatalar içerebilir.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: Büyük Dil Modelleri için Öğrenciler Tarafından Yazılmış Komut Satırlarının Karşılaştırmalı Değerlendirmesi

View Publication

Author

Arjun Guha (Northeastern Üniversitesi + Roblox), Hannah McLean Babe (Oberlin Koleji), Sydney Nguyen (Wellesley Koleji), Yangtian Zi (Northeastern Üniversitesi), Molly Q. Feldman (Oberlin Koleji), Carolyn Jane Anderson (Wellesley Koleji)

Venue

Hesaplamalı Dilbilim Derneği (ACL) 2024'ün bulguları

Abstract

Kod LLM'leri hızla yaygınlaşmaktadır ve bunların profesyonel programcıların verimliliğini artırabileceğine dair kanıtlar bulunmaktadır. Kod üretimi için mevcut karşılaştırma ölçütleri, modellerin uzman bir komutla doğru programlar üretip üretmediğini ölçer. Bu makalede, uzman olmayan bir grup olan yeni başlayan programcılar tarafından yazılmış, her problem için birden fazla komut içeren yeni bir karşılaştırma ölçütü sunuyoruz. StudentEval, Python programlama konusunda sadece bir dönemlik eğitim almış 80 öğrenci tarafından yazılmış, 48 problem için 1.749 komut içerir. Öğrencilerimiz bu komutları bir Kod LLM ile etkileşimli olarak çalışırken yazdılar ve başarı oranlarında büyük farklılıklar gözlemledik. StudentEval'i 5 Kod LLM'yi değerlendirmek için kullanıyoruz ve StudentEval'in mevcut karşılaştırma ölçütlerinden daha iyi bir model performans ayırt edici olduğunu tespit ediyoruz. Komutları analiz ettik ve öğrencilerin komut verme tekniklerinde önemli farklılıklar olduğunu gördük. Ayrıca, belirsiz LLM örneklemesinin, öğrencileri komutlarının gerçekte olduğundan daha etkili (veya daha az etkili) olduğunu düşünmeye yöneltebileceğini tespit ettik; bu durum, Code LLM'lerle öğretim yöntemleri üzerinde bazı etkileri olacaktır.