Treści na tej stronie zostały przetłumaczone przy użyciu sztucznej inteligencji (AI) lub technologii tłumaczenia maszynowego i mogą zawierać błędy.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: Benchmark podpowiedzi napisanych przez studentów dla dużych modeli językowych kodu

View Publication

Author

Arjun Guha (Uniwersytet Northeastern + Roblox), Hannah McLean Babe (Oberlin College), Sydney Nguyen (Wellesley College), Yangtian Zi (Uniwersytet Northeastern), Molly Q. Feldman (Oberlin College), Carolyn Jane Anderson (Wellesley College)

Venue

Wyniki konferencji Stowarzyszenia Lingwistyki Komputerowej (ACL) 2024

Abstract

Modele LLM do generowania kodu są szybko wdrażane i istnieją dowody na to, że mogą one zwiększyć produktywność profesjonalnych programistów. Obecne testy porównawcze dotyczące generowania kodu sprawdzają, czy modele generują poprawne programy na podstawie podpowiedzi eksperta. W niniejszym artykule przedstawiamy nowy test porównawczy zawierający wiele podpowiedzi dla każdego zadania, napisanych przez określoną grupę osób niebędących ekspertami: początkujących programistów. StudentEval zawiera 1749 poleceń dla 48 problemów, napisanych przez 80 studentów, którzy ukończyli zaledwie jeden semestr programowania w języku Python. Nasi studenci napisali te polecenia podczas interaktywnej pracy z modelem LLM do generowania kodu i zaobserwowaliśmy bardzo zróżnicowane wskaźniki sukcesu. Wykorzystujemy StudentEval do oceny 5 modeli LLM do generowania kodu i stwierdzamy, że StudentEval jest lepszym wskaźnikiem wydajności modelu niż istniejące testy porównawcze. Analizujemy polecenia i stwierdzamy znaczne różnice w technikach ich tworzenia przez studentów. Stwierdzamy również, że niedeterministyczne próbkowanie LLM może wprowadzać studentów w błąd, sugerując im, że ich polecenia są bardziej (lub mniej) skuteczne niż w rzeczywistości, co ma wpływ na sposób nauczania z wykorzystaniem modeli Code LLM.