StudentEval: Benchmark podpowiedzi napisanych przez studentów dla dużych modeli językowych kodu
Author
Venue
Wyniki konferencji Stowarzyszenia Lingwistyki Komputerowej (ACL) 2024
Abstract
Modele LLM do generowania kodu są szybko wdrażane i istnieją dowody na to, że mogą one zwiększyć produktywność profesjonalnych programistów. Obecne testy porównawcze dotyczące generowania kodu sprawdzają, czy modele generują poprawne programy na podstawie podpowiedzi eksperta. W niniejszym artykule przedstawiamy nowy test porównawczy zawierający wiele podpowiedzi dla każdego zadania, napisanych przez określoną grupę osób niebędących ekspertami: początkujących programistów. StudentEval zawiera 1749 poleceń dla 48 problemów, napisanych przez 80 studentów, którzy ukończyli zaledwie jeden semestr programowania w języku Python. Nasi studenci napisali te polecenia podczas interaktywnej pracy z modelem LLM do generowania kodu i zaobserwowaliśmy bardzo zróżnicowane wskaźniki sukcesu. Wykorzystujemy StudentEval do oceny 5 modeli LLM do generowania kodu i stwierdzamy, że StudentEval jest lepszym wskaźnikiem wydajności modelu niż istniejące testy porównawcze. Analizujemy polecenia i stwierdzamy znaczne różnice w technikach ich tworzenia przez studentów. Stwierdzamy również, że niedeterministyczne próbkowanie LLM może wprowadzać studentów w błąd, sugerując im, że ich polecenia są bardziej (lub mniej) skuteczne niż w rzeczywistości, co ma wpływ na sposób nauczania z wykorzystaniem modeli Code LLM.
