Natural Language Processing
Programming Languages
StudentEval: 코드 생성용 대규모 언어 모델을 위한 학생 작성 프롬프트 벤치마크
Author
Venue
2024년 컴퓨터언어학회(ACL) 연구 결과
Abstract
코드 LLM이 빠르게 도입되고 있으며, 이를 통해 전문 프로그래머의 생산성을 높일 수 있다는 증거가 있습니다. 현재 코드 생성 벤치마크는 전문가가 작성한 프롬프트를 주었을 때 모델이 올바른 프로그램을 생성하는지 여부를 측정합니다. 본 논문에서는 비전문가 프롬프트 작성자 집단인 초보 프로그래머들이 작성한, 문제당 여러 개의 프롬프트를 포함하는 새로운 벤치마크를 제시합니다. StudentEval은 파이썬 프로그래밍을 한 학기만 이수한 80명의 학생이 작성한 48개 문제에 대한 1,749개의 프롬프트를 포함한다. 우리 학생들은 코드 LLM과 대화형으로 작업하면서 이 프롬프트를 작성했으며, 우리는 매우 다양한 성공률을 관찰했다. 우리는 StudentEval을 사용하여 5개의 코드 LLM을 평가했고, StudentEval이 기존 벤치마크보다 모델 성능을 더 잘 구별해 낸다는 사실을 발견했다. 프롬프트를 분석한 결과, 학생들의 프롬프트 작성 기법에는 상당한 차이가 있는 것으로 나타났습니다. 또한 비결정적 LLM 샘플링이 학생들로 하여금 자신의 프롬프트가 실제보다 더(또는 덜) 효과적이라고 오인하게 만들 수 있다는 점을 발견했으며, 이는 코드 LLM을 활용한 교육 방법에 시사하는 바가 큽니다.
