이 사이트의 콘텐츠는 인공지능(AI) 또는 기계 번역 기술을 사용하여 번역되었으며 오류가 있을 수 있습니다.

Skip to content
Natural Language Processing
Programming Languages

StudentEval: 코드 생성용 대규모 언어 모델을 위한 학생 작성 프롬프트 벤치마크

View Publication

Author

아르준 구하 (노스이스턴 대학교 + 로블록스), 한나 맥린 베이브 (오벌린 대학교), 시드니 응우옌 (웰즐리 대학교), 양티안 지 (노스이스턴 대학교), 몰리 Q. 펠드먼 (오벌린 대학교), 캐롤린 제인 앤더슨 (웰즐리 대학교)

Venue

2024년 컴퓨터언어학회(ACL) 연구 결과

Abstract

코드 LLM이 빠르게 도입되고 있으며, 이를 통해 전문 프로그래머의 생산성을 높일 수 있다는 증거가 있습니다. 현재 코드 생성 벤치마크는 전문가가 작성한 프롬프트를 주었을 때 모델이 올바른 프로그램을 생성하는지 여부를 측정합니다. 본 논문에서는 비전문가 프롬프트 작성자 집단인 초보 프로그래머들이 작성한, 문제당 여러 개의 프롬프트를 포함하는 새로운 벤치마크를 제시합니다. StudentEval은 파이썬 프로그래밍을 한 학기만 이수한 80명의 학생이 작성한 48개 문제에 대한 1,749개의 프롬프트를 포함한다. 우리 학생들은 코드 LLM과 대화형으로 작업하면서 이 프롬프트를 작성했으며, 우리는 매우 다양한 성공률을 관찰했다. 우리는 StudentEval을 사용하여 5개의 코드 LLM을 평가했고, StudentEval이 기존 벤치마크보다 모델 성능을 더 잘 구별해 낸다는 사실을 발견했다. 프롬프트를 분석한 결과, 학생들의 프롬프트 작성 기법에는 상당한 차이가 있는 것으로 나타났습니다. 또한 비결정적 LLM 샘플링이 학생들로 하여금 자신의 프롬프트가 실제보다 더(또는 덜) 효과적이라고 오인하게 만들 수 있다는 점을 발견했으며, 이는 코드 LLM을 활용한 교육 방법에 시사하는 바가 큽니다.