Artificial Intelligence
Programming Languages
'Can It Edit?': 코드 편집 지침을 따르는 대규모 언어 모델의 능력 평가
Author
Venue
언어 모델링 컨퍼런스(COLM) 2024
Abstract
다양한 코드 합성 작업을 위한 대규모 언어 모델(LLM)의 개발 및 평가에 초점을 맞춘 연구가 상당수 진행되고 있습니다. 여기에는 자연어로부터 코드 합성, 코드로부터 테스트 합성, 코드 설명 합성 등이 포함됩니다. 반면, LLM을 활용한 지시형 코드 편집의 작동 방식에 대한 연구는 상대적으로 부족합니다. 이는 모델에게 코드 블록과 해당 코드를 수정하라는 지시가 제공되는 작업입니다. 편집 지시는 특정 기능을 추가하거나 제거하도록 요청하거나, 버그를 설명하고 수정 방법을 요청하거나, 또는 다른 종류의 해결책을 요청할 수 있다. 우리는 정교하게 설계된 코드 편집 작업 벤치마크를 소개하고, 이를 활용하여 여러 최첨단 LLM을 평가합니다. 평가 결과, 최첨단 오픈 소스 모델과 비공개 모델 간의 성능 격차가 상당한 것으로 드러났습니다. 예를 들어, GPT-3.5-Turbo조차도 코드 편집 작업에서 최고의 오픈 소스 모델보다 우수한 성능을 보입니다. 또한, 자연어 지침과 결합된 코드 편집 작업에 대한 신중하게 선별되고 자유로운 라이선스를 적용한 새로운 훈련 데이터셋을 소개합니다. 이 훈련 데이터셋을 사용하여, 오픈 소스 코드 LLM을 미세 조정함으로써 코드 편집 능력을 크게 향상시키고, 오픈 소스 모델과 비공개 모델 간의 격차를 좁힐 수 있음을 보여줍니다. 모든 코드, 데이터 및 모델은 https://github.com/nuprl/CanItEdit에서 확인할 수 있습니다.
