이 사이트의 콘텐츠는 인공지능(AI) 또는 기계 번역 기술을 사용하여 번역되었으며 오류가 있을 수 있습니다.

Skip to content
Artificial Intelligence
Programming Languages

'Can It Edit?': 코드 편집 지침을 따르는 대규모 언어 모델의 능력 평가

Author

페데리코 카사노(노스이스턴 대학교), 루이사 리(노스이스턴 대학교), 아쿨 세티(노스이스턴 대학교), 노아 신(노스이스턴 대학교), 애비 브레넌-존스(웰즐리 칼리지), 제이콥 기네신(노스이스턴 대학교), 에드워드 버먼 (노스이스턴 대학교), 조지 차크나슈빌리 (노스이스턴 대학교), 안톤 로즈코프 (HuggingFace), 캐롤린 제인 앤더슨 (웰즐리 칼리지), 아르준 구하 (Roblox + 노스이스턴 대학교)

Venue

언어 모델링 컨퍼런스(COLM) 2024

Abstract

다양한 코드 합성 작업을 위한 대규모 언어 모델(LLM)의 개발 및 평가에 초점을 맞춘 연구가 상당수 진행되고 있습니다. 여기에는 자연어로부터 코드 합성, 코드로부터 테스트 합성, 코드 설명 합성 등이 포함됩니다. 반면, LLM을 활용한 지시형 코드 편집의 작동 방식에 대한 연구는 상대적으로 부족합니다. 이는 모델에게 코드 블록과 해당 코드를 수정하라는 지시가 제공되는 작업입니다. 편집 지시는 특정 기능을 추가하거나 제거하도록 요청하거나, 버그를 설명하고 수정 방법을 요청하거나, 또는 다른 종류의 해결책을 요청할 수 있다. 우리는 정교하게 설계된 코드 편집 작업 벤치마크를 소개하고, 이를 활용하여 여러 최첨단 LLM을 평가합니다. 평가 결과, 최첨단 오픈 소스 모델과 비공개 모델 간의 성능 격차가 상당한 것으로 드러났습니다. 예를 들어, GPT-3.5-Turbo조차도 코드 편집 작업에서 최고의 오픈 소스 모델보다 우수한 성능을 보입니다. 또한, 자연어 지침과 결합된 코드 편집 작업에 대한 신중하게 선별되고 자유로운 라이선스를 적용한 새로운 훈련 데이터셋을 소개합니다. 이 훈련 데이터셋을 사용하여, 오픈 소스 코드 LLM을 미세 조정함으로써 코드 편집 능력을 크게 향상시키고, 오픈 소스 모델과 비공개 모델 간의 격차를 좁힐 수 있음을 보여줍니다. 모든 코드, 데이터 및 모델은 https://github.com/nuprl/CanItEdit에서 확인할 수 있습니다.