本網站內容使用人工智慧(AI)或機器翻譯技術翻譯,可能存在錯誤。

Skip to content
Artificial Intelligence
Programming Languages

它能編輯嗎?評估大型語言模型遵循程式碼編輯指令的能力

Author

費德里科·卡薩諾(東北大學)、路易莎·李(東北大學)、阿庫爾·塞西(東北大學)、諾亞·辛恩(東北大學)、艾比·布倫南-瓊斯(韋爾斯利學院)、雅各布·吉內辛(東北大學), 愛德華·伯曼(東北大學)、喬治·查克納什維利(東北大學)、安東·洛日科夫(HuggingFace)、卡羅琳·珍·安德森(韋爾斯利學院)、阿琼·古哈(Roblox + 東北大學)

Venue

2024年語言建模會議(COLM)

Abstract

大量研究致力於開發和評估用於各種程式碼合成任務的大型語言模型。這些任務包括從自然語言合成程式碼、從程式碼合成測試,以及合成程式碼解釋。相較之下,利用大型語言模型進行指令式程式碼編輯的行為卻鮮少被研究。這類任務中,模型會收到一段程式碼以及修改該程式碼的指令。 編輯指令可能要求新增或移除某個功能、描述一個錯誤並要求修正,或是要求提供另一種解決方案。 我們提出一套精心設計的程式碼編輯任務基準,並藉此評估數種尖端大型語言模型。評估結果揭示了當前最先進的開源與專有模型之間存在顯著能力差距。例如,即使是 GPT-3.5-Turbo,在程式碼編輯任務上的表現也優於最佳的開源模型。 我們同時推出一套嶄新、經嚴謹篩選且採用寬鬆授權的程式碼編輯任務訓練資料集,其中包含自然語言指令。透過這套訓練資料集,我們證明可對開源程式碼大型語言模型進行微調,以顯著提升其程式碼編輯能力,從而縮小開源與專有模型之間的差距。所有程式碼、資料及模型皆可於 https://github.com/nuprl/CanItEdit 取得。