Artificial Intelligence
Programming Languages
編集できるか? コード編集指示に従う大規模言語モデルの能力評価
Author
Venue
言語モデリング会議 (COLM) 2024
Abstract
多くの研究が、様々なコード合成タスクに向けた大規模言語モデルの開発と評価に注力している。これには、自然言語からのコード合成、コードからのテスト合成、およびコードの説明の合成などが含まれる。対照的に、LLMを用いた指示型コード編集の挙動については、まだ十分に研究されていない。これらは、モデルにコードのブロックと、そのコードを修正するよう指示を与えるタスクである。 編集指示には、機能の追加や削除、バグの説明と修正の要求、あるいは異なる種類の解決策の提示などが含まれる。 我々は、入念に構築されたコード編集タスクのベンチマークを導入し、これを使用していくつかの最先端LLMを評価する。我々の評価により、最先端のオープンソースモデルとクローズドモデルの能力間に大きな格差があることが明らかになった。例えば、GPT-3.5-Turboでさえ、コード編集タスクにおいては最良のオープンソースモデルよりも優れた性能を示す。 また、自然言語による指示と組み合わされた、コード編集タスク向けの、慎重に選定され、寛容なライセンスが適用された新しいトレーニングデータセットも導入します。このトレーニングデータセットを使用することで、オープンソースのコードLLMを微調整し、そのコード編集能力を大幅に向上させ、オープンソースモデルとクローズドモデルの間の格差を埋めることができることを示します。すべてのコード、データ、およびモデルは https://github.com/nuprl/CanItEdit で公開されています。
