このサイトのコンテンツは、人工知能(AI)または機械翻訳技術を使用して翻訳されており、誤りが含まれている場合があります。

Skip to content
Artificial Intelligence
Programming Languages

編集できるか? コード編集指示に従う大規模言語モデルの能力評価

Author

フェデリコ・カッサーノ(ノースイースタン大学)、ルイーザ・リー(ノースイースタン大学)、アクル・セティ(ノースイースタン大学)、ノア・シン(ノースイースタン大学)、アビー・ブレナン=ジョーンズ(ウェルズリー大学)、ジェイコブ・ギネシン(ノースイースタン大学)、 エドワード・バーマン(ノースイースタン大学)、ジョージ・チャクナシュヴィリ(ノースイースタン大学)、アントン・ロシュコフ(HuggingFace)、キャロリン・ジェーン・アンダーソン(ウェルズリー大学)、アルジュン・グハ(Roblox + ノースイースタン大学)

Venue

言語モデリング会議 (COLM) 2024

Abstract

多くの研究が、様々なコード合成タスクに向けた大規模言語モデルの開発と評価に注力している。これには、自然言語からのコード合成、コードからのテスト合成、およびコードの説明の合成などが含まれる。対照的に、LLMを用いた指示型コード編集の挙動については、まだ十分に研究されていない。これらは、モデルにコードのブロックと、そのコードを修正するよう指示を与えるタスクである。 編集指示には、機能の追加や削除、バグの説明と修正の要求、あるいは異なる種類の解決策の提示などが含まれる。 我々は、入念に構築されたコード編集タスクのベンチマークを導入し、これを使用していくつかの最先端LLMを評価する。我々の評価により、最先端のオープンソースモデルとクローズドモデルの能力間に大きな格差があることが明らかになった。例えば、GPT-3.5-Turboでさえ、コード編集タスクにおいては最良のオープンソースモデルよりも優れた性能を示す。 また、自然言語による指示と組み合わされた、コード編集タスク向けの、慎重に選定され、寛容なライセンスが適用された新しいトレーニングデータセットも導入します。このトレーニングデータセットを使用することで、オープンソースのコードLLMを微調整し、そのコード編集能力を大幅に向上させ、オープンソースモデルとクローズドモデルの間の格差を埋めることができることを示します。すべてのコード、データ、およびモデルは https://github.com/nuprl/CanItEdit で公開されています。