Artificial Intelligence
Programming Languages
Bisakah Model Bahasa Besar Mengedit Kode? Evaluasi Kemampuan Model Bahasa Besar dalam Mengikuti Instruksi Pengeditan Kode
Author
Venue
Konferensi Pemodelan Bahasa (COLM) 2024
Abstract
Sebagian besar penelitian berfokus pada pengembangan dan evaluasi model bahasa besar untuk berbagai tugas sintesis kode. Tugas-tugas ini meliputi sintesis kode dari bahasa alami, sintesis pengujian dari kode, dan sintesis penjelasan kode. Sebaliknya, perilaku pengeditan kode instruksional dengan LLM masih kurang diteliti. Ini adalah tugas-tugas di mana model diberikan blok kode dan instruksi untuk memodifikasi kode tersebut. Instruksi pengeditan dapat meminta penambahan atau penghapusan fitur, mendeskripsikan bug dan meminta perbaikan, atau meminta solusi yang berbeda. Kami memperkenalkan benchmark tugas pengeditan kode yang dirancang dengan cermat dan menggunakannya untuk mengevaluasi beberapa LLM mutakhir. Evaluasi kami mengungkap kesenjangan yang signifikan antara kemampuan model terbuka dan tertutup yang paling mutakhir. Misalnya, bahkan GPT-3.5-Turbo lebih unggul daripada model terbuka terbaik dalam tugas pengeditan kode. Kami juga memperkenalkan dataset pelatihan baru yang dirancang dengan cermat dan berlisensi terbuka untuk tugas-tugas pengeditan kode yang dipadukan dengan instruksi bahasa alami. Dengan menggunakan dataset pelatihan ini, kami menunjukkan bahwa kami dapat menyempurnakan LLM Kode terbuka untuk meningkatkan kemampuan pengeditan kode mereka secara signifikan, sehingga menutup kesenjangan antara model terbuka dan tertutup. Semua kode, data, dan model tersedia di https://github.com/nuprl/CanItEdit.
