Artificial Intelligence
Programming Languages
Düzenleyebilir mi? Büyük Dil Modellerinin Kod Düzenleme Talimatlarını Takip Etme Yeteneğinin Değerlendirilmesi
Author
Venue
Dil Modelleme Konferansı (COLM) 2024
Abstract
Önemli miktarda araştırma, çeşitli kod sentezi görevleri için büyük dil modellerinin geliştirilmesi ve değerlendirilmesine odaklanmaktadır. Bunlar arasında doğal dilden kod sentezi, koddan test sentezi ve kod açıklamalarının sentezi yer almaktadır. Buna karşın, LLM'lerle talimatlı kod düzenlemenin davranışı yeterince araştırılmamıştır. Bunlar, modele bir kod bloğu ve kodu değiştirmek için bir talimatın verildiği görevlerdir. Düzenleme talimatı, bir özelliğin eklenmesini veya kaldırılmasını isteyebilir, bir hatayı tanımlayıp düzeltmesini isteyebilir veya farklı bir çözüm türü isteyebilir. Kod düzenleme görevleri için özenle hazırlanmış bir karşılaştırma ölçütü sunuyoruz ve bunu birkaç son teknoloji LLM'yi değerlendirmek için kullanıyoruz. Değerlendirmemiz, en gelişmiş açık ve kapalı modellerin yetenekleri arasında önemli bir uçurum olduğunu ortaya koyuyor. Örneğin, GPT-3.5-Turbo bile kod düzenleme görevlerinde en iyi açık modelden daha iyidir. Ayrıca, doğal dil talimatlarıyla birleştirilmiş, özenle derlenmiş ve geniş lisanslı yeni bir kod düzenleme görevleri eğitim veri seti sunuyoruz. Bu eğitim veri setini kullanarak, açık Kod LLM'lerini ince ayar yaparak kod düzenleme yeteneklerini önemli ölçüde iyileştirebileceğimizi ve açık ile kapalı modeller arasındaki farkı kapatabileceğimizi gösteriyoruz. Tüm kod, veri ve modeller https://github.com/nuprl/CanItEdit adresinde mevcuttur.
