Artificial Intelligence
Programming Languages
क्या यह संपादित कर सकता है? कोड संपादन निर्देशों का पालन करने की बड़ी भाषा मॉडल क्षमताओं का मूल्यांकन
Author
Venue
भाषा मॉडलिंग पर सम्मेलन (COLM) 2024
Abstract
बड़ी मात्रा में शोध विभिन्न प्रकार के कोड संश्लेषण कार्यों के लिए बड़े भाषा मॉडल विकसित करने और उनका मूल्यांकन करने पर केंद्रित है। इनमें प्राकृतिक भाषा से कोड का संश्लेषण, कोड से परीक्षणों का संश्लेषण, और कोड की व्याख्याओं का संश्लेषण शामिल है। इसके विपरीत, एलएलएम के साथ निर्देशात्मक कोड संपादन का व्यवहार कम अध्ययन किया गया है। ये ऐसे कार्य हैं जिनमें मॉडल को कोड का एक ब्लॉक और कोड को संशोधित करने का निर्देश दिया जाता है। संपादन निर्देश में किसी फ़ीचर को जोड़ने या हटाने, किसी बग का वर्णन करने और उसका समाधान मांगने, या किसी अन्य प्रकार का समाधान मांगने के लिए कहा जा सकता है। हम कोड संपादन कार्यों का एक सावधानीपूर्वक तैयार किया गया बेंचमार्क पेश करते हैं और इसका उपयोग कई अत्याधुनिक एलएलएम का मूल्यांकन करने के लिए करते हैं। हमारा मूल्यांकन अत्याधुनिक ओपन और क्लोज्ड मॉडल की क्षमताओं के बीच एक महत्वपूर्ण अंतर को उजागर करता है। उदाहरण के लिए, कोड संपादन कार्यों में GPT-3.5-Turbo भी सर्वश्रेष्ठ ओपन मॉडल से बेहतर है। हम प्राकृतिक भाषा के निर्देशों के साथ कोड संपादन कार्यों का एक नया, सावधानीपूर्वक संकलित, अनुमति-आधारित लाइसेंस वाला प्रशिक्षण डेटासेट भी पेश करते हैं। इस प्रशिक्षण डेटासेट का उपयोग करके, हम दिखाते हैं कि हम खुले कोड एलएलएम को उनकी कोड संपादन क्षमताओं में काफी सुधार करने के लिए फाइन-ट्यून कर सकते हैं, जिससे खुले और बंद मॉडल के बीच की खाई कम हो जाती है। सभी कोड, डेटा और मॉडल https://github.com/nuprl/CanItEdit पर उपलब्ध हैं।
