Artificial Intelligence
Programming Languages
هل يمكنه التحرير؟ تقييم قدرة نماذج اللغة الكبيرة على اتباع تعليمات تحرير الكود
Author
Venue
مؤتمر نمذجة اللغة (COLM) 2024
Abstract
تركز الكثير من الأبحاث على تطوير وتقييم نماذج لغوية كبيرة لمجموعة متنوعة من مهام توليف الكود. وتشمل هذه المهام توليف الكود من اللغة الطبيعية، وتوليف الاختبارات من الكود، وتوليف تفسيرات الكود. في المقابل، لم يتم دراسة سلوك تحرير الكود التعليمي باستخدام نماذج اللغات الكبيرة (LLMs) بشكل كافٍ. وهذه مهام يتم فيها تزويد النموذج بكتلة من الكود وتعليمات لتعديل الكود. قد تطلب تعليمات التحرير إضافة ميزة أو إزالتها، أو تصف خطأً وتطلب إصلاحه، أو تطلب نوعًا مختلفًا من الحلول. نقدم معيارًا تم إعداده بعناية لمهام تحرير الكود ونستخدمه لتقييم العديد من نماذج اللغات الكبيرة (LLMs) المتطورة. يكشف تقييمنا عن فجوة كبيرة بين قدرات النماذج المفتوحة والمغلقة المتطورة. على سبيل المثال، حتى GPT-3.5-Turbo أفضل من أفضل نموذج مفتوح في مهام تحرير الكود. نقدم أيضًا مجموعة بيانات تدريب جديدة ومُنتقاة بعناية ومرخصة بشكل متساهل لمهام تحرير الكود مقترنة بتعليمات باللغة الطبيعية. باستخدام مجموعة بيانات التدريب هذه، نُظهر أنه يمكننا ضبط نماذج اللغة الكبيرة المفتوحة (Code LLMs) لتحسين قدراتها في تحرير الكود بشكل كبير، مما يقلص الفجوة بين النماذج المفتوحة والمغلقة. جميع الكود والبيانات والنماذج متاحة على https://github.com/nuprl/CanItEdit.
