Artificial Intelligence
Programming Languages
ఇది సరిదిద్దగలదా? కోడ్ ఎడిటింగ్ సూచనలను పాటించడంలో లార్జ్ లాంగ్వేజ్ మోడళ్ల సామర్థ్యాన్ని మూల్యాంకనం చేయడం
Author
Venue
భాషా నమూనాపై సమావేశం (COLM) 2024
Abstract
వివిధ రకాల కోడ్ సంశ్లేషణ పనుల కోసం పెద్ద భాషా మోడళ్లను అభివృద్ధి చేయడం మరియు మూల్యాంకనం చేయడంపై గణనీయమైన పరిశోధన దృష్టి సారించబడింది. వీటిలో సహజ భాష నుండి కోడ్ను సంశ్లేషణ చేయడం, కోడ్ నుండి పరీక్షలను సంశ్లేషణ చేయడం మరియు కోడ్ వివరణలను సంశ్లేషణ చేయడం వంటివి ఉన్నాయి. దీనికి విరుద్ధంగా, LLMలతో సూచనాత్మక కోడ్ ఎడిటింగ్ యొక్క ప్రవర్తనపై తక్కువగా అధ్యయనం చేయబడింది. ఈ పనులలో, మోడల్కు ఒక కోడ్ బ్లాక్ మరియు కోడ్ను సవరించడానికి ఒక సూచన అందించబడతాయి. ఎడిటింగ్ సూచనలో ఒక ఫీచర్ను జోడించమని లేదా తొలగించమని, ఒక బగ్ను వివరించి దానికి పరిష్కారం అడగమని, లేదా వేరే రకమైన పరిష్కారాన్ని అడగమని ఉండవచ్చు. మేము కోడ్ ఎడిటింగ్ టాస్క్ల కోసం జాగ్రత్తగా రూపొందించిన ఒక బెంచ్మార్క్ను పరిచయం చేస్తున్నాము మరియు అనేక అత్యాధునిక LLMలను మూల్యాంకనం చేయడానికి దానిని ఉపయోగిస్తున్నాము. మా మూల్యాంకనం, అత్యాధునిక ఓపెన్ మరియు క్లోజ్డ్ మోడళ్ల సామర్థ్యాల మధ్య ఒక గణనీయమైన అంతరాన్ని బహిర్గతం చేస్తుంది. ఉదాహరణకు, కోడ్ ఎడిటింగ్ టాస్క్లలో అత్యుత్తమ ఓపెన్ మోడల్ కంటే GPT-3.5-Turbo కూడా మెరుగ్గా ఉంది. మేము సహజ భాషా సూచనలతో కూడిన, కోడ్ ఎడిటింగ్ పనుల యొక్క కొత్త, జాగ్రత్తగా రూపొందించిన, అనుమతితో కూడిన లైసెన్స్ ఉన్న శిక్షణా డేటాసెట్ను కూడా పరిచయం చేస్తున్నాము. ఈ శిక్షణా డేటాసెట్ను ఉపయోగించి, ఓపెన్ కోడ్ LLMల యొక్క కోడ్ ఎడిటింగ్ సామర్థ్యాలను గణనీయంగా మెరుగుపరచడానికి మేము వాటిని ఫైన్-ట్యూన్ చేయగలమని, తద్వారా ఓపెన్ మరియు క్లోజ్డ్ మోడళ్ల మధ్య ఉన్న అంతరాన్ని తగ్గించగలమని మేము చూపిస్తున్నాము. మొత్తం కోడ్, డేటా మరియు మోడళ్లు https://github.com/nuprl/CanItEdit వద్ద అందుబాటులో ఉన్నాయి.
