एजेंट लाइटनिंग v1.0: एजेंट RL को कैसे नियंत्रित करें और परिणाम 14 अंकों तक बढ़ाएं

28 अगस्त 20267 बार देखा गया

नया हल्का फ्रेमवर्क एजेंट के पर्यावरण के साथ इंटरैक्शन कंटूर को एक अलग शेल में बदल देता है, जिससे LLM-एंडपॉइंट प्रॉक्सी के माध्यम से किसी भी एजेंट आर्किटेक्चर को प्रशिक्षित किया जा सकता है। SWE-bench Verified परीक्षणों में, केवल 6 हजार उदाहरणों पर फाइन-ट्यूनिंग ने Qwen3.5-9B की सटीकता को 41.8% से बढ़ाकर 56.4% कर दिया।

एजेंट लाइटनिंग v1.0: एजेंट RL को कैसे नियंत्रित करें और परिणाम 14 अंकों तक बढ़ाएं

Agent Lightning v1.0 क्या है और इसके बारे में चर्चा क्यों हो रही है

आधुनिक AI-एजेंट शायद ही कभी अकेले काम करते हैं: उनके चारों ओर एक agent harness बनाया जाता है — एक परत जो टूल्स, कॉन्टेक्स्ट और निष्पादन के प्रवाह को प्रबंधित करती है। यह "ढांचा" कैसे डिज़ाइन किया गया है, यह सीधे तौर पर निर्धारित करता है कि मॉडल कार्यों को कितने प्रभावी ढंग से संभालता है। हालाँकि, लंबे समय तक यह प्रशिक्षण के दायरे से बाहर रहा: RL-ट्रेनर केवल मॉडल के उत्तर देखता था और इस बात से कोई लेना-देना नहीं था कि एजेंट पर्यावरण के साथ कैसे इंटरैक्ट करता है।

Agent Lightning v1.0 प्रोजेक्ट एक अलग दृष्टिकोण प्रस्तुत करता है — harnessed agentic RL (नियंत्रित एजेंट RL)। इसका विचार यह है कि जो harness डिप्लॉयमेंट चरण में उपयोग किया जाता है, वह सीधे मॉडल के पोस्ट-ट्रेनिंग में भाग लेता है। यह एजेंट को उन्हीं परिस्थितियों में फिर से प्रशिक्षित करने की अनुमति देता है जिनमें वह प्रोडक्शन में काम करेगा, और मनमाने एजेंटों को RL-पाइपलाइन से जोड़ने की प्रक्रिया को काफी सरल बनाता है।

harnessed agentic RL कैसे काम करता है

पारंपरिक एजेंट RL में, "मॉडल → क्रिया → अवलोकन → नई क्रिया" चक्र प्रशिक्षण इंजन का होता है। नियंत्रित संस्करण में, यह पूरा चक्र harness अपने ऊपर ले लेता है, और ट्रेनर केवल LLM अनुरोध-प्रतिक्रिया जोड़ियों के अनुक्रम का अवलोकन करता है। यह पृथक्करण लचीलापन देता है: किसी भी एजेंट फ्रेमवर्क का उपयोग किया जा सकता है, बस उसे एंडपॉइंट-प्रॉक्सी के माध्यम से जोड़कर।

यह आर्किटेक्चर नई नहीं है: Agent Lightning के पहले संस्करण ने एक वियोजित (disaggregated) योजना प्रस्तुत की थी, जिसे बाद में अन्य फ्रेमवर्क — verl Uni-Agent, AReaL 2.0, slime और Polar — ने भी अपनाया। हालाँकि, इस दृष्टिकोण की अपनी कमियाँ भी हैं।

मुख्य समस्याएँ

लेखक कई कठिनाइयों का उल्लेख करते हैं जो व्यावहारिक कार्यान्वयन के दौरान उत्पन्न होती हैं:

  • Retokenization — अनुक्रमों का बार-बार टोकनाइज़ेशन प्रशिक्षण डेटा को विकृत कर सकता है।
  • Sample merging — विभिन्न स्रोतों से सैंपलों का संयोजन सावधानीपूर्वक प्रसंस्करण की मांग करता है।
  • Advantage calculation — डेटा के गैर-मानक संगठन के साथ एडवांटेज की गणना जटिल हो जाती है।
  • Loss normalization — लॉस सामान्यीकरण को harness की विशेषताओं को ध्यान में रखना चाहिए।
  • Backend scheduling — बैकएंड पर गणना का शेड्यूलिंग प्रशिक्षण की स्थिरता को प्रभावित करता है।

ये, प्रतीत होने वाले तकनीकी विवरण, अंतिम परिणाम को गंभीर रूप से प्रभावित कर सकते हैं। इनका पता लगाने के लिए ही Agent Lightning v1.0 बनाया गया था — लगभग 3,500 लाइनों के कोड वाला एक हल्का फ्रेमवर्क।

परिणाम: SWE-bench Verified पर +14.6 अंक

डेवलपर्स ने तीन प्रकार के एजेंटों पर दृष्टिकोण का परीक्षण किया: निर्देश-पालन के लिए, खोज के लिए और कोड लिखने के लिए। कोडिंग-एजेंटों के लिए, एक पूरी तरह से पुनरुत्पादनीय पाइपलाइन प्रकाशित की गई है।

प्रयोग इस प्रकार दिखता है: कुल 6,000 प्रशिक्षण उदाहरण और मध्यम कम्प्यूटेशनल संसाधन। RL-पोस्ट-ट्रेनिंग के बाद Qwen3.5-9B मॉडल ने SWE-bench Verified पर 56.4% का परिणाम दिखाया, जबकि प्रशिक्षण से पहले यह 41.8% था। पूर्ण वृद्धि — 14.6 प्रतिशत अंक। यह इतनी कम मात्रा में डेटा और हल्के फ्रेमवर्क के लिए एक मजबूत परिणाम है।

इसके अलावा, लेखक पूरी कार्य प्रक्रिया और प्रशिक्षण स्क्रिप्ट खुले तौर पर प्रकाशित करते हैं, ताकि कोई भी प्रयोग को दोहरा सके या Agent Lightning v1.0 को अपने स्वयं के शोध के लिए एक परीक्षण मंच के रूप में उपयोग कर सके।

उद्योग के लिए इसका क्या अर्थ है

harnessed agentic RL का उद्भव मॉडल और उसके परिवेश के सुसंगत कार्य पर जोर देता है, न कि केवल डेटा के साथ मॉडल को "भरने" पर। यदि पहले harness को एक सहायक विवरण माना जाता था, तो अब यह प्रशिक्षित लूप का हिस्सा बन जाता है। व्यवसायियों के लिए, इसका अर्थ है वास्तविक परिदृश्यों में एजेंटों का अधिक पूर्वानुमानित व्यवहार, और शोधकर्ताओं के लिए — खुले कार्यों का एक नया सेट: टोकनाइज़ेशन अनुकूलन से लेकर कम्प्यूटेशन शेड्यूलिंग तक।

Agent Lightning v1.0 इस क्षेत्र में एकमात्र प्रोजेक्ट नहीं है, लेकिन इसकी खुलापन और सरलता इसे प्रयोगों के लिए एक सुविधाजनक प्रारंभिक बिंदु बनाती है। यह बहुत संभव है कि निकट भविष्य में हम नए फ्रेमवर्क देखेंगे जो इन विचारों को औद्योगिक अनुप्रयोग तक ले जाएंगे।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
एजेंट लाइटनिंग v1.0: एजेंट RL को कैसे नियंत्रित करें और परिणाम 14 अंकों तक बढ़ाएं