Palmyra x6: 626 इंस्ट्रुमेंटल सीनारियो पर एंकर फाइन-ट्यूनिंग ने कॉर्पोरेट LLM को बेंचमार्क में अग्रणी बना दिया

8 सितम्बर 202617 बार देखा गया

Mixture-of-Experts आर्किटेक्चर पर आधारित Palmyra x6 मॉडल को सिंथेटिक टूल-उपयोग ट्रैजेक्टरीज़ के साथ रूढ़िवादी पोस्ट-ट्रेनिंग पद्धति से गुज़ारा गया। इस दृष्टिकोण ने इसे छह सार्वजनिक परीक्षणों में समकक्षों के बीच सर्वश्रेष्ठ प्रदर्शन दिलाया, जिसमें BFCL Core पर रिकॉर्ड 0.785 स्कोर शामिल है।

Palmyra x6: 626 इंस्ट्रुमेंटल सीनारियो पर एंकर फाइन-ट्यूनिंग ने कॉर्पोरेट LLM को बेंचमार्क में अग्रणी बना दिया

Palmyra x6 को क्या खास बनाता है

कॉर्पोरेट भाषा मॉडल की श्रेणी में एक नया उल्लेखनीय नाम जुड़ गया है: Palmyra x6। यह कोई और मॉडल नहीं है जिसने केवल बेहतर टेक्स्ट जनरेट करना सीखा हो। इसकी मुख्य विशेषज्ञता एजेंट-आधारित कार्यों में है, जहाँ सिस्टम को केवल सोचना नहीं होता, बल्कि वास्तव में बाहरी टूल्स से संपर्क करना, परिणाम प्राप्त करना और आगे कार्य करना होता है।

मॉडल स्वयं Mixture-of-Experts आर्किटेक्चर पर आधारित है, लेकिन असली दिलचस्पी इस बात में है कि इसे कैसे फाइन-ट्यून किया गया। लेखकों ने तथाकथित एंकर्ड सुपरवाइज़्ड फाइन-ट्यूनिंग लागू की। और यहाँ एक अप्रत्याशित मोड़ है: "मॉडल को लाखों उदाहरण खिलाने" के बजाय, उन्होंने केवल 626 सत्यापित ट्रेजेक्ट्रीज़ लीं। प्रत्येक ट्रेजेक्ट्री एक सिंथेटिक, लेकिन सत्यापित टूल-उपयोग परिदृश्य है। प्रशिक्षण केवल एक एपॉक के लिए, कम लर्निंग रेट के साथ चला, और ताकि मॉडल अपने मौजूदा कौशल न खोए, उसे KL-एंकर की मदद से फ्रोज़न बेस वर्ज़न के पास "रोके" रखा गया। ऑप्टिमाइज़र के रूप में Muon + Adam की हाइब्रिड योजना का उपयोग किया गया।

यह लगभग एक विरोधाभास जैसा लगता है: एक आधुनिक LLM, पैमाने में विशाल — और केवल कुछ सौ उदाहरण। लेकिन इसी कॉम्पैक्ट और सटीक दृष्टिकोण ने Writer Agent एजेंट वातावरण के लिए पिछले मानक मॉडल की तुलना में महत्वपूर्ण सुधार हासिल करने में मदद की। ऐसा लगता है कि मॉडल फाइन-ट्यूनिंग में कभी-कभी डेटा की मात्रा से ज़्यादा महत्वपूर्ण यह होता है कि वह वांछित व्यवहार को कितनी सटीकता से दर्शाता है।

एंकर्ड फाइन-ट्यूनिंग कैसे काम करती है

यदि प्रक्रिया को चरण-दर-चरण समझें, तो यह काफी सुंदर श्रृंखला बनती है। पहले उदाहरणों का एक कॉर्पस तैयार किया जाता है। डेटा वास्तविक ट्रैफ़िक से एकत्र नहीं किया जाता, बल्कि विशिष्ट टूल-आधारित परिदृश्यों को कवर करने के लिए संश्लेषित किया जाता है: फ़ंक्शन कॉल, प्रतिक्रिया प्रोसेसिंग, क्वेरी स्पष्टीकरण, दोबारा कॉल। जनरेशन के बाद, प्रत्येक परिदृश्य सत्यापन से गुजरता है — अंतिम सेट में केवल वे ही शामिल होते हैं जो दिए गए कार्य को वास्तव में सही ढंग से हल करते हैं।

फिर सबसे दिलचस्प हिस्सा शुरू होता है। मॉडल को केवल इन उदाहरणों पर फाइन-ट्यून नहीं किया जाता, बल्कि यह एक एंकर के साथ किया जाता है। KL-डाइवर्जेंस की मदद से इसके व्यवहार को सीमित किया जाता है: नया संस्करण टूल-आधारित कार्यों के लिए अनुकूलित हो सकता है, लेकिन उसे फ्रोज़न बेस मॉडल से बहुत अधिक विचलित होने की अनुमति नहीं है। यह किसी ऐसे व्यक्ति के प्रशिक्षण जैसा है जो विषय को पहले से अच्छी तरह जानता है: उसे सभी संभावित विकल्प नहीं दिखाए जाते, बल्कि केवल कुछ प्रमुख तकनीकें दिखाई जाती हैं, लेकिन साथ ही पुराने ज्ञान को न भूलने के लिए भी कहा जाता है।

"छोटा सैंपल + एक पास + कम लर्निंग रेट" का संयोजन जोखिम भरा लगता है, लेकिन इसी ने Palmyra x6 मॉडल को बिना किसी विनाशकारी भूलने के नए परिदृश्यों को सटीक रूप से एकीकृत करने की अनुमति दी। और हाइब्रिड ऑप्टिमाइज़र Muon + Adam इस प्रक्रिया में कम्प्यूटेशनल दक्षता भी जोड़ता है।

बेंचमार्क पर प्रदर्शन

इस तरह के फाइन-ट्यूनिंग का प्रभाव सार्वजनिक परीक्षणों में देखा जा सकता है। BFCL Core बेंचमार्क पर मॉडल 0.785 तक पहुँचता है — यह तुलना में शामिल कई हाल ही में जारी मॉडलों में सर्वश्रेष्ठ परिणाम है। और मॉडल केवल किसी एक अभ्यास में मजबूत नहीं है: यदि छह अलग-अलग बेंचमार्क का औसत निकाला जाए, तो Palmyra x6 फिर से समूह के अन्य सदस्यों से ऊपर होता है।

बायस और सुरक्षा मूल्यांकन पर विशेष रूप से ध्यान देना चाहिए। एजेंट क्षमताओं में तेज सुधार अक्सर पूर्वाग्रह या खतरनाक प्रतिक्रियाओं में वृद्धि के साथ होता है, लेकिन यहाँ ऐसा नहीं हुआ। पूर्वाग्रह और सुरक्षा मेट्रिक्स पर, मॉडल या तो प्रतिस्पर्धियों के स्तर पर होता है या आगे निकल जाता है। कॉर्पोरेट उपयोग के लिए यह मौलिक रूप से महत्वपूर्ण है: कंपनियों को केवल "स्मार्ट" नहीं, बल्कि नियंत्रणीय सहायकों की भी आवश्यकता होती है।

यह व्यावसायिक एजेंटों के लिए क्यों महत्वपूर्ण है

जो कंपनियाँ अपने स्वयं के एजेंट बना रही हैं, उनके लिए यह मामला एक अच्छा संकेत है। फाइन-ट्यूनिंग के लिए हमेशा करोड़ों डेटासेट और हफ्तों के कम्प्यूटेशनल समय की आवश्यकता नहीं होती। कभी-कभी कुछ सौ गुणवत्तापूर्ण, सत्यापित परिदृश्यों पर ध्यान केंद्रित करना और एक ऐसी तकनीक लागू करना पर्याप्त होता है जो मॉडल को पहले से ज्ञात व्यवहार से "भटकने" न दे।

बेशक, 626 ट्रेजेक्ट्रीज़ वास्तविक जीवन की सभी संभावित स्थितियों को कवर नहीं करतीं। लेकिन वे सही दिशा निर्धारित करती हैं: मॉडल समझता है कि टूल्स के साथ कैसे काम करना है, और बुनियादी ज्ञान इन पैटर्न को नए मामलों में सामान्यीकृत करने में मदद करता है। यह कॉर्पोरेट वातावरण में विशेष रूप से मूल्यवान है, जहाँ गोपनीयता प्रतिबंधों और विशेषज्ञ एनोटेशन की उच्च लागत के कारण एजेंट के वास्तविक कार्यों का बड़ा सेट इकट्ठा करना मुश्किल होता है।

इसीलिए Palmyra x6 को केवल एक और अपडेट के रूप में नहीं, बल्कि इस बात के प्रदर्शन के रूप में देखा जाना चाहिए कि एजेंट LLM का फाइन-ट्यूनिंग किस दिशा में आगे बढ़ रहा है। और यह देखते हुए कि मॉडल पहले से ही Writer Agent के पिछले संस्करण की तुलना में उल्लेखनीय सुधार दिखा रहा है, ऐसे कॉम्पैक्ट लेकिन सटीक तरीके enterprise-एजेंटों के लिए नया मानक बन सकते हैं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
Palmyra x6: 626 इंस्ट्रुमेंटल सीनारियो पर एंकर फाइन-ट्यूनिंग ने कॉर्पोरेट LLM को बेंचमार्क में अग्रणी बना दिया