FACA: नए उपकरण-आधारित एजेंट विधि

27 अगस्त 202615 बार देखा गया

शोधकर्ताओं ने FACA दृष्टिकोण प्रस्तावित किया है, जो केवल अंतिम परिणाम के बजाय प्रत्येक संवाद चरण के योगदान का मूल्यांकन करता है। यह परीक्षणों में बहु-चरणीय एजेंटों की गुणवत्ता में उल्लेखनीय सुधार करता है, विशेष रूप से Telecom परिदृश्यों में।

FACA: नए उपकरण-आधारित एजेंट विधि

आधुनिक AI एजेंट तेजी से संवाद मोड में काम कर रहे हैं: उपयोगकर्ता कार्य निर्धारित करता है, एजेंट टूल्स का उपयोग करता है, परिणाम लौटाता है, और व्यक्ति अनुरोध को स्पष्ट या सही करता है। ऐसी बहु-चरणीय अंतःक्रिया का मूल्यांकन करना कठिन है, क्योंकि अंत में केवल अंतिम परिणाम होता है। यह नहीं दिखाता कि एजेंट के कौन से कार्य वास्तव में सहायक थे और कौन से अनावश्यक निकले।

केवल परिणाम पर्याप्त क्यों नहीं है

ऐसे एजेंटों के लिए सुदृढीकरण सीखने में आमतौर पर रोलआउट का उपयोग किया जाता है: एजेंट क्रियाओं की एक श्रृंखला निष्पादित करता है, जिसके बाद उसे अंतिम परिणाम के लिए पुरस्कार मिलता है। यह दृष्टिकोण सुविधाजनक है, लेकिन काफी मोटा है। अनुरोध का सफल स्पष्टीकरण, स्पष्ट त्रुटि और बाद में सुधार को समान श्रेय मिलता है, हालाँकि अंतिम परिणाम में उनका योगदान पूरी तरह से अलग होता है। इस वजह से एजेंट धीमी गति से सीखता है और हमेशा यह नहीं समझ पाता कि कौन सा विशेष कार्य सफलता की ओर ले गया।

नए शोध के लेखक एक मूल्यवान सिग्नल स्रोत की ओर ध्यान आकर्षित करते हैं, जिसे अक्सर अनदेखा किया जाता है — उपयोगकर्ता की अगली प्रतिक्रिया। जब एजेंट अगला कदम उठाता है, तो व्यक्ति प्रतिक्रिया देता है: कार्य स्पष्ट करता है, असंतोष व्यक्त करता है, उत्तर की पुष्टि करता है। ऐसी प्रतिक्रिया केवल आगे के कदमों के लिए संदर्भ नहीं है, बल्कि अभी पूर्ण किए गए अंतःक्रिया खंड पर स्थानीय प्रतिक्रिया है।

FACA कैसे काम करता है

FACA विधि (Feedback-Aware Credit Assignment) उपयोगकर्ता की प्रतिक्रिया को एक पूर्ण प्रशिक्षण सिग्नल में बदल देती है। विचार यह है कि प्रत्येक प्रतिक्रिया को एजेंट के कार्यों के विशिष्ट खंड से मिलाया जाए, और फिर उस प्रतिक्रिया का स्थानीय लाभ परिकलित किया जाए — यह दिए गए संदर्भ के लिए अपेक्षित से कितना बेहतर है। यह लाभ सामान्यीकृत होता है और मानक टर्मिनल परिणाम लाभ में जोड़ा जाता है। इसके लिए न तो अतिरिक्त आलोचक की आवश्यकता होती है, न ही नए रोलआउट की — सब कुछ पहले से एकत्रित डेटा पर परिकलित होता है।

ऐसा संयोजन एजेंट को परिणाम का मोटा आकलन और अधिक सटीक मध्यवर्ती सिग्नल दोनों देता है। अतिरिक्त लाभ यह है कि विधि इन्फरेंस को जटिल नहीं बनाती: सभी अतिरिक्त सिग्नल पहले से मौजूद संवादों से निकाले जाते हैं, इसलिए इसे वास्तविक प्रणालियों में आसानी से लागू किया जा सकता है।

प्रयोगों के परिणाम

शोधकर्ताओं ने FACA की तुलना Interactive GRPO दृष्टिकोण से की, जो केवल परिणाम को ध्यान में रखता है। प्रशिक्षण समान परिस्थितियों में हुआ: वही सिम्युलेटर, वही दृश्य संवाद, वही प्रारंभिकरण और अनुकूलन। τ-परिवार के नौ डोमेन पर FACA ने 8B मॉडल के लिए औसत परिणाम 5.91 प्रतिशत अंक और 14B मॉडल के लिए 10.22 प्रतिशत अंक सुधारा। प्रत्येक मीट्रिक तीन स्वतंत्र रूप से प्रशिक्षित रनों पर प्राप्त किया गया था।

सबसे बड़ा लाभ Telecom डोमेन में मिला। उपयोगकर्ता प्रतिक्रियाओं की ध्रुवता को यादृच्छिक करने वाला अतिरिक्त प्रयोग दिखाता है कि 8B मॉडल के लिए यह लाभ पूरी तरह से गायब हो जाता है। यह पुष्टि करता है: सिग्नल उपयोगी जानकारी रखता है, न कि केवल शोर जोड़ता है। Pare-Bench और Co-Gym बेंचमार्क पर zero-shot मोड में परिणाम समान क्रम बनाए रखते हैं।

निष्कर्ष

यह कार्य स्पष्ट रूप से प्रदर्शित करता है कि उपयोगकर्ता की अगली प्रतिक्रिया केवल संदर्भ से अधिक है। यह सस्ता स्थानीय श्रेय देती है, जो बहु-चरणीय अंतःक्रिया के लिए एजेंटों के प्रशिक्षण में उल्लेखनीय सुधार करती है। FACA इस सिग्नल को सीखने की प्रक्रिया के महत्वपूर्ण पुनर्गठन के बिना निकालने का एक सरल और प्रभावी तरीका प्रस्तुत करता है। परिणामस्वरूप, एजेंट बेहतर समझते हैं कि कौन से कार्य वास्तव में उन्हें लक्ष्य के करीब लाते हैं, और कौन से पर पुनर्विचार करना चाहिए।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
FACA: नए उपकरण-आधारित एजेंट विधि