उपयोगकर्ता का चरित्र एक स्ट्रेस-टेस्ट के रूप में: एजेंटिक सर्च के लिए AgentWorld सिम्युलेटर ने क्या दिखाया

16 सितम्बर 202613 बार देखा गया

Agent4IR @ KDD 2026 के शोधकर्ताओं ने AgentWorld प्रस्तुत किया — एक ऐसा वातावरण जहाँ AI एजेंट्स की मज़बूती की परख की जाती है, उनके साथ OCEAN मॉडल के आधार पर अलग-अलग व्यक्तित्व प्रोफ़ाइल वाले वर्चुअल उपयोगकर्ताओं को जोड़कर और प्रतिस्पर्धात्मक विक्षोभ जोड़कर। यह दृष्टिकोण एजेंट्स के व्यवहार में उन कमियों को उजागर करता है, जिन्हें सामान्य एक-जैसी टेस्टिंग बिल्कुल नहीं पकड़ पाती।

उपयोगकर्ता का चरित्र एक स्ट्रेस-टेस्ट के रूप में: एजेंटिक सर्च के लिए AgentWorld सिम्युलेटर ने क्या दिखाया

एजेंट मूल्यांकन आमतौर पर सावधानी से लिखे गए परिदृश्यों पर आधारित होता है: पहले से ज्ञात संवाद, अनुमानित क्वेरी, एक "औसत" उपयोगकर्ता। ऐसे दृष्टिकोण को मापना सुविधाजनक होता है, लेकिन यह वास्तविकता को खराब ढंग से दर्शाता है, जहाँ एक ही इंटरफ़ेस के सामने पूरी तरह अलग गति, शैली और धैर्य वाले लोग बैठते हैं। AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval (arXiv:2608.24076, वर्कशॉप Agent4IR @ KDD 2026 में स्वीकृत) पर काम एजेंट की विश्वसनीयता को अलग नज़रिए से देखने का सुझाव देता है — बातचीत करने वाले के स्वभाव के माध्यम से और उस स्वभाव को तोड़ने के प्रयासों के माध्यम से।

स्क्रिप्ट से व्यक्तित्व तक: अंतराल कहाँ है

एजेंटिक सर्च के लिए क्लासिक बेंचमार्क इस प्रश्न का उत्तर देता है कि "क्या एजेंट ने कार्य हल किया"। लेकिन यह उस बारे में चुप रहता है कि चरणों के बीच क्या होता है, और परिणामों के प्रसार के बारे में लगभग कुछ नहीं बताता। यदि परीक्षण में सभी उपयोगकर्ता एक जैसा व्यवहार करते हैं, और सिस्टम पर हमलों का मॉडलिंग ही नहीं किया जाता, तो निष्कर्ष भी बंध्य होते हैं: ऐसे मापन से यह समझना असंभव है कि एजेंट वास्तव में कहाँ लड़खड़ाने लगता है।

यही इस अंतराल को लेखक — Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra और Vignesh Divakaran — भरने का प्रयास करते हैं। उनका मुख्य विचार सरल है: उपयोगकर्ताओं के व्यवहार के प्रसार को समतल नहीं करना चाहिए, बल्कि उसे एक अलग मापक यंत्र में बदलना चाहिए।

AgentWorld क्या है

AgentWorld एक सिम्युलेटर है, कोई अलग सर्च इंजन नहीं। यह एजेंट की जगह कार्य हल नहीं करता, बल्कि एक ऐसा वातावरण बनाता है जिसमें एजेंट को अलग-अलग परिदृश्यों और अलग-अलग प्रकार के वार्ताकारों के साथ चलाया जा सकता है, और न केवल अंतिम उत्तर बल्कि उसे प्राप्त करने का पथ भी दर्ज किया जाता है।

चार आधार स्तंभ

  1. Big Five पर आधारित उपयोगकर्ता मॉडल। पर्सोना पाँच-कारक मॉडल (जिसे OCEAN भी कहा जाता है) से परिभाषित होते हैं, और वे निर्वात में काम नहीं करते: प्रत्येक उपयोगकर्ता की अपनी स्थिति और अपना उपलब्ध उपकरणों का सेट होता है, और ये स्थितियाँ संवाद के दौरान बदलती रहती हैं।
  2. pass^k संगतता मीट्रिक। यह केवल "कितनी बार सफल हुआ" नहीं है। इसके साथ विफलताओं का संरचनात्मक वर्गीकरण, अपूर्ण लेकिन सार्थक प्रगति के लिए आंशिक अंक, और नियंत्रण हस्तांतरण की दोहरी जाँच होती है — यानी अलग से सत्यापित किया जाता है कि एजेंट ने मनुष्य या किसी अन्य सिस्टम को बारी सही ढंग से सौंपी या नहीं।
  3. फाइन-ट्यूनिंग के लिए डेटा निर्यात। सिम्युलेटर संचित रनों को निर्यात कर सकता है, कमज़ोर मूल्यांकन वालों को छाँटकर, सीधे छह फ़ॉर्मेट में जो फाइन-ट्यूनिंग के लिए उपयुक्त हैं।
  4. प्रतिस्पर्धात्मक Risk Analyser। यह मॉड्यूल उन मध्यवर्ती अवस्थाओं की "रीढ़" का स्नैपशॉट लेता है जिनसे एजेंट को गुज़रना अनिवार्य है, और फिर किसी विशिष्ट कार्य से जुड़े चार प्रकार के विक्षोभों के अनुसार मोंटे-कार्लो विधि से रनों को शाखित करता है। अंतिम जोखिम की गणना ΔP / ΔT अनुपात, डेम्पस्टर—शेफर साक्ष्य संलयन और शैप्ले द्वारा आक्रमण श्रेणियों के आरोपण के माध्यम से की जाती है।

तर्क पर ध्यान दें: पहले तीन ब्लॉक मापन और प्रशिक्षण के बारे में हैं, चौथा टूटने की भविष्यवाणी के बारे में। यह फ़्रेमवर्क शुरू से ही न केवल निदान बल्कि स्ट्रेस-टेस्टिंग के उपकरण के रूप में बनाया गया है।

तीन रन: विश्लेषणात्मक से प्रतिस्पर्धात्मक आक्रमण तक

प्रायोगिक भाग "भार" की अलग-अलग मात्रा वाले तीन हिस्सों से बना है।

  • संवादात्मक विश्लेषणात्मक एजेंट को दस OCEAN पर्सोना के विरुद्ध चलाया गया। गुणवत्ता अंकन के लिए 240 न्यायिक मूल्यांकन एकत्र किए गए।
  • ग्राहक सहायता एजेंट को पाँच कार्यों पर परखा गया, प्रत्येक पर्सोना के चार रूपों में।
  • प्रतिस्पर्धात्मक स्ट्रेस-टेस्ट उन्हीं पाँच कार्यों का: यहाँ विक्षोभ जोड़े गए, ताकि देखा जा सके कि पथ कितनी जल्दी बिखरते हैं।

तीसरा रन सबसे अधिक बोधक निकला। विक्षोभों के अभाव में भी पथ की न्यूनतम स्थिरता V_min = 0.375 रही — यानी "स्वच्छ" परिस्थितियाँ भी मज़बूती का कोई अतिरिक्त मार्जिन नहीं देतीं। और जब हमले शुरू किए गए, तो पता चला कि सबसे खतरनाक प्रहार क्वेरी की सामग्री पर नहीं, बल्कि उपकरणों और अवसंरचना पर होते हैं: शैप्ले आरोपण सिस्टम स्तर को लगभग 46%, क्रिया स्तर को लगभग 38% देता है।

यह ज़ोर में एक महत्वपूर्ण बदलाव है। एजेंट सुरक्षा की चर्चा अक्सर टेक्स्ट में प्रॉम्प्ट-इंजेक्शन तक सिमट जाती है, जबकि आँकड़े बताते हैं कि मुख्य जोखिम उस परत में रहता है जो उपकरण कॉल और उनकी स्थिति के लिए ज़िम्मेदार है।

स्वभाव विचलन का स्रोत

लेख में सबसे दिलचस्प बात निरपेक्ष मूल्यांकन नहीं, बल्कि पर्सोना के बीच का प्रसार है। एक ही कार्य पर सफलता दर मूल रूप से भिन्न रही: 50% बनाम 100%। यह मापन का शोर नहीं, बल्कि इस बात का संकेत है कि एजेंट अलग-अलग संवाद शैलियों से अलग-अलग ढंग से निपटता है।

अलग से उन विफलता मोडों की सूची दी गई है जिन्हें एकरूप परीक्षण बिल्कुल नहीं दिखाता:

  • क्रॉस-डोमेन लीक — जब एक कार्य का संदर्भ दूसरे में रिस जाता है;
  • संदर्भ बहाव — लंबे संवाद के दौरान विषय और लक्ष्यों का क्रमिक खिसकना;
  • गुणवत्ता में अंतर पर्सोना के बीच 0.27 अंक का।

लेखक ज़ोर देते हैं कि Risk Analyser पथ के स्तर पर नाज़ुकता माप सकता है — वहाँ जहाँ अकेला pass^k मीट्रिक विवश है, क्योंकि वह केवल सफलता या विफलता का तथ्य दर्ज करता है और "पहले ही चरण में टूट गया" और "लगभग अंत तक पहुँचा लेकिन स्थिति नहीं बनाए रख सका" में अंतर नहीं करता।

व्यवहार में यह किस काम आता है

यदि निष्कर्षों को नुस्खे की तरह देखें, तो वह इस प्रकार है: एजेंट का परीक्षण एक "औसत" उपयोगकर्ता पर नहीं, बल्कि स्वभावों के समूह पर करें, और उनके बीच के प्रसार को देखें, औसत को नहीं। औसत अंक काफ़ी अच्छा हो सकता है, जबकि आधे पर्सोना लगातार परिदृश्य में विफल हो रहे हों।

दूसरी व्यावहारिक परत — डेटा। चूँकि सिम्युलेटर सफल और असफल रनों को चिह्नित कर सकता है और उन्हें तैयार फ़ॉर्मेट में निर्यात कर सकता है, व्यक्तित्व न केवल परीक्षा बल्कि प्रशिक्षण सामग्री का स्रोत भी बन जाते हैं। यहाँ कमज़ोर बिंदु स्पष्ट है: ऐसे डेटासेट की गुणवत्ता पूरी तरह अंकन की गुणवत्ता पर निर्भर करती है, और न्यायिक मूल्यांकन प्रक्रिया का सबसे महँगा और व्यक्तिपरक हिस्सा है।

अंत में, तीसरी परत — सुरक्षा में प्राथमिकताएँ। चूँकि जोखिम का मुख्य हिस्सा सिस्टम स्तर और क्रियाओं पर पड़ता है, न कि शब्दावली पर, इसलिए सबसे पहले पहुँच अधिकार, कॉल सत्यापन और नियंत्रण हस्तांतरण की शुद्धता को मज़बूत करना चाहिए, न कि केवल इनपुट टेक्स्ट पर फ़िल्टर।

ध्यान में रखने योग्य बातें

पैमाने को याद रखना चाहिए: बात तीन प्रयोग सेटों की है, उनमें से एक में दस पर्सोना और अन्य दो में पाँच कार्य। 50% बनाम 100% जैसे आँकड़े नाटकीय लगते हैं, लेकिन वे छोटे नमूने पर आधारित हैं — यह अंतिम फ़ैसले की तुलना में दिशा का संकेत अधिक है। इसके अलावा, Big Five पर आधारित उपयोगकर्ता सिम्युलेशन अनिवार्य रूप से वास्तविक स्वभाव को कठोर बना देता है: जीवित मनुष्य असंगत होता है, जबकि सिम्युलेटर का पर्सोना फिर भी निर्धारित प्रोफ़ाइल का पालन करता है।

फिर भी पद्धतिगत विचार ठोस और स्थानांतरणीय लगता है। एजेंट की विश्वसनीयता एक संख्या नहीं, बल्कि वार्ताकारों के प्रकारों और विफलता के प्रकारों के अनुसार एक वितरण है। सिम्युलेटर AgentWorld इस दिशा में पहला गंभीर कदम उठाता है कि इस वितरण को मापा जा सके, अनुमान न लगाया जाए।

लेख का संस्करण v1 25 अगस्त 2026 को आया, वर्तमान v2 26 अगस्त 2026 का (आकार 1,710 KB); DOI — 10.48550/arXiv.2608.24076, विषय — cs.AI।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
उपयोगकर्ता का चरित्र एक स्ट्रेस-टेस्ट के रूप में: एजेंटिक सर्च के लिए AgentWorld सिम्युलेटर ने क्या दिखाया