मॉडल के उत्तर में "मुझे यकीन है" का टैग कोई माप नहीं, बल्कि एक और दावा है जिसकी अलग से जाँच ज़रूरी है। जब तक ऐसे अनुमान एजेंट के लॉजिक में शामिल किए जाते हैं, तब तक यह समझना चाहिए कि उन पर कितना भरोसा किया जा सकता है।
आत्मविश्वास पर सवाल क्यों उठे
एजेंटिक सिस्टम अब अक्सर इस तरह बनाए जाते हैं कि अगला कदम मॉडल के आत्म-मूल्यांकन को देखकर चुना जाता है: अगर वह ज़्यादा आत्मविश्वास जताता है, तो कार्रवाई की जाती है, अगर कम — तो किसी इंसान या दूसरे टूल को शामिल किया जाता है। यह तरीका सिर्फ़ एक शर्त पर काम करता है: कार्रवाई के समय जताया गया आत्मविश्वास असल सफलता की दर से लगभग मेल खाना चाहिए।
Bhushan Kashinath Joshi का काम (arXiv:2608.24691, 25 अगस्त 2026 को जमा) ठीक इसी धारणा की जाँच करता है — और वह भी ऐसे माहौल में जहाँ चूक तुरंत दिख जाती है और उसे किस्मत का दोष नहीं ठहराया जा सकता।
परीक्षण का मैदान: छिपे राजा वाला शतरंज
पारंपरिक शतरंज ऐसी जाँच के लिए ठीक नहीं बैठता: वहाँ सब कुछ खुला होता है, और "आत्मविश्वास" अनिवार्य रूप से खेल की ताकत के साथ घुल-मिल जाता है। इसलिए छिपी जानकारी वाला एक प्रारूप चुना गया, जहाँ राजा का दर्जा चुपचाप और कई बार एक मोहरे से दूसरे मोहरे पर जा सकता है। खिलाड़ी को नहीं पता होता कि मुख्य लक्ष्य इस समय कहाँ है, और उसे अंदाज़ों के आधार पर चलना पड़ता है।
तरीके की अहम बारीकी: एजेंट से हर चाल पर अलग से यह पूछा गया कि प्रतिद्वंद्वी का कौन-सा मोहरा चुपचाप राजा का दर्जा लिए हुए है — इसका संभाव्यता वितरण क्या है। यह चाल से स्वतंत्र रूप से पूछा गया — ताकि "मैं कहाँ गया" और "मैं क्या मानता हूँ" को मिलाया न जाए। असली स्थिति बाद में बहाल की गई और जताए गए आँकड़ों से मिलाई गई।

बासठ में से एक सही जवाब
मुख्य नतीजा किसी दुर्घटना जैसा लगता है। दो स्वतंत्र शृंखलाओं में, छिपे मोहरे की स्थिति के बारे में 0.5 से कम न होने वाले जताए गए आत्मविश्वास के साथ की गई बाज़ियाँ 62 में से सिर्फ़ 1 मामले में सही निकलीं। प्रतिशत में कहें तो "हाँ की ओर झुकाव" वाली जताई गई संभावना करीब डेढ़ प्रतिशत मामलों में सच हुई — यह अंतर प्रतिशत का नहीं, बल्कि परिमाण के कई गुना का है।
साथ ही, कैलिब्रेशन की यह कमी लगभग पूरी तरह इन्हीं घटनाओं में केंद्रित है: मूल शृंखला में 99.3% और दोहराई गई शृंखला में 98.7%। दूसरे शब्दों में, समस्या पूरे खेल में समान रूप से फैली हुई नहीं है — यह उन क्षणों में सिमटी है जब मॉडल ख़ास तौर पर ज़ोरदार ढंग से अपनी सही होने की बात करता है, और ठीक तब जब जोखिम भरी कार्रवाई उस पर निर्भर करती है।
दूसरी कॉन्फ़िगरेशन में भी वही पैटर्न
लेखक सिर्फ़ एक मॉडल तक सीमित नहीं रहे। जाँच में चार और कॉन्फ़िगरेशन शामिल थे, जिनमें दूसरा प्रदाता भी था। तस्वीर कमज़ोर रूप में दोहराती है और एक सुसंगत क्रम में सामने आती है — लेकिन यहाँ सावधानी ज़रूरी है: सिर्फ़ बिंदु-आकलन तुलनीय रहते हैं, और इतने नमूने के आकार पर ज़्यादातर जोड़ीदार अंतर सांख्यिकीय रूप से अलग-अलग नहीं कहे जा सकते।
लेखक ख़ुद इसे निष्कर्ष के विस्तार (scope) के रूप में बताते हैं, न कि इस बात के प्रमाण के रूप में कि मॉडल की क्षमता का स्तर उसके कैलिब्रेशन का पूर्वानुमान लगाता है। यानी यह न "जितना होशियार मॉडल, उतना ही बेहतर ख़ुद को आँकता है" है और न इसका उल्टा — बस यह घटना एक ख़ास सिस्टम से ज़्यादा व्यापक है।

विचार-बजट मीट्रिक को उम्मीद से ज़्यादा हिलाता है
एक और अप्रिय पहलू — लीडरबोर्ड में एक ही बाहरी रैंकिंग पर एक ही मॉडल की तुलना। बदलता सिर्फ़ विचार-बजट (deliberation budget) है, यानी मॉडल "सोचने में" कितना समय लगाता है। तो यह बदलाव कैलिब्रेशन मीट्रिक को लगभग उतना ही हिला देता है जितना अलग-अलग मॉडलों के बीच का बड़ा अंतर।
व्यावहारिक निष्कर्ष सीधा और असुविधाजनक है: जोखिम के आकलन वाले कामों के लिए सिस्टम चुनते समय लीडरबोर्ड में जगह को आधार नहीं बनाया जा सकता। एक ही मॉडल के भीतर, सेटिंग से पैदा हुआ फैलाव उतना ही है जितना हम एक मॉडल की दूसरे पर गंभीर बढ़त मानने के आदी हैं।
पारंपरिक मीट्रिक उल्टा भी दिखा सकते हैं
एक और नतीजा मापने के चिर-परिचित तरीकों पर चोट करता है। किसी अलग स्थान (seat) पर, आकलन की मानक धुरियाँ — चालों की वैधता, लागत, विलंब, पूरी की गई बाज़ियों का अनुपात — मॉडल की मान्यताओं की गुणवत्ता से पूरी तरह अलग हो सकती हैं। जो कॉन्फ़िगरेशन सभी पारंपरिक संकेतकों पर एक साथ जीत रहा था, उसने परीक्षण किए गए सभी में सबसे ख़राब मान्यता-गुणवत्ता दिखाई।
यहाँ व्याख्या में गलती करना आसान है: बात यह नहीं है कि सटीकता और सस्तापन अपने आप में नुकसानदेह हैं। बात यह है कि जिन मीट्रिकों के समूह को हम आम तौर पर पूर्ण मानते हैं, वह उस गुण को मापता ही नहीं जिसमें हमारी दिलचस्पी है — वह किसी और चीज़ के बारे में है।
"नतीजे के आधार पर" आकलन कुछ क्यों नहीं पकड़ेगा
सबसे अप्रिय परिणाम — छिपाव। बताए गए पैटर्न वाला मॉडल वही बाज़ी फिर भी जीत सकता है जिसके बारे में उसने ग़लत मान्यताएँ बनाई थीं। नतीजा अच्छा, लेकिन भीतर की दुनिया की तस्वीर ग़लत।
इससे यह निकलता है कि सिर्फ़ नतीजे के आधार पर जाँच (outcome-only) ऐसी ख़राबियों को सिद्धांत रूप में पकड़ ही नहीं सकती: जीत सवाल ख़त्म कर देती है, और कमज़ोर जगह सिस्टम में अगली बार तक बनी रहती है — बस फिर ऐसे काम में, जहाँ सही नतीजा न मिले।

व्यवहार में इसका क्या करें
कुछ व्यावहारिक निष्कर्ष जो नतीजों से सीधे निकलते हैं।
- मॉडल से उसका ख़ुद का संभाव्यता वितरण मुख्य अज्ञात के बारे में पूछें — और उसे चुनी गई कार्रवाई से अलग रखें। इन दो चीज़ों को अलग किए बिना कैलिब्रेशन का आकलन नहीं हो सकता।
- जताए गए आत्मविश्वास की तुलना अपने डेटा पर असल सफलता की दर से करें, न कि मॉडल के कार्ड में लिखे आँकड़ों पर भरोसा करें। छिपे मोहरे वाले खेल में अंतर बहुत बड़ा निकला, और कोई गारंटी नहीं कि किसी व्यावहारिक काम में यह कम होगा।
- जिस सीमा पर सिस्टम फ़ैसला इंसान को सौंपता है, उसकी जाँच सामान्य सटीकता से अलग करके करें। चूकें ठीक ज़्यादा जताए गए आत्मविश्वास वाले क्षेत्र में झुंड बनाती हैं।
- किसी भी तुलना में विचार-बजट तय रखें। वरना आप सेटिंग माप रहे होंगे, मॉडल नहीं।
- जीत या सफल नतीजे को सिस्टम की भीतरी मान्यताओं के सही होने का प्रमाण न मानें।
इस खोज का सार यह नहीं है कि मॉडल "ख़राब" हैं। बल्कि यह कि आत्मविश्वास और सही होना — दो अलग संकेतक हैं, और पहला अभी दूसरे का विकल्प बनने लायक नहीं है। जब तक एजेंटिक आर्किटेक्चर आत्म-मूल्यांकन के इर्द-गिर्द बनते हैं, तब तक इस फ़र्क़ को साफ़ तौर पर मापना पड़ेगा।



