प्रयोग की सार
फीफा विश्व कप एआई के लिए एक आदर्श परीक्षण ग्राउंड है: केवल 104 मैचों, सख्त नियमों और कारकों की एक बड़ी संख्या। शोधकर्ताओं ने जॉनाद Shianifar और Iias Faiud ने एआई वर्ल्ड कप 2026 बेंचमार्क बनाने के लिए इस कार्यक्रम का उपयोग करने का फैसला किया। बड़े भाषा मॉडल के आधार पर दस सहायकों ने प्रयोग में भाग लिया। उनमें से प्रत्येक को पूरे टूर्नामेंट के लिए एक भविष्यवाणी करनी थी - शुरुआती सीटी से पहले।
स्थितियां सभी के लिए बिल्कुल समान थीं: टूर्नामेंट की जानकारी का वही स्नैपशॉट, एक एकल प्रॉम्प्ट, एक ही JSON प्रतिक्रिया स्कीमा और एक सामान्य स्कोरिंग प्रक्रिया। यह दृष्टिकोण यादृच्छिक मतभेदों को समाप्त करता है और संकेतों की गुणवत्ता के बजाय खुद मॉडल की क्षमताओं की तुलना करने की अनुमति देता है। भविष्यवाणी में न केवल हर ग्रुप-स्टेज मैच का स्कोर शामिल था, बल्कि फाइनल ग्रुप स्टैंडिंग, फुल प्लेऑफ़ ब्रैकेट, टीमों की अंतिम स्थिति, साथ ही मॉडल के आत्मविश्वास स्तर और इसके निर्णय का संक्षिप्त विवरण भी शामिल था।

कैसे काम करता है
एआई वर्ल्ड कप की मुख्य विशेषता एक भविष्यवाणी का समग्र मूल्यांकन है। अंक टूर्नामेंट के प्रत्येक भाग के लिए सम्मानित किया गया: एक सही अनुमान मैच स्कोर के लिए अपने समूह में एक टीम की सही स्थिति के लिए, एक प्लेऑफ़ जोड़ी के सही विजेता के लिए, और इसी तरह। लेखकों ने जानबूझकर स्कोरिंग पारदर्शी बनाया: सूत्रों और कोड प्रकाशित किए गए हैं, इसलिए कोई भी परिणाम पुन: उत्पन्न कर सकता है।
यह डिज़ाइन महत्वपूर्ण है क्योंकि यह बताता है कि टूर्नामेंट का कौन सा हिस्सा अंतिम रैंकिंग में योगदान देता है। जैसा कि बाद की गणना से पता चला कि योगदान निकल गया अत्यंत असमान होना मैच शुरू होने के बाद मॉडल को उनके जवाब को संशोधित करने की अनुमति नहीं दी गई थी - टूर्नामेंट से पहले भविष्यवाणी बंद हो गई थी। यह एक विश्लेषक के वास्तविक कार्य को अनुकरण करता है जिसे मध्यवर्ती परिणामों पर peek करने की क्षमता के बिना अग्रिम में अंतिम पूर्वानुमान देना चाहिए।
कौन समग्र खड़ा जीता
एक व्यापक मार्जिन द्वारा पहली जगह GPT-5.5 सोच — 744 अंक के लिए चला गया। दूसरा परिणाम द्वारा पोस्ट किया गया था GPT-5.5 (717 अंक) Gemini (699), और चौथा - Qwen 3.7 (687)। दिलचस्प बात यह है कि केवल विजेता ने स्पेन के शीर्षक की भविष्यवाणी की - वास्तविक फाइनल में, स्पेनीर्ड्स ने अर्जेंटीना 1:0 को हराया। ऐसा लगता है कि लंबे समय तक तर्क के लिए मॉडल की क्षमता ने इसे बहु-चरण कार्य में बढ़त दी।
क्यों नाटक सब कुछ तय करते हैं
अप्रत्याशित खोज सहसंबंध विश्लेषण है। एक मॉडल का कुल स्कोर लगभग पूरी तरह से प्लेऑफ़ भविष्यवाणियों के लिए अर्जित अंकों से संबंधित है: सहसंबंध गुणांक 0.986 था। उसी समय, समूह-चरण परिणामों के साथ संबंध लगभग शून्य (r=0.055) था, और समूह-स्थिति भविष्यवाणियों के साथ यह भी नकारात्मक (r=–0.103) था। प्लेऑफ से पहले संचयी स्कोर का अंतिम प्लेसमेंट (R = -0.054) पर भी कोई प्रभाव नहीं पड़ा।
इसका मतलब यह है कि बेंचमार्क में सफलता इस बात पर निर्भर नहीं है कि कैसे एक मॉडल ने व्यक्तिगत मैचों के स्कोर की भविष्यवाणी की थी, लेकिन यह सही ढंग से टूर्नामेंट ब्रैकेट का निर्माण कर सकता है। समूह चरण में गलतियां सटीक प्लेऑफ़ पूर्वानुमान द्वारा क्षतिपूर्ति की जा सकती हैं, और इसके विपरीत - प्लेऑफ़ में किसी भी मिस रैंकिंग में घातक थे।

व्यक्तिगत मैचों पर सटीकता क्या मायने रखती है?
लेखकों ने अलग से समूह-चरण परिणाम भविष्यवाणियों की सटीकता की जांच की। यहां सबसे अच्छा मॉडल क्लाउड सोनेट 4.6 था - यह सही ढंग से परिणामों के 63.89% अनुमान लगाया गया था। हालांकि, यह केवल छठे में समाप्त हुआ समग्र खड़ा है। इसलिए व्यक्तिगत मैचों का अनुमान लगाने की क्षमता एक समग्र टूर्नामेंट भविष्यवाणी में सफलता की गारंटी नहीं देती है। एक मॉडल बड़ी तस्वीर खोते समय स्थानीय कार्यों में उत्कृष्टता प्राप्त कर सकता है - उदाहरण के लिए, प्लेऑफ़ ब्रैकेट में टीमों को गलत तरीके से बदलना या अंतिम पदों में गलतियों को बनाना।
गोपनीयता नीति
एक अन्य महत्वपूर्ण निष्कर्ष विश्वास अंशांकन से संबंधित है। मॉडल ने संकेत दिया कि वे अपने भविष्यवाणियों में कैसे विश्वास रखते थे, लेकिन इन अनुमानों में वास्तविक परिणामों के साथ कुछ भी नहीं था। परिणाम सटीकता के साथ औसत आत्मविश्वास का सहसंबंध 0.060 था, और कुल स्कोर -0.067 के साथ। दूसरे शब्दों में, सबसे आत्मविश्वासी मॉडल सबसे सटीक नहीं था, और सबसे मामूली एक जरूरी गलत नहीं था। यह एक अनुस्मारक है कि एक तंत्रिका नेटवर्क का आत्म-मूल्यांकन एक गुणवत्ता मीट्रिक नहीं है लेकिन केवल अपने आंतरिक संभावना वितरण का प्रतिबिंब है।
एआई पूर्वानुमान के लिए इसका क्या मतलब है
लेखक का मुख्य निष्कर्ष यह है कि पूरे टूर्नामेंट का पूर्वानुमान एक-एक करके मैचों की भविष्यवाणी करने की तुलना में अलग-अलग क्षमताओं का परीक्षण करता है। अंतिम रैंकिंग स्कोरिंग सिस्टम के डिजाइन पर काफी निर्भर करती है: यदि अंक अलग-अलग दिए गए हैं, तो मॉडल का ऑर्डर बदल सकता है। यह किसी भी व्यक्ति के लिए एनालिटिक्स में एआई का उपयोग करने के लिए एक महत्वपूर्ण अनुस्मारक है: आपको स्पष्ट रूप से समझने की आवश्यकता है कि मॉडल किस कार्य को हल करना है और क्या वास्तव में हम मापना चाहते हैं।
एक व्यावहारिक दृष्टिकोण से, एआई वर्ल्ड कप 2026 ने दिखाया कि आधुनिक एलएलएम पहले से ही जटिल बहु-चरण पूर्वानुमान बनाने में सक्षम हैं, लेकिन वे अभी भी एक विश्वसनीय "फुटबॉल ओरेकल" होने से दूर हैं। फिर भी, सामग्री की खुलापन - कच्चे मॉडल प्रतिक्रियाओं, स्कोरिंग कोड, संकेत - इस बेंचमार्क को आगे अनुसंधान के लिए उपयोगी बनाता है। कोई भी टीम इसे नींव के रूप में ले सकती है और अपनी मूल्यांकन योजना का प्रस्ताव कर सकती है। ArXiv पर खुद कागज 18 पृष्ठों को चलाता है, इसमें 8 आंकड़े और 7 टेबल शामिल हैं, और परियोजना भंडार पाठ में सूचीबद्ध है - इसलिए यदि आप चाहते हैं, तो आप प्रत्येक मॉडल की व्यक्तिगत प्रतिक्रियाओं के लिए नीचे सभी विवरणों का अध्ययन कर सकते हैं।




