FIFA World Cup as a test for AI: What the AI World Cup 2026 experiment showed

12 أغسطس 202628 الآراء

وتوقعت عشرة نماذج لغوية نتائج بطولة كاملة مقدما، وكان الفائز العام هو النموذج الذي خمّن البطل بشكل صحيح. وفي الوقت نفسه، كان القادة الذين يتطابقون دقتهم الفردية بعيدا عن البداية في النهائيات.

FIFA World Cup as a test for AI: What the AI World Cup 2026 experiment showed

The Essence of the Experiment

The FIFA World Cup is an ideal testing ground for AI: only 104 matches, strict rules, and an enormous number of factors. وقرر الباحثون جونايد شيانيفار وإياس فايود استخدام هذا الحدث لإنشاء معيار كأس العالم لعام 2026. وشارك في هذه التجربة عشرة مساعدين على أساس نماذج لغوية كبيرة. وكان على كل واحد منهم أن يقوم بتنبؤ واحد عن بطولة كاملة - قبل صافرة البداية.

The conditions were absolutely similar for everyone: the same snapshot of tournament information, a single prompt, the same JSON response schema, and a common scoring procedure. ويقضي هذا النهج على الاختلافات العشوائية ويسمح بمقارنة قدرات النماذج نفسها بدلا من نوعية العجلات. التوقع لم يتضمن فقط مقياس كل تطابق للمجموعة ولكن أيضاً المجموعة النهائية

كَمْ يَعْملُ

والسمة الرئيسية للكأس العالمي لرابطة الدول المستقلة هي التقييم الكلي للتنبؤ. تم منح نقاط لكل جزء من البطولة: لسجل تطابق صحيح وبالنسبة للموقع الصحيح لفريق في مجموعته، بالنسبة للفائز الصحيح في زوج اللعب، وهكذا، عمد أصحاب البلاغ إلى جعل الفرز شفافا: إذ تنشر الصيغ والشفرة، بحيث يمكن لأي شخص أن يستنسخ النتائج.

This design is important because it reveals which part of the tournament contributes most to the final ranking. وكما تبين من الحسابات اللاحقة، تبين أن هذه المساهمة أن تكون متفاوتة للغاية ولم يسمح للنماذج بتنقيح إجاباتها بعد بدء المباريات - وكانت التنبؤات مقفلة قبل البطولة. This simulates the real task of analyst who must deliver a final predict in advance, without the ability to peek at medium results.

الذين فازوا بالصفوف العامة

وذهب المركز الأول على هامش واسع الى GPT-5. نشرت النتيجة الثانية GPT-5.5 )٧٧١ نقطة( الثالثة Gemini )٦٩( والرابع - كوين ٣,٧ )٦٨٧(. من المثير للاهتمام، فقط الفائز توقّع لقب إسبانيا - في النهائي الفعلي، الأسبان ضربوا الأرجنتين 1: يبدو أن قدرة النموذج للتعقل الطويل أعطته حافة في مهمة متعددة الخطوات

لماذا المباريات تقرر كل شيء

النتيجة غير المتوقعة هي تحليل العلاقة النتيجة الإجمالية للنموذج ترتبط بشكل كامل تقريباً بالنقاط التي تم الحصول عليها لتوقعات المباريات At the same time, the relationship with group-stage results was virtually zero (r=0.055), and with group-position predictions it was even negative (r=0.103). كما أن النتيجة التراكمية المعروضة على المباريات لم يكن لها أثر على الوضع النهائي (r=0.054).

وهذا يعني أن النجاح في المعيار المرجعي لا يتوقف على مدى دقة التنبؤ بعشرات المباريات الفردية، بل على ما إذا كان من الممكن بناء معقوفة البطولة بشكل صحيح. ويمكن تعويض الأخطاء في مرحلة المجموعة عن طريق التنبؤات الدقيقة بالمباراة، والعكس بالعكس - أي أخطاء في المباريات كانت قاتلة في الترتيب.

الاستحقاق على المباريات الفردية ليس ما يهم أكثر

وبحث أصحاب البلاغ بصورة منفصلة مدى دقة التنبؤات المتعلقة بنتائج المجموعة. وهنا كان أفضل نموذج هو كلود سونيت 4.6 - وهو تخمين صحيح 63.89 في المائة من النتائج. على أية حال، أنهى السادسة فقط في مواقف عامة لذا فإن القدرة على التخمين لمباريات الفرد لا تضمن النجاح في التنبؤ الكلي بالبطولة ويمكن للنموذج أن يتفوق على المهام المحلية في الوقت الذي يفقد فيه الصورة الكبيرة - على سبيل المثال، الأفرقة المضللة بين قوسين أو التي ترتكب أخطاء في المناصب النهائية.

الثقة لا ترتبط بالدقة

وثمة استنتاج هام آخر يتعلق بمعايرة الثقة. وأشارت النماذج إلى مدى ثقتها في توقعاتها، ولكن هذه التقديرات لا علاقة لها بالنتائج الفعلية. The correlation of average confidence with outcome accuracy was −0.060, and with the total score — − 0.067. وبعبارة أخرى، فإن النموذج الأكثر ثقة ليس أدق، وأن أبسط نموذج ليس بالضرورة خاطئا. هذا تذكير بأن التقييم الذاتي للشبكة العصبية ليس قياساً جيداً ولكن مجرد انعكاس لتوزيع الاحتمالات الداخلية

What this means for AI forecasting

النتيجة الرئيسية للمؤلفين هي أن التنبؤ باختبارات بطولة كاملة مختلف القدرات عن التنبؤ بتطابق واحد تلو الآخر ويتوقف الترتيب النهائي اعتمادا كبيرا على تصميم نظام الترميز: فلو كانت النقاط قد مُنحت بطريقة مختلفة، فإن ترتيب النماذج يمكن أن يتغير. هذا تذكير مهم لأي شخص يستخدم آي إيه في التحليلات: يجب أن تفهم بوضوح المهمة التي يقوم بها النموذج لحلها وما نريد قياسه بالضبط.

ومن وجهة نظر عملية، أظهرت الدراسة الاستقصائية العالمية لعام 2026 أن الألغام الأرضية الحديثة قادرة بالفعل على بناء تنبؤات معقدة متعددة المراحل، ولكنها لا تزال بعيدة عن كونها " أوراكل كرة القدم " الموثوق بها. ومع ذلك، فإن انفتاح المواد - استجابات نموذجية خام، ورمز التكرير، والعجلات - يجعل هذا المعيار مفيدا لمزيد من البحث. ويمكن لأي فريق أن يأخذها كمؤسسة وأن يقترح خطة التقييم الخاصة به. الورق نفسه على الأركسيف يدير 18 صفحة، ويشمل 8 أرقام و 7 جداول، ومستودع المشروع مدرج في النص - لذا إذا أردت، يمكنك دراسة جميع التفاصيل أسفل إلى الردود الفردية لكل نموذج.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
AI World Cup 2026: How AI Predicted the FIFA World Cup