实验的意义
国际足联世界杯是AI的理想测试场:只有104场比赛,严格的规则,以及大量的因素. 研究人员乔奈德·希阿尼法尔(Jonaid Shianifar)和伊亚斯·费乌德(Iias Faiud)决定利用这一活动创造AI世界杯2026年的基准. 十名基于大语言模型的助手参加了实验. 他们每人必须对整个联赛进行单一的预测——在开始吹哨之前.
条件对每个人来说是完全相同的:同样的锦标赛信息快照,单一的即时,相同的JSON响应计划,以及共同的评分程序. 这种方法消除了随机差异,可以比较模型本身的能力,而不是提示的质量. 预测不仅包括每场小组赛阶段比赛的得分,还包括最终小组积分,全场决赛档,球队最后位置,以及模型的自信水平和对其决定的简要说明.

分数如何
AI世界杯的关键特征是对一项预测的整体评价. 锦标赛每个赛段都获得积分:为正确猜测的比赛分数 ,因为一个团队在其组合中的正确位置,对于一个季后赛组合的正确获胜者,等等. 作者们故意使评分透明:公式和代码被公布,所以任何人都可以复制结果.
这种设计很重要,因为它揭示了锦标赛中哪一部分对最终排名的贡献最大. 如随后的计算所示,这一贡献最终得到证实 极度不平衡。 模型在比赛开始后不允许修改答案——预言在联赛前被锁定. 这模拟了一个分析师的真正任务,他必须事先提供最后预报,而不能偷看中间结果。
谁赢得了整体地位
第一名以宽差进入GPT-5.5思考——744分. 第二项结果由 GPT-5.5 (717点),第三点是 Gemini (699),以及第四篇——Quen 3.7(687). 有趣的是,只有获胜者预测西班牙的冠军头衔——在实际决赛中,西班牙人以1:0战胜阿根廷. 看来模型的长推理能力使它在这样一个多步骤的任务中占有优势.
为什么季后赛决定一切
最出乎意料的是相关分析。 一个模型的总分几乎完全与季后赛预测获得的分数相关:相关系数为0.986. 同时,与组级结果的关系几乎为零(r=0.055),与组位预测的关系甚至为负(r=−0.103). 季后赛前的累积分数也对最终投档(r=−0.054)没有影响.
这意味着基准的成功不取决于一个模型对个别比赛的分数预测的准确性,而是取决于它是否能够正确构建联赛的档次. 分组赛阶段的失误可以通过准确的季后赛预报来弥补,反之亦然——季后赛中的任何失误对排名都是致命的.

个人匹配的准确性不是最重要的
作者分别审查了分组阶段结果预测的准确性。 这里最好的模型是克劳德·索内(Claude Sonnet)4.6——它正确地猜测了63.89%的结果. 然而,它只完成了第六 总体状况。 因此,个人猜对的能力并不能保证在综合联赛预测中取得成功. 一个模型在失去大局的同时可以出色地完成当地的任务——例如,将球队错置在季后赛中或者在最终位置上犯错误.
信心与准确性无关
另一个重要结论涉及信心校准。 这些模型表明它们对预测有多有信心,但这些估计与实际结果无关。 平均信心与结果准确性的相关性为−0.060,总得分为−0.067。 换句话说,最自信的模型并不是最准确的,最谦虚的模型不一定是错误的. 这提醒人们,神经网络的自我评估不是质量的衡量标准,而只是反映其内部概率分布.
这对AI预测意味着什么?
作者的主要结论是,预测整个锦标赛测试的能力与预测一个接一个匹配的能力不同. 最终排名很大程度上取决于评分系统的设计:如果积分授予方式不同,模型的顺序可能会改变. 这对分析中使用AI的人来说是一个重要的提醒:你需要清楚地了解模型要解决什么任务以及我们要衡量什么。
从实用的角度看,AI世界杯2026显示,现代LLM已经有能力构建复杂的多阶段预测,但它们仍然远非一个可靠的"足球神谕". 尽管如此,材料的开放性——原始模型反应,评分码,提示——使得这个基准对进一步研究很有用. 任何团队都可以将其作为基金会,并提出自己的评价计划. arXiv上的论文本身有18页,包括8个数字和7个表格,项目寄存器在文本中列出——所以如果你愿意,你可以研究每个模型的单个响应的所有细节.




