L'essence de l'expérience
La Coupe du monde FIFA est un terrain d'essai idéal pour l'IA : seulement 104 matchs, des règles strictes et un nombre énorme de facteurs. Les chercheurs Jonaid Shianifar et Iias Faiud ont décidé d'utiliser cet événement pour créer la référence de la Coupe du monde de l'IA 2026. Dix assistants basés sur de grands modèles linguistiques ont participé à l'expérience. Chacun d'entre eux devait faire une seule prédiction pour tout le tournoi — avant le sifflet de départ.
Les conditions étaient absolument identiques pour tout le monde : le même instantané de l'information du tournoi, une seule prompte, le même schéma de réponse JSON, et une procédure de notation commune. Cette approche élimine les différences aléatoires et permet de comparer les capacités des modèles eux-mêmes plutôt que la qualité des prompts. La prédiction comprenait non seulement la note de chaque match en étape de groupe, mais aussi le classement final du groupe, la période complète des éliminatoires, les positions finales des équipes, ainsi que le niveau de confiance du modèle et une brève explication de sa décision.

Comment la notation a fonctionné
La principale caractéristique de la Coupe du monde d'IA est l'évaluation holistique d'une prédiction. Des points ont été attribués pour chaque partie du tournoi: pour un score de match correctement deviné , pour la position correcte d'une équipe dans son groupe, pour le gagnant correct d'une paire de séries éliminatoires, etc. Les auteurs ont délibérément rendu le score transparent: les formules et le code sont publiés, afin que n'importe qui puisse reproduire les résultats.
Ce design est important car il révèle quelle partie du tournoi contribue le plus au classement final. Comme le montrent les calculs ultérieurs, cette contribution s'est avérée être extrêmement inégale. Les modèles n'ont pas été autorisés à réviser leurs réponses après le début des matchs — la prédiction était verrouillée avant le tournoi. Cela simule la tâche réelle d'un analyste qui doit fournir une prévision finale à l'avance, sans avoir la capacité de regarder aux résultats intermédiaires.
Qui a gagné le classement général
La première place par une large marge est allé à GPT-5.5 Penser — 744 points. Le deuxième résultat a été affiché par GPT-5.5 (717 points), troisième Gemini (699) et quatrième — Qwen 3.7 (687). Fait intéressant, seul le vainqueur a prédit le titre de l'Espagne — en finale, les Espagnols ont battu l'Argentine 1:0. Il semble que la capacité de raisonnement long du modèle lui ait donné un avantage dans une tâche à plusieurs étapes.
Pourquoi les séries éliminatoires décident tout
La conclusion la plus inattendue est l'analyse de corrélation. Le score total d'un modèle est presque parfaitement corrélé avec les points gagnés pour les prédictions des séries éliminatoires : le coefficient de corrélation était de 0,986. Dans le même temps, la relation avec les résultats au stade de groupe était pratiquement nulle (r=0,055), et avec les prédictions de position de groupe, elle était même négative (r=−0,103). Le score cumulatif avant les éliminatoires n'a pas eu d'effet sur le placement final (r=−0,054).
Cela signifie que le succès de l'indice de référence ne dépendait pas de la précision avec laquelle un modèle prédisait les scores des matches individuels, mais de sa capacité à construire correctement le milieu du tournoi. Les erreurs lors de la phase de groupe pourraient être compensées par des prévisions de séries éliminatoires précises, et vice versa — toute erreur dans les séries éliminatoires était fatale pour le classement.

L'exactitude sur les matches individuels n'est pas ce qui compte le plus
Les auteurs ont examiné séparément l'exactitude des prévisions des résultats des étapes de groupe. Ici, le meilleur modèle était Claude Sonnet 4.6 — il a correctement deviné 63,89% des résultats. Cependant, il n'a terminé que sixième dans le général. Donc la capacité de deviner des matchs individuels ne garantit pas le succès dans une prédiction globale de tournoi. Un modèle peut exceller dans les tâches locales tout en perdant la vue d'ensemble - par exemple, placer des équipes mal placées dans la période éliminatoire ou faire des erreurs dans les positions finales.
La confiance n'est pas liée à l'exactitude
Une autre conclusion importante concerne l'étalonnage de la confiance. Les modèles indiquent à quel point ils sont confiants dans leurs prévisions, mais ces estimations n'ont rien à voir avec les résultats réels. La corrélation entre la confiance moyenne et l'exactitude des résultats était de −0,060 et la note totale — −0,067. En d'autres termes, le modèle le plus confiant n'était pas le plus précis et le plus modeste n'était pas nécessairement faux. C'est un rappel que l'auto-évaluation d'un réseau neuronal n'est pas une mesure de qualité, mais simplement un reflet de sa distribution de probabilité interne.
Ce que cela signifie pour la prévision de l'IA
La principale conclusion des auteurs est que la prévision d'un tournoi entier teste différentes capacités que la prévision des matches un par un. Le classement final dépend fortement de la conception du système de notation : si des points étaient attribués différemment, l'ordre des modèles pourrait changer. C'est un rappel important pour quiconque utilise l'IA dans l'analyse : vous devez comprendre clairement quelle tâche le modèle résout et ce que nous voulons mesurer exactement.
D'un point de vue pratique, la Coupe du monde d'IA 2026 a montré que les LLM modernes sont déjà capables de construire des prévisions multi-étapes complexes, mais ils sont encore loin d'être un « oracle de foot » fiable. Néanmoins, l'ouverture des matériaux — réponses du modèle brut, code de notation, appels — rend ce point de repère utile pour de plus amples recherches. Toute équipe peut la prendre comme une fondation et proposer son propre plan d'évaluation. L'article lui-même sur arXiv tourne 18 pages, comprend 8 figures et 7 tableaux, et le dépôt de projet est listé dans le texte — donc si vous le souhaitez, vous pouvez étudier tous les détails jusqu'aux réponses individuelles de chaque modèle.




