Суть эксперимента
Чемпионат мира по футболу — идеальная площадка для проверки AI: всего 104 матча, строгие правила, огромное количество факторов. Исследователи Jonaid Shianifar и Iias Faiud решили использовать это событие для создания бенчмарка AI World Cup 2026. В эксперименте участвовали десять ассистентов на основе больших языковых моделей. Каждый из них должен был сделать один-единственный прогноз на весь турнир — до стартового свистка.
Условия для всех были абсолютно одинаковыми: один и тот же снимок турнирной информации, единый промпт, одинаковая JSON-схема ответа и общая процедура подсчёта очков. Такой подход убирает случайные различия и позволяет сравнивать именно возможности моделей, а не качество подсказок. Прогноз включал не только счёт каждого матча группового этапа, но и итоги групп, полную сетку плей-офф, итоговые места команд, а также уровень уверенности модели и краткое объяснение решения.

Как считались очки
Ключевая особенность AI World Cup — целостная оценка прогноза. За каждую часть турнира начислялись баллы: за угаданный счёт матча, за верную позицию команды в группе, за правильного победителя пары в плей-офф и так далее. Авторы намеренно сделали подсчёт очков прозрачным: формулы и код опубликованы, поэтому любой желающий может воспроизвести результаты.
Такая конструкция важна, потому что она позволяет увидеть, какая часть турнира вносит наибольший вклад в итоговый рейтинг. Как показали дальнейшие расчёты, этот вклад оказался крайне неравномерным. Моделям не разрешалось пересматривать свои ответы после начала матчей — прогноз фиксировался до турнира. Это имитирует реальную задачу аналитика, который должен дать итоговый прогноз заранее, не имея возможности подглядеть промежуточные результаты.
Кто выиграл в общем зачёте
Первое место с большим отрывом заняла модель GPT-5.5 Thinking — 744 очка. Второй результат показала GPT-5.5 (717 очков), третьей стала Gemini (699), четвёртой — Qwen 3.7 (687). Интересно, что только победительница предсказала чемпионство Испании — в реальном финале испанцы обыграли Аргентину со счётом 1:0. Похоже, способность модели к длинным рассуждениям дала ей преимущество в такой многошаговой задаче.
Почему решает плей-офф
Самая неожиданная находка — корреляционный анализ. Общий счёт модели почти идеально коррелировал с очками, полученными за прогнозы плей-офф: коэффициент корреляции составил 0.986. При этом связь с результатами группового этапа была практически нулевой (r=0.055), а с прогнозами позиций в группах — даже отрицательной (r=−0.103). Суммарный счёт до плей-офф также не влиял на итоговое место (r=−0.054).
Это означает, что успех в бенчмарке зависел не от того, насколько точно модель предсказывала счета конкретных матчей, а от того, сумела ли она правильно выстроить турнирную сетку. Ошибки в групповом этапе можно было компенсировать точными прогнозами на стадии плей-офф, и наоборот — все промахи в плей-офф фатально обрушивали рейтинг.

Точность отдельных матчей — не главное
Отдельно авторы рассмотрели точность предсказания исходов группового этапа. Здесь лучшей оказалась модель Claude Sonnet 4.6 — она верно угадала 63,89% исходов. Однако в общем зачёте она заняла лишь шестое место. Получается, что умение угадывать отдельные матчи не гарантирует успеха в целостном прогнозе турнира. Модель может отлично справляться с локальными задачами, но терять картину целиком — например, неправильно расставлять команды в сетке плей-офф или ошибаться в итоговых местах.
Уверенность не связана с точностью
Ещё один важный вывод касается калибровки уверенности. Модели указывали, насколько они уверены в своих прогнозах, но эти оценки не имели отношения к реальным результатам. Корреляция средней уверенности с точностью исходов составила −0.060, а с общим счётом — −0.067. То есть самая уверенная модель не была самой точной, а самая скромная — не обязательно ошибалась. Это напоминает о том, что самооценка нейросетей — не метрика качества, а лишь отражение их внутреннего распределения вероятностей.
Что это значит для ИИ-прогнозирования
Главный вывод авторов — прогнозирование всего турнира проверяет иные способности, чем предсказание матчей по одному. Итоговый рейтинг сильно зависит от дизайна системы подсчёта очков: если бы очки начислялись иначе, порядок моделей мог бы измениться. Это важное напоминание для всех, кто использует ИИ в аналитике: нужно чётко понимать, какую именно задачу решает модель и что мы хотим измерить.
С практической точки зрения AI World Cup 2026 показал, что современные LLM уже способны строить сложные многоэтапные прогнозы, но до стабильного «футбольного оракула» им далеко. Тем не менее открытость материалов — сырые ответы моделей, код подсчёта очков, промпты — делает этот бенчмарк полезным для дальнейших исследований. Любая команда может взять его за основу и предложить собственный вариант оценки. Сама статья на arXiv насчитывает 18 страниц, в ней 8 рисунков и 7 таблиц, а репозиторий проекта указан в тексте — так что при желании можно изучить все детали вплоть до отдельных ответов каждой модели.




