FIFA World Cup como prueba para AI: lo que el experimento AI World Cup 2026 mostró

12 agosto 202628 vistas

Diez modelos de lenguaje predijeron los resultados de todo el torneo de antemano, y el ganador general fue el modelo que correctamente adivinó al campeón. Mientras tanto, los líderes en la precisión del partido individual estaban lejos de la primera en la posición final.

FIFA World Cup como prueba para AI: lo que el experimento AI World Cup 2026 mostró

La esencia del experimento

La Copa Mundial de la FIFA es un campo de pruebas ideal para AI: sólo 104 partidos, reglas estrictas y un enorme número de factores. Los investigadores Jonaid Shianifar e Iias Faiud decidieron utilizar este evento para crear el parámetro de referencia AI World Cup 2026. Diez asistentes basados en modelos de lenguaje grande participaron en el experimento. Cada uno de ellos tuvo que hacer una sola predicción para todo el torneo — antes del silbato inicial.

Las condiciones eran absolutamente idénticas para todos: la misma instantánea de la información del torneo, un solo impulso, el mismo esquema de respuesta JSON, y un procedimiento de puntuación común. Este enfoque elimina las diferencias aleatorias y permite comparar las capacidades de los propios modelos en lugar de la calidad de los impulsos. La predicción incluyó no sólo la puntuación de cada partido de grupo, sino también la posición final del grupo, el soporte completo de playoff, las posiciones finales de los equipos, así como el nivel de confianza del modelo y una breve explicación de su decisión.

Cómo funcionaba la puntuación

La característica clave de la Copa Mundial de AI es la evaluación holística de una predicción. Los puntos fueron galardonados por cada parte del torneo: para una puntuación de partido correctamente adivinada , para la posición correcta de un equipo en su grupo, para el ganador correcto de un par de playoff, y así sucesivamente. Los autores deliberadamente hicieron que la puntuación sea transparente: las fórmulas y el código se publican, para que cualquiera pueda reproducir los resultados.

Este diseño es importante porque revela qué parte del torneo contribuye más a la clasificación final. Como los cálculos posteriores mostraron, esa contribución resultó para ser extremadamente desigual. No se permitió que los modelos revisaran sus respuestas después de que se iniciaran los partidos; la predicción fue bloqueada antes del torneo. Esto simula la tarea real de un analista que debe entregar un pronóstico final por adelantado, sin la capacidad de mirar a los resultados intermedios.

Quien ganó la posición general

Primer lugar por un amplio margen fue a GPT-5.5 Pensamiento — 744 puntos. El segundo resultado fue publicado por GPT-5.5 (717 puntos), tercero Gemini (699), y cuarto — Qwen 3.7 (687). Curiosamente, sólo el ganador predijo el título de España —en la final real, los españoles golpearon a Argentina 1:0. Parece que la capacidad del modelo para un largo razonamiento le dio una ventaja en una tarea de varios pasos.

¿Por qué los playoff deciden todo?

El hallazgo más inesperado es el análisis de correlación. La puntuación total de un modelo casi perfectamente correlacionada con los puntos ganados para las predicciones de playoff: el coeficiente de correlación fue de 0.986. Al mismo tiempo, la relación con los resultados de las etapas del grupo era prácticamente cero (r=0.055), y con las predicciones de las posiciones del grupo era incluso negativa (r=−0.103). La puntuación acumulativa antes de los playoffs tampoco tuvo efecto en la colocación final (r=−0.054).

Esto significa que el éxito en el parámetro de referencia no dependía de lo exacto que un modelo predijo las puntuaciones de partidos individuales, sino de si podría construir correctamente el soporte del torneo. Los errores en la etapa de grupo pueden ser compensados por previsiones exactas de playoff, y viceversa — cualquier falta en los playoffs fue fatal para el ranking.

La precisión en los partidos individuales no es lo que importa más

Los autores examinaron por separado la exactitud de las predicciones de resultados en fase de grupo. Aquí el mejor modelo fue Claude Sonnet 4.6 — adivino correctamente el 63.89% de los resultados. Sin embargo, sólo terminó sexto en el en general. Así que la capacidad de adivinar partidos individuales no garantiza el éxito en una predicción holística del torneo. Un modelo puede sobresalir en las tareas locales al perder la gran imagen, por ejemplo, desplazando equipos en el soporte de playoff o cometiendo errores en posiciones finales.

La confianza no está vinculada a la precisión

Otra conclusión importante es la calibración de la confianza. Los modelos indicaron cuán confiados estaban en sus predicciones, pero estas estimaciones no tenían nada que ver con los resultados reales. La correlación de la confianza media con la exactitud de los resultados fue −0.060, y con la puntuación total — −0.067. En otras palabras, el modelo más seguro no era el más preciso, y el más modesto no era necesariamente incorrecto. Esto es un recordatorio de que la autoevaluación de una red neuronal no es una medición de calidad, sino simplemente un reflejo de su distribución de probabilidad interna.

Lo que esto significa para el pronóstico de AI

La conclusión principal de los autores es que prever un torneo entero prueba diferentes habilidades que predecir partidos uno por uno. El ranking final depende en gran medida del diseño del sistema de puntuación: si los puntos se adjudican de manera diferente, el orden de los modelos podría cambiar. Este es un recordatorio importante para cualquiera que use IA en análisis: es necesario entender claramente qué tarea está resolviendo el modelo y qué es exactamente lo que queremos medir.

Desde un punto de vista práctico, la Copa Mundial AI 2026 mostró que los LLM modernos ya son capaces de construir complejos pronósticos multietapa, pero todavía están lejos de ser un "oráculo de fútbol confiable". Sin embargo, la apertura de los materiales —respuestas de modelos brutos, código de puntuación, impulsos— hace que este punto de referencia sea útil para más investigación. Cualquier equipo puede tomarlo como base y proponer su propio esquema de evaluación. El propio papel en arXiv ejecuta 18 páginas, incluye 8 figuras y 7 tablas, y el repositorio del proyecto se enumera en el texto, por lo que si lo desea, puede estudiar todos los detalles hasta las respuestas individuales de cada modelo.

Preguntas frecuentes

AI World Cup 2026: Cómo AI predicó la Copa Mundial de la FIFA