La etiqueta «estoy seguro» en la respuesta del modelo no es una medición, sino otra afirmación que requiere una verificación aparte. Mientras este tipo de estimaciones se integran en la lógica de los agentes, conviene entender cuánto se puede confiar en ellas.
Por qué surgieron dudas sobre la confianza
Los sistemas agénticos están diseñados cada vez más para que el siguiente paso se elija teniendo en cuenta la autoevaluación del modelo: si declara una confianza alta, la acción se ejecuta; si es baja, interviene una persona u otra herramienta. Este esquema solo funciona bajo una condición: en el momento de la acción, la confianza declarada debe corresponder aproximadamente a la frecuencia real de aciertos.
El trabajo de Bhushan Kashinath Joshi (arXiv:2608.24691, presentado el 25 de agosto de 2026) pone a prueba precisamente esta suposición, y lo hace en un entorno donde el fallo es visible de inmediato y no se puede achacar a la mala suerte.
El campo de pruebas: ajedrez con rey oculto
El ajedrez clásico no sirve bien para esta verificación: allí todo está a la vista y la «confianza» se mezcla inevitablemente con la fuerza de juego. Por eso se eligió una variante con información oculta, donde el estatus real puede pasar de forma secreta y repetida de una pieza a otra. El jugador no sabe dónde está el objetivo principal en cada momento y se ve obligado a actuar a base de conjeturas.
Un detalle clave de la metodología: en cada jugada se le pedía al agente por separado la distribución de probabilidad sobre qué pieza del rival porta de forma oculta el estatus real. Esto se consultaba con independencia de la jugada en sí, para no mezclar «hacia dónde me moví» con «qué creo». La posición verdadera se reconstruía tras la partida y se comparaba con los números declarados.

Una respuesta correcta de sesenta y dos
El resultado principal parece un accidente. En dos series independientes de partidas, las capturas realizadas con una confianza declarada no inferior a 0,5 sobre la ubicación de la pieza oculta resultaron correctas en 1 caso de 62. Si lo pasamos a porcentajes, la probabilidad declarada de «más bien sí que no» se tradujo en un acierto en aproximadamente el uno y medio por ciento de las situaciones: una discrepancia de órdenes de magnitud, no de porcentajes.
Además, el déficit de calibración se concentra casi por completo en esos eventos: 99,3% en la serie original y 98,7% en la repetida. En otras palabras, el problema no está repartido de manera uniforme por toda la partida: se concentra en los momentos en que el modelo proclama con especial vehemencia que tiene razón, y justo cuando de él depende una acción arriesgada.
El mismo patrón en otras configuraciones
El autor no se limitó a un solo modelo. La verificación abarcó otras cuatro configuraciones, incluido un segundo proveedor. El cuadro se repite en una forma más débil y se ordena de manera consistente, pero aquí conviene ser cuidadoso: solo las estimaciones puntuales siguen siendo comparables, y la mayoría de las diferencias por pares, con este tamaño de muestra, son estadísticamente indistinguibles.
El propio autor lo describe como el alcance del hallazgo (scope), y no como una prueba de que el nivel de capacidad del modelo prediga su calibración. Es decir, no estamos ante un «cuanto más inteligente es el modelo, mejor se evalúa a sí mismo» ni ante lo contrario: simplemente, el fenómeno aparece más ampliamente que en un sistema concreto.

El presupuesto de razonamiento desplaza la métrica más de lo que parece
Un asunto aparte y desagradable es la comparación de un mismo modelo con una calificación externa invariable en la tabla de clasificación. Lo único que cambia es el presupuesto de razonamiento (deliberation budget), es decir, cuánto «tiempo para pensar» dedica el modelo. Pues bien, este desplazamiento cambia la métrica de calibración casi tanto como una gran brecha entre modelos distintos.
La conclusión práctica es simple e incómoda: no se puede tomar como referencia el puesto en la tabla de clasificación al elegir un sistema para tareas con evaluación de riesgo. Dentro de un mismo modelo, la dispersión provocada por la configuración es comparable a lo que solemos considerar una ventaja seria de un modelo sobre otro.
Las métricas tradicionales pueden mostrar lo contrario
Otro resultado golpea los métodos habituales de medición. En un asiento (seat) concreto, los ejes estándar de evaluación —legalidad de las jugadas, costo, latencia, proporción de partidas llevadas hasta el final— pueden divergir por completo de la calidad de las creencias del modelo. La configuración que ganaba en todos los indicadores tradicionales a la vez mostró la peor calidad de creencias entre todas las probadas.
Aquí es fácil equivocarse en la interpretación: no se trata de que la precisión y lo barato sean perjudiciales en sí mismos. Se trata de que el conjunto de métricas que solemos considerar exhaustivo simplemente no mide la propiedad que nos interesa: mide otra cosa.
Por qué la evaluación «por el resultado» no detectará nada
La consecuencia más desagradable es el enmascaramiento. Un modelo con el patrón descrito todavía puede ganar esa misma partida sobre la que construyó creencias erróneas. El resultado es bueno, pero la imagen interna del mundo era incorrecta.
De ahí se sigue que una verificación exclusivamente por el resultado (outcome-only) no detecta este tipo de fallos en principio: la victoria cierra el asunto, y el punto débil permanece en el sistema hasta la próxima vez, solo que ya en una tarea donde puede que no se produzca el desenlace correcto.

Qué hacer con esto en la práctica
Algunas conclusiones operativas que se derivan directamente de los resultados.
- Pedirle al modelo su propia distribución de probabilidad sobre la incógnita clave, y guardarla por separado de la acción elegida. Sin separar estas dos cosas, no será posible evaluar la calibración.
- Comparar la confianza declarada con la frecuencia real de aciertos en tus propios datos, en lugar de confiar en las cifras de la ficha del modelo. En el juego con la pieza oculta, la brecha resultó enorme, y nada garantiza que en una tarea aplicada sea menor.
- Verificar el umbral en el que el sistema transfiere la decisión a una persona, por separado de la precisión general. Los fallos se agrupan precisamente en la zona de alta confianza declarada.
- Fijar el presupuesto de razonamiento en cualquier comparación. De lo contrario, se está midiendo la configuración, no el modelo.
- No considerar una victoria o un desenlace exitoso como prueba de la corrección de las creencias internas del sistema.
El sentido general del hallazgo no es que los modelos sean «malos». Más bien es que la confianza y la razón son dos indicadores distintos, y el primero todavía no sirve como sustituto del segundo. Mientras las arquitecturas agénticas se construyan en torno a la autoevaluación, habrá que medir esta diferencia de forma explícita.



