La confiance n'est pas la justesse : comment les LLM échouent à la calibration dans un jeu de figure cachée

18 septembre 202611 vues

Un nouveau préprint sur arXiv examine si l'on peut se fier à l'auto-évaluation d'un modèle de langage au moment de choisir un coup. Dans une variante d'échecs avec un statut « royal » caché, la probabilité déclarée ≥0,5 n'a coïncidé avec la position réelle de la pièce qu'une seule fois sur 62 tentatives, et la quasi-totalité du déficit de calibration s'est concentrée précisément sur ces épisodes.

La confiance n'est pas la justesse : comment les LLM échouent à la calibration dans un jeu de figure cachée

La mention « je suis sûr » dans la réponse d'un modèle n'est pas une mesure, mais une affirmation de plus qui exige une vérification distincte. Tant que ces évaluations sont intégrées dans la logique des agents, il vaut la peine de comprendre à quel point on peut leur faire confiance.

Pourquoi la confiance a soulevé des questions

Les systèmes agentiques sont de plus en plus souvent conçus de telle sorte que l'étape suivante est choisie en fonction de l'auto-évaluation du modèle : s'il déclare une confiance élevée, l'action est exécutée ; si elle est faible, un humain ou un autre outil est sollicité. Un tel schéma ne fonctionne qu'à une seule condition : au moment de l'action, la confiance déclarée doit correspondre à peu près au taux de réussite réel.

Les travaux de Bhushan Kashinath Joshi (arXiv:2608.24691, soumis le 25 août 2026) vérifient précisément cette hypothèse — et ce, dans un cadre où l'erreur est immédiatement visible et ne peut être mise sur le compte de la malchance.

Le terrain d'essai : les échecs au roi caché

Les échecs classiques se prêtent mal à une telle vérification : tout y est ouvert, et la « confiance » se confond inévitablement avec la force de jeu. C'est pourquoi une variante à information cachée a été retenue, où le statut royal peut secrètement et à plusieurs reprises passer d'une pièce à l'autre. Le joueur ne sait pas où se trouve actuellement l'objectif principal et doit agir à l'aveuglette.

Détail clé de la méthodologie : à chaque coup, on demandait séparément à l'agent une distribution de probabilités sur la pièce adverse qui porte secrètement le statut royal. Cela était demandé indépendamment du coup lui-même — afin de ne pas mélanger « où je suis allé » et « ce en quoi je crois ». La position réelle était reconstituée après la partie et comparée aux chiffres déclarés.

Une bonne réponse sur soixante-deux

Le résultat principal ressemble à un accident. Dans deux séries de parties indépendantes, les captures effectuées avec une confiance déclarée d'au moins 0,5 quant à l'emplacement de la pièce cachée se sont révélées correctes dans 1 cas sur 62. En pourcentage, la probabilité déclarée « plutôt oui que non » s'est traduite par une réussite dans environ un et demi pour cent des situations — un écart de plusieurs ordres de grandeur, et non de quelques pour cent.

De plus, le déficit de calibration est presque entièrement concentré dans ces événements : 99,3 % dans la série initiale et 98,7 % dans la série répétée. Autrement dit, le problème n'est pas étalé uniformément sur toute la partie — il est concentré dans les moments où le modèle clame particulièrement fort sa justesse, et précisément là où une action risquée en dépend.

Le même schéma dans d'autres configurations

L'auteur ne s'est pas limité à un seul modèle. La vérification a couvert quatre configurations supplémentaires, dont un second fournisseur. Le tableau se répète sous une forme plus faible et s'ordonne de manière cohérente — mais la prudence s'impose ici : seules les estimations ponctuelles restent comparables, et la plupart des différences par paires, avec une telle taille d'échantillon, sont statistiquement indiscernables.

L'auteur lui-même décrit cela comme la portée de la découverte (scope), et non comme la preuve que le niveau de capacités d'un modèle prédit sa calibration. Autrement dit, il ne s'agit ni de « plus le modèle est intelligent, mieux il s'évalue », ni de l'affirmation inverse — simplement, le phénomène se rencontre plus largement qu'un système particulier.

Le budget de raisonnement déplace la métrique plus qu'il n'y paraît

Un autre point désagréable : la comparaison d'un même modèle à classement externe inchangé dans le tableau de bord. Seul le budget de raisonnement (deliberation budget) change, c'est-à-dire le temps de « réflexion » que le modèle consacre. Or, ce décalage modifie la métrique de calibration presque autant qu'un grand écart entre différents modèles.

La conclusion pratique est simple et inconfortable : on ne peut pas se fier au rang dans le classement pour choisir un système destiné à des tâches impliquant une évaluation du risque. Au sein d'un même modèle, la dispersion causée par le réglage est comparable à ce que nous avons l'habitude de considérer comme un avantage sérieux d'un modèle sur un autre.

Les métriques traditionnelles peuvent montrer l'inverse

Un autre résultat frappe les méthodes de mesure habituelles. Sur un siège (seat) donné, les axes d'évaluation standard — légalité des coups, coût, latence, proportion de parties menées à terme — peuvent diverger totalement de la qualité des convictions du modèle. La configuration qui l'emportait sur tous les indicateurs traditionnels à la fois a démontré la pire qualité de convictions parmi toutes celles testées.

Il est facile ici de se tromper dans l'interprétation : il ne s'agit pas de dire que la précision et le faible coût sont nuisibles en soi. Il s'agit de dire que l'ensemble de métriques que nous considérons habituellement comme exhaustif ne mesure tout simplement pas la propriété qui nous intéresse — il porte sur autre chose.

Pourquoi l'évaluation « sur le résultat » ne détectera rien

La conséquence la plus désagréable est le masquage. Un modèle présentant le schéma décrit peut encore gagner cette fameuse partie au sujet de laquelle il avait construit des convictions erronées. Le résultat est bon, alors que la représentation interne du monde était incorrecte.

Il s'ensuit qu'une vérification fondée exclusivement sur le résultat (outcome-only) ne détecte en principe pas de tels défaillances : la victoire clôt la question, et le point faible reste dans le système jusqu'à la prochaine fois — mais cette fois dans une tâche où l'issue correcte pourrait ne pas se produire.

Que faire de tout cela en pratique

Quelques conclusions opérationnelles qui découlent directement des résultats.

  • Demander au modèle sa propre distribution de probabilités sur l'inconnue clé — et la conserver séparément de l'action choisie. Sans cette séparation, il est impossible d'évaluer la calibration.
  • Comparer la confiance déclarée au taux de réussite réel sur ses propres données, plutôt que de se fier aux chiffres de la fiche du modèle. Dans le jeu à la pièce cachée, l'écart s'est révélé énorme, et rien ne garantit qu'il sera plus faible dans une tâche appliquée.
  • Vérifier le seuil auquel le système transmet la décision à un humain, indépendamment de la précision globale. Les erreurs se concentrent précisément dans la zone de confiance déclarée élevée.
  • Fixer le budget de raisonnement dans toutes les comparaisons. Sinon, vous mesurez le réglage, et non le modèle.
  • Ne pas considérer une victoire ou une issue favorable comme la preuve de la justesse des convictions internes du système.

Le sens général de la découverte n'est pas que les modèles sont « mauvais ». Il est plutôt que la confiance et la justesse sont deux indicateurs distincts, et que le premier ne peut pas encore remplacer le second. Tant que les architectures agentiques se construisent autour de l'auto-évaluation, cette différence devra être mesurée explicitement.

Foire aux questions

Matériaux connexes

Tous matériaux