Boucle bayésienne externe pour la planification des LLM en présence de données incomplètes

28 septembre 202613 vues

L’article étudie une architecture dans laquelle un module distinct estime les probabilités des états cachés de l’environnement et les transmet à un modèle de langage au lieu de lui fournir la séquence complète des événements passés. Les auteurs expliquent son lien avec la théorie des POMDP et font état de croyances plus précises et de meilleurs résultats dans deux tâches de test par rapport à six alternatives.

Boucle bayésienne externe pour la planification des LLM en présence de données incomplètes

Pourquoi les LLM se trompent en cas d’observations incomplètes

Les auteurs attribuent les erreurs des agents LLM dans les environnements partiellement observables à l’absence d’une distribution explicite des croyances concernant l’état caché. En général, l’agent agit selon une politique conditionnée par l’historique des actions et des observations.

L’article décrit trois erreurs caractéristiques :

  • une décision prématurée face à un retour ambigu ;
  • un biais en faveur d’une hypothèse erronée après une observation informative ;
  • une dérive de la politique à mesure que l’historique s’allonge.

Le problème ne tient pas seulement à la qualité de la réponse à une requête donnée. L’agent ne dispose pas d’une représentation explicite de ce qu’il considère comme un état caché possible.

Comment fonctionne la boucle bayésienne externe

Belief-State Engine (BSE) est un module d’inférence externe au LLM. Il maintient une distribution a posteriori bayésienne sur les états cachés d’un modèle POMDP donné — un processus décisionnel markovien partiellement observable.

À chaque étape, la boucle fonctionne ainsi :

  1. BSE met à jour la distribution de croyance concernant l’état caché.
  2. Le LLM reçoit uniquement cette distribution.
  3. Le journal initial des actions et des observations reste inaccessible au LLM.

Cette approche dissocie la prise en compte de l’incertitude du modèle de langage. La condition essentielle de cette architecture est que le LLM ne reçoive pas l’historique initial.

Quelles garanties dépendent de l’architecture

Les auteurs définissent une spécification minimale composée de quatre axiomes pour un état interne cohérent avec les croyances. Le contenu des axiomes n’est pas détaillé ici.

Les auteurs démontrent que l’association d’un LLM et de BSE forme une politique markovienne correcte sur le belief MDP induit par le POMDP initial. À condition que le LLM n’ait jamais accès à l’historique initial, cette association hérite des garanties d’optimalité de Bellman issues de la théorie classique des POMDP.

Critère pratique : ces garanties concernent l’association décrite et dépendent de la restriction d’accès à l’historique. Elles ne peuvent être dissociées des conditions de l’architecture.

Ce que l’évaluation a montré

L’architecture a été testée sur le Tiger POMDP et sur une tâche de graphe d’attaque red team. La comparaison portait sur six méthodes de référence.

Méthode de référenceRésultat de BSE dans les deux domaines
Reactive LLMRetour de tâche plus élevé, meilleur calibrage des croyances et plus grande cohérence des décisions
Chain-of-ThoughtRetour de tâche plus élevé, meilleur calibrage des croyances et plus grande cohérence des décisions
ReActRetour de tâche plus élevé, meilleur calibrage des croyances et plus grande cohérence des décisions
Natural-language belief trackerRetour de tâche plus élevé, meilleur calibrage des croyances et plus grande cohérence des décisions
QMDPRetour de tâche plus élevé, meilleur calibrage des croyances et plus grande cohérence des décisions
POMCPRetour de tâche plus élevé, meilleur calibrage des croyances et plus grande cohérence des décisions

Le résumé indique également que l’effet n’est pas propre à un seul modèle. Dix ablations ciblées visent à isoler la contribution de différents choix architecturaux.

Quand envisager cette approche

BSE prend en charge une distribution sur les états cachés d’un POMDP donné. La description de la tâche dans le cadre d’un tel modèle est donc un critère central pour déterminer si l’approche est applicable.

L’évaluation de l’article porte sur les deux domaines indiqués. Elle ne confirme pas que les résultats sont transposables à toutes les tâches impliquant des données incomplètes.

Ce qui est disponible pour vérification

Le préprint Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability est accompagné du code, des spécifications des environnements, de modèles de prompts et de journaux de seed.

L’article d’Arnab Chattopadhayay et Debdipta Halder a été soumis à arXiv le 9 septembre 2026. Il convient d’évaluer la conclusion pratique en tenant compte des environnements, des comparaisons et des conditions d’accès du LLM à l’historique décrits.

Foire aux questions

Matériaux connexes

Tous matériaux
Boucle bayésienne externe pour la planification des LLM en présence de données incomplètes