Por qué los LLM se equivocan cuando las observaciones son incompletas
Los autores relacionan los errores de los agentes LLM en entornos parcialmente observables con la ausencia de una distribución explícita de creencias sobre el estado oculto. Por lo general, el agente actúa como una política condicionada por el historial de acciones y observaciones.
El artículo describe tres errores característicos:
- tomar una decisión prematura ante comentarios ambiguos;
- inclinarse por una hipótesis incorrecta tras una observación informativa;
- desviación de la política a medida que crece el historial.
El problema no se limita a la calidad de la respuesta a una consulta concreta. Al agente le falta una representación explícita de los posibles estados ocultos que considera plausibles.
Cómo funciona el bucle bayesiano externo
Belief-State Engine (BSE) es un módulo de inferencia externo al LLM. Mantiene una distribución posterior bayesiana sobre los estados ocultos de un modelo POMDP dado, es decir, un proceso de decisión de Markov parcialmente observable.
En cada paso, el bucle funciona así:
- BSE actualiza la distribución de creencias sobre el estado oculto.
- El LLM recibe únicamente esta distribución.
- El LLM no tiene acceso al registro original de acciones y observaciones.

Este enfoque separa el seguimiento de la incertidumbre del modelo de lenguaje. La condición clave de la arquitectura es que el LLM no reciba el historial original.
Qué garantías dependen de la arquitectura
Los autores establecen una especificación mínima de cuatro axiomas para un estado interno coherente con las creencias. El contenido de los axiomas no se revela aquí.
Los autores demuestran que la combinación de LLM y BSE constituye una política de Markov válida en el belief MDP inducido por el POMDP original. Si el LLM nunca accede al historial original, la combinación hereda las garantías de optimalidad de Bellman de la teoría clásica de POMDP.
Criterio práctico: estas garantías se aplican a la combinación descrita y dependen de la restricción de acceso al historial. No se pueden separar de las condiciones de la arquitectura.
Qué mostró la evaluación
La arquitectura se evaluó en Tiger POMDP y en una tarea de grafo de ataque red team. La comparación incluyó seis métodos de referencia.
| Método de referencia | Resultado de BSE en ambos ámbitos |
|---|---|
| Reactive LLM | Mayor retorno de la tarea, mejor calibración de las creencias y mayor coherencia de las decisiones |
| Chain-of-Thought | Mayor retorno de la tarea, mejor calibración de las creencias y mayor coherencia de las decisiones |
| ReAct | Mayor retorno de la tarea, mejor calibración de las creencias y mayor coherencia de las decisiones |
| Rastreador de creencias en lenguaje natural | Mayor retorno de la tarea, mejor calibración de las creencias y mayor coherencia de las decisiones |
| QMDP | Mayor retorno de la tarea, mejor calibración de las creencias y mayor coherencia de las decisiones |
| POMCP | Mayor retorno de la tarea, mejor calibración de las creencias y mayor coherencia de las decisiones |
El resumen también afirma que el efecto no es específico de un único modelo. Diez ablaciones específicas están destinadas a aislar la contribución de decisiones arquitectónicas concretas.
Cuándo conviene considerar este enfoque
BSE mantiene una distribución sobre los estados ocultos de un POMDP dado. Por ello, describir la tarea en el marco de un modelo de este tipo es un criterio central para determinar si el enfoque resulta aplicable.
La evaluación del artículo abarca los dos ámbitos indicados. No confirma que los resultados puedan generalizarse a cualquier tarea con datos incompletos.
Qué se puede verificar
El preprint Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability incluye código, especificaciones de los entornos, plantillas de prompts y registros de seeds.
El artículo de Arnab Chattopadhayay y Debdipta Halder se envió a arXiv el 9 de septiembre de 2026. La conclusión práctica debe valorarse teniendo en cuenta los entornos, las comparaciones y las condiciones de acceso del LLM al historial que se describen.



