Ciclo bayesiano externo para o planeamento de LLM com dados incompletos

28 setembro 202612 visualizações

O artigo explora uma arquitetura na qual um módulo separado estima as probabilidades dos estados ocultos do ambiente e as transmite ao modelo de linguagem, em vez de lhe fornecer a sequência completa de eventos anteriores. Os autores justificam a sua relação com a teoria dos POMDP e relatam crenças mais precisas e melhores resultados em duas tarefas de teste, em comparação com seis alternativas.

Ciclo bayesiano externo para o planeamento de LLM com dados incompletos

Por que os LLMs erram com observações incompletas

Os autores atribuem os erros de agentes LLM em ambientes parcialmente observáveis à ausência de uma distribuição explícita de crenças sobre o estado oculto. Em geral, o agente atua como uma política condicionada pelo histórico de ações e observações.

O artigo descreve três erros característicos:

  • decisão prematura diante de feedback ambíguo;
  • viés em favor de uma hipótese incorreta após uma observação informativa;
  • desvio da política à medida que o histórico cresce.

O problema não se resume à qualidade da resposta a uma solicitação isolada. Falta ao agente uma representação explícita daquilo que considera possíveis estados ocultos.

Como funciona o circuito bayesiano externo

Belief-State Engine (BSE) é um módulo de inferência externo ao LLM. Ele mantém uma distribuição a posteriori de Bayes sobre os estados ocultos de um modelo POMDP definido — um processo de decisão de Markov parcialmente observável.

A cada passo, o circuito funciona assim:

  1. O BSE atualiza a distribuição de crenças sobre o estado oculto.
  2. O LLM recebe apenas essa distribuição.
  3. O registro original de ações e observações permanece inacessível ao LLM.

Esta abordagem separa o tratamento da incerteza do modelo de linguagem. A condição fundamental da arquitetura é que o LLM não receba o histórico original.

Que garantias dependem da arquitetura

Os autores definem uma especificação mínima, composta por quatro axiomas, para um estado interno alinhado com as crenças. O conteúdo dos axiomas não é apresentado aqui.

Os autores provam que a combinação de LLM e BSE forma uma política de Markov válida num belief MDP induzido pelo POMDP original. Desde que o LLM nunca tenha acesso ao histórico original, a combinação herda as garantias de otimalidade de Bellman da teoria clássica de POMDP.

Critério prático: estas garantias aplicam-se à combinação descrita e dependem da restrição de acesso ao histórico. Não podem ser dissociadas das condições da arquitetura.

O que a avaliação demonstrou

A arquitetura foi testada no Tiger POMDP e numa tarefa de grafo de ataque red-team. A comparação incluiu seis métodos de referência.

Método de referênciaResultado do BSE em ambos os domínios
Reactive LLMMaior retorno da tarefa, melhor calibração das crenças e maior consistência das decisões
Chain-of-ThoughtMaior retorno da tarefa, melhor calibração das crenças e maior consistência das decisões
ReActMaior retorno da tarefa, melhor calibração das crenças e maior consistência das decisões
Natural-language belief trackerMaior retorno da tarefa, melhor calibração das crenças e maior consistência das decisões
QMDPMaior retorno da tarefa, melhor calibração das crenças e maior consistência das decisões
POMCPMaior retorno da tarefa, melhor calibração das crenças e maior consistência das decisões

O resumo também afirma que o efeito não é específico de um único modelo. Dez ablações direcionadas destinam-se a isolar a contribuição de decisões arquitetónicas individuais.

Quando vale a pena considerar esta abordagem

O BSE suporta uma distribuição sobre os estados ocultos de um POMDP definido. Por isso, a descrição da tarefa no âmbito de um modelo deste tipo é um critério central para determinar a aplicabilidade da abordagem.

A avaliação do artigo abrange os dois domínios indicados. Não confirma que os resultados se generalizem a quaisquer tarefas com dados incompletos.

O que está disponível para verificação

O preprint Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability inclui código, especificações dos ambientes, modelos de prompts e registos de seeds.

O artigo de Arnab Chattopadhayay e Debdipta Halder foi submetido ao arXiv em 9 de setembro de 2026. A conclusão prática deve ser avaliada tendo em conta os ambientes, as comparações e as condições de acesso do LLM ao histórico descritos.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Ciclo bayesiano externo para o planeamento de LLM com dados incompletos