Внешний байесовский контур для планирования LLM при неполных данных

28 сентября 202613 просмотров

В статье исследуется архитектура, в которой отдельный модуль оценивает вероятности скрытых состояний среды и передаёт их языковой модели вместо полной последовательности прошлых событий. Авторы обосновывают её связь с теорией POMDP и сообщают о более точных убеждениях и лучших результатах в двух тестовых задачах по сравнению с шестью альтернативами.

Внешний байесовский контур для планирования LLM при неполных данных

Почему LLM ошибаются при неполных наблюдениях

Ошибки LLM-агентов в частично наблюдаемых средах авторы связывают с отсутствием явного распределения убеждений о скрытом состоянии. Обычно агент действует как политика, обусловленная историей действий и наблюдений.

В статье описаны три характерные ошибки:

  • преждевременное решение при неоднозначной обратной связи;
  • смещение к неверной гипотезе после информативного наблюдения;
  • дрейф политики по мере роста истории.

Проблема не только в качестве ответа на отдельный запрос. Агенту не хватает явного представления о том, что он считает возможным скрытым состоянием.

Как устроен внешний байесовский контур

Belief-State Engine (BSE) — модуль вывода вне LLM. Он поддерживает апостериорное распределение Байеса по скрытым состояниям заданной модели POMDP — частично наблюдаемого марковского процесса принятия решений.

На каждом шаге контур работает так:

  1. BSE обновляет распределение убеждений о скрытом состоянии.
  2. LLM получает только это распределение.
  3. Исходный журнал действий и наблюдений остаётся недоступен для LLM.

Такой подход отделяет учёт неопределённости от языковой модели. Ключевое условие архитектуры — LLM не получает исходную историю.

Какие гарантии зависят от архитектуры

Авторы задают минимальную спецификацию из четырёх аксиом для согласованного с убеждениями внутреннего состояния. Содержание аксиом здесь не раскрывается.

Авторы доказывают, что связка LLM и BSE образует корректную марковскую политику на belief MDP, индуцированном исходной POMDP. При условии, что LLM никогда не получает доступ к исходной истории, связка наследует гарантии оптимальности Беллмана классической теории POMDP.

Практический критерий: эти гарантии относятся к описанной связке и зависят от ограничения доступа к истории. Их нельзя отделять от условий архитектуры.

Что показала оценка

Архитектуру проверяли на Tiger POMDP и задаче red-team attack-graph. Сравнение включало шесть базовых методов.

Базовый методРезультат BSE в обеих областях
Reactive LLMБолее высокий task return, лучшая калибровка убеждений и большая согласованность решений
Chain-of-ThoughtБолее высокий task return, лучшая калибровка убеждений и большая согласованность решений
ReActБолее высокий task return, лучшая калибровка убеждений и большая согласованность решений
Natural-language belief trackerБолее высокий task return, лучшая калибровка убеждений и большая согласованность решений
QMDPБолее высокий task return, лучшая калибровка убеждений и большая согласованность решений
POMCPБолее высокий task return, лучшая калибровка убеждений и большая согласованность решений

В аннотации также заявлено, что эффект не специфичен для одной модели. Десять целевых абляций предназначены для выделения вклада отдельных архитектурных решений.

Когда подход уместно рассматривать

BSE поддерживает распределение по скрытым состояниям заданной POMDP. Поэтому описание задачи в рамках такой модели — центральный критерий применимости подхода.

Оценка в статье охватывает две указанные области. Она не подтверждает перенос результатов на любые задачи с неполными данными.

Что доступно для проверки

К препринту Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability приложены код, спецификации сред, шаблоны промптов и журналы seed.

Статью Arnab Chattopadhayay и Debdipta Halder подали на arXiv 9 сентября 2026 года. Практический вывод следует оценивать с учётом описанных сред, сравнений и условий доступа LLM к истории.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Внешний байесовский контур для планирования LLM-агентов