Осторожность, которая меняется с опытом: метод RATTL для безопасных решений в условиях неизвестности
Когда агент действует в реальном мире, он почти всегда сталкивается с неполной информацией о том, как устроена среда. Особенно остро эта проблема стоит для систем, которые должны работать в реальном времени: роботы, автономные транспортные средства или сервисы на основе больших языковых моделей. Перестраховаться настолько, чтобы учесть все мыслимые сценарии, невозможно, а слишком смелое поведение может привести к аварии. Нужен баланс, и именно его пытается найти новый подход, предложенный в исследовании Deep Kumar Ganguly и Jan Kretinsky.
Откуда взялась задача
Авторы представили работу «Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making» (arXiv:2608.17574). Статья была подана в августе 2026 года и принята на воркшоп RobustifAI конференции IJCAI-ECAI 2026. В центре внимания — RATTL, или Risk-Adversarial Total-Reward Learning. Это метод, который позволяет агенту принимать решения, оценивая риски в условиях, когда динамика среды известна лишь частично.
Ключевая идея RATTL в том, что степень осторожности не фиксирована, а напрямую зависит от того, насколько агент на самом деле не уверен в своём окружении. Если свидетельств мало — действуем осторожно. Если их становится больше — можем позволить себе более смелые действия. Именно эта адаптивность отличает метод от классических подходов, где уровень риска задаётся заранее и остаётся неизменным.
Как работает метод: неопределённость как радиус
В основе RATTL лежит байесовский апостериор по неизвестной динамике среды. Проще говоря, агент постоянно обновляет свои представления о том, как мир устроен, — по мере накопления наблюдений. Но для планирования этого недостаточно: нужно ещё понять, насколько эти представления могут быть ошибочными.
Решение авторов состоит в том, чтобы рассматривать множество возможных моделей среды в виде так называемого Wasserstein-множества неопределённости. Радиус этого множества — мера того, насколько далеко мы допускаем отклонение от текущих ожиданий, — задаётся как монотонная функция от апостериора. На ранних этапах, когда данных мало, радиус большой: агент допускает, что среда может вести себя почти как угодно. По мере поступления свидетельств радиус сжимается, и круг «возможных миров» сужается.
Этот механизм даёт интересный эффект интерполяции. В пределе, когда радиус максимален, поведение агента эквивалентно гарантирующей наихудший случай робастности — стратегии, которая безопасна при самых неприятных сценариях. Когда радиус стремится к нулю, агент превращается в риск-нейтрального оптимизатора, который просто максимизирует ожидаемую суммарную награду. В промежуточных точках мы получаем непрерывный спектр поведений — от крайне консервативного до почти самоуверенного.
Построение такого критерия опирается на двойственность, лежащую в основе Entropic Value-at-Risk. Эта связь позволяет перевести выбор уровня риска в выбор радиуса неопределённости, что оказывается вычислительно удобно и концептуально ясно: вместо абстрактного «коэффициента осторожности» мы работаем с геометрической величиной, которую можно интерпретировать как допустимое отклонение от известной модели.
Гарантии и безопасность: «Safety Sandwich»
Авторы не ограничились эвристиками. Они показали, что задача планирования в RATTL корректна при условиях транзиентности и компактности пространства состояний. Это означает, что алгоритм не «разваливается» на бесконечных траекториях и даёт осмысленные значения функции полезности.
Центральный теоретический результат получил название Safety Sandwich — «сэндвич безопасности». Значение RATTL всегда находится между двумя экстремальными значениями. Снизу его ограничивает неинформированное робастное значение — то есть оценка, которую получил бы агент, не имеющий вообще никаких данных и готовый к самому худшему. Сверху — оптимум при полном знании динамики. По мере того как апостериор концентрируется вокруг истинной модели, разрыв между этими границами сокращается, и оценка RATTL стремится к оптимуму. Другими словами, метод гарантирует, что перестраховка в начале не приводит к катастрофически низкой награде, а уверенность в конце не делает агента слепым к остаточным рискам.
Поведение в примерах: от абстракции к практике
Для иллюстрации авторы рассматривают канонический пример с бинарной опасностью — ситуацию, где существует два состояния среды, одно из которых безопасно, а другое смертельно опасно. В этом случае индуцированный критерий RATTL сводится к Conditional Value-at-Risk с уровнем, который задаётся энтропией апостериора. Иными словами, чем более «размазано» распределение убеждений агента, тем более строгий порог потерь он выбирает.

Другой рабочий пример показывает любопытное поведение: агент долго откладывает эффективное действие, ожидая, пока не будет достигнут резкий порог идентификации. То есть он готов терпеть неоптимальность — например, медленно двигаться или выбирать заведомо не самую выгодную стратегию, — лишь бы не рисковать вслепую. Как только свидетельства становятся достаточно убедительными, происходит качественный скачок: агент переключается на уверенные действия. Это напоминает поведение человека, который в незнакомом месте сначала идёт медленно и оглядывается, а потом ускоряется, узнав дорогу.
Такой режим работы особенно важен для систем реального времени. Авторы подчёркивают, что RATTL рассчитан на безопасность агентов, действующих в условиях непрерывного потока данных, включая системы на основе больших языковых моделей. Для них неизвестность возникает не только из-за физической среды, но и из-за неопределённости в поведении пользователей или качестве обрабатываемого текста.

Почему это важно
Главный вклад RATTL — в отказе от жёсткой дихотомии «осторожность против эффективности». Вместо этого авторы предлагают рассматривать их как две стороны одного процесса: чем больше мы знаем, тем смелее можем быть, и при этом хотим сохранять явную связь между степенью нашего знания и допустимым риском. Такой подход делает методы автоматического принятия решений более прозрачными и предсказуемыми, что важно для практического внедрения.
Остаётся открытым вопрос о вычислительной сложности при работе с большими пространствами состояний, но теоретическая основа уже заложена. Возможно, в ближайшее время мы увидим модификации RATTL для конкретных доменов — от управления беспилотниками до ассистентов на базе ИИ, которые учатся на собственном опыте, не ставя под угрозу ни себя, ни окружающих.



