Осторожность, которая меняется с опытом: метод RATTL для безопасных решений в условиях неизвестности

28 августа 202615 просмотров

В новой работе представлен алгоритм RATTL, который определяет уровень риска через текущую неуверенность агента в модели среды: чем меньше данных, тем осторожнее поведение, а с ростом уверенности политика постепенно становится смелее. Такой подход даёт промежуточные гарантии между защитой от худшего случая и стремлением к максимальной награде.

Осторожность, которая меняется с опытом: метод RATTL для безопасных решений в условиях неизвестности

Осторожность, которая меняется с опытом: метод RATTL для безопасных решений в условиях неизвестности

Когда агент действует в реальном мире, он почти всегда сталкивается с неполной информацией о том, как устроена среда. Особенно остро эта проблема стоит для систем, которые должны работать в реальном времени: роботы, автономные транспортные средства или сервисы на основе больших языковых моделей. Перестраховаться настолько, чтобы учесть все мыслимые сценарии, невозможно, а слишком смелое поведение может привести к аварии. Нужен баланс, и именно его пытается найти новый подход, предложенный в исследовании Deep Kumar Ganguly и Jan Kretinsky.

Откуда взялась задача

Авторы представили работу «Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making» (arXiv:2608.17574). Статья была подана в августе 2026 года и принята на воркшоп RobustifAI конференции IJCAI-ECAI 2026. В центре внимания — RATTL, или Risk-Adversarial Total-Reward Learning. Это метод, который позволяет агенту принимать решения, оценивая риски в условиях, когда динамика среды известна лишь частично.

Ключевая идея RATTL в том, что степень осторожности не фиксирована, а напрямую зависит от того, насколько агент на самом деле не уверен в своём окружении. Если свидетельств мало — действуем осторожно. Если их становится больше — можем позволить себе более смелые действия. Именно эта адаптивность отличает метод от классических подходов, где уровень риска задаётся заранее и остаётся неизменным.

Как работает метод: неопределённость как радиус

В основе RATTL лежит байесовский апостериор по неизвестной динамике среды. Проще говоря, агент постоянно обновляет свои представления о том, как мир устроен, — по мере накопления наблюдений. Но для планирования этого недостаточно: нужно ещё понять, насколько эти представления могут быть ошибочными.

Решение авторов состоит в том, чтобы рассматривать множество возможных моделей среды в виде так называемого Wasserstein-множества неопределённости. Радиус этого множества — мера того, насколько далеко мы допускаем отклонение от текущих ожиданий, — задаётся как монотонная функция от апостериора. На ранних этапах, когда данных мало, радиус большой: агент допускает, что среда может вести себя почти как угодно. По мере поступления свидетельств радиус сжимается, и круг «возможных миров» сужается.

Этот механизм даёт интересный эффект интерполяции. В пределе, когда радиус максимален, поведение агента эквивалентно гарантирующей наихудший случай робастности — стратегии, которая безопасна при самых неприятных сценариях. Когда радиус стремится к нулю, агент превращается в риск-нейтрального оптимизатора, который просто максимизирует ожидаемую суммарную награду. В промежуточных точках мы получаем непрерывный спектр поведений — от крайне консервативного до почти самоуверенного.

Построение такого критерия опирается на двойственность, лежащую в основе Entropic Value-at-Risk. Эта связь позволяет перевести выбор уровня риска в выбор радиуса неопределённости, что оказывается вычислительно удобно и концептуально ясно: вместо абстрактного «коэффициента осторожности» мы работаем с геометрической величиной, которую можно интерпретировать как допустимое отклонение от известной модели.

Гарантии и безопасность: «Safety Sandwich»

Авторы не ограничились эвристиками. Они показали, что задача планирования в RATTL корректна при условиях транзиентности и компактности пространства состояний. Это означает, что алгоритм не «разваливается» на бесконечных траекториях и даёт осмысленные значения функции полезности.

Центральный теоретический результат получил название Safety Sandwich — «сэндвич безопасности». Значение RATTL всегда находится между двумя экстремальными значениями. Снизу его ограничивает неинформированное робастное значение — то есть оценка, которую получил бы агент, не имеющий вообще никаких данных и готовый к самому худшему. Сверху — оптимум при полном знании динамики. По мере того как апостериор концентрируется вокруг истинной модели, разрыв между этими границами сокращается, и оценка RATTL стремится к оптимуму. Другими словами, метод гарантирует, что перестраховка в начале не приводит к катастрофически низкой награде, а уверенность в конце не делает агента слепым к остаточным рискам.

Поведение в примерах: от абстракции к практике

Для иллюстрации авторы рассматривают канонический пример с бинарной опасностью — ситуацию, где существует два состояния среды, одно из которых безопасно, а другое смертельно опасно. В этом случае индуцированный критерий RATTL сводится к Conditional Value-at-Risk с уровнем, который задаётся энтропией апостериора. Иными словами, чем более «размазано» распределение убеждений агента, тем более строгий порог потерь он выбирает.

Другой рабочий пример показывает любопытное поведение: агент долго откладывает эффективное действие, ожидая, пока не будет достигнут резкий порог идентификации. То есть он готов терпеть неоптимальность — например, медленно двигаться или выбирать заведомо не самую выгодную стратегию, — лишь бы не рисковать вслепую. Как только свидетельства становятся достаточно убедительными, происходит качественный скачок: агент переключается на уверенные действия. Это напоминает поведение человека, который в незнакомом месте сначала идёт медленно и оглядывается, а потом ускоряется, узнав дорогу.

Такой режим работы особенно важен для систем реального времени. Авторы подчёркивают, что RATTL рассчитан на безопасность агентов, действующих в условиях непрерывного потока данных, включая системы на основе больших языковых моделей. Для них неизвестность возникает не только из-за физической среды, но и из-за неопределённости в поведении пользователей или качестве обрабатываемого текста.

Почему это важно

Главный вклад RATTL — в отказе от жёсткой дихотомии «осторожность против эффективности». Вместо этого авторы предлагают рассматривать их как две стороны одного процесса: чем больше мы знаем, тем смелее можем быть, и при этом хотим сохранять явную связь между степенью нашего знания и допустимым риском. Такой подход делает методы автоматического принятия решений более прозрачными и предсказуемыми, что важно для практического внедрения.

Остаётся открытым вопрос о вычислительной сложности при работе с большими пространствами состояний, но теоретическая основа уже заложена. Возможно, в ближайшее время мы увидим модификации RATTL для конкретных доменов — от управления беспилотниками до ассистентов на базе ИИ, которые учатся на собственном опыте, не ставя под угрозу ни себя, ни окружающих.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Метод RATTL: безопасные решения в условиях неизвестности