Онтологическое доверие: как вовремя заметить, что ИИ-агент уходит от исходной задачи

30 августа 20267 просмотров

Авторы предлагают онлайн-монитор RGE, который разбирает доверие к агенту на составляющие «роль», «цель» и «свидетельства» и отслеживает их на всём протяжении длинной траектории. Такой подход позволяет ловить накопленный дрейф даже тогда, когда каждый отдельный шаг выглядит допустимым, а на тестах OSWorld, FinanceBench и EICU-AC он оказывается точнее существующих эвристик, судей-моделей и шилдов.

Онтологическое доверие: как вовремя заметить, что ИИ-агент уходит от исходной задачи

Современные ИИ-агенты способны выполнять длинные последовательности действий: вызывать функции, обрабатывать ответы сервисов, принимать промежуточные решения. Наблюдателю сложно уследить за каждым шагом, поэтому для контроля безопасности обычно используют автоматические мониторы. Но как быть, если отдельные шаги выглядят безупречно, а вся цепочка постепенно уходит в сторону от того, что просил пользователь?

Почему локальные проверки не спасают

Долгосрочный агент может на каждом шаге вызывать корректный инструмент с правдоподобными аргументами, и всё равно необнаружимо смещаться: вместо исходной задачи он начинает решать более широкую или смежную, «притягивает» свидетельства, которых пользователь не предоставлял. Такое накопление отклонений называют дрейфом траектории. Существующие системы проверки, как правило, смотрят на локальное соответствие отдельных действий, либо выносят общий вердикт по всей траектории, либо оценивают суммарный риск. Проблема в том, что они не анализируют именно промежуточные префиксы — то, как развивается соотношение между траекторией и задачей по мере её выполнения.

Недавняя работа на arXiv (2608.17718) описывает подход, который пытается закрыть этот пробел. Авторы предлагают понятие «онтологического доверия»: это свойство не всего пути, а каждого префикса траектории, причём свойство, заданное относительно исходной задачи.

Три компонента доверия

Чтобы вовремя заметить отклонение, нужно разложить доверие на составляющие. Именно это делает монитор RGE — его название происходит от Role, Goal, Evidence. Формально доверие к префиксу траектории оценивается по трём осям:

  • Роль — остаётся ли агент в рамках полномочий, которые дал пользователь, или постепенно «назначает» себя более широкой ролью.
  • Цель — насколько текущее направление движения соответствует авторизованной цели, а не подменяется похожей, но смежной.
  • Свидетельства — опирается ли агент на данные, реально присутствующие в наблюдениях, или на неявные допущения и незапрошенную информацию.

Такой тройной контроль позволяет различать, например, агента, который перестал выполнять задачу, и агента, который лишь меняет допустимый способ её выполнения.

Как устроена проверка

Важная деталь: RGE не является «чёрным ящиком», который оценивает траекторию одной сквозной моделью. Языковые модели здесь применяются только для того, чтобы получить структурированные представления задачи и отдельных шагов. Обновление состояния доверия, проекции на три компонента и решение о вмешательстве — детерминированные. Благодаря этому на выходе получается воспроизводимая траектория доверия: можно точно сказать, в какой момент и из-за какого именно компонента возникло подозрение. Это важное инженерное решение, потому что оно снижает зависимость от капризов большой модели и упрощает аудит.

Насколько это работает

Для проверки подхода авторы собрали корпус траекторий на базе трёх разных сред: OSWorld, FinanceBench и EICU-AC. В корпус вошли бенигные (нормальные) выполнения, примеры дрейфа со спаренными префиксами и так называемые «псевдосогласованные» сбои — когда действия выглядят логичными, но на самом деле ошибочны.

На этом материале RGE превзошёл адаптированные бейзлайны на правилах, judge-модели и шилды с точки зрения обнаружения дрейфа в префиксах. С двумя более крупными моделями-оценщиками он достигает более 93% Drift F1 на каждом бенчмарке, сохраняя при этом покрытие бенигных случаев на уровне не ниже 95,8%. Иначе говоря, он редко пропускает реальный дрейф и при этом не заваливает нормальную работу ложными тревогами.

Однако исследователи честно охарактеризовали и ограничение. «Псевдосогласованные» сбои остаются сложным случаем: их обнаружение сильно зависит от того, виден ли результат выполнения задачи внешне. Если во внешнем мире нет явного подтверждения успеха или провала, монитор не всегда может отличить аккуратно замаскированное отклонение от обычной неопределённости. Это не недоработка — это структурная граница любого подхода, который не имеет доступа к полной семантике мира.

Выводы

Главный урок из этой работы — следить нужно не только за отдельными шагами, но и за формой траектории в целом. Практический подход может быть таким: для каждого префикса задавать себе вопрос, не изменилась ли роль агента, не подменилась ли цель и нет ли «чужих» свидетельств. Именно эти три вопроса ложатся в основу более прозрачного и проверяемого надзора за долгосрочными агентами. И, вероятно, в будущем «онтологическое доверие» станет такой же обыденной метрикой для ИИ-агентов, как сегодня — точность или латентность.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Онтологическое доверие: как ИИ-агент уходит от задачи