Проблема: от текста к действиям
Современные агентные ИИ-системы умеют не просто генерировать ответы, а выполнять операции с внешними инструментами: изменять файлы, отправлять сообщения, запускать задания и менять состояние рабочих процессов. Вместе с этим смещается и фокус безопасности: если раньше главной угрозой был вредный текст, то теперь — вредные операционные побочные эффекты. Традиционные меры на уровне промптов способны влиять на поведение модели, но они не создают реальной границы исполнения: модель может предложить действие, и оно будет выполнено напрямую, без дополнительной проверки.
Именно здесь на сцену выходит система Aegis, предлагающая принципиально иной подход к управлению агентами. Вместо того чтобы полагаться на «хорошее поведение» модели, Aegis рассматривает выходы модели как предложения, которые проходят через доверенный уровень решений перед тем, как инструмент будет вызван.

Как работает Aegis: модель предлагает, среда решает
Ключевой принцип Aegis можно сформулировать коротко: модель предлагает, доверенная среда выполнения решает. Это runtime governance — управление на этапе выполнения, а не на этапе генерации.
Три уровня защиты
Aegis оценивает каждое предложение от модели по нескольким направлениям:
- Соответствие активным политикам: система сверяет предлагаемое действие с текущим состоянием политик, чтобы отсечь недопустимые операции.
- Проверка происхождения (provenance): доверенная серверная сторона подтверждает, что действие действительно исходит от авторизованного процесса, а не подменено по пути.
- Отказ при неопределённости (fail-closed): если система не может однозначно подтвердить безопасность действия, она отказывает в его выполнении — то есть по умолчанию действует принцип «запрещено всё, что явно не разрешено».
Отдельного внимания заслуживает механизм урегулирования в стиле сената. Когда предложение попадает в спорную категорию, вместо единоличного решения запускается путь авторизации на основе кворума. Это значит, что ни один компонент системы не может в одиночку принять решение — требуется согласие нескольких участников. Такой подход исключает односторонние решения и снижает риск того, что отдельная уязвимость или ошибка приведёт к опасному действию.
Экспериментальная оценка: что показали тесты
Чтобы проверить эффективность Aegis, авторы провели серию экспериментов на повторяемом sandbox-корпусе. В тестах использовались пять семейств прогонов, 42 задачи, три условия и десять повторов на каждое семейство. Общий объём данных — 6300 строк логов.
Результаты в цифрах
- В подходе, основанном только на промпт-политиках, было обнаружено 79 строк с рискованной утечкой по пути сравнения.
- При управлении Aegis (2100 строк) зафиксировано ноль применений управляемых mock-инструментов и ноль управляемых завершений с рискованными побочными эффектами.
- Все 1832 строки, предпринятые под управлением Aegis, сохранили доверенное происхождение, разрешённое системой.
- Все 1019 строк, урегулированных через «сенат», имели кворум и итоговые подписанные данные подсчёта голосов.

Выводы и ограничения
Авторы исследования подчёркивают важный нюанс: полученные результаты не доказывают общую безопасность автономных агентов. Речь идёт о более узком системном утверждении — в рамках оценочного sandbox-корпуса управление границами действий на этапе выполнения предотвратило превращение наблюдаемых рискованных предложений в реальные управляемые побочные эффекты.
Это означает, что Aegis работает как предохранитель: он не делает модель «безопасной по своей природе», но создаёт надёжный барьер между намерением модели и фактическим действием. Такой подход выглядит перспективным для практического применения в системах, где агенты работают с критическими инструментами, — но требует дальнейших исследований на более широких и разнообразных сценариях.



