Что означает black-box-оценка
Black-box-подход оценивает наблюдаемое поведение агентной системы. Для проверки нужны только базовые описания системы, привилегированный доступ не требуется.
Такой подход связывает наблюдаемое поведение с категориями риска. Он позволяет проводить оценку без доступа к внутренним механизмам.
Практический критерий: выбирайте black-box-проверку, если привилегированный доступ недоступен, но можно предоставить базовое описание системы.
Из чего состоит проверка
Фреймворк объединяет таксономию рисков и автоматизированный red teaming. Авторы выделяют семь доменов, связывающих поведение агентов с категориями риска.

SAGE-RT создаёт 120 adversarial scenarios для каждого домена. Оценка также включает человеческую валидацию и LLM judges.
- Таксономия: семь доменов риска.
- Сценарии: автоматизированный red teaming для каждого домена.
- Проверка результатов: человеческая валидация и LLM judges.
Критерий выбора: метод соответствует задаче, если нужна автоматизированная генерация сценариев с последующей проверкой людьми и LLM judges.
Что показала проверка
Авторы проверили две архитектуры агентов — CrewAI и AutoGen — и четыре базовые модели.
| Показатель | Результат |
|---|---|
| Средний governance risk | 56,25% |
| Privacy risk в multi-agent-конфигурациях | 65% |
| Уязвимости поведения агентов | до 85% |
Эти значения описывают разные показатели. Их не следует сводить к одной общей оценке риска.
Практический критерий: при сравнении результатов важно сохранять исходные категории показателей и контекст конфигурации.
Почему одношаговой оценки недостаточно
Авторы отмечают, что стандартные оценки остаются одношаговыми. Они не выявляют уязвимости, которые возникают при последовательности действий.
Риски связаны с тем, как агенты работают:
- читают недоверенные входные данные;
- вызывают инструменты с реальными разрешениями;
- действуют автономно.
Сочетание этих факторов расширяет поверхность безопасности. Критерий оценки — проверять не только отдельный ответ, но и поведение агента в нескольких шагах.
Когда выбирать black-box-подход
Этот подход подходит для оценки рисков, если внутренний доступ к агенту недоступен. Достаточно предоставить базовое описание системы.
Он также полезен, когда проверка должна связывать наблюдаемое поведение с категориями риска. Для поиска многошаговых уязвимостей одношаговой оценки недостаточно.
Практический критерий: выбирайте подход, если задача требует проверить поведение без привилегированного доступа и учитывать риски, возникающие в нескольких шагах.



