Оценка ИИ-агентов без доступа к их внутренним механизмам

28 сентября 202611 просмотров

В статье описан метод проверки автономных систем по семи категориям угроз: генератор SAGE-RT создаёт для каждой из них по 120 сценариев атак. Испытания CrewAI и AutoGen показали высокие показатели уязвимости поведения агентов, а также риски для управления и приватности, особенно в мультиагентных конфигурациях.

Оценка ИИ-агентов без доступа к их внутренним механизмам

Что означает black-box-оценка

Black-box-подход оценивает наблюдаемое поведение агентной системы. Для проверки нужны только базовые описания системы, привилегированный доступ не требуется.

Такой подход связывает наблюдаемое поведение с категориями риска. Он позволяет проводить оценку без доступа к внутренним механизмам.

Практический критерий: выбирайте black-box-проверку, если привилегированный доступ недоступен, но можно предоставить базовое описание системы.

Из чего состоит проверка

Фреймворк объединяет таксономию рисков и автоматизированный red teaming. Авторы выделяют семь доменов, связывающих поведение агентов с категориями риска.

SAGE-RT создаёт 120 adversarial scenarios для каждого домена. Оценка также включает человеческую валидацию и LLM judges.

  • Таксономия: семь доменов риска.
  • Сценарии: автоматизированный red teaming для каждого домена.
  • Проверка результатов: человеческая валидация и LLM judges.

Критерий выбора: метод соответствует задаче, если нужна автоматизированная генерация сценариев с последующей проверкой людьми и LLM judges.

Что показала проверка

Авторы проверили две архитектуры агентов — CrewAI и AutoGen — и четыре базовые модели.

ПоказательРезультат
Средний governance risk56,25%
Privacy risk в multi-agent-конфигурациях65%
Уязвимости поведения агентовдо 85%

Эти значения описывают разные показатели. Их не следует сводить к одной общей оценке риска.

Практический критерий: при сравнении результатов важно сохранять исходные категории показателей и контекст конфигурации.

Почему одношаговой оценки недостаточно

Авторы отмечают, что стандартные оценки остаются одношаговыми. Они не выявляют уязвимости, которые возникают при последовательности действий.

Риски связаны с тем, как агенты работают:

  • читают недоверенные входные данные;
  • вызывают инструменты с реальными разрешениями;
  • действуют автономно.

Сочетание этих факторов расширяет поверхность безопасности. Критерий оценки — проверять не только отдельный ответ, но и поведение агента в нескольких шагах.

Когда выбирать black-box-подход

Этот подход подходит для оценки рисков, если внутренний доступ к агенту недоступен. Достаточно предоставить базовое описание системы.

Он также полезен, когда проверка должна связывать наблюдаемое поведение с категориями риска. Для поиска многошаговых уязвимостей одношаговой оценки недостаточно.

Практический критерий: выбирайте подход, если задача требует проверить поведение без привилегированного доступа и учитывать риски, возникающие в нескольких шагах.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Оценка ИИ-агентов без доступа к внутренним механизмам