Évaluation d’agents d’IA sans accès à leurs mécanismes internes

28 septembre 202611 vues

L’article décrit une méthode d’évaluation des systèmes autonomes selon sept catégories de menaces : le générateur SAGE-RT crée 120 scénarios d’attaque pour chacune d’elles. Les tests de CrewAI et AutoGen ont révélé une forte vulnérabilité du comportement des agents, ainsi que des risques liés à la gouvernance et à la confidentialité, en particulier dans les configurations multi-agents.

Évaluation d’agents d’IA sans accès à leurs mécanismes internes

Ce que signifie l’évaluation en boîte noire

L’approche en boîte noire évalue le comportement observable d’un système agentique. Seules des descriptions de base du système sont nécessaires pour le tester ; aucun accès privilégié n’est requis.

Cette approche relie le comportement observable à des catégories de risque. Elle permet de mener une évaluation sans accéder aux mécanismes internes.

Critère pratique : choisissez une évaluation en boîte noire si l’accès privilégié n’est pas disponible, mais qu’une description de base du système peut être fournie.

En quoi consiste le test

Le cadre combine une taxonomie des risques et du red teaming automatisé. Les auteurs distinguent sept domaines qui relient le comportement des agents aux catégories de risque.

SAGE-RT crée 120 scénarios adversariaux pour chaque domaine. L’évaluation comprend également une validation humaine et des juges LLM.

  • Taxonomie : sept domaines de risque.
  • Scénarios : red teaming automatisé pour chaque domaine.
  • Vérification des résultats : validation humaine et juges LLM.

Critère de choix : la méthode convient si la tâche nécessite une génération automatisée de scénarios, suivie d’une vérification par des humains et des juges LLM.

Résultats du test

Les auteurs ont testé deux architectures d’agents — CrewAI et AutoGen — ainsi que quatre modèles de base.

IndicateurRésultat
Risque moyen en matière de gouvernance56,25 %
Risque pour la confidentialité dans les configurations multi-agents65 %
Vulnérabilités du comportement des agentsjusqu’à 85 %

Ces valeurs correspondent à des indicateurs différents. Elles ne doivent pas être ramenées à une seule évaluation globale du risque.

Critère pratique : pour comparer les résultats, il est important de conserver les catégories d’indicateurs d’origine et le contexte de configuration.

Pourquoi une évaluation en une seule étape ne suffit pas

Les auteurs soulignent que les évaluations standard restent limitées à une seule étape. Elles ne détectent pas les vulnérabilités qui apparaissent au fil d’une séquence d’actions.

Les risques sont liés à la manière dont les agents fonctionnent :

  • lisent des entrées non fiables ;
  • appellent des outils avec des autorisations réelles ;
  • agissent de manière autonome.

La combinaison de ces facteurs élargit la surface d’attaque. Le critère d’évaluation consiste à examiner non seulement une réponse isolée, mais aussi le comportement de l’agent sur plusieurs étapes.

Quand choisir l’approche en boîte noire

Cette approche convient à l’évaluation des risques lorsque l’accès interne à l’agent n’est pas disponible. Il suffit de fournir une description de base du système.

Elle est également utile lorsque le test doit relier le comportement observable à des catégories de risque. Une évaluation en une seule étape ne suffit pas pour détecter les vulnérabilités qui se manifestent sur plusieurs étapes.

Critère pratique : choisissez cette approche si la tâche nécessite de tester le comportement sans accès privilégié et de prendre en compte les risques qui apparaissent sur plusieurs étapes.

Foire aux questions

Matériaux connexes

Tous matériaux
Évaluation d’agents d’IA sans accès à leurs mécanismes internes