Ce que signifie l’évaluation en boîte noire
L’approche en boîte noire évalue le comportement observable d’un système agentique. Seules des descriptions de base du système sont nécessaires pour le tester ; aucun accès privilégié n’est requis.
Cette approche relie le comportement observable à des catégories de risque. Elle permet de mener une évaluation sans accéder aux mécanismes internes.
Critère pratique : choisissez une évaluation en boîte noire si l’accès privilégié n’est pas disponible, mais qu’une description de base du système peut être fournie.
En quoi consiste le test
Le cadre combine une taxonomie des risques et du red teaming automatisé. Les auteurs distinguent sept domaines qui relient le comportement des agents aux catégories de risque.

SAGE-RT crée 120 scénarios adversariaux pour chaque domaine. L’évaluation comprend également une validation humaine et des juges LLM.
- Taxonomie : sept domaines de risque.
- Scénarios : red teaming automatisé pour chaque domaine.
- Vérification des résultats : validation humaine et juges LLM.
Critère de choix : la méthode convient si la tâche nécessite une génération automatisée de scénarios, suivie d’une vérification par des humains et des juges LLM.
Résultats du test
Les auteurs ont testé deux architectures d’agents — CrewAI et AutoGen — ainsi que quatre modèles de base.
| Indicateur | Résultat |
|---|---|
| Risque moyen en matière de gouvernance | 56,25 % |
| Risque pour la confidentialité dans les configurations multi-agents | 65 % |
| Vulnérabilités du comportement des agents | jusqu’à 85 % |
Ces valeurs correspondent à des indicateurs différents. Elles ne doivent pas être ramenées à une seule évaluation globale du risque.
Critère pratique : pour comparer les résultats, il est important de conserver les catégories d’indicateurs d’origine et le contexte de configuration.
Pourquoi une évaluation en une seule étape ne suffit pas
Les auteurs soulignent que les évaluations standard restent limitées à une seule étape. Elles ne détectent pas les vulnérabilités qui apparaissent au fil d’une séquence d’actions.
Les risques sont liés à la manière dont les agents fonctionnent :
- lisent des entrées non fiables ;
- appellent des outils avec des autorisations réelles ;
- agissent de manière autonome.
La combinaison de ces facteurs élargit la surface d’attaque. Le critère d’évaluation consiste à examiner non seulement une réponse isolée, mais aussi le comportement de l’agent sur plusieurs étapes.
Quand choisir l’approche en boîte noire
Cette approche convient à l’évaluation des risques lorsque l’accès interne à l’agent n’est pas disponible. Il suffit de fournir une description de base du système.
Elle est également utile lorsque le test doit relier le comportement observable à des catégories de risque. Une évaluation en une seule étape ne suffit pas pour détecter les vulnérabilités qui se manifestent sur plusieurs étapes.
Critère pratique : choisissez cette approche si la tâche nécessite de tester le comportement sans accès privilégié et de prendre en compte les risques qui apparaissent sur plusieurs étapes.



