Qué significa la evaluación de caja negra
El enfoque de caja negra evalúa el comportamiento observable de un sistema de agentes. Para realizar la comprobación, solo se necesitan descripciones básicas del sistema; no se requiere acceso privilegiado.
Este enfoque vincula el comportamiento observable con categorías de riesgo. Permite realizar una evaluación sin acceder a los mecanismos internos.
Criterio práctico: elige una comprobación de caja negra si no se dispone de acceso privilegiado, pero se puede proporcionar una descripción básica del sistema.
En qué consiste la comprobación
El framework combina una taxonomía de riesgos y red teaming automatizado. Los autores identifican siete dominios que vinculan el comportamiento de los agentes con categorías de riesgo.

SAGE-RT crea 120 escenarios adversarios para cada dominio. La evaluación también incluye validación humana y jueces LLM.
- Taxonomía: siete dominios de riesgo.
- Escenarios: red teaming automatizado para cada dominio.
- Verificación de resultados: validación humana y jueces LLM.
Criterio de elección: el método se ajusta a la tarea si se necesita generar escenarios de forma automatizada y verificarlos después con personas y jueces LLM.
Qué reveló la comprobación
Los autores probaron dos arquitecturas de agentes —CrewAI y AutoGen— y cuatro modelos de referencia.
| Indicador | Resultado |
|---|---|
| Riesgo de gobernanza medio | 56,25% |
| Riesgo de privacidad en configuraciones multiagente | 65% |
| Vulnerabilidades en el comportamiento de los agentes | hasta un 85% |
Estos valores describen indicadores diferentes. No deben combinarse en una única evaluación general del riesgo.
Criterio práctico: al comparar resultados, es importante conservar las categorías originales de los indicadores y el contexto de la configuración.
Por qué no basta con una evaluación de un solo paso
Los autores señalan que las evaluaciones estándar siguen siendo de un solo paso. No detectan vulnerabilidades que surgen de una secuencia de acciones.
Los riesgos están relacionados con la forma en que trabajan los agentes:
- leen entradas no confiables;
- llaman a herramientas con permisos reales;
- actúan de forma autónoma.
La combinación de estos factores amplía la superficie de seguridad. El criterio de evaluación consiste en comprobar no solo una respuesta aislada, sino también el comportamiento del agente a lo largo de varios pasos.
Cuándo elegir el enfoque de caja negra
Este enfoque es adecuado para evaluar riesgos cuando no se dispone de acceso interno al agente. Basta con proporcionar una descripción básica del sistema.
También es útil cuando la comprobación debe vincular el comportamiento observable con categorías de riesgo. Una evaluación de un solo paso no basta para detectar vulnerabilidades de varios pasos.
Criterio práctico: elige este enfoque si la tarea requiere comprobar el comportamiento sin acceso privilegiado y tener en cuenta los riesgos que surgen a lo largo de varios pasos.



