Evaluación de agentes de IA sin acceso a sus mecanismos internos

28 septiembre 202611 vistas

El artículo describe un método para evaluar sistemas autónomos según siete categorías de amenazas: el generador SAGE-RT crea 120 escenarios de ataque para cada una. Las pruebas de CrewAI y AutoGen revelaron altos niveles de vulnerabilidad en el comportamiento de los agentes, así como riesgos para la gobernanza y la privacidad, especialmente en configuraciones multiagente.

Evaluación de agentes de IA sin acceso a sus mecanismos internos

Qué significa la evaluación de caja negra

El enfoque de caja negra evalúa el comportamiento observable de un sistema de agentes. Para realizar la comprobación, solo se necesitan descripciones básicas del sistema; no se requiere acceso privilegiado.

Este enfoque vincula el comportamiento observable con categorías de riesgo. Permite realizar una evaluación sin acceder a los mecanismos internos.

Criterio práctico: elige una comprobación de caja negra si no se dispone de acceso privilegiado, pero se puede proporcionar una descripción básica del sistema.

En qué consiste la comprobación

El framework combina una taxonomía de riesgos y red teaming automatizado. Los autores identifican siete dominios que vinculan el comportamiento de los agentes con categorías de riesgo.

SAGE-RT crea 120 escenarios adversarios para cada dominio. La evaluación también incluye validación humana y jueces LLM.

  • Taxonomía: siete dominios de riesgo.
  • Escenarios: red teaming automatizado para cada dominio.
  • Verificación de resultados: validación humana y jueces LLM.

Criterio de elección: el método se ajusta a la tarea si se necesita generar escenarios de forma automatizada y verificarlos después con personas y jueces LLM.

Qué reveló la comprobación

Los autores probaron dos arquitecturas de agentes —CrewAI y AutoGen— y cuatro modelos de referencia.

IndicadorResultado
Riesgo de gobernanza medio56,25%
Riesgo de privacidad en configuraciones multiagente65%
Vulnerabilidades en el comportamiento de los agenteshasta un 85%

Estos valores describen indicadores diferentes. No deben combinarse en una única evaluación general del riesgo.

Criterio práctico: al comparar resultados, es importante conservar las categorías originales de los indicadores y el contexto de la configuración.

Por qué no basta con una evaluación de un solo paso

Los autores señalan que las evaluaciones estándar siguen siendo de un solo paso. No detectan vulnerabilidades que surgen de una secuencia de acciones.

Los riesgos están relacionados con la forma en que trabajan los agentes:

  • leen entradas no confiables;
  • llaman a herramientas con permisos reales;
  • actúan de forma autónoma.

La combinación de estos factores amplía la superficie de seguridad. El criterio de evaluación consiste en comprobar no solo una respuesta aislada, sino también el comportamiento del agente a lo largo de varios pasos.

Cuándo elegir el enfoque de caja negra

Este enfoque es adecuado para evaluar riesgos cuando no se dispone de acceso interno al agente. Basta con proporcionar una descripción básica del sistema.

También es útil cuando la comprobación debe vincular el comportamiento observable con categorías de riesgo. Una evaluación de un solo paso no basta para detectar vulnerabilidades de varios pasos.

Criterio práctico: elige este enfoque si la tarea requiere comprobar el comportamiento sin acceso privilegiado y tener en cuenta los riesgos que surgen a lo largo de varios pasos.

Preguntas frecuentes

Material similar

Todos los materiales
Evaluación de agentes de IA sin acceso a sus mecanismos internos