Aegis: salvaguarda para agentes de IA: las propuestas del modelo pasan por un nivel de decisiones confiable

25 agosto 202617 vistas

El nuevo sistema Aegis intercepta las solicitudes de herramientas que envía el agente y las pasa por un mecanismo de verificación externo antes de su ejecución real. En experimentos con un corpus especial de escenarios, logró cero efectos secundarios riesgosos, mientras que las restricciones de prompt habituales no ofrecían esa garantía.

Aegis: salvaguarda para agentes de IA: las propuestas del modelo pasan por un nivel de decisiones confiable

Problema: Del texto a las acciones

Los sistemas modernos de inteligencia artificial pueden hacer más que generar respuestas, pueden realizar operaciones con herramientas externas: modificar archivos, enviar mensajes, tareas de lanzamiento y cambiar el estado de los flujos de trabajo. Esto también cambia el enfoque de seguridad: mientras que el texto dañino solía ser la principal amenaza, ahora es efectos secundarios nocivos operativos. Las medidas tradicionales de nivel rápido pueden influir en el comportamiento modelo, pero no crean un límite de ejecución real: el modelo puede proponer una acción, y se ejecutará directamente, sin verificación adicional.

Aquí es donde Aegis entra en juego, ofreciendo un enfoque fundamentalmente diferente a la gestión de los agentes. En lugar de depender de la "buena conducta" del modelo, Aegis trata las salidas modelo como propuestas que pasan a través de una capa de decisión confiable antes de que se invoque la herramienta.

How Aegis Works: The Model Proposes, the Environment Decide

El principio clave de Aegis puede resumirse brevemente: el modelo propone, el entorno de ejecución confiable decide. Esto es gobernanza de tiempo de ejecución: control en la etapa de ejecución, no en la etapa de generación.

Tres capas de protección

Aegis evalúa cada propuesta del modelo en varias dimensiones:

  • Cumplimiento de las políticas activas: el sistema revisa la acción propuesta contra el estado de la política actual para filtrar las operaciones no autorizadas.
  • Verificación de los ingresos: el lado del servidor de confianza confirma que la acción origina genuinamente de un proceso autorizado y no ha sido manipulada a lo largo del camino.
  • Comportamiento cerrado: si el sistema no puede confirmar inequívocamente una acción es segura, se niega a ejecutarla, lo que significa que el principio predeterminado es "todo lo que no se permite explícitamente está prohibido".

El mecanismo de resolución de estilo senado merece especial atención. Cuando una propuesta entra en una categoría controvertida, se activa un camino de autorización basado en quórum en lugar de una decisión unilateral. Esto significa que ningún componente único del sistema puede tomar una decisión por sí mismo — se requiere un consenso de múltiples participantes. Este enfoque excluye las decisiones unilaterales y reduce el riesgo de que una sola vulnerabilidad o error lleve a una acción peligrosa.

Evaluación experimental: Lo que muestran los exámenes

Para verificar la eficacia de Aegis, los autores realizaron una serie de experimentos sobre un cuerpo de sandbox reproducible. Las pruebas utilizaron cinco familias administradas, 42 tareas, tres condiciones y diez repeticiones por familia. El volumen total de datos fue de 6.300 líneas de registro.

Resultados en Números

  • En el enfoque de políticas inmediatas, 79 líneas con fuga de riesgo fueron detectados a lo largo de la ruta de comparación.
  • Bajo la gobernanza de Aegis (2.100 líneas), cero aplicaciones de herramientas gobernadas y cero terminaciones gobernadas con efectos secundarios riesgosos fueron registrados.
  • Todas las 1,832 líneas ejecutada bajo la gobernanza de Aegis preserva la procedencia confiable y aprobada por el sistema.
  • Todas las 1.019 líneas resuelto a través del "senate" tenía quórum y los datos finales de la cuenta de voto firmados.

Conclusiones y limitaciones

Los autores del estudio enfatizan un matiz importante: los resultados obtenidos no probar la seguridad general de los agentes autónomos. Se trata de una reclamación sistémica más estrecha, dentro del cuerpo de arena de evaluación, que rige los límites de acción en la etapa de ejecución impidió que las propuestas de riesgo se conviertan en efectos secundarios reales gobernados.

Esto significa que Aegis funciona como un fusible de seguridad: no hace que el modelo "seguro por naturaleza", pero crea una barrera confiable entre la intención del modelo y la acción real. Este enfoque parece prometedor para uso práctico en sistemas donde los agentes trabajan con herramientas críticas, pero requiere más investigación sobre escenarios más amplios y más diversos.

Preguntas frecuentes

Aegis – Security System for AI Agents review