Problème : Du texte aux actions
Les systèmes d'IA modernes peuvent faire plus que simplement générer des réponses — ils peuvent effectuer des opérations avec des outils externes: modifier des fichiers, envoyer des messages, lancer des tâches et changer l'état des flux de travail. Cela déplace également l'accent sur la sécurité : alors que le texte nuisible était la principale menace, il est maintenant des effets secondaires opérationnels nocifs. Les mesures traditionnelles au niveau rapide peuvent influencer le comportement du modèle, mais elles ne créent pas de limite d'exécution réelle : le modèle peut proposer une action, et elle sera exécutée directement, sans vérification supplémentaire.
C'est là que Aegis entre en jeu, offrant une approche fondamentalement différente de la gestion des agents. Au lieu de s'appuyer sur le « bon comportement » du modèle, Aegis traite les sorties du modèle comme des propositions qui passent par une couche de décision de confiance avant que l'outil ne soit invoqué.

Comment Aegis fonctionne: le modèle propose, l'environnement décide
Le principe clé d'Aegis peut être résumé brièvement : le modèle propose, l'environnement d'exécution de confiance décide. Il s'agit de la gouvernance de l'exécution — le contrôle au stade de l'exécution, pas au stade de la génération.
Trois niveaux de protection
Aegis évalue chaque proposition du modèle dans plusieurs dimensions:
- Respect des politiques actives: le système vérifie l'action proposée par rapport à l'état actuel de la politique pour filtrer les opérations interdites.
- Vérification de la provenance: le côté serveur de confiance confirme que l'action provient véritablement d'un processus autorisé et n'a pas été altérée le long du chemin.
- Échec du comportement fermé: si le système ne peut confirmer sans ambiguïté qu'une action est sûre, il refuse de l'exécuter, ce qui signifie que le principe par défaut est « tout ce qui n'est pas explicitement autorisé est interdit ».
Le mécanisme de résolution de type sénat mérite une attention particulière. Lorsqu'une proposition entre dans une catégorie contestée, une procédure d'autorisation fondée sur le quorum est déclenchée au lieu d'une décision unilatérale. Cela signifie qu'aucun élément du système ne peut prendre de décision seul — un consensus de la part de plusieurs participants est nécessaire. Cette approche exclut les décisions unilatérales et réduit le risque qu'une vulnérabilité ou une erreur unique entraîne une action dangereuse.
Évaluation expérimentale : ce que les tests ont montré
Pour vérifier l'efficacité d'Aegis, les auteurs ont réalisé une série d'expériences sur un corpus reproductible de bacs à sable. Les tests utilisaient cinq familles, 42 tâches, trois conditions et dix répétitions par famille. Le volume total de données était de 6 300 lignes.
Résultats en chiffres
- Dans l'approche axée sur les politiques rapides, 79 lignes avec fuite à risque ont été détectés le long de la trajectoire de comparaison.
- Sous la gouvernance d'Aegis (2 100 lignes), zéro application d'outils de simulation gouvernés et 0 achèvements régis avec des effets secondaires risqués ont été enregistrées.
- Toutes les 1 832 lignes exécuté sous la gouvernance d'Aegis a préservé une provenance fiable et approuvée par le système.
- Toutes les 1019 lignes Le quorum et les données définitives signées du compte de vote ont été déterminés par l'intermédiaire du « siège ».

Conclusions et limites
Les auteurs de l'étude soulignent une nuance importante: les résultats obtenus ne prouvent pas la sécurité générale des agents autonomes. Il s'agit d'une revendication systémique plus étroite — dans le corpus d'évaluation sandbox, qui régit les limites d'action au stade de l'exécution a empêché les propositions à risque observées de se transformer en effets secondaires régis réels.
Cela signifie qu'Aegis fonctionne comme un fusible de sécurité : il ne rend pas le modèle « sûr par nature », mais il crée une barrière fiable entre l'intention du modèle et l'action réelle. Cette approche semble prometteuse pour une utilisation pratique dans les systèmes où les agents travaillent avec des outils critiques, mais elle nécessite des recherches plus poussées sur des scénarios plus larges et plus diversifiés.



