Aegis:AI代理的保险丝——模型建议通过可信决策层

25 八月 202617 视图

新的Aegis系统会拦截代理发出的工具调用请求,并在实际执行前通过外部审查机制进行过滤。在专门构建的场景语料实验中,该系统实现了零风险副作用,而常规的提示词限制无法提供这种保障。

Aegis:AI代理的保险丝——模型建议通过可信决策层

问题: 从文本到动作

现代代理AI系统可以做的不仅仅是生成响应——它们可以用外部工具进行操作:修改文件,发送消息,启动任务,以及改变工作流程状态. 这也转移了安全焦点:虽然有害的文字曾经是主要的威胁,现在却是有害的操作副作用. 传统的即时级措施可以影响模型行为,但不会产生真正的执行边界:模型可以提出一个动作,并且会直接执行,而无需额外的验证.

这里 艾吉斯语Name 提供了一种完全不同的代理管理方法。 Aegis不依靠模型的"良好行为",而是将模型输出视为在工具被引用前通过一个可信赖的决策层的建议.

Aegis如何运作:模型建议、环境决定

Aegis的关键原则可以简单总结: 模式建议,信任的执行环境决定这是运行时间治理——执行阶段的控制,而不是生成阶段。

三层保护

Aegis从几个方面评价模型中的每一项建议:

  • 遵守积极政策:系统对照当前政策状态检查拟议行动,以筛选出不允许的操作.
  • 证据核查:可信赖的服务器一方证实,动作真正起源于授权的流程,并没有沿途被篡改.
  • 关闭失败的行为:如果系统不能毫不含糊地确认一个行动是安全的,它拒绝执行它——意思是默认原则是"一切没有明文允许的都是被禁止的".

参议院式的决议机制值得特别关注。 当某项提案属于有争议的类别时,会触发基于法定人数的授权途径,而不是单方面的决定。 这意味着没有一个单一的系统组成部分能够自己作出决定——需要多个参与者的共识。 这种办法排除了单方面的决定,减少了单一的脆弱性或错误导致危险行动的风险。

实验评价:测试显示的是什么

为了验证Aegis的有效性,作者们对可复制的沙盒体进行了一系列实验. 测试使用5个经营家庭,42个任务,3个条件,每个家庭重复10次. 总数据量为6300条日志线.

数字结果

  • 在迅速的政策性方针中, 79条防渗漏线 沿比较路径检测。
  • 在Aegis治理下(2 100行), 所规范的模拟工具的零应用0 管理完成并具有风险副作用 被记录下来。
  • 所有1 832条线路 在Aegis治理下执行。
  • 所有1 019条线路 通过“议会”解决的,有法定人数和最后签字的计票数据。

结论和限制

研究作者强调一个重要的细微差别:获得的结果 未证明自主代理的一般安全这是一种范围较窄的系统性主张——在评价沙盒内,在执行阶段对行动界限进行规范,防止观察到的风险提案变成真正的受管制的副作用。

这意味着艾吉斯的工作就像安全引信:它并没有使模型"自然安全",而是在模型的意图和实际动作之间制造了可靠的屏障. 这种办法看来在代理人使用关键工具的系统中可以实际使用,但需要进一步研究更广泛和更多样化的情况。

常问问题

Aegis - AI代理安全系统审查