现代AI智能体能够执行长序列的操作:调用函数、处理服务响应、做出中间决策。观察者很难跟踪每一个步骤,因此通常使用自动监控器来确保安全。但如果单个步骤看起来完美无缺,而整个链条却逐渐偏离用户的要求,该怎么办?
为什么局部检查无济于事
长期运行的智能体可能在每一步都调用正确的工具、给出看似合理的参数,但仍然在不知不觉中发生偏移:它不再解决原始任务,而是开始解决更宽泛或相邻的问题,“引入”用户并未提供的证据。这种偏差的累积被称为轨迹漂移。现有的检查系统通常要么关注单个动作的局部一致性,要么对整个轨迹给出总体判断,要么评估综合风险。问题在于,它们并没有专门分析中间前缀——即随着任务执行,轨迹与任务之间关系的发展变化。
arXiv上最近的一篇论文(2608.17718)描述了一种试图填补这一空白的方法。作者提出了“本体论信任”的概念:这不是整条路径的属性,而是轨迹每个前缀的属性,而且是相对于原始任务来定义的属性。

信任的三个组成部分
为了及时发现偏差,需要将信任分解为各个组成部分。RGE监控器正是这样做的——其名称来源于Role、Goal、Evidence(角色、目标、证据)。形式上,对轨迹前缀的信任从三个维度进行评估:
- 角色 —— 智能体是否保持在用户授予的权限范围内,还是逐渐“赋予”自己更宽泛的角色。
- 目标 —— 当前的前进方向在多大程度上符合被授权的目标,而不是被替换为相似但相邻的目标。
- 证据 —— 智能体是依据观察中实际存在的数据,还是依据隐含假设和未经请求的信息。
这种三重检查可以区分,例如,一个不再执行任务的智能体与一个仅仅在改变执行任务的合法方式的智能体。
检查是如何运作的
一个重要细节:RGE并不是一个用单一端到端模型评估轨迹的“黑箱”。这里使用语言模型仅仅是为了获得任务和各个步骤的结构化表示。信任状态的更新、向三个组成部分的投影以及是否干预的决策都是确定性的。因此,输出的是一个可复现的信任轨迹:可以准确地说出在哪个时刻、由于哪个具体组成部分产生了怀疑。这是一个重要的工程决策,因为它降低了对大模型不确定性的依赖,并简化了审计。

效果如何
为了验证该方法,作者基于三个不同的环境构建了一个轨迹语料库:OSWorld、FinanceBench和EICU-AC。语料库中包含良性(正常)执行、带有配对前缀的漂移示例,以及所谓的“伪一致”故障——即动作看起来合乎逻辑但实际上有误的情况。
基于这些数据,RGE在前缀漂移检测方面超越了基于规则的自适应基线、judge模型和防护盾。使用两个更大的评估模型时,它在每个基准上都达到了超过93%的Drift F1分数,同时良性案例的覆盖率保持在95.8%以上。换句话说,它很少漏掉真正的漂移,同时也不会用误报淹没正常操作。
不过,研究人员也诚实地指出了局限性。“伪一致”故障仍然是一个难题:它们的检测在很大程度上取决于任务执行结果是否在外部可见。如果外部世界没有明确的成功或失败确认,监控器并不总能区分精心伪装的偏差与普通的不确定性。这不是缺陷——而是任何无法访问世界完整语义的方法所面临的结构性边界。
结论
这项工作的主要启示是:不仅要关注单个步骤,还要关注整个轨迹的形态。一个实用的方法可以是:对每个前缀问自己,智能体的角色是否发生了变化、目标是否被替换、是否存在“外来”证据。正是这三个问题构成了对长期智能体进行更透明、更可验证监督的基础。而且,也许在未来,“本体论信任”会像今天的准确率或延迟一样,成为AI智能体的一种日常指标。



