现代AI智能体越来越多地以对话模式工作:用户提出任务,智能体调用工具,返回结果,然后用户澄清或修正请求。这种多步交互很难评估,因为最终只有一个最终结果。它无法显示智能体的哪些行为真正起到了帮助作用,哪些是多余的。
为什么仅凭结果不够
在强化学习中,这类智能体通常使用rollout:智能体执行一系列动作,然后根据最终结果获得奖励。这种方法很方便,但相当粗糙。一次成功的请求澄清、一个明显的错误以及随后的修正都会获得相同的信用分配,尽管它们对最终结果的贡献完全不同。因此,智能体学习速度较慢,并不总能理解究竟是哪个动作带来了成功。
新研究的作者们关注到一个常被忽视的宝贵信号来源——用户的下一条回复。当智能体完成一步操作后,用户会做出反应:澄清任务、表达不满、确认答案。这条回复不仅仅是后续步骤的上下文,更是对刚完成的交互片段的局部反馈。

FACA的工作原理
FACA(反馈感知信用分配)方法将用户的回复转化为完整的学习信号。其核心思想是将每个反应与智能体动作的特定片段进行匹配,然后计算该反应的局部优势——即相对于该上下文预期水平的优势程度。这一优势经过归一化后,被添加到标准的结果终局优势中。整个过程既不需要额外的评论器,也不需要新的rollout——所有计算都在已收集的数据上完成。
这种组合为智能体提供了对结果的粗略评估,同时也提供了更精确的中间信号。额外的好处是,该方法不会使推理过程复杂化:所有附加信号都从已有的对话中提取,因此很容易应用于实际系统。
实验结果
研究人员将FACA与仅考虑结果的Interactive GRPO方法进行了对比。训练在相同条件下进行:相同的模拟器、相同的可见对话、相同的初始化和优化。在τ家族的九个领域中,FACA将8B模型的平均结果提升了5.91个百分点,14B模型提升了10.22个百分点。每项指标均来自三个独立训练的运行。
最大的提升出现在Telecom领域。一项额外的用户回复极性随机化实验表明,对于8B模型,这一提升完全消失。这证实了:该信号携带有效信息,而不仅仅是增加噪声。在Pare-Bench和Co-Gym基准的zero-shot模式下,结果保持相同的量级。

结论
这项工作清楚地表明,用户的下一条回复不仅仅是上下文。它提供了廉价的局部信用信号,显著改善了多轮交互智能体的训练。FACA提供了一种简单有效的方法来提取这一信号,而无需大幅重构训练流程。最终,智能体能更好地理解哪些动作真正使其接近目标,哪些动作值得重新考虑。



