Agent Lightning v1.0:如何驾驭智能体强化学习并将成绩提升14分

28 八月 20267 视图

新的轻量级框架将智能体与环境交互的轮廓转换为独立外壳,允许通过LLM端点代理训练任意智能体架构。在SWE-bench Verified测试中,仅用6000个示例进行微调,便将Qwen3.5-9B的准确率从41.8%提升至56.4%。

Agent Lightning v1.0:如何驾驭智能体强化学习并将成绩提升14分

什么是 Agent Lightning v1.0,为什么大家都在讨论它

现代 AI 智能体很少单独工作:围绕它们构建的是 agent harness——一个管理工具、上下文和执行流程的中间层。这个“框架”的设计方式直接决定了模型处理任务的效率。然而,长期以来它一直处于训练循环之外:RL 训练器只看到模型的回答,并不涉及智能体如何与环境交互。

Agent Lightning v1.0 项目提出了另一种方法——harnessed agentic RL(受控智能体强化学习)。其核心思想是,在部署阶段使用的 harness 直接参与模型的后训练。这使得智能体可以在与生产环境相同的条件下进行微调,并显著简化了将任意智能体接入 RL 流水线的过程。

harnessed agentic RL 是如何运作的

在传统的智能体 RL 中,“模型 → 动作 → 观察 → 新动作”的循环属于训练引擎。而在受控方案中,整个循环由 harness 接管,训练器只观察 LLM 请求-响应对的序列。这种解耦带来了灵活性:可以使用任何智能体框架,只需通过端点代理接入即可。

这种架构并不新鲜:Agent Lightning 的第一版就引入了分离式(disaggregated)方案,后来其他框架也采用了这一思路——例如 verl Uni-Agent、AReaL 2.0、slime 和 Polar。然而,这种方法也有其自身的陷阱。

关键问题

作者指出了在实际实现中出现的几个难点:

  • Retokenization——序列的重复分词可能会扭曲训练数据。
  • Sample merging——合并来自不同来源的样本需要谨慎处理。
  • Advantage calculation——在非标准数据组织方式下,优势(advantage)的计算会变得更加复杂。
  • Loss normalization——损失归一化需要考虑 harness 的特性。
  • Backend scheduling——后端计算调度会影响训练的稳定性。

这些看似技术性的细节可能会对最终结果产生重大影响。为了研究这些问题,Agent Lightning v1.0 应运而生——一个约 3,500 行代码的轻量级框架。

结果:SWE-bench Verified 上提升 +14.6 个百分点

开发者在三类智能体上验证了该方法:指令遵循、信息检索和代码编写。对于 coding 智能体,他们发布了完全可复现的流水线。

实验情况如下:总共 6,000 个训练样本和适度的计算资源。Qwen3.5-9B 模型经过 RL 微调后,在 SWE-bench Verified 上的成绩从训练前的 41.8% 提升至 56.4%。绝对提升为 14.6 个百分点。对于如此小的数据量和轻量级框架来说,这是一个非常亮眼的成绩。

此外,作者公开了完整的工作流程和训练脚本,任何人都可以复现实验,或将 Agent Lightning v1.0 作为自己研究的试验台。

这对行业意味着什么

harnessed agentic RL 的出现将重点从“给模型灌数据”转向模型与其环境的协同工作。如果说过去 harness 被视为辅助组件,那么现在它已成为可训练循环的一部分。对从业者而言,这意味着智能体在真实场景中的行为更加可预测;对研究者而言,则带来了一系列新的开放问题:从分词优化到计算调度。

Agent Lightning v1.0 并不是这一领域的唯一项目,但它的开放性和简洁性使其成为实验的理想起点。很可能在不久的将来,我们会看到新的框架将这些想法推向工业应用。

常问问题

Agent Lightning v1.0:如何驾驭智能体强化学习并将成绩提升14分