从理想演示到真实网站
基于AI的浏览器助手能够自信地处理简短且清晰的场景:查找商品、下单、填写表单。但一旦这样的代理出现在真实网站上——加载缓慢、意外弹出的窗口、不断变化的布局以及数十次中间点击——情况就完全不同了。在现实中,AI必须在长链条操作中保持目标,发现并纠正自身错误,同时应对信息过载的界面。
实践中“长场景”意味着什么?这不是一次点击,甚至不是十次:代理可能需要执行30到40步甚至更多,才能达到预期结果。每一步都依赖于前一步,一个错误就可能让所有努力付诸东流。此外,真实网页不断变化:布局“漂移”,新元素出现,数据异步加载。在静态演示上训练的模型在如此条件下会迷失方向。
问题在于,大多数现有方法都是在简化演示上训练的,并未针对如此复杂程度设计。简单地扩展模型规模在这里无济于事:实验室条件与真实网络之间的鸿沟要求重新审视整个流水线——从动作执行到最终评估。

面向长时域的统一框架
AIMAE团队正是将这一任务作为目标,推出了Wuying-Browser-Agent——一个覆盖浏览器代理所有工作层面的开源框架。作者没有只关注单一环节,而是将执行、控制、优化和评估对齐统一。
让我们逐一详细分析每个层面。执行——代理如何与页面交互:点击、输入文本、切换标签页。控制——观察动作并在出现问题时及时干预。优化——训练过程,使模型向成功轨迹调整。最后是评估——衡量代理在真实网络中完成任务表现的方法。所有这些层面必须协同工作,否则系统在长距离任务中就会崩溃。
三个关键组件保障系统运行:
- 结构化浏览器工具集——一组稳定的动作执行原语。它为代理提供可预测的环境,并帮助以决策为导向管理上下文。代理不再依赖不可靠的选择器或随机时序,而是获得清晰、统一执行的指令。
- RUIC-SFT——一种基于错误恢复轨迹和复杂界面元素交互的监督微调方法。模型不仅从成功链条中学习,还学习如何走出困境。
- DAO-GRPO——一种优化算法,通过潜在奖励塑形和基于散度的步骤加权,改善长时域中的“信用”分配。每个动作都根据其对整体结果的贡献进行评估,而非孤立看待。
这种方法使模型不仅能执行完美步骤,还能应对真实干扰,并理解哪些动作真正推动其向目标前进。该框架已经表明,对齐流水线比单纯增加模型规模带来更大收益。

BrowserBench:真实长度的测试
如何验证代理真正准备好应对真实网络?现有基准往往过短,无法暴露长距离任务中的典型失败。典型测试可能只有5到10步,而现实中代理需要工作更长时间。因此团队创建了自己的基准——BrowserBench。这是一个包含350个来自真实网站任务的双语数据集,平均场景长度接近38步。
这样的长度是本质区别。在短任务中,代理几乎可以随机行动仍获得高分。而在长任务中,每个错误都会累积,没有正确的“信用”分配,系统很快就会偏离方向。BrowserBench能够揭示这些失败,帮助理解哪些机制需要改进。
结果不言自明。拥有270亿参数的Wuying-Browser-Agent在WebVoyager上达到80.6%,在Online-Mind2Web上达到66.7%,在BrowserBench上达到65.1%——这是浏览器使用基准上的新开源纪录。同一流水线也成功迁移到其他领域:在Tau2-Bench、Claw-Eval和BFCL-v4数据集上平均得分73.8。
值得注意的是,成功并非来自某一特定任务,而是多个独立测试同时取得。这意味着该框架掌握了与网页界面交互的通用原则,而非针对特定基准进行调优。良好的泛化能力表明代理真正理解自己在做什么,而不仅仅是死记硬背模式。

这对AI代理发展意味着什么
主要结论不在于具体数字,尽管它们令人印象深刻。更重要的是方法:要让代理在真实世界中工作,就必须停止追逐干净演示上的单项纪录,转而围绕长而复杂的场景构建整个系统。Wuying-Browser-Agent表明这是可以实现的,而且是以开源形式——研究人员可以复现其结果并继续推进。
这种方法也具有实际价值。想象一下,你需要在十几个网站上比较条件、预订机票或填写冗长表单。目前这些只能手动完成,因为没有助手能保持如此长时间的上下文。借助类似Wuying-Browser-Agent的框架,这类任务在不久的将来就可能实现自动化。
浏览器代理正从实验室实验转变为实用工具。我们只需等待这些系统进入普通浏览器,接管日常事务——从购物到填写文档。而从这个框架来看,等待的时间不会太长。



