EXPO-FT:无需额外数据即可微调机器人策略——在复杂操作中完美达成30/30

7 九月 202619 视图

新方法展示了如何通过强化学习,高效地将预训练的“视觉-语言-动作”模型适配到具体任务中。在复杂操作中,系统平均仅需19分钟真实机器人数据即可达到理想效果,且代码已开源。

EXPO-FT:无需额外数据即可微调机器人策略——在复杂操作中完美达成30/30

为什么要微调机器人策略?

现代视觉-语言-动作(VLA)模型能够很好地将所见内容泛化到新的操作场景中。但它们预训练的技能几乎总是不足以在现实世界中稳定工作:同一动作可能因物体轻微位移、光照变化或零件形状改变而失败。经典方法在这里也无济于事:从零开始训练忽略了模型已在大规模数据集上获得的有用先验知识,而典型的微调则需要过多的尝试和计算。正是这一差距被新开发成果——EXPO-FT系统所填补,它为现成的机器人策略提供了稳定且经济的强化学习微调方案。

方法原理

作者的核心思想是不从零开始重新训练模型,也不将资源浪费在对优先任务无用的探索上。相反,EXPO-FT对已理解任务的VLA模型进行微调,使其能快速适应新要求。这种方法既能保留关于操作的一般知识,又能同时精炼特定应用所需的动作。

此外,开发人员还关注了训练过程的稳定性。从描述来看,该系统解决了传统上被认为困难的任务:包括精确铺设灯带并随后将插头插入插座、动态击打台球使其入袋,以及将花朵小心放入酒瓶的窄口中。在所有上述场景中,定位精度和对初始物体布局变化的及时响应都至关重要。

测试内容与结果

作者在多个此类场景中测试了该方法,并对结果感到满意。该开发成果达到了理想的平衡:在所有评估任务中,系统在30次尝试中均成功完成30次。同时,它平均仅需约19分钟的真实机器人-物体交互时间。显然,这不是单次试验的时间,而是微调所需的在线数据总量,且明显少于传统方案。在与从零开始训练的方法以及经典VLA策略强化学习微调方案的对比中,EXPO-FT在成功率上表现更优,因而也更具实用性:数据更少,达标完成次数更多。

开源代码与后续步骤

特别值得一提的是,研究人员并未将系统封闭起来。EXPO-FT项目以开源代码形式发布——这使得其他团队能够复现结果、将该方法适配到自己的机器人平台,并与其自身方法进行比较。截至发布时,论文已公布两个版本:第一版于2026年5月发布,第二版于同年8月中旬发布,后者可能已纳入社区反馈。看来,EXPO-FT不仅是又一个实验室技巧,更是朝着在真实机器人技术中更实用地利用大型预训练模型迈出的一步——在这些场景中,有限的计算预算和可用的物理试验次数至关重要。

常问问题

EXPO-FT:无需额外数据即可微调机器人策略——在复杂操作中完美达成30/30