LoopVLA:如何在机器人控制中训练模型在表征细化时及时停止

5 九月 202618 视图

LoopVLA的新架构不再总是使用视觉-语言骨干网络的最深层,而是通过共享Transformer块迭代细化表示,并在每一步判断信息是否足以执行动作。借助自监督分布对齐,该模型将参数数量减少45%,推理速度提升至1.7倍,同时在成功率上不逊于基线方法。

LoopVLA:如何在机器人控制中训练模型在表征细化时及时停止

为什么深度并不总能帮助机器人

在现代“视觉-语言-动作”(VLA)模型中,有一个约定俗成的规则:视觉-语言骨干网络的层越深,表征就越抽象,并且被认为对控制越有用。然而,机器人操作并不是一次大的推理,而是一系列频繁的闭环空间修正。对于这些任务来说,过度的抽象往往显得多余:它需要更多的计算量,并且会抹掉低层级的几何细节,而没有这些细节,精确控制就无从谈起。

想象一下机器人伸手去拿一个杯子。在每一帧中,它都需要对轨迹做出小幅修正,而这些修正取决于物体的精确位置。如果模型对输入数据的抽象过深,它可能就会“看不到”需要的角度或偏移量。而如果每次都从头重新计算——就没有足够的时间来进行实际控制。

现有在这类网络中节省资源的方法,包括在预先选定的层提前退出,或者使用诸如检查相邻步骤动作一致性之类的启发式方法。但它们并没有回答关键问题:当前的表征是否足以在当下做出正确的动作?通常,这个决定是基于外部规则做出的,而不是基于数据本身的内容。

因此,作者团队提出了LoopVLA架构,试图将“可以停止的时刻”形式化,并将其直接嵌入到训练过程中。

带充分性评估的循环精化

LoopVLA的思路是,用循环结构取代固定的层链。同一个Transformer块对多模态token应用多次,逐步精化表征。在每次迭代中,模型会输出两个结果:一个候选动作和一个充分性分数——一个预测是否应继续精化的数值。

这类似于模型与自身的内在对话:在第一次前向传播时,它行动迅速,但可能不够精确;在第二次时,它更加自信,但仍可能有所犹豫。充分性分数正是这种自信程度的指标。

所有迭代共享参数——这是与经典深度网络的根本区别。模型不再绑定到绝对的层号:更重要的是表征本身发生了什么变化。这使得模型可以根据演化中的状态向量的变化动态,在不同示例的不同点停止。每次迭代模型都使用同一组参数,因此训练是稳定的,并且不需要单独调整步数。在推理阶段,循环对不同示例可以执行不同的次数,这实际上使模型在复杂度上具有自适应性。

如何让模型理解充分性

并不存在“这里可以停止”的直接标注。因此,作者采用了自监督的方法——他们将置信度评分的分布与相邻迭代中动作的相对质量对齐。简单来说,中间层的充分性分数开始与当前动作相比前一次迭代的动作是好是坏相对应。这样,充分性信号就来自策略本身,而不是外部标注。

最终,“表征精化 → 动作预测 → 充分性评估”这个组合被训练成一个统一的系统,其中停止决策直接与控制目标函数相关联。可以将其理解为一种置信度蒸馏:模型将“动作何时足够好”的知识从较晚的迭代转移到较早的迭代。这使它能够在早期阶段就判断是否需要进一步的工作。

这在实践中带来了什么

在三个基准测试——LIBERO、LIBERO-Plus和VLA-Arena——上的实验中,该模型证明了智能停止确实有效。与强基线VLA策略相比,LoopVLA将参数数量减少了45%,并将推理吞吐量提升了高达1.7倍。同时,任务成功率没有下降,在某些情况下甚至有所提升。

如果将其转化为应用机器人学的语言,这是一个双重优势:

  • 降低计算负载:每个控制步骤的操作更少,这对机载系统尤为重要。
  • 保持精度:模型在几何细节至关重要的地方不会丢失它们,在粗略抽象就足够的地方也不会浪费资源。

这些结果对于计算资源受限的真实系统尤其重要,例如移动机器人或工业机械臂。动态停止的能力使得更有效地利用能量并更快地响应环境变化成为可能。有趣的是,参数的节省并非通过简化架构实现,而是通过更合理地利用现有组件。一个具有共享权重的循环块不是一个更小的模型,而是一个知道何时及时停止的模型。

总结

LoopVLA是一个例子,展示了摒弃“越深越好”的教条,转而采用自适应计算控制,如何能够同时提升性能和效率。模型学会了及时停止,这被证明比无条件加深网络更有效。这种方法为更实用的VLA系统铺平了道路,这些系统面向真实机器人,在那些环境中每一毫秒和每一瓦特都至关重要。

常问问题

LoopVLA:如何在机器人控制中训练模型在表征细化时及时停止