“先想后看”的问题:为什么机器人需要单一模型
经典的机器人控制方法看起来像一条流水线:系统先规划一系列动作,然后一个独立的视觉模块试图将计划与摄像头实际看到的内容进行匹配。在实践中,这种组合经常出现问题:预测与实际图像不一致,错误不断累积,在长距离任务中机器人会“失去线索”,开始混乱地行动。
工程师们一直在寻找一种方法,将预见和控制统一到单一架构中,使模型不仅能输出指令,还能并行地“想象”这些指令的后果。其中一个解决方案就是带有记忆的统一世界模型——UniWM。它不是由零散模块拼凑而成,而是一个统一的多模态自回归系统,明确地将动作与视觉预测结果联系起来。

UniWM是如何工作的:想象成为控制的一部分
关键思想是让视觉预见不再是辅助步骤,而是决策过程中不可分割的一部分。模型接收来自第一人称视角相机(egocentric camera)的当前帧和动作历史作为输入,然后通过自回归方式不仅生成下一步动作,还生成与之对应的未来视觉图像。这样就形成了一个闭环:动作计划在机器人开始移动之前就已在“头脑中”得到验证。
这样一来,预测与实际控制之间的偏差就被消除了。当模型选择动作时,它已经知道执行该动作后眼前画面将如何变化。这在导航中尤为重要,因为每个指令都会影响后续的观测——例如在转弯或绕过障碍物时。
UniWM使用一个统一的骨干网络(backbone)来处理异构数据:图像、文本、运动指令。这简化了训练过程,并允许模型在不同类型的任务之间迁移知识,而无需重新构建架构。
记忆:为什么机器人不会忘记自己要去哪里
长时间导航的主要问题之一是保持上下文。如果模型只看到当前帧,在一系列机动操作后很容易失去方向感。UniWM通过分层记忆机制解决了这个问题。它结合了两个层级:
- 短期记忆——保留最新的感知信号,例如最近的帧和近期的动作;
- 长期记忆——保存轨迹的整体上下文,帮助模型理解机器人相对于起点的位置以及哪些区域已经走过。
这种结构使得在长时间规划范围内保持连贯推理成为可能。模型不仅仅对当下的图像做出反应——它会考虑整个路径,这对于大空间和复杂场景至关重要。

数据与实际验证
开发人员在四个导航基准测试上测试了该模型——Go Stanford、ReCon、SCAND和HuRoN,以及包含人形机器人数据的1X Humanoid Dataset数据集。结果显示,与强基线相比取得了显著进展。
- 导航成功率提升至30%——即机器人到达目标的频率显著提高。
- 轨迹误差大幅降低:模型更准确地遵循预定路线,偏离更少,不会进行多余的操作。
- **零样本泛化(Zero-shot generalization)**在之前未见过的TartanDrive数据集上得到验证——模型无需额外训练即可将学到的模式应用于新数据。
- 可扩展性在高维人形机器人导航中得到验证,由于复杂的运动学,这类任务需要动作与视觉反馈之间特别精确的协调。
这些结果表明,统一模型能够取代过去被认为在复杂机器人技术中必不可少的多阶段流水线。而且,这些改进并非通过针对特定基准进行调优实现,而是通过系统性地协调预测与控制实现的。

这对机器人技术意味着什么
放弃分离的规划与视觉模块不仅仅是技术上的简化。这是一种范式转变:机器人不再“拼接”不同模型的结果,而是获得对世界的整体理解,其中动作与其视觉后果密不可分。这种方法使系统更加可靠,行为更加可预测。
该工作已被ECCV 2026接收,共22页,包含12幅图——这是一项完整的研究,详细描述了架构和实验。我们只需等待这类解决方案成为自主机器和无人机的标准,因为在那些领域,即使是精度上的微小提升也可能具有决定性意义。



