世界模型不崩溃:用对比逆动态替代高斯假设

4 九月 202613 视图

AC-MTM新方法通过潜在状态转移来训练JEPA模型,为表征坍缩提供了稳健的对抗信号,并在复杂的OGBench测试中显著提升了性能。

世界模型不崩溃:用对比逆动态替代高斯假设

在最新的arXiv预印本2608.17542中(提交于2026年8月18日),Jack Boylan和Chris Hokamp提出了一种对抗JEPA世界模型坍缩的非传统方法。他们不是将预先设定的形状强加给潜在空间,而是从数据转换本身提取对抗退化的信号。该方法被命名为AC-MTM——动作对比掩码转换建模——从实验结果来看,它在复杂视觉环境中表现尤为出色。

为什么JEPA模型会坍缩

JEPA(联合嵌入预测架构)方法围绕预测未来嵌入而非像素展开。这很方便,但这样的目标函数存在一个平凡解:编码器可能固定为常数,对任何输入都输出相同的表示。此时预测误差归零,世界关系的学习完全不会发生。这正是所有实际JEPA实现都要添加额外防坍缩机制的原因——从正则化器到架构约束,不一而足。

一种常见做法是对潜在分布进行正则化。例如,LeWorldModel(LeWM)模型使用SIGReg——一种强制表示呈现各向同性高斯噪声形态的正则化器。这能稳定训练,但代价是强假设:潜在空间必须符合某个与环境动态无关的特定分布。新论文的作者认为,对抗坍缩的压力可以不是来自外部,而是来自状态之间的转换本身。

对比反向动态取代高斯束缚

AC-MTM保留了与LeWM相同的潜在预测直接目标,但增加了一个辅助反向动态头。该头仅在训练期间存在,解决一个判别任务:给定一对潜在状态,它必须确定是哪个动作将模型从第一个状态转换到第二个状态。Action-NCE损失函数迫使每个潜在转换在批次中所有动作中识别出产生它的那个动作。

这种设定既不需要目标网络,也不需要stop-gradient、预训练编码器或重建。关键在于:坍缩的编码器对所有状态输出相同表示,物理上无法区分不同动作。因此,反向动态任务变得不可解,这提供了可证明的防退化信号。压力来自数据结构本身,而非人为规定。

训练完成后,反向动态分支被直接丢弃。在测试时,编码、直接预测、规划和计算成本与LeWM完全一致——推理阶段没有任何额外负担。

实验显示了什么

该方法在四个标准pixel-control任务上使用一致的规划协议进行了验证。AC-MTM能够稳定地从零开始训练,平均表现与SIGReg相当。也就是说,放弃高斯正则化器不会在简单环境中造成质量损失。

更令人感兴趣的是在复杂基准OGBench Visual Scene上的表现。AC-MTM达到80.0±2.0%的成功率,而SIGReg仅为58.0±2.0%。在每个训练种子上的提升为20–24个百分点。为了理解这个量级:随机策略运行50个回合的基线水平为52%,因此方法之间的差异确实显著。

同时,对比反向动态不依赖分布假设。作者描述了该方法有效所需的动作空间和可观测性假设,但这些条件明显比高斯性要求宽松得多。

实际意义

该工作的核心结论是:要避免坍缩,不需要预先决定表示应该是什么样子。只需设置一个退化编码器必然失败的任务即可。这种方法不仅更符合原理,而且在复杂视觉任务上表现更优——在这些任务中,SIGReg的高斯约束反而阻碍了学习。

代码已公开,结果易于复现并适配到自己的项目中。对于所有基于JEPA思想构建世界模型的人来说,AC-MTM是一个实用的选择:没有额外推理开销,不需要目标网络和stop-gradient,并且拥有更自然的学习信号来源。

常问问题

世界模型不崩溃:用对比逆动态替代高斯假设