Modèles du monde sans effondrement : dynamique inverse contrastive au lieu d'hypothèses gaussiennes

4 septembre 202613 vues

Nouvelle approche AC-MTM qui entraîne les modèles JEPA en définissant l'action par la transition latente ; cela fournit un signal robuste contre l'effondrement des représentations et améliore nettement les résultats sur le test complexe OGBench.

Modèles du monde sans effondrement : dynamique inverse contrastive au lieu d'hypothèses gaussiennes

В свежем препринте arXiv:2608.17542, поданном 18 августа 2026 года, Jack Boylan и Chris Hokamp предлагают неочевидный способ борьбы с коллапсом в JEPA-мировых моделях. Вместо того чтобы навязывать латентному пространству заранее заданную форму, они извлекают сигнал против вырождения из самих данных переходов. Метод получил название AC-MTM — Action-Contrastive Masked Transition Modeling — и, судя по экспериментам, особенно убедительно работает на сложных визуальных средах.

Почему JEPA-модели схлопываются

Подход JEPA (Joint Embedding Predictive Architecture) строится вокруг предсказания будущих эмбеддингов, а не пикселей. Это удобно, но у такой целевой функции есть тривиальное решение: энкодер может зафиксироваться на константе и выдавать одинаковое представление для любого входа. Тогда ошибка предсказания обращается в ноль, и никакого обучения мировых отношений не происходит. Именно поэтому все практические реализации JEPA добавляют дополнительные механизмы против коллапса — от регуляризаторов до архитектурных ограничений.

Один из распространённых приёмов — регуляризация латентного распределения. Например, модель LeWorldModel (LeWM) использует SIGReg — регуляризатор, который заставляет представления выглядеть как изотропный гауссов шум. Это стабилизирует обучение, но ценой жёсткого допущения: латентное пространство должно соответствовать определённому распределению, не связанному с динамикой среды. Авторы новой работы утверждают, что давление, мешающее коллапсу, может приходить не извне, а из самих переходов между состояниями.

Контрастная обратная динамика вместо гауссовых оков

AC-MTM сохраняет прямую цель латентного предсказания, как в LeWM, но добавляет к ней вспомогательную головку обратной динамики. Эта головка существует только во время обучения и решает дискриминативную задачу: по паре латентных состояний она должна определить, какое именно действие перевело модель из первого во второе. Функция потерь Action-NCE заставляет каждый латентный переход идентифицировать породившее его действие среди всех действий в батче.

Такая постановка не требует ни целевой сети, ни stop-gradient, ни предобученного энкодера, ни реконструкции. Главное — коллапсировавший энкодер, который выдаёт одинаковые представления для всех состояний, физически не способен отличить одно действие от другого. Значит, задача обратной динамики становится неразрешимой, и это даёт доказуемый сигнал против вырождения. Давление возникает из структуры данных, а не из искусственного предписания.

После завершения обучения ветвь обратной динамики просто отбрасывается. В тестовое время кодирование, прямое предсказание, планирование и вычислительные затраты остаются идентичными LeWM — никакой дополнительной нагрузки на инференс.

Что показали эксперименты

Метод проверили на четырёх стандартных задачах pixel-control с согласованным протоколом планирования. AC-MTM стабильно обучается с нуля и в среднем показывает результаты, сравнимые с SIGReg. То есть отказ от гауссова регуляризатора не приводит к потере качества на простых средах.

Более интересная картина на сложном бенчмарке OGBench Visual Scene. Там AC-MTM достигает 80,0±2,0% успеха, тогда как SIGReg — лишь 58,0±2,0%. Улучшение составляет 20–24 процентных пункта на каждом обучающем сиде. Для понимания масштаба: один прогон случайной политики из 50 эпизодов даёт базовый уровень 52%, так что разница между методами действительно значимая.

При этом контрастивная обратная динамика не опирается на распределённые допущения. Авторы характеризуют предположения о пространстве действий и наблюдаемости, при которых метод работает, но эти условия заметно мягче требования гауссовости.

Практические следствия

Главный вывод работы: чтобы избежать коллапса, не нужно заранее решать, как должны выглядеть представления. Достаточно поставить задачу, которую выродившийся энкодер гарантированно провалит. Такой подход оказывается не только более принципиальным, но и даёт лучшие результаты на сложных визуальных задачах, где гауссовы ограничения SIGReg мешают обучению.

Код опубликован, так что результаты легко воспроизвести и адаптировать под свои проекты. Для всех, кто строит мировые модели на идеях JEPA, AC-MTM — это практичный вариант: без дополнительных расходов на инференс, без целевых сетей и stop-gradient, и с более естественным источником обучающего сигнала.

Foire aux questions

Matériaux connexes

Tous matériaux
Modèles du monde sans effondrement : dynamique inverse contrastive au lieu d'hypothèses gaussiennes