UniWM: одна модель вместо связки «план + зрение» — роботы учатся предвидеть и действовать

5 сентября 202617 просмотров

Новая архитектура объединяет визуальное предсказание и выбор действий в едином мультимодальном бэкбоне с иерархической памятью. На четырех навигационных бенчмарках она повышает успешность до 30% и показывает zero-shot перенос на неизвестные данные, включая управление человекоподобным роботом.

UniWM: одна модель вместо связки «план + зрение» — роботы учатся предвидеть и действовать

Проблема «сначала подумай, потом посмотри»: почему роботам нужна одна модель

Классический подход к управлению роботом выглядит как конвейер: сначала система планирует последовательность действий, затем отдельный модуль зрения пытается сопоставить план с тем, что реально видит камера. На практике такая связка часто даёт сбои: предсказания не совпадают с фактическим изображением, ошибки накапливаются, а на длинных дистанциях робот «теряет нить» и начинает действовать хаотично.

Инженеры давно искали способ объединить предвидение и управление в одной архитектуре, чтобы модель не просто выдавала команды, а параллельно «воображала» их последствия. Одним из таких решений стала унифицированная модель мира с памятью — UniWM. Она построена не как связка разрозненных модулей, а как единая мультимодальная авторегрессионная система, которая явно связывает действия с визуально предсказанными результатами.

Как устроена UniWM: воображение становится частью управления

Ключевая идея — сделать визуальное предвидение не вспомогательным шагом, а составной частью принятия решений. Модель получает на вход текущий кадр с эгоцентрической камеры и историю действий, затем авторегрессионно генерирует не только следующий шаг, но и соответствующий ему будущий визуальный образ. Получается замкнутый цикл: план действий проверяется «в голове» робота ещё до того, как он начнёт двигаться.

Благодаря этому рассогласование между прогнозом и реальным управлением устраняется. Когда модель выбирает действие, она уже знает, как изменится картинка перед глазами после этого действия. Это особенно важно в навигации, где каждая команда влияет на последующие наблюдения — например, при повороте или объезде препятствия.

UniWM использует один бэкбон для работы с разнородными данными: изображениями, текстом, командами движения. Это упрощает обучение и позволяет модели переносить знания между разными типами задач без перестройки архитектуры.

Память: почему робот не забывает, куда шёл

Одна из главных проблем длительной навигации — удержание контекста. Если модель видит только текущий кадр, она легко теряет ориентацию после серии манёвров. В UniWM эту проблему решает иерархический механизм памяти. Он объединяет два уровня:

  • краткосрочная память — удерживает свежие перцептивные сигналы, такие как последние кадры и недавние действия;
  • долгосрочная память — сохраняет общий контекст траектории, что помогает модели понимать, где робот находится относительно начальной точки и какие участки уже пройдены.

Такая структура позволяет сохранять связные рассуждения на длинных горизонтах планирования. Модель не просто реагирует на сиюсекундное изображение — она учитывает весь путь, что критично для больших пространств и сложных сценариев.

Цифры и проверка на практике

Разработчики протестировали модель на четырёх навигационных бенчмарках — Go Stanford, ReCon, SCAND и HuRoN, а также на датасете 1X Humanoid Dataset, который содержит данные человекоподобного робота. Результаты говорят о значительном прогрессе по сравнению с сильными базовыми линиями.

  • Успешность навигации выросла до 30% — то есть робот стал заметно чаще достигать цели.
  • Ошибки траектории существенно снизились: модель точнее следует намеченному маршруту, меньше отклоняется и не делает лишних манёвров.
  • Zero-shot обобщение подтвердилось на неизвестном ранее датасете TartanDrive — модель смогла применить наученные паттерны на новых данных без дополнительного обучения.
  • Масштабируемость проверена на высокоразмерной навигации человекоподобного робота, где из-за сложной кинематики требуется особенно точное согласование действий и визуальной обратной связи.

Эти результаты показывают, что единая модель способна заменить многоступенчатые пайплайны, которые раньше считались обязательными для сложной робототехники. Причём улучшения достигаются не за счёт подгонки под конкретный бенчмарк, а за счёт системного согласования предсказания и управления.

Что это значит для робототехники

Отказ от раздельного планирования и зрения — это не просто техническое упрощение. Это смена парадигмы: вместо того чтобы «склеивать» результаты разных моделей, робот получает целостное представление о мире, где действие и его визуальное последствие неразделимы. Такой подход делает систему более надёжной, а поведение — более предсказуемым.

Работа принята к ECCV 2026 и занимает 22 страницы с 12 рисунками — это полноценное исследование с детальным описанием архитектуры и экспериментов. Остаётся ждать, когда подобные решения станут стандартом для автономных машин и дронов, где даже небольшое улучшение точности может иметь решающее значение.

Часто задаваемые вопросы

Похожие материалы

Все материалы
UniWM — обзор нейросети для навигации роботов