EXPO-FT: дообучение робополитик без лишних данных — идеальные 30 из 30 на сложных манипуляциях

7 сентября 202619 просмотров

Новый метод показывает, как эффективно адаптировать предобученные модели «зрение-язык-действие» под конкретные задачи с помощью обучения с подкреплением. На сложных манипуляциях система достигает идеальных результатов в среднем за 19 минут реальных данных робота, а код уже открыт.

EXPO-FT: дообучение робополитик без лишних данных — идеальные 30 из 30 на сложных манипуляциях

Зачем дообучать робополитики?

Современные vision-language-action (VLA) модели неплохо обобщают увиденное на новые манипуляционные сценарии. Но их предобученных навыков почти всегда недостаточно для стабильной работы в реальном мире: одно и то же действие может не получиться при малейшем смещении объекта, изменении освещения или формы детали. Классические подходы здесь тоже не спасают: обучение с нуля игнорирует те полезные приоры, которые модель уже получила на большом наборе данных, а типичное дообучение требует слишком много проб и вычислений. Именно этот разрыв и закрывает новая разработка — система EXPO-FT, предлагающая стабильное и экономичное RL-дообучение готовых робополитик.

Как устроен подход

Ключевая идея авторов в том, чтобы не переучивать модель с нуля и не тратить ресурсы на бесполезные для приоритизированных задач вылазки. Вместо этого EXPO-FT донастраивает уже понимающую задачи VLA-модель так, что та быстро приспосабливается к новым требованиям. Такой подход позволяет сохранить общие знания о манипуляциях и параллельно оттачивать именно те действия, которые нужны для конкретного применения.

Дополнительно разработчики позаботились об устойчивости процесса обучения. Судя по описанию, система решает задачи, которые традиционно считаются сложными: здесь и точная прокладка гирлянды с последующей установкой вилки в розетку, и динамичный удар по бильярдному шару с попаданием в лузу, и аккуратная установка цветка в узкое горлышко винной бутылки. Во всех этих сценариях важны и точность позиционирования, и своевременная реакция на вариации начальной расстановки объектов.

Что проверяли и что получилось

Авторы протестировали метод на нескольких таких сценариях и остались довольны результатом. Разработка достигла идеального баланса: во всех оцененных задачах система успешно справлялась с заданием в 30 случаях из 30. При этом ей требовалось в среднем всего около 19 минут реальных взаимодействий робота с объектами. Понятно, что это не время одного эпизода, а суммарный объём онлайн-данных, которые понадобились для дообучения, и он оказывается заметно меньше, чем у традиционных схем. При сравнении с методами обучения с нуля и классическими вариантами RL-дообучения VLA-политик EXPO-FT показал себя лучше по успешности, а значит, и по практичности: меньше данных, больше зачётных выполнений.

Открытый код и дальнейшие шаги

Отдельно стоит отметить, что исследователи не стали оставлять систему закрытой. Проект EXPO-FT публикуется с открытым исходным кодом — это позволяет другим командам воспроизводить результаты, адаптировать метод под собственные робототехнические платформы и сравнивать его со своими подходами. На момент публикации у статьи анонсировано две версии: первая появилась в мае 2026 года, вторая — в середине августа того же года, и она, вероятно, уже учитывает обратную связь от сообщества. Похоже, EXPO-FT — не просто очередной лабораторный приём, а шаг к более практичному использованию больших предобученных моделей в реальной робототехнике, где критичны ограниченные вычислительные бюджеты и количество доступных физических испытаний.

Часто задаваемые вопросы

Похожие материалы

Все материалы
EXPO-FT: дообучение робополитик — обзор метода