Зачем дообучать робополитики?
Современные vision-language-action (VLA) модели неплохо обобщают увиденное на новые манипуляционные сценарии. Но их предобученных навыков почти всегда недостаточно для стабильной работы в реальном мире: одно и то же действие может не получиться при малейшем смещении объекта, изменении освещения или формы детали. Классические подходы здесь тоже не спасают: обучение с нуля игнорирует те полезные приоры, которые модель уже получила на большом наборе данных, а типичное дообучение требует слишком много проб и вычислений. Именно этот разрыв и закрывает новая разработка — система EXPO-FT, предлагающая стабильное и экономичное RL-дообучение готовых робополитик.

Как устроен подход
Ключевая идея авторов в том, чтобы не переучивать модель с нуля и не тратить ресурсы на бесполезные для приоритизированных задач вылазки. Вместо этого EXPO-FT донастраивает уже понимающую задачи VLA-модель так, что та быстро приспосабливается к новым требованиям. Такой подход позволяет сохранить общие знания о манипуляциях и параллельно оттачивать именно те действия, которые нужны для конкретного применения.
Дополнительно разработчики позаботились об устойчивости процесса обучения. Судя по описанию, система решает задачи, которые традиционно считаются сложными: здесь и точная прокладка гирлянды с последующей установкой вилки в розетку, и динамичный удар по бильярдному шару с попаданием в лузу, и аккуратная установка цветка в узкое горлышко винной бутылки. Во всех этих сценариях важны и точность позиционирования, и своевременная реакция на вариации начальной расстановки объектов.
Что проверяли и что получилось
Авторы протестировали метод на нескольких таких сценариях и остались довольны результатом. Разработка достигла идеального баланса: во всех оцененных задачах система успешно справлялась с заданием в 30 случаях из 30. При этом ей требовалось в среднем всего около 19 минут реальных взаимодействий робота с объектами. Понятно, что это не время одного эпизода, а суммарный объём онлайн-данных, которые понадобились для дообучения, и он оказывается заметно меньше, чем у традиционных схем. При сравнении с методами обучения с нуля и классическими вариантами RL-дообучения VLA-политик EXPO-FT показал себя лучше по успешности, а значит, и по практичности: меньше данных, больше зачётных выполнений.
Открытый код и дальнейшие шаги
Отдельно стоит отметить, что исследователи не стали оставлять систему закрытой. Проект EXPO-FT публикуется с открытым исходным кодом — это позволяет другим командам воспроизводить результаты, адаптировать метод под собственные робототехнические платформы и сравнивать его со своими подходами. На момент публикации у статьи анонсировано две версии: первая появилась в мае 2026 года, вторая — в середине августа того же года, и она, вероятно, уже учитывает обратную связь от сообщества. Похоже, EXPO-FT — не просто очередной лабораторный приём, а шаг к более практичному использованию больших предобученных моделей в реальной робототехнике, где критичны ограниченные вычислительные бюджеты и количество доступных физических испытаний.




