Учись и развивайся: как агент-ориентированное обучение избавляет роботов от бесконечного переобучения

1 сентября 20264 просмотров

Новая архитектура Teach-and-Grow собирает удачные демонстрации в переиспользуемые блоки навыков, чтобы робот мог осваивать незнакомые задачи без перенастройки модели под каждый случай. На бенчмарке LIBERO подход показывает рекордные результаты, а авторы связывают с ним будущее масштабируемого обучения роботов.

Учись и развивайся: как агент-ориентированное обучение избавляет роботов от бесконечного переобучения

Обычное переобучение — тупик для робототехники

Современные роботы, построенные на сквозных моделях «vision-language-action» (VLA) и world-action-моделях, впечатляют, пока работают в знакомой обстановке. Но стоит сцене измениться — новое освещение, другая планировка, непривычный объект — и модель начинает ошибаться. Чтобы восстановить навык, приходится собирать свежие данные, переучивать политику и прогонять регрессионные тесты. Этот цикл называют «налогом на переобучение»: каждое обновление окружения требует нового витка затратной ручной работы.

Особенность робототехники в том, что данные нельзя просто скачать из интернета. Физический опыт приходится добывать, управляя настоящими машинами, — медленно и дорого. Поэтому подход «собрал много данных — обучил — собрал ещё больше» масштабируется плохо.

Агент вместо политики: идея Teach-and-Grow Learning

Группа исследователей (Chang Nie, Zhe Liu, Hesheng Wang) предложила архитектуру Teach-and-Grow Learning (TGL), которая смещает акцент с переобучения на переиспользование опыта. Вместо того чтобы каждый раз переучивать модель под новую задачу, TGL строит библиотеку навыков — многократно используемых поведений для типовых подцелей.

Всё начинается с нескольких успешных демонстраций. Мультимодальный агент разбирает их на логически завершённые блоки — Skill Blocks. Каждый блок отвечает за конкретный значимый шаг: взять предмет, переместить, поставить, открыть крышку. Эти блоки сохраняются в Skill Library как исполняемые программы.

Когда робот попадает в новую сцену, агент не запускает заранее заученную последовательность, а рассуждает: какие навыки здесь уместны, как их скомпоновать, какой инструмент применить — обученный или рассчитанный геометрически. Затем он исполняет план, наблюдает физический результат и, если поведение отклоняется от намерения, корректирует маршрут. Все успехи, неудачи и исправления фиксируются в структурированной Experience Memory, которая помогает агенту принимать решения в следующий раз.

Почему это работает: обучение как продолженный процесс

Ключевое отличие TGL от классических подходов — отношение к развёртыванию. Обычно считается, что обучение закончилось, когда модель вышла «на линию». В TGL развёртывание само становится периодом продолженного обучения: каждая выполненная задача облегчает следующую, потому что агент накапливает переиспользуемые блоки и знания об их применимости. Новой политике под конкретную задачу учиться не нужно — достаточно скомбинировать существующие навыки и при необходимости скорректировать исполнение.

Исследователи выдвигают гипотезу масштабирования: если X — это объём эффективного переиспользуемого опыта, то ошибка на будущих задачах и потребность в дообучении падают по степенному закону, стремясь к неустранимому минимуму. Иными словами, чем больше полезных навыков накоплено, тем дешевле осваивать всё новые и новые умения.

Что показали эксперименты

Оценка на бенчмарке LIBERO показала результаты уровня state-of-the-art. Контролируемые исследования подтвердили три важных свойства:

  • индукция навыков — агент может извлекать обобщаемые блоки из демонстраций, а не просто запоминать траектории;
  • устойчивое переиспользование — навыки работают в новых сценах без переобучения;
  • адаптация под управлением агента — робот сам замечает отклонения и меняет поведение в реальном времени.

Вместо заключения

Teach-and-Grow Learning — это шаг к роботам, которые «растут» вместе с опытом, а не бесконечно переучиваются с нуля. Такая архитектура особенно перспективна для промышленности и сервисной робототехники, где среда постоянно меняется, а каждая минута простоя оборудования стоит денег. Если гипотеза о степенном масштабировании подтвердится, стоимость внедрения новых роботизированных задач может снизиться на порядки — и тогда адаптивные машины перестанут быть экзотикой.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Teach-and-Grow Learning — обзор архитектуры обучения роботов