От планирования в латентном пространстве к переносу навыков
Современное обучение с подкреплением уже не сводится к простому перебору действий. В подходе model-based RL агент сначала строит внутреннюю модель мира — то, как среда реагирует на его действия, — а затем использует эту модель для планирования. Нейронные модели мира позволяют делать это в латентном пространстве: они сжимают наблюдения в векторы и предсказывают следующие состояния и награды без явных предположений об устройстве среды. Это мощно, но у такого подхода есть заметное ограничение: модель обычно получается сильно завязанной на конкретную задачу.
Авторы нового препринта arXiv:2608.17959 — Isidoro Tamassia, Lennert De Smet и Giuseppe Marra — предложили пересмотреть саму структуру модели мира. Их идея в том, чтобы выделить из латентного состояния символические компоненты, от которых зависит награда, и предсказывать именно их. Такая нейросимволическая модель позволяет переносить навыки на новые задачи без единого дополнительного шага во взаимодействии со средой — то есть в режиме zero-shot. Версия работы v2 была представлена 24 августа 2026 года.
Почему обычные модели мира «прилипают» к задаче
Классическая нейронная модель мира обучается на данных конкретной среды и конкретной функции награды. В процессе обучения латентные представления формируются так, чтобы быть удобными для этой награды, но они не обязаны быть интерпретируемыми или переносимыми на другие цели. Поэтому при смене задачи — например, при изменении целевого состояния или правил вознаграждения — агенту приходится фактически переучиваться: внутренние признаки не несут в себе нужной структуры.
Можно представить себе агента, который отлично планирует маршрут к цели в одном лабиринте, но при переносе в лабиринт с другой разметкой наград теряется. Его латентные состояния «заточены» под прежнюю награду, а не под объективные свойства среды. Это и есть главная проблема, которую пытаются решить авторы.

Что меняет нейросимволическая формулировка
Вместо того чтобы предсказывать награду по всему латентному состоянию целиком, авторы предлагают выделить в нём структурированную символическую часть. Предсказание награды зависит только от небольшого подмножества таких символических компонент — например, от положения агента, наличия ключа или открытой двери. Реконструкция же наблюдений остаётся отдельной задачей и может использовать всё латентное состояние целиком.
Такое разделение двух целей — восстановить картинку и предсказать награду через символы — принципиально меняет поведение модели при переносе. Если новая функция награды определена над тем же символическим пространством состояний, агенту не нужно заново исследовать среду. Он уже умеет извлекать нужную символическую информацию и теперь просто пересчитывает, как новая награда соотносится с тем, что он наблюдает.

Преимущества и открытые вопросы
Главный результат исследования — экспериментальное подтверждение, что нейросимволические модели мира дают лучшее обобщение на новые функции награды, чем чисто нейронные подходы. Это важный аргумент в пользу того, что добавление символической прослойки действительно помогает переносу, а не просто усложняет архитектуру.
Но такая архитектура ставит и собственные вызовы.
- Нужно решить, какие именно компоненты состояния считать символическими, а какие оставить «сырыми» для реконструкции.
- Символьное пространство должно быть достаточно выразительным, чтобы в нём можно было определять разнообразные задачи, — иначе перенос ограничится узким классом целей.
- Обучение раздельного предсказания награды и реконструкции сложнее: модель не должна терять визуальную информацию, которая нужна только для восстановления наблюдений.
Зачем это нужно
Перенос навыков без дообучения — одна из ключевых целей в обучении с подкреплением. Сейчас каждый новый сценарий часто означает новый этап сбора данных и взаимодействия со средой. Нейросимволические модели мира могут сделать такой переход заметно дешевле: достаточно, чтобы новая задача описывалась в терминах уже знакомых агенту символических состояний. По сути, это шаг к тому, чтобы агент понимал не только «как выглядит мир», но и «что в этом мире важно для достижения цели».
Работа относится к областям искусственного интеллекта и машинного обучения (cs.AI, cs.LG) и пока носит характер исследовательского результата. Но направление выглядит перспективным: интерпретируемая символическая прослойка помогает и с обобщением, и с доверием к решениям модели.



