Пожалуй, одна из самых трудных задач для робота — понять, что человеку нужна помощь, и не мешать, когда всё идёт нормально. Новый бенчмарк на стыке Theory-of-Mind и воплощённого ИИ предлагает проверять именно это: агент должен сам выбирать момент для вмешательства, а не просто демонстрировать «теоретическое» понимание чужого состояния.
От вопросов к действию
Существующие ToM-бенчмарки для воплощённых агентов чаще всего построены по одной схеме: агенту показывают сцену, а затем задают вопросы об убеждениях и намерениях человека либо просят предсказать следующее действие на уровне сценария. Такие тесты оценивают скорее рассуждения постфактум, чем способность взаимодействовать с меняющейся средой в реальном времени. Между тем именно непрерывное восприятие и своевременная реакция отличают полезного ассистента от «правильно ответившего на экзамене» алгоритма.
Замкнутый цикл точного вмешательства
Новый челлендж MindHelper переводит эту задачу в замкнутый цикл. Агент должен постоянно наблюдать за окружением, поддерживать отдельные убеждения о каждом человеке в сцене, понимать, когда человек действительно испытывает трудности, и только в этот момент выполнять конкретное действие. Не менее важна и обратная сторона: если вмешательство не требуется, агент обязан промолчать и ничего не делать.
За основу взят предыдущий роботоцентричный подход MindPower, в котором рассуждения идут по принципу «от восприятия к действию». Однако в новом сценарии этого недостаточно: необходимо не только правильно решить, что делать, но и правильно решить, стоит ли делать вообще. Такой дизайн приближает бенчмарк к реальному взаимодействию, где излишняя помощь может раздражать не меньше, чем её отсутствие.

Как устроен MindClaw
Чтобы решить такой челлендж, авторы предлагают фреймворк MindClaw, в котором соединяются три компонента:
- Таблица убеждений актора — структура, где хранятся предположения о целях и знаниях конкретного человека в текущий момент.
- Воплощённые когнитивные навыки — набор способностей, позволяющих агенту не только рассуждать, но и выполнять физические действия в среде.
- Триггерный когнитивный диспетчер — механизм, который отвечает на ключевой вопрос: сработал ли повод для вмешательства. Диспетчер либо запускает действие, либо оставляет агента в режиме наблюдения.
Архитектура напоминает «когнитивную клешню»: она захватывает информацию, удерживает её в форме убеждений и отпускает только тогда, когда рядом есть реальная задача для робота.
Что показали эксперименты
Результаты выглядят показательно. Фреймворк MindClaw достигает 36,63 % точного вмешательства и 14,36 % точности решения задач. Для сравнения, прямые VLM-бейзлайны, которые не используют предложенную архитектуру, показывают лишь 12,05 % и 3,80 % соответственно. Иными словами, разрыв почти в три раза по качеству вмешательства и почти в четыре раза по успешности задач.
Это подтверждает, что наличие явной модели убеждений и отдельного триггера для действий даёт агенту заметное преимущество перед «сырым» использованием зрительно-языковых моделей. Особенно ценно, что успех измеряется не точностью ответов, а корректным поведением в замкнутом контуре: робот должен быть одинаково прав и тогда, когда помогает, и тогда, когда остаётся в стороне.

Статус работы
Препринт с описанием нового бенчмарка опубликован на arXiv под идентификатором 2606.01063. По словам авторов, статья является расширенной версией более ранней работы MindPower, представленной на CVPR 2026, и сопровождается дополнительным набором экспериментов. Текущая версия, помеченная как v3, была обновлена 24 августа 2026 года, а сам проект всё ещё находится в процессе развития. Так что, скорее всего, в ближайшее время стоит ждать уточнений и новых результатов на этом направлении.



