Люди — главная проблема для навигационных алгоритмов
Роботы всё чаще оказываются в пространствах, где нужно делить дорогу с людьми: магазины, больницы, городские улицы. Умение корректно интерпретировать команды и при этом не нарушать личные границы прохожих становится критически важным. Однако большинство существующих подходов к навигации по языковым инструкциям (Vision-and-Language Navigation, VLN) проверялись в условиях, где пешеходов либо нет вовсе, либо их поведение упрощено до предела. Это приводит к тому, что даже продвинутые агенты теряются в реальной обстановке.
Исследователи обратили внимание на этот разрыв и представили новый открытый бенчмарк — HA-VLN 2.0. Он создан для того, чтобы проверять способность робота одновременно выполнять навигационные команды и вести себя социально приемлемо: объезжать людей, не врезаться в них, соблюдать дистанцию.

От дискретных карт к живым улицам
Традиционные VLN-бенчмарки делились на дискретные и непрерывные. В первом случае агент перемещается между заранее заданными точками и не заботится о плавности движения. Во втором появляется свободное пространство, но в большинстве сценариев оно остаётся статичным: прохожие не двигаются или их едва ли учитывают. При этом в реальности люди постоянно идут навстречу, меняют траектории, общаются друг с другом.
Авторы работы с ArXiv:2503.14229 (статья принята к IROS 2026) предлагают унифицированный подход: HA-VLN 2.0 объединяет и дискретные, и непрерывные среды, добавляя в них явные социальные ограничения. То есть прежде чем оценивать точность маршрута, проверяется, не нарушил ли агент личное пространство человека. Такая постановка задачи существенно ближе к условиям, в которых роботам придётся работать на самом деле.
В статье, насчитывающей 35 страниц и 20 рисунков, подробно описаны как архитектура бенчмарка, так и полученные результаты. Над проектом работали 12 авторов из академических и индустриальных лабораторий, включая исследователей из Университета Карнеги-Меллона (Alexander G. Hauptmann) и других институтов.
HA-VLN 2.0: единый стандарт для социальной навигации
Новый бенчмарк включает несколько ключевых компонентов. Во-первых, это стандартизированные метрики, которые одновременно измеряют точность достижения цели и степень соблюдения персонального пространства. Простая метрика вроде «процент успешных эпизодов» здесь дополняется штрафами за вторжение в зону комфорта пешеходов.
Во-вторых, исследователи создали обновлённый датасет HAPS 2.0 и симуляторы, моделирующие взаимодействие сразу с несколькими людьми. Учитываются не только закрытые помещения, но и открытые пространства, а также более точное согласование языка с жестами и движениями. Это позволяет испытывать агентов в условиях, приближенных к реальным городским сценариям.
Для проверки работоспособности подхода авторы провели бенчмарки на 16 844 социально обоснованных инструкциях. Такое количество примеров позволяет надёжно оценить поведение алгоритмов в разных ситуациях. Отдельно подчёркивается, что вместе с бенчмарком публикуются датасеты, симуляторы, бейзлайны и протоколы — всё, что нужно для воспроизведения экспериментов.
Что показали тесты: социальная осведомлённость решает
Бенчмарк вскрыл серьёзную проблему: производительность ведущих навигационных агентов резко падает при добавлении динамики людей и частичной наблюдаемости. Агенты, которые отлично справлялись в статичных средах, начинают сталкиваться с пешеходами или вставать в тупик, когда те появляются в поле зрения неожиданно.

При этом эксперименты показали, что явное социальное моделирование даёт ощутимые преимущества. Если агент заранее обучен учитывать присутствие людей и предсказывать их движение, устойчивость навигации повышается, а количество столкновений снижается. Это подтверждает необходимость человеко-ориентированных подходов вместо простого поиска кратчайшего пути.
Важно, что выводы проверены не только в симуляции. Авторы провели испытания на реальном роботе, которые подтвердили перенос результатов из виртуальной среды в физическую. Такой переход от симуляции к реальности — обязательное условие для практического применения, и HA-VLN 2.0 предлагает инфраструктуру для его проверки.
Открытая экосистема для развития робототехники
Один из важных аспектов проекта — открытость. Вместе со статьёй публикуются не только описания, но и рабочие инструменты: датасеты, симуляторы, коды базовых алгоритмов и протоколы обучения. Кроме того, создана таблица лидеров, где команды могут сравнивать свои навигационные агенты в прозрачных условиях. Это особенно ценно, поскольку позволяет отслеживать прогресс в области социальной навигации и избегать завышенных результатов на закрытых тестовых выборках.
Развитие таких бенчмарков — важный шаг к тому, чтобы роботы перестали быть лабораторными игрушками и научились безопасно сосуществовать с людьми в реальной жизни. Новые метрики и симуляторы подталкивают сообщество к исследованиям в сторону большей социальной осознанности, а не только технической точности.

В дальнейшем можно ожидать расширения сценариев: более сложные погодные условия, разные типы пешеходов и дополнительные модальности в инструкциях. Но уже сейчас HA-VLN 2.0 задаёт новый стандарт для оценки навигационных алгоритмов, ориентированных на взаимодействие с обществом.



