人——导航算法面临的主要问题
机器人越来越多地出现在需要与人共享道路的空间中:商店、医院、城市街道。正确解读指令同时不侵犯行人个人边界的能力变得至关重要。然而,大多数现有的视觉-语言导航(Vision-and-Language Navigation, VLN)方法都是在没有行人或行人行为被极度简化的条件下进行测试的。这导致即使是先进的智能体在真实环境中也会迷失方向。
研究人员注意到了这一差距,并提出了一个新的开源基准——HA-VLN 2.0。它的设计目的是测试机器人同时执行导航指令和保持社交得体行为的能力:绕开行人、避免碰撞、保持安全距离。

从离散地图到真实街道
传统的VLN基准分为离散型和连续型两类。前者中,智能体在预先设定的点之间移动,不需要考虑运动的平滑性。后者引入了自由空间,但在大多数场景中空间仍然是静态的:行人不动或几乎不被考虑。而在现实中,人们不断迎面走来、改变轨迹、彼此交流。
来自ArXiv:2503.14229(论文已被IROS 2026接收)的作者们提出了一种统一的方法:HA-VLN 2.0将离散和连续环境结合起来,并在其中加入明确的社会约束。也就是说,在评估路径准确性之前,先检查智能体是否侵犯了人的个人空间。这种任务设定更接近机器人实际工作中需要面对的条件。
这篇长达35页、包含20幅图的论文详细描述了基准的架构和实验结果。项目由来自学术界和工业界实验室的12位作者共同完成,包括卡内基梅隆大学(Alexander G. Hauptmann)等机构的研究人员。
HA-VLN 2.0:社会导航的统一标准
新基准包含几个关键组件。首先是标准化指标,同时衡量目标达成的准确性和个人空间遵守程度。像“成功情节百分比”这样的简单指标在这里被对侵入行人舒适区的惩罚所补充。
其次,研究人员创建了更新的数据集HAPS 2.0以及模拟器,用于模拟与多个人的交互。不仅考虑室内环境,还涵盖开放空间,以及语言与手势和动作之间更精确的对齐。这使得智能体能够在接近真实城市场景的条件下进行测试。
为了验证方法的有效性,作者在16,844条具有社会依据的指令上进行了基准测试。这样的样本量可以在不同情境下可靠地评估算法行为。特别强调的是,基准发布的同时还公开了数据集、模拟器、基线和协议——所有复现实验所需的资源。
测试结果:社会感知至关重要
基准揭示了一个严重的问题:加入行人动态和部分可观测性后,领先导航智能体的性能急剧下降。在静态环境中表现出色的智能体,当行人突然出现在视野中时,开始与行人相撞或陷入僵局。

同时,实验表明,显式的社会建模带来了显著优势。如果智能体提前学会考虑人的存在并预测其运动,导航的稳定性会提高,碰撞次数也会减少。这证实了以人为中心的方法比单纯寻找最短路径更为必要。
重要的是,结论不仅在仿真中得到了验证。作者还在真实机器人上进行了测试,确认了结果从虚拟环境到物理环境的迁移。这种从仿真到现实的过渡是实际应用的必要条件,而HA-VLN 2.0提供了验证这一过程的完整基础设施。
推动机器人技术发展的开放生态系统
该项目的一个重要方面是开放性。随论文一起发布的不仅有描述,还有可用的工具:数据集、模拟器、基础算法代码和训练协议。此外,还创建了一个排行榜,团队可以在透明的条件下比较各自的导航智能体。这尤其有价值,因为它可以追踪社会导航领域的进展,避免在封闭测试集上出现虚高的结果。
这类基准的发展是重要的一步,让机器人不再是实验室里的玩具,而是学会在现实生活中与人安全共处。新的指标和模拟器推动社区朝着更高的社会感知方向研究,而不仅仅是技术精度。

未来可以期待场景的进一步扩展:更复杂的天气条件、不同类型的行人以及指令中更多的模态。但就目前而言,HA-VLN 2.0已经为面向社会交互的导航算法评估设定了新标准。



