摄像头画面直接转化为行驶轨迹——这是端到端驾驶规划器的主要承诺。然而,在看似简单的表象背后,往往隐藏着一个令人不快的意外:模型通过录像学习驾驶员行为,可能会找到比诚实分析道路状况更“省力”的方式来“猜测”正确动作。它使用的往往不是因果关系,而是训练数据中存在的统计巧合。

为什么端到端规划器会抓住随机细节不放
端到端规划器通过模仿学习进行训练:向它们展示专家行为的示例,期望它们在相似条件下复现相同的决策。这种方法在数据足够多样时是有效的。问题在于,专家轨迹旁边几乎总有一些与操作仅间接相关的物体。这可能是路边的标志、建筑立面、特征明显的护栏,甚至是一根普通电线杆。
如果在训练样本中,这类物体在驾驶员刹车或变道等时刻规律性地出现,规划器就会记住这种关联。从形式上看,模型在期望因果关系的地方找到了统计规律:它开始将该物体视为动作的原因,而实际上它只是伴随出现。在常规场景中这并不明显,因为相关性恰好与真实行为一致。但一旦道路状况变得罕见——即“长尾”场景——虚假依赖就会显现出来:模型可能在需要行驶的地方刹车,或者反之。
这种因果混淆是隐蔽而危险的。它不会在标准测试中表现为明显错误,而恰恰会降低在非常规场景中的稳健性——而这些场景正是现代驾驶辅助系统所针对的。因此,简单地向数据集中添加更多示例通常行不通:只要相关性有助于降低训练集上的误差,模型仍然会寻找任何相关性。
为什么open-loop指标无法揭示真正的原因
如何判断规划器在做决策时究竟关注什么?最简单的方法是在录制的场景上运行它,并测量经典的open-loop指标:轨迹的均方根误差(L2)和碰撞频率。这些参数正是评估自动驾驶时最常用的。但研究表明,这些指标几乎完全由车辆自身的当前状态决定:位置、速度和加速度。它们无法回答场景中的哪些元素影响了操作。
想象两个规划器:一个谨慎地绕开行人,另一个因为路面上一个在数据中恰好经常与行人同时出现的亮斑而刹车。在open-loop指标上,两者都会显示较低的L2误差和零事故率——因为输出的轨迹相似。但在第二种情况下,该系统在现实世界中毫无用处:一旦遇到没有“虚假”信号的场景,规划器就会失去方向感。常规指标看不到这一点,因此也无法预警行为的脆弱性。

无需重新训练的因果审计
要识别虚假依赖,需要因果干预:干预场景,改变其中的个别元素,观察决策如何变化。逻辑很简单:如果替换一个无关紧要的背景物体后规划器急剧改变轨迹,说明它正是依赖该物体。但经典的因果分析方法要求重新训练模型:每次干预都需要重新更新大型神经网络的权重。对于已经部署的规划器来说,这不可能——在实际运营中,没有人有额外资源在每次测试后重新训练。
隐藏在缩写CADET背后的提案作者决定另辟蹊径。他们的框架无需训练(training-free),可以在不更新任何参数的情况下研究预训练的端到端规划器。CADET不改变权重,而是在场景本身中进行精心设计的干预,并跟踪规划器输出的反应。

这种方法同时开辟了三种可能性:
- 审计——识别规划器错误依赖的具体物体;
- 基准测试——按决策“噪声”程度比较不同规划器;
- 修正——削弱虚假特征对输出的影响,同样无需微调。
这就成了一个通用的诊断工具,可以应用于任何现成的模型。开发者不再仅仅用事故统计数据来测试系统,而是获得一种机制,能够在潜在事故发生之前揭示其原因。这对于长尾场景尤其宝贵,因为在这些场景中几乎不可能收集到完整的真实示例集。
这种方法在实践中为何有用
对于将端到端规划器集成到车辆中的工程师来说,重要的不仅是测试赛道上的精度,还有行为的可预测性。CADET能够回答“系统为什么选择这条轨迹”的问题——并且在部署到实际交通工具之前就能做到。无需等待罕见情况在路上出现;只需在虚拟环境中进行一系列有针对性的干预,就能发现薄弱环节。
这种审计也改变了开发方式。如果你有两个open-loop指标大致相同的候选模型,以前的选择几乎是随机的。现在可以观察哪个模型更少关注随机特征,并优先选择它。即使第二个模型在标准测试中形式上更精确,因果上更“干净”的系统更有可能经受住现实世界及其无限多样性的考验。
值得注意的是,这项于2026年出现的工作已经提供了完整的工具集,而不仅仅是描述问题。端到端规划器是自动驾驶中最有前景的方向之一,但它们在工业中的适用性直接取决于我们能否理解其决策的内在逻辑。没有因果审计,标准场景下的高精度仍然只是幸运的巧合,而不是安全的保证。



