MPCFormer:可解释的自动驾驶系统,学习理解其他驾驶员并在密集车流中安全行驶

12 九月 20260 视图

研究人员提出了一种结合物理约束与真实驾驶数据的方法:Transformer模型首先预测车辆之间的相互影响,随后规划器生成类人化的驾驶操作。测试中,该方法相比强化学习显著减少了轨迹预测误差和碰撞次数。

MPCFormer:可解释的自动驾驶系统,学习理解其他驾驶员并在密集车流中安全行驶

密集的车流不仅仅是车辆的移动,更是一场持续的无言对话。驾驶员通过车身的轻微偏移、加速和停顿来解读周围车辆的意图。自动驾驶要参与这种对话则更为困难:经典的神经网络擅长预测单独的轨迹,但很难解释为何选择了这样的行为。MPCFormer 方法试图将预测与安全性结合起来,让车辆不仅能猜测轨迹,还能理解道路上社交互动的逻辑。

为何在密集车流中常规模型不够用

当车辆紧贴行驶并频繁变道时,单个参与者的行为直接取决于其他参与者的行动。对这种互动评估的失误会导致两种极端:自动驾驶要么过于谨慎而阻碍车流,要么在不恰当的时机尝试执行操作。

纯学习的规划器能够从数据中模仿驾驶风格,但其内部逻辑往往仍是“黑匣子”。在常规情况下这尚可接受,但在高速出口密集车流中,不可预测决策的代价过高。相反,经典控制方法擅长理解运动物理,但未必总能考虑到其他驾驶员也有目标、会做出反应并主动让行。

物理与数据之间的折中

该方法的作者提出,不必在物理建模与机器学习之间二选一,而是将二者结合。MPCFormer 方法的核心是社交互动的耦合动力学:车辆状态并非单独描述,而是作为一个整体系统,其中某个参与者的行为会改变所有其他参与者的条件。

动力学建立在离散状态空间中,物理先验被嵌入模型中。由此,中间表示保持可解释性:专家可以追溯系统基于哪些约束做出决策。动力学系数并非手动指定,而是由 Transformer 编码器-解码器架构在自然驾驶记录上训练得出。

据研究人员称,这是首个显式建模多辆车联合动力学的方法,而非局限于独立预测。

为何选择 MPC

学习到的动力学使规划器能够生成多样化、类人的行为场景:自动驾驶可以根据情况表现得更加自信或更加礼让。但神经网络本身并不能保证安全性。

这时便引入了模型预测控制(MPC)。它检查生成的候选方案是否符合约束,并在危险选项进入执行之前将其拒绝。这降低了完全依赖神经网络输出的方法所固有的风险。

测试结果

开发者使用开放的 NGSIM 数据集评估了 MPCFormer,该数据集包含高速公路真实车流记录。在 5 秒预测时域下,平均轨迹预测误差为 0.86 米——这是在所考察的现代方法中的最佳结果。

另外还测试了高强度互动的闭环场景:车辆需要连续多次变道,以便及时驶入出口匝道。在此,混合模型也显示出相对于基于强化学习的规划器的显著优势:

  • 94.67% —— 成功执行操作的比例;
  • +15.75% —— 驾驶效率的提升;
  • 0.5% —— 碰撞频率,而基础 RL 规划器为 21.25%。

事故率降低近 40 倍——这是最有说服力的论据,证明可解释的物理约束与学习到的社交模型相结合,能让自动驾驶更安全,其行为也更接近经验丰富的驾驶员。

常问问题

MPCFormer:可解释的自动驾驶系统,学习理解其他驾驶员并在密集车流中安全行驶