第十届AI City Challenge:从交通基准测试到物理AI试验场

31 八月 20268 视图

周年赛季与ECCV 2026同期举行,汇聚了来自26个国家的325支队伍。参赛者应对从多摄像头3D感知到生成式视频流预测及异常检测等挑战,十年来该赛事已从简单的车辆追踪演变为智慧城市的综合生态系统。

第十届AI City Challenge:从交通基准测试到物理AI试验场

AI City Challenge十周年:从追踪车辆到理解城市

第十届AI City Challenge不仅仅是一张普通的排行榜。这项始于2017年的竞赛,最初的任务相当务实——在摄像头录像中检测、分类和跟踪车辆——八年间已发展成为物理人工智能研究的大型平台。今年,该挑战赛与ECCV 2026会议同期举办,组织者为智慧城市和智能交通领域十年的基准测试画上了一个象征性的句号。

有什么变化?如果说最初几年的重点是“看见并数清”汽车,那么现在的问题在于让机器理解上下文:谁在违反规则,行人打算做什么,道路上的哪个片段是危险的以及为什么。这已经不仅仅是计算机视觉,而是感知、推理和预测的混合体——正是今天被称为物理人工智能的领域。

规模创下纪录

十周年赛季吸引了比上届明显更多的参赛者。今年有325支队伍来自26个国家和地区注册参赛——相比之下,2025年有来自15个国家的245支队伍。队伍数量增长近三分之一,地域覆盖几乎翻倍,这说明挑战赛的任务不仅吸引了交通视觉领域的专业研究者,也吸引了从多模态模型到生成式建模等广泛的人工智能研究人员。

这种参赛者的多样性是自然的:竞赛的赛道覆盖了多个方向,而这些方向很少出现在同一个基准测试中。

六大赛道——六大挑战

2026年的主赛程由六个方向组成:

  • 多相机3D感知——根据多台相机的数据重建场景的三维图像,这对自动驾驶和城市视频监控至关重要。
  • 交通安全描述与VQA——生成道路场景的文本描述并回答相关问题,使系统能够解释道路上正在发生什么。
  • 交通异常推理——识别非常规的、潜在危险的事件并理解其原因。
  • 行人异常文本检索——基于自然语言查询,在视频录像中搜索行人异常行为的片段。
  • 交通视频流生成式预测——合成道路场景的未来帧,这对模拟器和模型训练很有用。
  • 跨城市目标检测——将在某一城市数据上训练的模型迁移到另一城市的摄像头,且不损失质量。

域外奖励赛道

在第三赛道内部,组织者隐藏了两个额外的竞赛排行榜——它们形式上算作第7和第8赛道,但使用主域之外的数据。第一个专注于理解“鱼眼”摄像头画面中的交通违规行为——许多城市都安装了这种镜头,但模型通常是在普通街道摄像头上训练的。第二个奖励赛道是关于行人情境意图的VQA:需要回答的问题不是关于人当前在做什么,而是关于他可能打算做什么。这比动作识别要困难得多,要求模型对场景有深层的理解。

系统为何获胜

对参赛者方案的分析揭示了一个有趣的规律。没有任何一支顶尖队伍只依赖单一架构。成功的方法都是大型基础模型与更经典技巧的组合

  • 几何推理——利用相机与3D空间之间的投影关系;
  • 检索与重排序——在最终回答之前选择相关的视频片段或候选;
  • 合成数据设计——为稀有场景生成额外的训练样本;
  • 域适应——例如,在城市或相机类型之间迁移模型;
  • 受控推理——用特定规则或词典约束模型的输出。

换句话说,新的基准测试表明,物理人工智能并不等于“拿一个大模型然后丢给数据”。可靠性是通过混合方案实现的,其中神经网络辅以几何、外部知识和细致的后处理。

十年——从检测到理解之路

纵观AI City Challenge的整体演变,可以看到最重要的一点:该基准测试已不再仅仅是提高检测器精度的试验场。现在它是一个检验完整智能系统的平台,这些系统必须在真实城市环境中感知、推理和预测。而且,不仅精度和速度很重要,隐私也很重要——一个独立的任务层面涉及在不泄露个人数据的情况下评估模型。

组织者发布了一篇文章,详细描述了竞赛的设置、所有数据集、评估协议、排行榜结果和研讨会材料。对于研究人员和工程师来说,这实质上是一份关于智能交通和物理人工智能领域当前状况的现成综述——同时也是邀请大家在下一赛季一试身手的邀请函。

常问问题

第十届AI City Challenge:从交通基准测试到物理AI试验场