Юбилей AI City Challenge: от слежки за машинами к пониманию города
Десятый выпуск AI City Challenge — это не просто очередная таблица лидерборда. Соревнование, которое стартовало в 2017 году с вполне прикладных задач — обнаруживать, классифицировать и сопровождать транспортные средства на записях камер, — за восемь лет превратилось в масштабную площадку для исследований физического ИИ. В этом году челлендж проводится вместе с конференцией ECCV 2026, и его организаторы подвели символический итог десятилетия бенчмаркинга в области умных городов и интеллектуального транспорта.
Что изменилось? Если первые годы фокус был на «увидеть и посчитать» автомобили, то теперь речь идёт о том, чтобы машина понимала контекст: кто нарушает правила, что собирается сделать пешеход, какой эпизод на дороге опасен и почему. Это уже не просто компьютерное зрение, а гибрид восприятия, рассуждений и прогнозирования — та самая область, которую сегодня принято называть физическим ИИ.

Масштаб бьёт рекорды
Юбилейный сезон привлёк заметно больше участников, чем предыдущий. В этом году зарегистрировались 325 команд из 26 стран и регионов — для сравнения, в 2025-м было 245 команд из 15 стран. Рост почти на треть по числу команд и почти вдвое по географии говорит о том, что задачи челленджа стали интересны не только узким специалистам по транспортному зрению, но и широкому кругу исследователей ИИ — от работы с мультимодальными моделями до генеративного моделирования.
Такой разброс участников естественен: треки соревнования покрывают сразу несколько направлений, которые редко встречаются в одном бенчмарке.
Шесть треков — шесть вызовов
Основная программа 2026 года состоит из шести направлений:
- Многокамерное 3D-восприятие — восстановление трёхмерной картины сцены по данным с нескольких камер, что критично для автономного транспорта и городского видеонаблюдения.
- Подписи и VQA для безопасности транспорта — генерация текстовых описаний дорожных ситуаций и ответы на вопросы по ним, чтобы система могла объяснить, что происходит на дороге.
- Рассуждения об аномалиях дорожного движения — выявление нестандартных, потенциально опасных событий и понимание их причин.
- Текстовый поиск аномалий людей — поиск по видеозаписям фрагментов с необычным поведением пешеходов на основе естественно-языкового запроса.
- Генеративное прогнозирование транспортных видеопотоков — синтез будущих кадров дорожных сцен, что полезно для симуляторов и обучения моделей.
- Кросс-городское обнаружение объектов — перенос модели, обученной на данных одного города, на камеры другого без потери качества.

Внедоменные бонус-треки
Внутри третьего трека организаторы спрятали два дополнительных соревновательных лидерборда — формально они считаются треками 7 и 8, но используют данные вне основного домена. Первый посвящён пониманию нарушений ПДД на кадрах с камер «рыбий глаз» — такие объективы стоят во многих городах, но модели обычно тренируют на обычных уличных камерах. Второй бонус-трек — VQA о ситуационных намерениях пешеходов: нужно отвечать на вопросы не о том, что человек делает сейчас, а о том, что он, вероятно, собирается сделать. Это заметно сложнее, чем распознавание действий, и требует от модели глубинного понимания сцены.
Почему системы побеждают
Анализ решений участников показывает интересную закономерность. Ни одна из топовых команд не полагается только на одну архитектуру. Успешные подходы — это комбинация крупных фундаментальных моделей с более классическими приёмами:
- геометрическое обоснование — использование проекционных связей между камерами и 3D-пространством;
- поиск и реранжирование — выбор релевантных фрагментов видео или кандидатов перед финальным ответом;
- дизайн синтетических данных — генерация дополнительных обучающих примеров для редких сценариев;
- адаптация домена — например, перенос моделей между городами или типами камер;
- контролируемый инференс — ограничение выхода модели определёнными правилами или словарём.
Иными словами, новый бенчмарк показал, что физический ИИ не сводится к «взять большую модель и натравить на данные». Надёжность достигается гибридными схемами, где нейросети дополняются геометрией, внешними знаниями и аккуратным постпроцессингом.
Десять лет — путь от детекции к пониманию
Если смотреть на эволюцию AI City Challenge в целом, видно главное: бенчмарк перестал быть просто полигоном для улучшения точности детекторов. Теперь это площадка для проверки целостных интеллектуальных систем, которые должны воспринимать, рассуждать и прогнозировать в условиях реального города. Причём важную роль играют не только точность и скорость, но и приватность — отдельный пласт задач связан с оценкой моделей без раскрытия персональных данных.
Организаторы выпустили статью, где подробно описали настройку соревнования, все наборы данных, протоколы оценки, результаты лидербордов и материалы воркшопа. Для исследователей и инженеров это, по сути, готовый обзор текущего состояния дел в области интеллектуального транспорта и физического ИИ — и одновременно приглашение попробовать свои силы в следующем сезоне.




