Слепое обучение против географического сдвига: предобучение и аугментация выводят детекторы трафика на новый уровень

18 сентября 202614 просмотров

Команда исследователей собрала модульный конвейер для распознавания объектов на дорогах, который работает без единого кадра из целевого города и без подбора чувствительных гиперпараметров. Две ортогональные опоры — предобучение с class-agnostic objectness distillation и аугментация Grayworld, отучающая attention-головы цепляться за цветовые подсказки, — дали детектору RF-DETR прирост +24.29 и первое место (47.53 mAP) в треке AI City Challenge.

Слепое обучение против географического сдвига: предобучение и аугментация выводят детекторы трафика на новый уровень

Город как отдельный домен

Детектор машин, светофоров и пешеходов, обученный на записях с камер одного города, при переезде в другой город теряет в точности заметно и предсказуемо. Причина не в самой модели, а в том, что меняется буквально всё сразу: освещение и баланс белого у камер, плотность потока, разметка, привычные цвета кузовов и даже внешний вид типовых моделей транспорта. Формально это называют географическим доменным сдвигом, а на практике — регулярной головной болью тех, кто раскатывает системы дорожного наблюдения сразу в нескольких регионах.

Классический выход — доменная адаптация. Но у неё есть неприятное свойство: почти всегда она требует либо тонкой настройки архитектуры, которая разваливается от смены гиперпараметров, либо прямого доступа к данным целевого города — их профилирования, подбора порогов по ним, анализа статистик. И вот тут начинаются ограничения совсем не технического характера.

Что означает «слепой» цикл обучения

В экосистемах, где к данным относятся как к чувствительной информации, оба привычных пути закрыты по определению. Нельзя выгружать кадры из целевого города на исследовательский стенд, нельзя строить по ним статистику, нельзя на них подкручивать модель. Остаётся полностью «слепой» режим: обучение и оценка идут без единого целевого примера, а проверка качества возможна только там, где разметка уже существует и не покидала защищённый контур.

Именно в эту рамку авторы новой работы и поставили свою задачу. Их интересует не очередной хитрый слой адаптации, а вопрос попроще и поинтереснее: сколько можно выжать из того, что уже есть — из предобучения и аугментации, — если отказаться от любых манипуляций с целевыми данными.

Две ортогональные опоры

Предлагаемая схема обучения для детекции объектов строится на двух независимых механизмах. Слово «ортогональные» здесь ключевое: они не дублируют друг друга и давят разные источники ошибки — один работает с семантикой и структурой объекта, второй с тем, за что цепляется внимание модели.

Предобучение на нескольких датасетах с objectness distillation

Первая опора — стратегия предобучения сразу на нескольких наборах данных с так называемой class-agnostic objectness distillation. Идея в том, чтобы развязать две вещи, которые в обычном обучении склеены: структурную геометрию транспортного средства и семантические таксономии.

Проще говоря, модель сначала учится отвечать на вопрос «здесь есть объект характерной формы?», не вдаваясь в то, как этот объект назван в конкретном датасете. Это важно, потому что таксономии между наборами данных и между городами расходятся: где-то отдельный класс для фургонов, где-то всё свалено в «vehicle», а границы между легковыми и грузовыми заданы по-разному. Если модель опирается на устойчивую геометрию, а не на локальные соглашения о метках, смена города бьёт по ней слабее.

Grayworld: заставить attention отказаться от цвета

Вторая опора — поток доменно-устойчивой аугментации, в который добавлена новая трансформация под названием Grayworld. Её задача — выбить у модели почву из-под ног там, где она привыкла жульничать.

Детекторы часто находят «короткие пути»: связывают класс объекта с цветом. Жёлтая машина — такси, красный силуэт — определённый тип транспорта, специфический оттенок неба или асфальта — признак конкретной камеры или времени суток. Внутри одного города такие подсказки работают, а при переносе в другой регион рассыпаются, потому что цветопередача, свет и принятые цвета там свои. Grayworld давит именно эти хроматические ярлыки, вынуждая глобальные attention-головы опираться на устойчивые априорные представления о форме. Цвет перестаёт быть доказательством, геометрия — остаётся.

Эксперименты и результат

Оценка проводилась на real-time трансформерном детекторе RF-DETR. Авторы отдельно подчёркивают, что вся конструкция укладывается в скромный бюджет памяти GPU — 16 ГБ, то есть воспроизводима на обычной рабочей станции, а не только на кластере.

Оптимизированные варианты RF-DETR-HR и RF-DETR-Grayworld дали прирост +24.29 относительно базового уровня и заняли первое место в таблице лидеров AI City Challenge Track 6 с показателем 47.53 mAP. Это уже не «немного лучше бейзлайна» — это разница между детектором, который в новом городе почти бесполезен, и тем, который там работает.

Работа принята на воркшоп AI City Challenge в рамках конференции ECCV 2026; препринт доступен как arXiv:2608.24154 (cs.CV, cs.AI), а код и данные выложены в репозитории SKKUAutoLab/aic26_cross_city.

Что из этого стоит забрать практикам

Несколько выводов, которые полезны за пределами конкретного бенчмарка.

  • Аугментация — не косметика. Она способна целенаправленно ломать нежелательные корреляции, если понимать, за что именно цепляется модель. Grayworld — пример узкого, но точного инструмента против цветовых коротких путей.
  • Предобучение можно проектировать под перенос. Class-agnostic объектность и развязка геометрии от таксономии — приём, который пригодится везде, где классы в датасетах описаны по-разному.
  • «Слепой» протокол — это честная постановка, а не ограничение. Если метод не подглядывает в целевые данные, его результат говорит о реальной устойчивости, а не о качестве подгонки.
  • Бюджет памяти — часть результата. Требование в 16 ГБ делает подход применимым в инженерной практике, где не всегда есть топовое железо.

Осторожность тоже уместна: выводы получены на одном семействе детекторов и одном соревновательном треке, а Grayworld — всё-таки эвристика, а не гарантия. Географический сдвиг остаётся проблемой, у которой нет одного универсального решения, но теперь понятно, что значительная часть прогресса достигается ещё до того, как модель впервые увидит новый город.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Слепое обучение против географического сдвига: обзор метода