TimeRoute: персональный выбор модальностей и диффузия против устаревших сигналов в рекомендациях

14 сентября 20267 просмотров

Исследователи из Амстердамского университета предложили диффузионный рекомендатель, который подбирает пропорции текста, картинок и звука под каждого пользователя с учётом скорости, с какой эти сигналы теряют актуальность. Отдельные долгосрочный и краткосрочный потоки денойзинга отсеивают устаревшие модальные связи ещё до того, как они попадут в граф распространения.

TimeRoute: персональный выбор модальностей и диффузия против устаревших сигналов в рекомендациях

Проблема: разные сигналы устаревают с разной скоростью

Мультимодальные рекомендательные системы давно перестали опираться только на историю кликов. Они подмешивают к взаимодействиям «пользователь — объект» содержание самого объекта: описание, картинку, звук. Логика простая — чем больше каналов информации, тем точнее предсказание. На практике всё сложнее: вклад каждого канала не постоянен, он меняется во времени, причём с собственной скоростью.

Авторы работы arXiv:2608.10983 (Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth; первая версия — 11 августа 2026 года, вторая — 24 августа) называют это modality time-scale mismatch — рассогласованием временных масштабов модальностей. Их пример: ближе к Дню святого Валентина при выборе шоколада люди меньше читают состав и больше смотрят на упаковку и звуковое сопровождение карточки. Текстовые признаки теряют вес, визуальные и аудио — набирают. Через две недели пропорция снова меняется.

Из этого наблюдения вырастают две отдельные задачи. Первая: у людей разный темп поведения, и одному пользователю нужна одна пропорция модальностей, другому — совсем другая. Вторая, менее очевидная: модальность, потерявшая актуальность, не просто перестаёт помогать — она начинает активно вредить, подкидывая в модель устаревшие и вводящие в заблуждение сигналы.

TimeRoute: маршрутизация под конкретного пользователя

Решение обеих задач собрано в одной диффузионной архитектуре — TimeRoute. Её смысл в отказе от универсальных коэффициентов слияния, которые годами были стандартом: мол, текст всегда весит 0,4, картинка — 0,35, остальное — по мелочи.

Персональное распределение вместо общих весов

Ключевой элемент — временной маршрутизатор модальностей. Он агрегирует поведение конкретного пользователя в компактный временной профиль и превращает его в персональное распределение весов по модальностям. То есть вопрос «на что здесь смотреть в первую очередь» решается не глобально для всей системы, а отдельно для каждого профиля временного поведения.

Два горизонта денойзинга

Вторая часть — диффузионный реконструктор графа. Тот же временной профиль подаётся в него через Feature-wise Linear Modulation (FiLM), а денойзинг разведён на два потока голов: долгосрочный и краткосрочный. Медленные тренды и быстрые всплески обрабатываются разными ветками, и это принципиально — смешать их в одном канале значит потерять именно то различие, из-за которого всё затевалось.

Зачем нужна диффузия именно здесь? Она позволяет отсеивать модальные рёбра до того, как они попадут в граф распространения. Устаревшая связь не ослабляется постфактум — она не строится вовсе. Это принципиально другой подход, чем взвешивание уже готового графа.

Эксперименты: три датасета, десять прогонов

Авторы проверяли систему на трёх наборах данных — короткие видео из TikTok, Amazon-Baby и Amazon-Sports. Каждый результат усреднён по десяти случайным инициализациям, что для рекомендательных бенчмарков довольно строго: разброс между прогонами здесь обычно съедает половину прироста.

Улучшения относительно сильных базовых моделей устойчивы по Recall@K, Precision@K и NDCG@K. Самый заметный зафиксированный результат — рост до 9,8% по P@20 на Amazon-Baby. Важно, что прирост не разовый и не привязан к одной метрике: он проявляется по всему набору измерений.

Attribution: проверка механизмов, а не только цифр

Отдельная часть работы — контролируемые attribution-исследования. Это попытка ответить на вопрос, который часто остаётся за кадром: что именно дало прирост — предложенная идея или случайное совпадение в архитектуре?

Выводы получились жёсткими. Улучшения требуют одновременно и новых механизмов, и временного входа. Если отдать тот же временной профиль обычному бэкбону, не меняя процедуру маршрутизации, выигрыша не будет. А если подсунуть маршрутизатору случайный шум, результат окажется не лучше, чем при полном удалении маршрутизатора из модели.

Проще говоря, работает не сам факт наличия временных данных в системе, а конкретная связка «профиль → распределение модальностей → управляемая денойзинг-реконструкция». Убрать любой элемент — конструкция рассыпается.

Что это значит на практике

Главная мысль работы выходит за пределы рекомендаций. Мультимодальность обычно воспринимается как накопление: добавили ещё один источник данных — стало лучше. TimeRoute напоминает, что источники конкурируют между собой, и их соотношение — такая же настраиваемая величина, как любые веса модели.

Второй практический вывод касается устаревания. В рекомендательных системах принято бороться со старыми сигналами на уровне пользовательских предпочтений — пересчитывать историю, забывать давние клики. Здесь та же проблема поднимается на уровень модальностей: устареть может не вкус человека, а релевантность целого канала информации. И бороться с этим логичнее на входе в граф, а не после того, как мусор уже разошёлся по всей структуре.

Третий момент — персонализация распределения. Идея, что пропорции модальностей должны выводиться из временного профиля конкретного человека, а не задаваться один раз для всей платформы, выглядит переносимо. Тот же принцип применим там, где сходятся разнородные сигналы: поиск, ранжирование ленты, смешанные по типу контента каталоги. Код авторы открыли, так что проверить подход на своих данных вполне реально.

Часто задаваемые вопросы

Похожие материалы

Все материалы
TimeRoute — нейросеть для мультимодальных рекомендаций