Masalah: sinyal yang berbeda menjadi usang dengan kecepatan yang berbeda
Sistem rekomendasi multimodal sudah lama tidak lagi hanya mengandalkan riwayat klik. Mereka mencampurkan interaksi "pengguna — objek" dengan konten dari objek itu sendiri: deskripsi, gambar, suara. Logikanya sederhana — semakin banyak kanal informasi, semakin akurat prediksinya. Dalam praktiknya, semuanya lebih rumit: kontribusi setiap kanal tidak konstan, ia berubah seiring waktu, dan masing-masing dengan kecepatannya sendiri.
Penulis makalah arXiv:2608.10983 (Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth; versi pertama — 11 Agustus 2026, versi kedua — 24 Agustus) menyebutnya modality time-scale mismatch — ketidakcocokan skala waktu antar modalitas. Contoh mereka: menjelang Hari Valentine, saat memilih cokelat, orang lebih sedikit membaca komposisi dan lebih banyak melihat kemasan serta iringan suara pada kartu produk. Fitur teks kehilangan bobot, fitur visual dan audio bertambah. Dua minggu kemudian proporsinya berubah lagi.

Dari pengamatan ini tumbuh dua tugas terpisah. Pertama: orang memiliki tempo perilaku yang berbeda, dan satu pengguna membutuhkan satu proporsi modalitas, pengguna lain — proporsi yang sama sekali berbeda. Kedua, yang kurang jelas: modalitas yang kehilangan relevansi tidak sekadar berhenti membantu — ia mulai secara aktif merugikan, dengan menyuntikkan sinyal usang dan menyesatkan ke dalam model.
TimeRoute: perutean untuk setiap pengguna
Solusi untuk kedua tugas itu dikumpulkan dalam satu arsitektur difusi — TimeRoute. Intinya adalah menolak koefisien penggabungan universal yang selama bertahun-tahun menjadi standar: katanya, teks selalu berbobot 0,4, gambar — 0,35, sisanya — kecil.
Distribusi personal alih-alih bobot umum
Elemen kuncinya adalah perute modalitas temporal. Ia mengagregasi perilaku pengguna tertentu menjadi profil temporal yang ringkas dan mengubahnya menjadi distribusi bobot per modalitas yang personal. Artinya, pertanyaan "apa yang harus dilihat lebih dulu di sini" tidak dijawab secara global untuk seluruh sistem, melainkan secara terpisah untuk setiap profil perilaku temporal.
Dua horizon denoising
Bagian kedua adalah rekonstruktor graf difusi. Profil temporal yang sama dimasukkan ke dalamnya melalui Feature-wise Linear Modulation (FiLM), dan denoising dipisahkan menjadi dua aliran head: jangka panjang dan jangka pendek. Tren lambat dan lonjakan cepat diproses oleh cabang yang berbeda, dan ini fundamental — mencampurnya dalam satu kanal berarti kehilangan justru perbedaan yang menjadi alasan semua ini dirancang.

Mengapa difusi diperlukan justru di sini? Ia memungkinkan penyaringan tepi modal sebelum masuk ke graf propagasi. Koneksi usang tidak dilemahkan setelah fakta — ia tidak dibangun sama sekali. Ini pendekatan yang secara fundamental berbeda dari pembobotan graf yang sudah jadi.
Eksperimen: tiga dataset, sepuluh kali pengujian
Penulis menguji sistem pada tiga kumpulan data — video pendek dari TikTok, Amazon-Baby, dan Amazon-Sports. Setiap hasil dirata-ratakan dari sepuluh inisialisasi acak, yang untuk benchmark rekomendasi cukup ketat: variasi antar pengujian di sini biasanya menghabiskan setengah dari peningkatan.
Peningkatan dibandingkan model dasar yang kuat konsisten pada Recall@K, Precision@K, dan NDCG@K. Hasil paling mencolok yang tercatat — kenaikan hingga 9,8% pada P@20 di Amazon-Baby. Yang penting, peningkatan ini bukan sekali saja dan tidak terikat pada satu metrik: ia muncul di seluruh rangkaian pengukuran.
Attribution: pengujian mekanisme, bukan sekadar angka
Bagian terpisah dari makalah ini adalah studi attribution yang terkontrol. Ini upaya menjawab pertanyaan yang sering terlewat: apa sebenarnya yang memberikan peningkatan — ide yang diajukan atau kebetulan dalam arsitektur?
Kesimpulannya tegas. Peningkatan memerlukan sekaligus mekanisme baru dan input temporal. Jika profil temporal yang sama diberikan ke backbone biasa tanpa mengubah prosedur perutean, tidak akan ada keuntungan. Dan jika perute diberi noise acak, hasilnya tidak lebih baik daripada menghapus perute sepenuhnya dari model.
Sederhananya, yang bekerja bukan sekadar keberadaan data temporal dalam sistem, melainkan kombinasi spesifik "profil → distribusi modalitas → rekonstruksi denoising yang terkendali". Hilangkan salah satu elemen — konstruksinya runtuh.

Apa artinya ini dalam praktik
Gagasan utama makalah ini melampaui batas rekomendasi. Multimodalitas biasanya dipahami sebagai akumulasi: tambahkan satu sumber data lagi — hasilnya lebih baik. TimeRoute mengingatkan bahwa sumber-sumber itu saling bersaing, dan rasio di antara mereka adalah besaran yang dapat disetel, sama seperti bobot model lainnya.
Kesimpulan praktis kedua menyangkut keusangan. Dalam sistem rekomendasi, lazimnya sinyal lama dilawan pada tingkat preferensi pengguna — menghitung ulang riwayat, melupakan klik lama. Di sini masalah yang sama diangkat ke tingkat modalitas: yang bisa menjadi usang bukan selera seseorang, melainkan relevansi seluruh kanal informasi. Dan lebih logis untuk melawannya di pintu masuk graf, bukan setelah sampah menyebar ke seluruh struktur.
Poin ketiga — personalisasi distribusi. Gagasan bahwa proporsi modalitas harus diturunkan dari profil temporal seseorang, bukan ditetapkan sekali untuk seluruh platform, tampak dapat dipindahkan. Prinsip yang sama berlaku di tempat sinyal beragam bertemu: pencarian, perankingan feed, katalog dengan jenis konten campuran. Penulis membuka kodenya, jadi menguji pendekatan ini pada data sendiri sangat mungkin dilakukan.



