समस्या: अलग-अलग संकेत अलग-अलग गति से पुराने पड़ते हैं
मल्टीमॉडल सिफ़ारिश प्रणालियों ने बहुत पहले ही केवल क्लिक इतिहास पर निर्भर रहना छोड़ दिया है। वे "उपयोगकर्ता — वस्तु" इंटरैक्शन में वस्तु की सामग्री भी मिलाती हैं: विवरण, चित्र, ध्वनि। तर्क सरल है — सूचना के जितने अधिक चैनल, उतना ही सटीक पूर्वानुमान। व्यवहार में सब कुछ अधिक जटिल है: प्रत्येक चैनल का योगदान स्थिर नहीं है, वह समय के साथ बदलता है, और अपनी अलग गति से बदलता है।
arXiv:2608.10983 (Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth; पहला संस्करण — 11 अगस्त 2026, दूसरा — 24 अगस्त) के लेखक इसे modality time-scale mismatch — मोडैलिटी के समय-मानकों का असंगम — कहते हैं। उनका उदाहरण: वैलेंटाइन डे के करीब चॉकलेट चुनते समय लोग सामग्री कम पढ़ते हैं और पैकेजिंग तथा कार्ड के ध्वनि साथ पर अधिक ध्यान देते हैं। पाठ्य विशेषताएँ अपना वज़न खो देती हैं, दृश्य और श्रव्य — बढ़ा लेती हैं। दो सप्ताह बाद अनुपात फिर बदल जाता है।

इस अवलोकन से दो अलग-अलग समस्याएँ उभरती हैं। पहली: लोगों के व्यवहार की गति अलग-अलग होती है, और एक उपयोगकर्ता को मोडैलिटी का एक अनुपात चाहिए, दूसरे को बिल्कुल अलग। दूसरी, कम स्पष्ट: जो मोडैलिटी प्रासंगिकता खो चुकी है, वह केवल मदद करना बंद नहीं करती — वह सक्रिय रूप से नुकसान पहुँचाने लगती है, मॉडल में पुराने और भ्रामक संकेत डालती है।
TimeRoute: विशिष्ट उपयोगकर्ता के लिए रूटिंग
दोनों समस्याओं का समाधान एक ही डिफ्यूज़न आर्किटेक्चर — TimeRoute — में समाहित है। इसका सार उन सार्वभौमिक संयोजन गुणांकों को छोड़ने में है जो वर्षों तक मानक रहे: मानो पाठ का वज़न हमेशा 0.4, चित्र का — 0.35, और बाकी — मामूली।
सामान्य वज़नों के बजाय व्यक्तिगत वितरण
मुख्य तत्व — मोडैलिटी का टेम्पोरल राउटर। यह किसी विशिष्ट उपयोगकर्ता के व्यवहार को एक संक्षिप्त टेम्पोरल प्रोफ़ाइल में समेकित करता है और उसे मोडैलिटी के अनुसार व्यक्तिगत वज़न वितरण में बदल देता है। यानी "यहाँ सबसे पहले किस पर ध्यान देना है" — यह प्रश्न पूरे सिस्टम के लिए वैश्विक रूप से नहीं, बल्कि प्रत्येक टेम्पोरल व्यवहार प्रोफ़ाइल के लिए अलग-अलग हल किया जाता है।
डीनॉइज़िंग के दो क्षितिज
दूसरा भाग — ग्राफ़ का डिफ्यूज़न पुनर्निर्माता। वही टेम्पोरल प्रोफ़ाइल Feature-wise Linear Modulation (FiLM) के माध्यम से इसमें दी जाती है, और डीनॉइज़िंग को दो हेड-धाराओं में बाँटा गया है: दीर्घकालिक और अल्पकालिक। धीमे रुझान और तेज़ उछाल अलग-अलग शाखाओं में संसाधित होते हैं, और यह मूलभूत है — उन्हें एक ही चैनल में मिलाना यानी ठीक उसी अंतर को खो देना जिसके लिए यह सब शुरू किया गया था।

यहाँ डिफ्यूज़न की आवश्यकता क्यों है? यह मोडल किनारों को प्रसार ग्राफ़ में पहुँचने से पहले छानने की अनुमति देती है। पुराना संबंध बाद में कमज़ोर नहीं किया जाता — वह बनता ही नहीं। यह तैयार ग्राफ़ को भारित करने की तुलना में मूलभूत रूप से अलग दृष्टिकोण है।
प्रयोग: तीन डेटासेट, दस रन
लेखकों ने सिस्टम को तीन डेटासेट पर परखा — TikTok के छोटे वीडियो, Amazon-Baby और Amazon-Sports। प्रत्येक परिणाम दस यादृच्छिक इनिशियलाइज़ेशनों पर औसत किया गया है, जो सिफ़ारिश बेंचमार्क के लिए काफ़ी कड़ा है: यहाँ रनों के बीच का फैलाव आमतौर पर आधा सुधार खा जाता है।
मज़बूत बेसलाइन मॉडलों की तुलना में सुधार Recall@K, Precision@K और NDCG@K पर स्थिर हैं। सबसे उल्लेखनीय दर्ज परिणाम — Amazon-Baby पर P@20 में 9.8% तक की वृद्धि। महत्वपूर्ण यह है कि वृद्धि एकबारगी नहीं है और किसी एक मीट्रिक से बँधी नहीं: वह मापों के पूरे सेट में प्रकट होती है।
Attribution: केवल आँकड़ों की नहीं, तंत्रों की जाँच
कार्य का एक अलग हिस्सा — नियंत्रित attribution अध्ययन। यह उस प्रश्न का उत्तर देने का प्रयास है जो अक्सर पर्दे के पीछे रह जाता है: वृद्धि वास्तव में किससे आई — प्रस्तावित विचार से या आर्किटेक्चर में किसी आकस्मिक संयोग से?
निष्कर्ष कठोर निकले। सुधार के लिए एक साथ नए तंत्र और टेम्पोरल इनपुट दोनों आवश्यक हैं। यदि वही टेम्पोरल प्रोफ़ाइल किसी सामान्य बैकबोन को दे दी जाए, रूटिंग प्रक्रिया बदले बिना, तो लाभ नहीं होगा। और यदि राउटर को यादृच्छिक शोर थमा दिया जाए, तो परिणाम मॉडल से राउटर को पूरी तरह हटाने से बेहतर नहीं होगा।
सरल शब्दों में, काम सिस्टम में टेम्पोरल डेटा की उपस्थिति मात्र से नहीं, बल्कि विशिष्ट संयोजन "प्रोफ़ाइल → मोडैलिटी वितरण → नियंत्रित डीनॉइज़िंग-पुनर्निर्माण" से चलता है। कोई भी तत्व हटाओ — संरचना बिखर जाती है।

व्यवहार में इसका क्या अर्थ है
कार्य का मुख्य विचार सिफ़ारिशों की सीमा से आगे जाता है। मल्टीमॉडैलिटी को आमतौर पर संचय के रूप में देखा जाता है: डेटा का एक और स्रोत जोड़ा — बेहतर हो गया। TimeRoute याद दिलाता है कि स्रोत आपस में प्रतिस्पर्धा करते हैं, और उनका अनुपात भी मॉडल के किसी भी वज़न की तरह एक समायोज्य मात्रा है।
दूसरा व्यावहारिक निष्कर्ष पुराने पड़ने से संबंधित है। सिफ़ारिश प्रणालियों में पुराने संकेतों से उपयोगकर्ता प्राथमिकताओं के स्तर पर लड़ने की प्रथा है — इतिहास दोबारा गिनना, पुराने क्लिक भुला देना। यहाँ वही समस्या मोडैलिटी के स्तर पर उठाई गई है: पुराना व्यक्ति का स्वाद नहीं, बल्कि सूचना के पूरे चैनल की प्रासंगिकता हो सकती है। और इससे लड़ना ग्राफ़ में प्रवेश के समय अधिक तर्कसंगत है, न कि उसके बाद जब कचरा पूरी संरचना में फैल चुका हो।
तीसरा पहलू — वितरण का वैयक्तिकरण। यह विचार कि मोडैलिटी के अनुपात किसी विशिष्ट व्यक्ति की टेम्पोरल प्रोफ़ाइल से निकाले जाने चाहिए, न कि पूरे प्लेटफ़ॉर्म के लिए एक बार तय किए जाने चाहिए, स्थानांतरणीय लगता है। वही सिद्धांत वहाँ लागू होता है जहाँ विषम संकेत मिलते हैं: खोज, फ़ीड रैंकिंग, सामग्री के प्रकार से मिश्रित कैटलॉग। लेखकों ने कोड खोल दिया है, इसलिए अपने डेटा पर दृष्टिकोण परखना बिल्कुल संभव है।



