शहर एक अलग डोमेन के रूप में
एक शहर के कैमरों की रिकॉर्डिंग पर प्रशिक्षित कार, ट्रैफ़िक सिग्नल और पैदल यात्रियों का डिटेक्टर, दूसरे शहर में जाने पर सटीकता में स्पष्ट और पूर्वानुमेय रूप से गिरावट दिखाता है। कारण मॉडल में नहीं है, बल्कि यह है कि सब कुछ एक साथ बदल जाता है: कैमरों की रोशनी और व्हाइट बैलेंस, यातायात का घनत्व, सड़क की लाइनें, वाहनों के परिचित रंग और यहाँ तक कि आम वाहन मॉडलों का रूप भी। औपचारिक रूप से इसे भौगोलिक डोमेन शिफ्ट कहा जाता है, और व्यवहार में — उन लोगों के लिए एक नियमित सिरदर्द जो सड़क निगरानी प्रणालियों को एक साथ कई क्षेत्रों में तैनात करते हैं।
पारंपरिक समाधान है डोमेन अडैप्टेशन। लेकिन इसमें एक अप्रिय गुण है: लगभग हमेशा इसके लिए या तो आर्किटेक्चर की बारीक ट्यूनिंग की आवश्यकता होती है, जो हाइपरपैरामीटर बदलने पर बिखर जाती है, या लक्ष्य शहर के डेटा तक सीधी पहुँच की — उनकी प्रोफाइलिंग, उनके आधार पर थ्रेशोल्ड का चयन, आँकड़ों का विश्लेषण। और यहीं पर बिल्कुल गैर-तकनीकी प्रकृति की सीमाएँ शुरू होती हैं।
"ब्लाइंड" प्रशिक्षण चक्र का क्या अर्थ है
जिन पारिस्थितिक तंत्रों में डेटा को संवेदनशील जानकारी माना जाता है, वहाँ दोनों परिचित रास्ते परिभाषा से ही बंद हैं। लक्ष्य शहर के फ्रेम को शोध स्टैंड पर निर्यात नहीं किया जा सकता, उन पर आँकड़े नहीं बनाए जा सकते, उन पर मॉडल को ट्यून नहीं किया जा सकता। केवल पूरी तरह से "ब्लाइंड" मोड बचता है: प्रशिक्षण और मूल्यांकन बिना किसी लक्ष्य उदाहरण के होते हैं, और गुणवत्ता की जाँच केवल वहीं संभव है जहाँ एनोटेशन पहले से मौजूद है और सुरक्षित परिधि से बाहर नहीं गया है।
यही वह ढाँचा है जिसमें नए शोध के लेखकों ने अपना कार्य रखा है। उनकी रुचि किसी और चालाक अडैप्टेशन लेयर में नहीं है, बल्कि एक सरल और अधिक दिलचस्प प्रश्न में है: मौजूद चीज़ों से — प्रीट्रेनिंग और ऑगमेंटेशन से — कितना निकाला जा सकता है, यदि लक्ष्य डेटा के साथ किसी भी तरह के हेरफेर से इनकार कर दिया जाए।

दो ऑर्थोगोनल आधार
ऑब्जेक्ट डिटेक्शन के लिए प्रस्तावित प्रशिक्षण योजना दो स्वतंत्र तंत्रों पर आधारित है। यहाँ "ऑर्थोगोनल" शब्द महत्वपूर्ण है: वे एक-दूसरे की नकल नहीं करते और त्रुटि के विभिन्न स्रोतों पर काम करते हैं — एक वस्तु की सामग्री और संरचना के साथ काम करता है, दूसरा उस चीज़ के साथ जिससे मॉडल का ध्यान जुड़ता है।
objectness distillation के साथ कई डेटासेट पर प्रीट्रेनिंग
पहला आधार — तथाकथित class-agnostic objectness distillation के साथ एक साथ कई डेटा सेटों पर प्रीट्रेनिंग की रणनीति। विचार यह है कि दो चीज़ों को अलग किया जाए जो सामान्य प्रशिक्षण में जुड़ी हुई हैं: वाहन की संरचनात्मक ज्यामिति और सामग्री-आधारित वर्गीकरण।
सरल शब्दों में, मॉडल पहले इस प्रश्न का उत्तर देना सीखता है कि "क्या यहाँ विशिष्ट आकार की कोई वस्तु है?", इस बात में न जाकर कि किसी विशेष डेटासेट में उस वस्तु को क्या नाम दिया गया है। यह महत्वपूर्ण है क्योंकि डेटा सेटों और शहरों के बीच वर्गीकरण भिन्न होते हैं: कहीं वैन के लिए अलग क्लास है, कहीं सब कुछ "vehicle" में मिला दिया गया है, और कारों और ट्रकों के बीच की सीमाएँ अलग-अलग तरीके से परिभाषित हैं। यदि मॉडल स्थिर ज्यामिति पर निर्भर करता है, न कि लेबल के बारे में स्थानीय समझौतों पर, तो शहर बदलने से उस पर कम प्रभाव पड़ता है।
Grayworld: attention को रंग से मुख मोड़ने पर मजबूर करना
दूसरा आधार — डोमेन-स्थिर ऑगमेंटेशन की धारा, जिसमें Grayworld नामक एक नया रूपांतरण जोड़ा गया है। इसका काम मॉडल के पैरों के नीचे से ज़मीन खींच लेना है, वहाँ जहाँ उसने बेईमानी करना सीख लिया है।
डिटेक्टर अक्सर "शॉर्टकट" ढूँढ लेते हैं: वस्तु के क्लास को रंग से जोड़ देते हैं। पीली कार — टैक्सी, लाल आकृति — एक विशिष्ट प्रकार का वाहन, आकाश या डामर की विशिष्ट छटा — किसी विशेष कैमरे या दिन के समय का संकेत। एक ही शहर के भीतर ऐसे संकेत काम करते हैं, लेकिन दूसरे क्षेत्र में स्थानांतरित होने पर बिखर जाते हैं, क्योंकि वहाँ रंग-संप्रेषण, प्रकाश और प्रचलित रंग अपने हैं। Grayworld ठीक इन वर्णक्रमीय लेबलों पर दबाव डालता है, जिससे वैश्विक attention-हेड्स आकार के बारे में स्थिर पूर्वधारणाओं पर निर्भर होने को मजबूर होते हैं। रंग प्रमाण होना बंद हो जाता है, ज्यामिति — बनी रहती है।

प्रयोग और परिणाम
मूल्यांकन real-time ट्रांसफ़ॉर्मर डिटेक्टर RF-DETR पर किया गया। लेखक विशेष रूप से इस बात पर ज़ोर देते हैं कि पूरी संरचना GPU मेमोरी के मामूली बजट — 16 GB — में फिट हो जाती है, यानी यह एक सामान्य वर्कस्टेशन पर दोहराई जा सकती है, न कि केवल क्लस्टर पर।
अनुकूलित वेरिएंट RF-DETR-HR और RF-DETR-Grayworld ने आधार स्तर के सापेक्ष +24.29 की वृद्धि दी और 47.53 mAP के संकेतक के साथ AI City Challenge Track 6 की लीडरबोर्ड तालिका में पहला स्थान हासिल किया। यह अब "बेसलाइन से थोड़ा बेहतर" नहीं है — यह उस डिटेक्टर के बीच का अंतर है जो नए शहर में लगभग बेकार है, और उसके बीच जो वहाँ काम करता है।
यह कार्य ECCV 2026 सम्मेलन के ढाँचे में AI City Challenge वर्कशॉप में स्वीकृत हुआ है; प्रीप्रिंट arXiv:2608.24154 (cs.CV, cs.AI) के रूप में उपलब्ध है, और कोड तथा डेटा SKKUAutoLab/aic26_cross_city रिपॉज़िटरी में प्रकाशित हैं।
इसमें से व्यवसायियों को क्या सीखना चाहिए
कुछ निष्कर्ष जो किसी विशेष बेंचमार्क से परे उपयोगी हैं।
- ऑगमेंटेशन कोई सौंदर्य-वस्तु नहीं है। यह लक्षित रूप से अवांछित सहसंबंधों को तोड़ सकता है, यदि यह समझा जाए कि मॉडल वास्तव में किससे जुड़ता है। Grayworld रंग-आधारित शॉर्टकट के विरुद्ध एक संकीर्ण लेकिन सटीक उपकरण का उदाहरण है।
- प्रीट्रेनिंग को स्थानांतरण के लिए डिज़ाइन किया जा सकता है। Class-agnostic objectness और ज्यामिति को वर्गीकरण से अलग करना — एक ऐसी तकनीक है जो हर वहाँ काम आएगी जहाँ डेटासेट में क्लास अलग-अलग तरीके से परिभाषित हैं।
- "ब्लाइंड" प्रोटोकॉल एक ईमानदार प्रस्तुति है, सीमा नहीं। यदि विधि लक्ष्य डेटा में झाँकती नहीं है, तो उसका परिणाम वास्तविक स्थिरता के बारे में बताता है, न कि फिटिंग की गुणवत्ता के बारे में।
- मेमोरी बजट परिणाम का हिस्सा है। 16 GB की आवश्यकता इस दृष्टिकोण को इंजीनियरिंग अभ्यास में लागू करने योग्य बनाती है, जहाँ हमेशा टॉप-एंड हार्डवेयर उपलब्ध नहीं होता।
सावधानी भी उचित है: निष्कर्ष डिटेक्टरों के एक परिवार और एक प्रतिस्पर्धी ट्रैक पर प्राप्त किए गए हैं, और Grayworld फिर भी एक अनुमान है, गारंटी नहीं। भौगोलिक शिफ्ट एक ऐसी समस्या बनी हुई है जिसका कोई एक सार्वभौमिक समाधान नहीं है, लेकिन अब यह स्पष्ट है कि प्रगति का एक बड़ा हिस्सा मॉडल के नए शहर को पहली बार देखने से पहले ही हासिल किया जाता है।




