AI सिटी चैलेंज की दसवीं वर्षगांठ: कारों पर नज़र रखने से शहर को समझने तक
AI सिटी चैलेंज का दसवां संस्करण सिर्फ एक और लीडरबोर्ड तालिका नहीं है। यह प्रतियोगिता, जो 2017 में काफी व्यावहारिक कार्यों — कैमरा रिकॉर्डिंग में वाहनों का पता लगाना, वर्गीकरण और ट्रैकिंग — के साथ शुरू हुई थी, आठ वर्षों में भौतिक AI के लिए एक बड़े पैमाने के अनुसंधान मंच में बदल गई है। इस वर्ष यह चैलेंज ECCV 2026 सम्मेलन के साथ आयोजित किया जा रहा है, और इसके आयोजकों ने स्मार्ट शहरों और बुद्धिमान परिवहन के क्षेत्र में बेंचमार्किंग के एक दशक का प्रतीकात्मक सारांश प्रस्तुत किया है।
क्या बदला है? यदि शुरुआती वर्षों में ध्यान कारों को "देखने और गिनने" पर था, तो अब बात यह है कि मशीन संदर्भ को समझे: कौन नियम तोड़ रहा है, पैदल यात्री क्या करने वाला है, सड़क पर कौन सा एपिसोड खतरनाक है और क्यों। यह अब केवल कंप्यूटर विज़न नहीं है, बल्कि धारणा, तर्क और पूर्वानुमान का एक संकर है — वही क्षेत्र जिसे आज भौतिक AI कहा जाता है।

पैमाना रिकॉर्ड तोड़ रहा है
वर्षगांठ सीज़न ने पिछले साल की तुलना में काफी अधिक प्रतिभागियों को आकर्षित किया है। इस वर्ष 26 देशों और क्षेत्रों से 325 टीमों ने पंजीकरण कराया है — तुलना के लिए, 2025 में 15 देशों की 245 टीमें थीं। टीमों की संख्या में लगभग एक तिहाई और भौगोलिक विस्तार में लगभग दोगुनी वृद्धि यह दर्शाती है कि चैलेंज के कार्य अब केवल परिवहन विज़न के विशेषज्ञों के लिए ही नहीं, बल्कि AI शोधकर्ताओं की एक विस्तृत श्रृंखला के लिए भी दिलचस्प हो गए हैं — मल्टीमॉडल मॉडल से लेकर जनरेटिव मॉडलिंग तक।
प्रतिभागियों का ऐसा विविध समूह स्वाभाविक है: प्रतियोगिता के ट्रैक कई दिशाओं को कवर करते हैं जो शायद ही कभी एक ही बेंचमार्क में मिलते हैं।
छह ट्रैक — छह चुनौतियाँ
2026 का मुख्य कार्यक्रम छह दिशाओं से बना है:
- मल्टी-कैमरा 3D धारणा — कई कैमरों के डेटा से दृश्य की त्रि-आयामी तस्वीर का पुनर्निर्माण, जो स्वायत्त परिवहन और शहरी वीडियो निगरानी के लिए महत्वपूर्ण है।
- परिवहन सुरक्षा के लिए कैप्शन और VQA — सड़क स्थितियों का पाठ्य विवरण तैयार करना और उन पर सवालों के जवाब देना, ताकि सिस्टम समझा सके कि सड़क पर क्या हो रहा है।
- यातायात विसंगतियों पर तर्क — असामान्य, संभावित रूप से खतरनाक घटनाओं की पहचान और उनके कारणों को समझना।
- मानव विसंगतियों की पाठ्य खोज — प्राकृतिक भाषा क्वेरी के आधार पर वीडियो रिकॉर्डिंग में पैदल यात्रियों के असामान्य व्यवहार वाले अंशों की खोज।
- परिवहन वीडियो स्ट्रीम का जनरेटिव पूर्वानुमान — सड़क दृश्यों के भविष्य के फ्रेम का संश्लेषण, जो सिमुलेटर और मॉडल प्रशिक्षण के लिए उपयोगी है।
- क्रॉस-सिटी ऑब्जेक्ट डिटेक्शन — एक शहर के डेटा पर प्रशिक्षित मॉडल को गुणवत्ता खोए बिना दूसरे शहर के कैमरों पर स्थानांतरित करना।

डोमेन-बाहर बोनस ट्रैक
तीसरे ट्रैक के भीतर, आयोजकों ने दो अतिरिक्त प्रतिस्पर्धी लीडरबोर्ड छिपाए हैं — औपचारिक रूप से उन्हें ट्रैक 7 और 8 माना जाता है, लेकिन वे मुख्य डोमेन के बाहर के डेटा का उपयोग करते हैं। पहला "फिश-आई" कैमरों के फ्रेम पर यातायात नियम उल्लंघन की समझ के लिए समर्पित है — ऐसे लेंस कई शहरों में लगे होते हैं, लेकिन मॉडल आमतौर पर सामान्य सड़क कैमरों पर प्रशिक्षित होते हैं। दूसरा बोनस ट्रैक — पैदल यात्रियों के स्थितिजन्य इरादों के बारे में VQA है: सवालों के जवाब इस बारे में देने होते हैं कि व्यक्ति अभी क्या कर रहा है, नहीं, बल्कि वह संभवतः क्या करने वाला है। यह क्रिया पहचान से काफी कठिन है और इसके लिए मॉडल को दृश्य की गहरी समझ की आवश्यकता होती है।
सिस्टम क्यों जीतते हैं
प्रतिभागियों के समाधानों का विश्लेषण एक दिलचस्प पैटर्न दिखाता है। शीर्ष टीमों में से कोई भी केवल एक आर्किटेक्चर पर निर्भर नहीं है। सफल दृष्टिकोण — बड़े फाउंडेशनल मॉडलों का संयोजन अधिक शास्त्रीय तकनीकों के साथ:
- ज्यामितीय तर्क — कैमरों और 3D स्थान के बीच प्रक्षेपण संबंधों का उपयोग;
- खोज और पुनः-रैंकिंग — अंतिम उत्तर से पहले प्रासंगिक वीडियो अंशों या उम्मीदवारों का चयन;
- सिंथेटिक डेटा डिज़ाइन — दुर्लभ परिदृश्यों के लिए अतिरिक्त प्रशिक्षण उदाहरणों का निर्माण;
- डोमेन अनुकूलन — उदाहरण के लिए, शहरों या कैमरा प्रकारों के बीच मॉडल स्थानांतरण;
- नियंत्रित इन्फ्रेंस — मॉडल आउटपुट को विशिष्ट नियमों या शब्दावली तक सीमित करना।
दूसरे शब्दों में, नए बेंचमार्क ने दिखाया कि भौतिक AI "बड़ा मॉडल लो और डेटा पर लगाओ" तक सीमित नहीं है। विश्वसनीयता हाइब्रिड योजनाओं से प्राप्त होती है, जहाँ न्यूरल नेटवर्क को ज्यामिति, बाहरी ज्ञान और सावधानीपूर्वक पोस्ट-प्रोसेसिंग द्वारा पूरक किया जाता है।
दस साल — डिटेक्शन से समझ तक का सफर
यदि AI सिटी चैलेंज के विकास को समग्र रूप से देखें, तो मुख्य बात स्पष्ट है: बेंचमार्क अब केवल डिटेक्टरों की सटीकता सुधारने का मैदान नहीं रहा। अब यह समग्र बुद्धिमान प्रणालियों के परीक्षण का मंच है, जिन्हें वास्तविक शहर की स्थितियों में धारणा, तर्क और पूर्वानुमान करना होता है। इसके अलावा, केवल सटीकता और गति ही नहीं, बल्कि गोपनीयता भी महत्वपूर्ण भूमिका निभाती है — कार्यों की एक अलग परत व्यक्तिगत डेटा का खुलासा किए बिना मॉडल के मूल्यांकन से संबंधित है।
आयोजकों ने एक पेपर जारी किया है जिसमें प्रतियोगिता की सेटिंग, सभी डेटासेट, मूल्यांकन प्रोटोकॉल, लीडरबोर्ड परिणाम और वर्कशॉप सामग्री का विस्तार से वर्णन किया गया है। शोधकर्ताओं और इंजीनियरों के लिए, यह अनिवार्य रूप से बुद्धिमान परिवहन और भौतिक AI के क्षेत्र में वर्तमान स्थिति की एक तैयार समीक्षा है — और साथ ही अगले सीज़न में अपनी किस्मत आज़माने का निमंत्रण भी।




