स्पाइकिंग न्यूरल नेटवर्क्स पर आमतौर पर ऊर्जा-दक्षता के संदर्भ में चर्चा होती है: घने गुणनों की जगह विरल घटनाएँ, निरंतर क्लॉक की जगह विरल सक्रियता। लेकिन इस वर्ग के मॉडलों में एक दूसरा संसाधन भी है, जो लगभग हमेशा अनुपयोगी रह जाता है: समय के साथ निरंतर बदलता झिल्ली विभव (membrane potential)। एक नया शोध-कार्य इसे किसी मध्यवर्ती चर के रूप में नहीं, बल्कि एक पूर्ण विश्वास-अवस्था (belief state) के रूप में देखने का सुझाव देता है — और उसी पर यह तय करने का कि आगे क्या देखा जाए।
समस्या: पॉइंट क्लाउड को एक ही मार्ग से स्कैन किया जाता है
जब स्पाइकिंग नेटवर्क को 3D डेटा पर लागू किया जाता है, तो दृश्य के टुकड़े आमतौर पर पहले से तय क्रम में देखे जाते हैं — जो सभी इनपुट के लिए एक जैसा होता है। देखने का क्रम इस पर निर्भर नहीं करता कि पॉइंट क्लाउड में वास्तव में क्या मौजूद है। नतीजा एक अजीब विषमता है: स्पाइकिंग गणनाओं की सबसे विशिष्ट विशेषता, झिल्ली विभव का समय-विकास, इस पर कोई प्रभाव नहीं डालती कि नेटवर्क कौन-सा डेटा देखेगा और कब रुकेगा। निर्णय गतिकी के "बाहर" से लिया जाता है, उसके भीतर से नहीं।

Active Spiking Perception: चयन की ज़िम्मेदारी झिल्ली पर
Active Spiking Perception (ASP) विधि पहचान को एक पुनरावृत्त चक्र में बदल देती है। नेटवर्क एक टुकड़ा देखता है, LIF न्यूरॉनों (leaky integrate-and-fire) की अवस्था अद्यतन करता है, और अपने झिल्ली विभव को वर्ग के बारे में वर्तमान परिकल्पना — running belief — के रूप में पढ़ता है। यही परिकल्पना तय करती है कि अगला टुकड़ा कौन-सा दृष्टि-क्षेत्र में आएगा, और margin में अग्रणी की स्पष्ट बढ़त समय-पूर्व रोकने का संकेत बनती है।
विचार सरल है, लेकिन विभव की भूमिका बदल देता है: वह परतों के बीच की एक सेवक राशि होना छोड़ देता है और ऐसा इंटरफ़ेस बन जाता है जिसके ज़रिए नेटवर्क स्वयं को "समझाता" है कि उत्तर देने के लिए उसमें क्या कमी है।
चयन नीति कैसे बनी है
चयन की ज़िम्मेदारी एक हल्के मॉड्यूल Slice-Selection Policy पर है। अगले अवलोकन के उम्मीदवार farthest-point sampling से लिए जाते हैं, और उनका मूल्यांकन दो चीज़ों पर होता है: झिल्ली की वर्तमान अवस्था और पूर्व-गणित ज्यामितीय डिस्क्रिप्टर। प्रशिक्षण end-to-end, straight-through Gumbel-Softmax के ज़रिए होता है, और इन्फ़रेंस पर यह योजना साधारण argmax में बदल जाती है। अतिरिक्त लागत मामूली है — बैकबोन के पैरामीटरों की संख्या का लगभग 2%।
यह केवल अनुमानी तरीका क्यों नहीं है
लेखक इस रचना के लिए सैद्धांतिक आधार प्रस्तुत करते हैं। पहला: leaky integration की कार्यप्रणाली को बायेसियन फ़िल्टर में पश्च प्रायिकता के लघुगणक के पुनरावृत्त अद्यतन के रूप में देखा जा सकता है — यानी विभव का संचय साक्ष्य के संचय के समतुल्य है। दूसरा: रोकने का नियम वितरित-मुक्त चयनात्मक जोखिम सुनिश्चित करता है, और वह भी उस क्षण में बहु-तुलना के दंड के बिना जब नेटवर्क अवलोकन बंद करने का निर्णय लेता है। तीसरा: चरणों के बीच स्ट्रीमिंग अवस्था का स्थानांतरण अवलोकनों के उपसर्ग पर शून्य से पुनर्गणना के समतुल्य है — बशर्ते परिमित-परिशुद्धता का विचलन सीमित हो।
प्रयोगों ने क्या दिखाया
ModelNet40 पर विधि 90.62% देती है, ModelNet10 पर — 93.28%। यह सबसे मज़बूत स्पाइकिंग बेसलाइन से 1.7 प्रतिशत-बिंदु कम है, और वह बेसलाइन भी बड़े बैकबोन का उपयोग करती है। इसलिए शिखर परिशुद्धता इस कार्य का मुख्य तर्क नहीं है। तर्क कुछ और है: ASP एक प्रमाणित anytime-इंटरफ़ेस जोड़ती है, जो तुलना किए गए किसी भी दृष्टिकोण में उपलब्ध नहीं है।
यह तंत्र सघन पूर्वानुमानों तक भी विस्तारित होता है: ShapeNetPart पर 83.21 instance mIoU और S3DIS Area 5 पर 48.50 mIoU। अंतिम परिणाम को लेखक इस डेटासेट पर पहला स्पाइकिंग परिणाम बताते हैं।
एक अलग कहानी है स्थानांतरणीयता। यदि टुकड़ों के अधिगम्य चयन को स्थिर चयन से बदल दिया जाए, तो वही तर्क फ़ोविएटेड गैर-स्पाइकिंग ट्रांसफ़ॉर्मर पर भी काम करता रहता है। यानी यह नीति किसी विशिष्ट स्पाइकिंग आर्किटेक्चर का गुण नहीं, बल्कि एक स्वतंत्र तकनीक है।

गणनाओं के लिए नियंत्रक के रूप में थ्रेशोल्ड
इन्फ़रेंस की लागत अवलोकनों की संख्या के साथ सख़्ती से रैखिक बढ़ती है — यह इसका परिणाम है कि नेटवर्क टुकड़ों को एक-एक करके संसाधित करता है। विश्वास का थ्रेशोल्ड एक मापनीय नियंत्रक बन जाता है: उसे बढ़ाकर मॉडल को अधिक देर तक और अधिक सटीकता से देखने पर विवश किया जा सकता है, घटाकर — उत्तर जल्दी पाया जा सकता है। लेखक लाभ का अनुमान तुलनीय विकल्पों की तुलना में 2.8x से 1.35x कम ऊर्जा खपत की श्रेणी में लगाते हैं। व्यावहारिक अर्थ स्पष्ट है: एक ही समाधान सर्वर परिदृश्य के लिए भी उपयुक्त है, जहाँ सटीकता मायने रखती है, और ऑन-बोर्ड परिदृश्य के लिए भी, जहाँ बजट अधिक महत्वपूर्ण है।
सीमाएँ और आगे की दिशा
ईमानदारी से कम से कम एक अड़चन बताई गई है: S3DIS में एक वर्ग को प्रयुक्त क्रॉप आकार के साथ पहचाना नहीं जा पाता। लेखक इसे छिपाते नहीं, बल्कि वह पूर्वानुमान भी देते हैं जो समस्या को हल कर देता — यानी अगले पुनरावर्तन के लिए एक संकेत।
निष्कर्ष
इस कार्य का मुख्य मूल्य बेंचमार्क के आँकड़ों में नहीं, बल्कि दृष्टिकोण के बदलाव में है। यहाँ झिल्ली विभव एकीकरण का उपोत्पाद नहीं, बल्कि विश्वास-अवस्था है, जिससे क्रिया का चयन और रोकने का मानदंड — दोनों निकलते हैं। इससे तीन परिणाम उपजते हैं: प्रमाणित गारंटियों वाला anytime-मोड सामने आता है, लागत रैखिक हो जाती है और एक ही पैरामीटर से नियंत्रित होती है, और चयन की नीति स्वयं अन्य आर्किटेक्चरों, गैर-स्पाइकिंग सहित, पर स्थानांतरणीय सिद्ध होती है।
दूसरे शब्दों में, स्पाइकिंग मॉडलों में न केवल ऊर्जा का, बल्कि "निर्णय" का संसाधन भी पाया गया। और इसका उपयोग बैकबोन को शून्य से दोबारा लिखे बिना किया जा सकता है।
तकनीकी विवरण arXiv:2608.19232 (cs.NE, cs.AI, cs.LG; ACM I.2.10, I.5.1, I.2.6) प्रीप्रिंट में दिए गए हैं, संस्करण v1 — 4 अगस्त 2026, v2 — 22 अगस्त। आयतन — 28 पृष्ठ, 9 चित्र, 17 तालिकाएँ और परिशिष्ट A–J।




