सबसे हालिया arXiv प्रीप्रिंट arXiv:2608.17542 में, जो 18 अगस्त 2026 को प्रस्तुत किया गया, Jack Boylan और Chris Hokamp JEPA विश्व मॉडलों में पतन से निपटने का एक गैर-स्पष्ट तरीका प्रस्तावित करते हैं। लैटेंट स्पेस पर पहले से तय आकार थोपने के बजाय, वे संक्रमण डेटा से ही अध:पतन के खिलाफ संकेत निकालते हैं। इस विधि का नाम AC-MTM — Action-Contrastive Masked Transition Modeling — रखा गया है, और प्रयोगों के अनुसार, यह जटिल दृश्य वातावरणों पर विशेष रूप से प्रभावी ढंग से काम करती है।
JEPA मॉडल क्यों सिकुड़ जाते हैं
JEPA (Joint Embedding Predictive Architecture) दृष्टिकोण पिक्सेल के बजाय भविष्य के एम्बेडिंग की भविष्यवाणी के इर्द-गिर्द बनाया गया है। यह सुविधाजनक है, लेकिन ऐसे उद्देश्य फलन का एक तुच्छ समाधान है: एन्कोडर एक स्थिरांक पर स्थिर हो सकता है और किसी भी इनपुट के लिए समान प्रतिनिधित्व दे सकता है। तब भविष्यवाणी त्रुटि शून्य हो जाती है, और विश्व संबंधों का कोई सीखना नहीं होता। यही कारण है कि सभी व्यावहारिक JEPA कार्यान्वयन पतन के खिलाफ अतिरिक्त तंत्र जोड़ते हैं — नियमितीकरणकर्ताओं से लेकर वास्तुशिल्प बाधाओं तक।
एक सामान्य तरीका लैटेंट वितरण का नियमितीकरण है। उदाहरण के लिए, LeWorldModel (LeWM) मॉडल SIGReg का उपयोग करता है — एक नियमितीकरणकर्ता जो प्रतिनिधित्व को आइसोट्रोपिक गाऊसी शोर जैसा दिखने के लिए मजबूर करता है। यह प्रशिक्षण को स्थिर करता है, लेकिन एक कठोर धारणा की कीमत पर: लैटेंट स्पेस को एक निश्चित वितरण के अनुरूप होना चाहिए, जो पर्यावरण की गतिशीलता से संबंधित नहीं है। नए काम के लेखकों का दावा है कि पतन को रोकने वाला दबाव बाहर से नहीं, बल्कि राज्यों के बीच संक्रमण से ही आ सकता है।

गाऊसी बंधनों के बजाय कंट्रास्टिव रिवर्स डायनेमिक्स
AC-MTM LeWM की तरह लैटेंट भविष्यवाणी के प्रत्यक्ष लक्ष्य को बनाए रखता है, लेकिन इसमें एक सहायक रिवर्स डायनेमिक्स हेड जोड़ता है। यह हेड केवल प्रशिक्षण के दौरान मौजूद होता है और एक विभेदक कार्य हल करता है: लैटेंट राज्यों की एक जोड़ी से, उसे यह निर्धारित करना होता है कि किस क्रिया ने मॉडल को पहले से दूसरे में स्थानांतरित किया। Action-NCE हानि फलन प्रत्येक लैटेंट संक्रमण को बैच में सभी क्रियाओं के बीच उसे उत्पन्न करने वाली क्रिया की पहचान करने के लिए मजबूर करता है।
ऐसी रचना के लिए न तो लक्ष्य नेटवर्क की आवश्यकता होती है, न stop-gradient की, न पूर्व-प्रशिक्षित एन्कोडर की, और न ही पुनर्निर्माण की। मुख्य बात यह है कि एक सिकुड़ा हुआ एन्कोडर, जो सभी राज्यों के लिए समान प्रतिनिधित्व देता है, शारीरिक रूप से एक क्रिया को दूसरे से अलग नहीं कर सकता। इसका मतलब है कि रिवर्स डायनेमिक्स का कार्य अघुलनशील हो जाता है, और यह अध:पतन के खिलाफ एक सिद्ध संकेत देता है। दबाव डेटा की संरचना से उत्पन्न होता है, न कि कृत्रिम निर्देश से।
प्रशिक्षण पूरा होने के बाद, रिवर्स डायनेमिक्स शाखा को बस हटा दिया जाता है। परीक्षण समय में, एन्कोडिंग, प्रत्यक्ष भविष्यवाणी, योजना और कम्प्यूटेशनल लागत LeWM के समान रहती है — अनुमान पर कोई अतिरिक्त बोझ नहीं।

प्रयोगों ने क्या दिखाया
इस विधि को चार मानक pixel-control कार्यों पर एक सुसंगत योजना प्रोटोकॉल के साथ परीक्षण किया गया। AC-MTM शुरू से ही स्थिर रूप से प्रशिक्षित होता है और औसतन SIGReg के बराबर परिणाम दिखाता है। यानी, गाऊसी नियमितीकरणकर्ता को छोड़ने से सरल वातावरणों में गुणवत्ता का नुकसान नहीं होता।
अधिक दिलचस्प तस्वीर जटिल OGBench Visual Scene बेंचमार्क पर है। वहाँ AC-MTM 80,0±2,0% सफलता प्राप्त करता है, जबकि SIGReg केवल 58,0±2,0%। सुधार प्रत्येक प्रशिक्षण सीड पर 20–24 प्रतिशत अंकों का है। पैमाने को समझने के लिए: 50 एपिसोड की एक यादृच्छिक नीति का एक रन 52% का आधार स्तर देता है, इसलिए विधियों के बीच का अंतर वास्तव में महत्वपूर्ण है।
साथ ही, कंट्रास्टिव रिवर्स डायनेमिक्स वितरण संबंधी धारणाओं पर निर्भर नहीं करता। लेखक उन क्रिया-स्थान और अवलोकनीयता धारणाओं को चिह्नित करते हैं जिनके तहत विधि काम करती है, लेकिन ये शर्तें गाऊसीपन की आवश्यकता से काफी हल्की हैं।
व्यावहारिक निहितार्थ
काम का मुख्य निष्कर्ष: पतन से बचने के लिए, पहले से यह तय करने की आवश्यकता नहीं है कि प्रतिनिधित्व कैसा दिखना चाहिए। बस एक ऐसा कार्य निर्धारित करना पर्याप्त है जिसे एक अध:पतित एन्कोडर निश्चित रूप से विफल कर देगा। ऐसा दृष्टिकोण न केवल अधिक सैद्धांतिक रूप से सुदृढ़ है, बल्कि जटिल दृश्य कार्यों पर बेहतर परिणाम भी देता है, जहाँ SIGReg की गाऊसी बाधाएँ सीखने में बाधा डालती हैं।
कोड प्रकाशित किया गया है, इसलिए परिणामों को आसानी से पुन: प्रस्तुत किया जा सकता है और अपनी परियोजनाओं के अनुकूल बनाया जा सकता है। JEPA विचारों पर विश्व मॉडल बनाने वाले सभी लोगों के लिए, AC-MTM एक व्यावहारिक विकल्प है: अनुमान पर अतिरिक्त लागत के बिना, लक्ष्य नेटवर्क और stop-gradient के बिना, और सीखने के संकेत के अधिक प्राकृतिक स्रोत के साथ।



