लूपवीएलए — मॉडल को रोबोट नियंत्रण के लिए प्रतिनिधित्व परिशोधन के दौरान समय पर रुकना कैसे सिखाएं

5 सितम्बर 202618 बार देखा गया

नई LoopVLA आर्किटेक्चर हमेशा vision-language बैकबोन की सबसे गहरी परत का उपयोग करने के बजाय, एक साझा Transformer-ब्लॉक के माध्यम से प्रतिनिधित्वों को पुनरावृत्त रूप से परिष्कृत करती है और प्रत्येक चरण पर निर्णय लेती है कि कार्रवाई के लिए पर्याप्त जानकारी है या नहीं। self-supervised वितरण संरेखण के माध्यम से, मॉडल पैरामीटरों की संख्या 45% कम करता है और इन्फ्रेंस को 1.7 गुना तक तेज करता है, बिना सफलता दर में बुनियादी दृष्टिकोणों से पीछे रहे।

लूपवीएलए — मॉडल को रोबोट नियंत्रण के लिए प्रतिनिधित्व परिशोधन के दौरान समय पर रुकना कैसे सिखाएं

क्यों गहराई हमेशा रोबोट की मदद नहीं करती

आधुनिक "विज़न-लैंग्वेज-एक्शन" (VLA) मॉडल में एक स्थापित नियम है: विज़न-लैंग्वेज बैकबोन की परत जितनी गहरी होगी, प्रतिनिधित्व उतना ही अधिक अमूर्त और, जैसा माना जाता है, नियंत्रण के लिए उतना ही अधिक उपयोगी होगा। हालाँकि, रोबोटिक मैनिपुलेशन एक बड़ा तर्क नहीं है, बल्कि लगातार होने वाले बंद-लूप स्थानिक सुधारों का एक क्रम है। उनके लिए, अत्यधिक अमूर्तता अक्सर अनावश्यक होती है: इसके लिए अधिक गणना की आवश्यकता होती है और यह निम्न-स्तरीय ज्यामितीय विवरणों को मिटा देती है, जिनके बिना सटीक नियंत्रण असंभव है।

कल्पना करें कि एक रोबोट एक कप तक पहुँच रहा है। हर फ्रेम में, उसे प्रक्षेपवक्र में छोटे सुधार करने की आवश्यकता होती है, और ये सुधार वस्तु की सटीक स्थिति पर निर्भर करते हैं। यदि मॉडल ने इनपुट डेटा को बहुत गहराई से अमूर्त कर दिया है, तो वह आवश्यक कोण या विस्थापन को "नहीं देख" सकता है। और यदि हर बार सब कुछ शुरू से पुनर्गणना करनी पड़े, तो वास्तविक नियंत्रण के लिए समय नहीं बचेगा।

ऐसे नेटवर्क में संसाधन बचाने के मौजूदा तरीके — पूर्व-चयनित परत पर जल्दी बाहर निकलना या पड़ोसी चरणों पर क्रियाओं की स्थिरता की जाँच जैसी ह्यूरिस्टिक्स हैं। लेकिन वे मुख्य प्रश्न का उत्तर नहीं देते: क्या वर्तमान प्रतिनिधित्व अभी सही कार्रवाई करने के लिए पर्याप्त है? आमतौर पर, निर्णय बाहरी नियमों के आधार पर लिया जाता है, न कि डेटा की सामग्री के आधार पर।

इसलिए, लेखकों के समूह ने LoopVLA आर्किटेक्चर का प्रस्ताव रखा, जो "उस क्षण को औपचारिक रूप देने" का प्रयास करता है जब रुकना संभव हो और इसे सीधे प्रशिक्षण प्रक्रिया में शामिल करता है।

पर्याप्तता मूल्यांकन के साथ आवर्ती शोधन

LoopVLA का विचार परतों की कठोर श्रृंखला के बजाय एक आवर्ती लूप का उपयोग करना है। एक ही Transformer ब्लॉक को मल्टीमॉडल टोकन पर कई बार लागू किया जाता है, धीरे-धीरे प्रतिनिधित्व को परिष्कृत किया जाता है। प्रत्येक पुनरावृत्ति पर, मॉडल दो परिणाम देता है: एक उम्मीदवार क्रिया और एक sufficiency score — एक संख्या जो भविष्यवाणी करती है कि शोधन जारी रखना चाहिए या नहीं।

यह मॉडल के अपने साथ आंतरिक संवाद जैसा है: पहले पास में, यह तेज़ी से कार्य करता है, लेकिन संभवतः पर्याप्त सटीक नहीं होता; दूसरे में, यह अधिक आत्मविश्वासी होता है, लेकिन फिर भी संदेह कर सकता है। Sufficiency score इसी आत्मविश्वास का संकेतक है।

सभी पुनरावृत्तियों पर साझा पैरामीटर — शास्त्रीय गहरे नेटवर्क से एक मौलिक अंतर है। मॉडल परत की पूर्ण संख्या से बंधा नहीं रहता: जो अधिक महत्वपूर्ण है वह यह है कि प्रतिनिधित्व के साथ क्या हो रहा है। यह विभिन्न उदाहरणों के लिए अलग-अलग बिंदुओं पर रुकने की अनुमति देता है, विकसित होते राज्य वेक्टर के परिवर्तन की गतिशीलता पर निर्भर करता है। प्रत्येक पुनरावृत्ति के लिए, मॉडल पैरामीटर के एक ही सेट का उपयोग करता है, इसलिए प्रशिक्षण स्थिर होता है और चरणों की संख्या के अलग-अलग ट्यूनिंग की आवश्यकता नहीं होती है। अनुमान के चरण में, लूप विभिन्न उदाहरणों के लिए अलग-अलग संख्या में चल सकता है, जो मॉडल को जटिलता के मामले में अनुकूली बनाता है।

मॉडल को पर्याप्तता समझना कैसे सिखाया जाता है

"यहाँ रुकना संभव है" का कोई सीधा लेबल मौजूद नहीं है। इसलिए, लेखकों ने एक self-supervised तकनीक लागू की — वे पड़ोसी पुनरावृत्तियों पर क्रियाओं की सापेक्ष गुणवत्ता के साथ confidence-अनुमानों के वितरण को संरेखित करते हैं। सीधे शब्दों में कहें तो, मध्यवर्ती sufficiency scores इस बात से मेल खाने लगते हैं कि वर्तमान क्रिया पिछले पास की क्रिया से कितनी बेहतर या बदतर है। इस प्रकार, पर्याप्तता का संकेत स्वयं नीति से आता है, न कि बाहरी एनोटेशन से।

परिणामस्वरूप, "प्रतिनिधित्व शोधन → क्रिया भविष्यवाणी → पर्याप्तता मूल्यांकन" की श्रृंखला एक एकल प्रणाली के रूप में सीखी जाती है, जहाँ रुकने का निर्णय सीधे नियंत्रण उद्देश्य फ़ंक्शन से जुड़ा होता है। इसे आत्मविश्वास के आसवन के रूप में सोचा जा सकता है: मॉडल ज्ञान स्थानांतरित करता है कि क्रिया कब पर्याप्त रूप से अच्छी है, बाद की पुनरावृत्तियों से पहले की पुनरावृत्तियों तक। यह इसे शुरुआती चरणों में ही समझने की अनुमति देता है कि आगे काम करने की आवश्यकता है या नहीं।

व्यवहार में यह क्या देता है

तीन बेंचमार्क — LIBERO, LIBERO-Plus और VLA-Arena — पर प्रयोगों में, मॉडल ने दिखाया कि स्मार्ट रुकना वास्तव में काम करता है। LoopVLA मजबूत बेसलाइन VLA-नीतियों की तुलना में पैरामीटर की संख्या 45% कम करता है और अनुमान थ्रूपुट को 1.7 गुना तक बढ़ाता है। साथ ही, कार्य पूरा करने की सफलता दर घटती नहीं है, और कई मामलों में बढ़ भी जाती है।

इसे अनुप्रयुक्त रोबोटिक्स की भाषा में अनुवाद करें, तो यह दोहरा लाभ है:

  • कम्प्यूटेशनल लोड में कमी: नियंत्रण के प्रत्येक चरण में कम संचालन, जो ऑन-बोर्ड सिस्टम के लिए विशेष रूप से महत्वपूर्ण है।
  • सटीकता बनाए रखना: मॉडल उन जगहों पर ज्यामितीय विवरण नहीं खोता जहाँ वे महत्वपूर्ण हैं, और उन जगहों पर संसाधन बर्बाद नहीं करता जहाँ मोटा अमूर्तन पर्याप्त है।

ये परिणाम विशेष रूप से वास्तविक प्रणालियों के लिए महत्वपूर्ण हैं जहाँ कम्प्यूटेशनल संसाधन सीमित हैं, उदाहरण के लिए, मोबाइल रोबोट या औद्योगिक मैनिपुलेटर। गतिशील रूप से रुकने की क्षमता ऊर्जा का अधिक कुशल उपयोग और पर्यावरण में परिवर्तनों पर तेज़ प्रतिक्रिया की अनुमति देती है। दिलचस्प बात यह है कि पैरामीटर की बचत आर्किटेक्चर को सरल बनाकर नहीं, बल्कि पहले से मौजूद घटकों के अधिक तर्कसंगत उपयोग से प्राप्त होती है। साझा वज़न वाला आवर्ती ब्लॉक एक छोटा मॉडल नहीं है, बल्कि एक ऐसा मॉडल है जो समय पर रुकना जानता है।

निष्कर्ष

LoopVLA एक उदाहरण है कि कैसे "जितना गहरा, उतना बेहतर" हठधर्मिता को छोड़कर अनुकूली कम्प्यूटेशन प्रबंधन के पक्ष में प्रदर्शन और दक्षता दोनों में सुधार कर सकता है। मॉडल समय पर रुकना सीखता है, और यह नेटवर्क को बिना शर्त गहरा करने से अधिक उत्पादक साबित होता है। यह दृष्टिकोण वास्तविक रोबोटों के लिए अधिक व्यावहारिक VLA-सिस्टम का मार्ग खोलता है, जहाँ हर मिलीसेकंड और हर वाट मायने रखता है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
लूपवीएलए — मॉडल को रोबोट नियंत्रण के लिए प्रतिनिधित्व परिशोधन के दौरान समय पर रुकना कैसे सिखाएं