सीखें और विकसित हों: कैसे एजेंट-आधारित प्रशिक्षण रोबोटों को बार-बार दोबारा प्रशिक्षित करने से मुक्त करता है

1 सितम्बर 20264 बार देखा गया

नई Teach-and-Grow आर्किटेक्चर सफल डेमो को पुनः उपयोग योग्य कौशल ब्लॉकों में एकत्रित करती है, ताकि रोबोट मॉडल को हर मामले के लिए पुनः कॉन्फ़िगर किए बिना अपरिचित कार्यों में महारत हासिल कर सके। LIBERO बेंचमार्क पर यह दृष्टिकोण रिकॉर्ड-तोड़ परिणाम दिखाता है, और लेखक इसके साथ स्केलेबल रोबोट लर्निंग का भविष्य जोड़ते हैं।

सीखें और विकसित हों: कैसे एजेंट-आधारित प्रशिक्षण रोबोटों को बार-बार दोबारा प्रशिक्षित करने से मुक्त करता है

सामान्य पुनःप्रशिक्षण — रोबोटिक्स के लिए एक गतिरोध

आधुनिक रोबोट, जो एंड-टू-एंड "विज़न-लैंग्वेज-एक्शन" (VLA) मॉडल और वर्ल्ड-एक्शन मॉडल पर बने हैं, तब तक प्रभावशाली होते हैं जब तक वे परिचित वातावरण में काम करते हैं। लेकिन जैसे ही दृश्य बदलता है — नई रोशनी, अलग लेआउट, अपरिचित वस्तु — मॉडल गलतियाँ करने लगता है। कौशल को बहाल करने के लिए, नया डेटा इकट्ठा करना, नीति को फिर से प्रशिक्षित करना और रिग्रेशन टेस्ट चलाना पड़ता है। इस चक्र को "पुनःप्रशिक्षण कर" कहा जाता है: पर्यावरण का हर अपडेट महंगे मैन्युअल काम के एक नए दौर की मांग करता है।

रोबोटिक्स की खासियत यह है कि डेटा को इंटरनेट से आसानी से डाउनलोड नहीं किया जा सकता। भौतिक अनुभव को वास्तविक मशीनों को नियंत्रित करके प्राप्त करना पड़ता है — धीरे-धीरे और महंगे तरीके से। इसलिए "बहुत सारा डेटा इकट्ठा करो — प्रशिक्षित करो — और भी अधिक इकट्ठा करो" दृष्टिकोण अच्छी तरह से स्केल नहीं होता।

नीति के बजाय एजेंट: टीच-एंड-ग्रो लर्निंग का विचार

शोधकर्ताओं के एक समूह (Chang Nie, Zhe Liu, Hesheng Wang) ने टीच-एंड-ग्रो लर्निंग (TGL) नामक एक आर्किटेक्चर प्रस्तावित किया है, जो पुनःप्रशिक्षण से हटकर अनुभव के पुन:उपयोग पर जोर देता है। हर नए कार्य के लिए मॉडल को फिर से प्रशिक्षित करने के बजाय, TGL एक स्किल लाइब्रेरी बनाता है — सामान्य उप-लक्ष्यों के लिए पुन:प्रयोज्य व्यवहार।

सब कुछ कुछ सफल प्रदर्शनों से शुरू होता है। एक मल्टीमॉडल एजेंट उन्हें तार्किक रूप से पूर्ण ब्लॉकों — स्किल ब्लॉक्स में विभाजित करता है। प्रत्येक ब्लॉक एक विशिष्ट महत्वपूर्ण कदम के लिए जिम्मेदार होता है: वस्तु उठाना, स्थानांतरित करना, रखना, ढक्कन खोलना। ये ब्लॉक निष्पादन योग्य प्रोग्राम के रूप में स्किल लाइब्रेरी में संग्रहीत होते हैं।

जब रोबोट एक नए दृश्य में पहुँचता है, तो एजेंट पहले से सीखा हुआ अनुक्रम नहीं चलाता, बल्कि तर्क करता है: यहाँ कौन से कौशल उपयुक्त हैं, उन्हें कैसे संयोजित किया जाए, कौन सा उपकरण लागू किया जाए — प्रशिक्षित या ज्यामितीय रूप से गणना किया हुआ। फिर वह योजना को निष्पादित करता है, भौतिक परिणाम का अवलोकन करता है, और यदि व्यवहार इरादे से विचलित होता है, तो मार्ग को सही करता है। सभी सफलताएँ, विफलताएँ और सुधार एक संरचित एक्सपीरियंस मेमोरी में दर्ज किए जाते हैं, जो एजेंट को अगली बार निर्णय लेने में मदद करती है।

यह क्यों काम करता है: सीखना एक सतत प्रक्रिया के रूप में

TGL और शास्त्रीय दृष्टिकोणों के बीच मुख्य अंतर — तैनाती के प्रति दृष्टिकोण है। आमतौर पर यह माना जाता है कि सीखना तब समाप्त हो जाता है जब मॉडल "लाइन पर" आ जाता है। TGL में, तैनाती स्वयं निरंतर सीखने की अवधि बन जाती है: प्रत्येक पूरा किया गया कार्य अगले को आसान बनाता है, क्योंकि एजेंट पुन:प्रयोज्य ब्लॉक और उनकी प्रयोज्यता के बारे में ज्ञान जमा करता है। किसी विशिष्ट कार्य के लिए नई नीति सीखने की आवश्यकता नहीं होती — मौजूदा कौशल को संयोजित करना और आवश्यकता पड़ने पर निष्पादन को सही करना पर्याप्त है।

शोधकर्ता एक स्केलिंग परिकल्पना प्रस्तुत करते हैं: यदि X प्रभावी पुन:प्रयोज्य अनुभव की मात्रा है, तो भविष्य के कार्यों में त्रुटि और अतिरिक्त प्रशिक्षण की आवश्यकता एक पावर-लॉ के अनुसार घटती है, जो एक अपरिहार्य न्यूनतम की ओर बढ़ती है। दूसरे शब्दों में, जितने अधिक उपयोगी कौशल जमा होते हैं, नए कौशल सीखना उतना ही सस्ता होता जाता है।

प्रयोगों ने क्या दिखाया

LIBERO बेंचमार्क पर मूल्यांकन ने स्टेट-ऑफ-द-आर्ट स्तर के परिणाम दिखाए। नियंत्रित अध्ययनों ने तीन महत्वपूर्ण गुणों की पुष्टि की:

  • कौशल प्रेरण — एजेंट प्रदर्शनों से सामान्यीकरण योग्य ब्लॉक निकाल सकता है, न कि केवल प्रक्षेप पथ याद रख सकता है;
  • मजबूत पुन:उपयोग — कौशल बिना पुनःप्रशिक्षण के नए दृश्यों में काम करते हैं;
  • एजेंट-नियंत्रित अनुकूलन — रोबोट स्वयं विचलन का पता लगाता है और वास्तविक समय में व्यवहार बदलता है।

निष्कर्ष के बजाय

टीच-एंड-ग्रो लर्निंग — उन रोबोटों की ओर एक कदम है जो अनुभव के साथ "बढ़ते" हैं, न कि बार-बार शून्य से सीखते हैं। यह आर्किटेक्चर विशेष रूप से उद्योग और सेवा रोबोटिक्स के लिए आशाजनक है, जहाँ वातावरण लगातार बदलता रहता है, और उपकरण डाउनटाइम का हर मिनट पैसा खर्च करता है। यदि पावर-लॉ स्केलिंग परिकल्पना की पुष्टि हो जाती है, तो नए रोबोटिक कार्यों को लागू करने की लागत कई गुना कम हो सकती है — और तब अनुकूली मशीनें विलासिता नहीं रह जाएँगी।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
सीखें और विकसित हों: कैसे एजेंट-आधारित प्रशिक्षण रोबोटों को बार-बार दोबारा प्रशिक्षित करने से मुक्त करता है