DeepMind का नया AI पॉलीगॉन — EVE Online: बिना रीस्टार्ट वाली दुनिया में ताकत की परीक्षा

12 सितम्बर 20264 बार देखा गया

DeepMind और Fenris Creations EVE Online का एक अलग स्वायत्त संस्करण तैयार कर रहे हैं, जहाँ न्यूरल नेटवर्क को लगातार बदलती गेमिंग अर्थव्यवस्था में काम करना होगा। यह प्रयोग जाँचेगा कि क्या मॉडल ज्ञान बनाए रख सकते हैं, दीर्घकालिक स्मृति का उपयोग कर सकते हैं, और मैच को फिर से शुरू करने की संभावना के बिना कई हफ्तों की योजनाएँ बना सकते हैं।

DeepMind का नया AI पॉलीगॉन — EVE Online: बिना रीस्टार्ट वाली दुनिया में ताकत की परीक्षा

Google DeepMind और Fenris Creations की टीमों ने एक असामान्य प्रयोग के लिए हाथ मिलाया है — उनके एजेंट असली खिलाड़ियों से अलग, EVE Online की एक स्वायत्त प्रति में बसेंगे। अगर मानक गेमिंग टेस्ट आमतौर पर इस सवाल का जवाब देते हैं कि "क्या AI जीत सकता है", तो यहाँ काम कहीं ज़्यादा जटिल है: क्या कृत्रिम बुद्धिमत्ता ऐसी दुनिया में सीखने, याद रखने और योजना बनाने में सक्षम है जो गलती के बाद फिर से शुरू नहीं होती?

EVE Online, Atari या StarCraft जैसा क्यों नहीं है

अतीत में DeepMind पहले ही गो, Atari और StarCraft II में विजय प्राप्त कर चुकी है। लेकिन इन सभी विधाओं में एक समान विशेषता है: लक्ष्य काफी स्पष्ट होता है, और मैच सीमित होता है। पार्टी खत्म — रीस्टार्ट करके पिछली गतिविधियों को भुलाया जा सकता है। EVE Online में ऐसी सुविधा नहीं मिलेगी।

यह मल्टीप्लेयर स्पेस गेम 2003 में आया था और तब से इसने अपनी एक जीवंत अर्थव्यवस्था बनाई है, जिसे खिलाड़ी खुद संचालित करते हैं। व्यापार मार्ग मांग के अनुसार बदलते हैं, कीमतें स्थिर नहीं रहतीं, संसाधन सीमित हैं। यहाँ खिलाड़ी सिर्फ़ लड़ते नहीं — वे गठबंधन बनाते हैं, प्रतिस्पर्धा करते हैं और कभी-कभी एक-दूसरे को धोखा भी देते हैं। हर फैसला माहौल को प्रभावित करता है, और उसे वापस लेना असंभव है: दुनिया में "रीस्टार्ट बटन" नहीं है। यही चीज़ EVE Online को AI के लिए एक अनोखी परीक्षा बनाती है।

शोधकर्ताओं के लिए, ऐसा मैदान एक विशेष पार्टी में सबसे अच्छी चाल खोजने से हटकर, एक जटिल प्रणाली के भीतर निरंतर अस्तित्व की ओर बढ़ना है। एक बार सफल रणनीति ढूँढ लेना पर्याप्त नहीं है — दुनिया के बदलने पर, और यहाँ तक कि अपने ही फैसलों के प्रभाव से भी, लगातार उचित तरीके से काम करते रहना ज़रूरी है।

AI-एजेंटों के लिए कौन से कौशल आवश्यक होंगे

DeepMind चार प्रमुख चुनौतियों पर प्रकाश डालती है, जिन्हें एजेंटों को वास्तव में EVE Online में रहने के लिए हल करना होगा।

निरंतर सीखना

सामान्य मॉडल अक्सर "विनाशकारी भूलने" (catastrophic forgetting) से ग्रस्त होते हैं: कुछ नया सीखने पर, वे पुराने कौशल का एक हिस्सा खो देते हैं। बिना रीस्टार्ट वाली दुनिया में यह गंभीर हो जाता है। अगर व्यापार में निपुण कोई एजेंट जहाज़ चलाना भूल जाए, तो वापसी का कोई रास्ता नहीं है — सभी अर्जित क्षमताओं को एक साथ बनाए रखना आवश्यक है।

दीर्घकालिक स्मृति

आधुनिक कॉन्टेक्स्ट विंडो सीमित हैं, लेकिन EVE में सफलता के लिए हफ्तों और महीनों पुरानी घटनाओं को याद रखना पड़ता है। मूल्य परिवर्तन, पुराने संघर्ष, सहयोगियों के वादे — यह सारी जानकारी वर्तमान व्यवहार को प्रभावित करती है और एजेंट के ध्यान से बाहर नहीं होनी चाहिए।

हफ्तों और महीनों की योजना बनाना

EVE में लाभदायक रणनीति लगभग कभी भी त्वरित नहीं होती। आज संसाधन खरीदना ताकि उन्हें एक महीने बाद बेचा जा सके; ऐसी स्थिति लेना जो कई हफ्तों बाद ही गठबंधन को लाभ पहुँचाए — यह प्रणाली लंबी सोच को प्रोत्साहित करती है। AI को लंबे क्षितिज पर अपने कार्यों के परिणामों की गणना करनी होगी।

एजेंटों की परस्पर क्रिया

सिमुलेशन में एक साथ कई AI काम करेंगे। उन्हें सहयोग करना, प्रतिस्पर्धा करना और संभवतः एक-दूसरे को गुमराह करना होगा — ठीक वैसे ही जैसे असली खिलाड़ी करते हैं। उनमें से किसी के पास भी हो रही घटनाओं की पूरी तस्वीर नहीं होगी, और कई फैसलों का नतीजा समय के साथ ही सामने आएगा।

सुरक्षित प्रयोग: पहले सैंडबॉक्स, फिर खुली दुनिया

फ़िलहाल यह परियोजना पूरी तरह से शोध प्रकृति की है। न तो अंतिम मेट्रिक्स, न ही पूरी की गई मिशनों के उदाहरण DeepMind प्रकाशित कर रही है — प्रयोग शुरुआती चरण में है। पहले चरण में, एजेंट स्थानीय सर्वर के साथ एक पृथक वातावरण में काम करते हैं, सिमुलेशन और ऐतिहासिक डेटा का उपयोग करते हुए। यह दृष्टिकोण जीवित दुनिया की अर्थव्यवस्था को जोखिम में डाले बिना परिकल्पनाओं का परीक्षण करने का अवसर देता है।

अगला मैदान EVE Frontier होना चाहिए — ब्रह्मांड का एक हिस्सा जहाँ अधिक खुले नियम हैं, और खिलाड़ी दुनिया की यांत्रिकी को ही प्रभावित कर सकते हैं। दूर के भविष्य में, कंपनी EVE Online और EVE Vanguard में लोगों के साथ "परिपक्व" एजेंटों के आने की संभावना से इनकार नहीं करती। Fenris Creations का मानना है कि ऐसी प्रणालियाँ प्रोडक्शन में जाने से पहले बदलावों का परीक्षण कर सकती हैं, वर्चुअल अर्थव्यवस्था पर नवाचारों के प्रभाव का मॉडल बना सकती हैं और नए खिलाड़ियों को ढलने में मदद कर सकती हैं।

हालाँकि, इस वादे पर कि एजेंटों का उपयोग इंसान की जगह या नियमों को दरकिनार कर खेलने के लिए नहीं किया जाएगा, समुदाय सतर्कता से देखता है: यह फ़िलहाल केवल डेवलपर्स का बयान है, कोई पुष्ट तकनीकी गारंटी नहीं।

खिलाड़ी क्या सोचते हैं और यह EVE से बाहर क्यों महत्वपूर्ण है

समुदाय की प्रतिक्रिया मिश्रित रही है। कुछ लोग EVE Online को इस तरह के परीक्षणों के लिए आदर्श वातावरण बताते हैं और खुश हैं कि प्रयोगों को जीवित सर्वर से बाहर रखा गया है: इससे अपरिपक्व मॉडलों के कारण अर्थव्यवस्था को नुकसान नहीं होगा। अन्य मानते हैं कि स्टूडियो को पहले खेल की पुरानी तकनीकी और आर्थिक समस्याओं को सुलझाना चाहिए था, और उसके बाद ही न्यूरल नेटवर्क जोड़ने चाहिए। प्रमुख गतिविधियों के स्वचालन को लेकर भी चिंताएँ जताई जा रही हैं, जो पहले से ही नाजुक संतुलन को तोड़ सकती हैं।

फिर भी, इस प्रयोग का मूल्य खेल की सीमाओं से कहीं परे है। यदि AI दीर्घकालिक स्मृति, महीनों तक योजना बनाने की क्षमता और बिना रीस्टार्ट के बदलते परिवेश के अनुकूल होने की योग्यता प्रदर्शित करने में सफल रहता है, तो इन उपलब्धियों को आर्थिक मॉडलिंग, संसाधन प्रबंधन और अन्य प्रणालियों में लागू किया जा सकता है, जहाँ फैसलों के परिणामों को आसानी से पूर्ववत नहीं किया जा सकता। ऐसे परीक्षणों के लिए EVE Online शायद किसी भी अन्य मंच से बेहतर उपयुक्त है: यहाँ कोई छोटा राउंड नहीं है, लेकिन AI की परीक्षा लेने के लिए सभी शर्तें मौजूद हैं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
DeepMind का नया AI पॉलीगॉन — EVE Online: बिना रीस्टार्ट वाली दुनिया में ताकत की परीक्षा