मिथुन 3 प्रो और फ्लैश टॉप एआई गेमिंग रैंकिंग

19 अगस्त 202616 बार देखा गया

DeepMind and Kaggle ने गेम एरिना को नए गेम, "Werewolf" और पोकर के साथ विस्तारित किया है, जो सामाजिक खुफिया और रणनीतिक सोच का परीक्षण करता है। मिथुन 3 प्रो और फ्लैश मॉडल ने सभी विषयों में सर्वश्रेष्ठ परिणाम प्राप्त किए, जो नेताओं के रूप में उनकी स्थिति की पुष्टि करते थे।.

मिथुन 3 प्रो और फ्लैश टॉप एआई गेमिंग रैंकिंग

गेम एरिना ने "Werewolf" और पोकर जोड़ दिया

Google DeepMind और Kaggle के गेम Arena परीक्षण मंच एक नए स्तर पर पहुंच गया है: दो अपरंपरागत खेल - "Werewolf" और पोकर - परिचित शतरंज में जोड़ा गया है। यह सिर्फ मनोरंजन नहीं है, बल्कि एआई मूल्यांकन को वास्तविक दुनिया के परिदृश्यों के करीब लाने का प्रयास है, जहां न केवल गणना मायने रखती है बल्कि सामाजिक वातावरण में भी व्यवहार करती है।

शतरंज तर्क और सामरिक सोच के परीक्षण के लिए स्वर्ण मानक बनी हुई है। दूसरी ओर "Werewolf", पूरी तरह से कुछ और है। यहां, मॉडल को धोखा का पता लगाने, अन्य खिलाड़ियों के व्यवहार की निगरानी करने और विश्वास बनाने की आवश्यकता है। पोकर एक अन्य जटिल तत्व जोड़ता है - अधूरे जानकारी के तहत निर्णय लेने, जहां कुछ डेटा छिपा हुआ है और जोखिम फ्लाई पर गणना की जानी चाहिए।

अब डेवलपर्स के पास एक एकीकृत स्थान है जहां वे एआई संज्ञानात्मक क्षमताओं की एक विस्तृत श्रृंखला की तुलना कर सकते हैं - शुद्ध गणित से भावनात्मक खुफिया तक।

क्या वास्तव में नए परीक्षण की जांच

मंच पर प्रत्येक खेल कौशल के एक विशिष्ट सेट के लिए जिम्मेदार है। तर्क, सामाजिक बातचीत, जोखिम प्रबंधन - यह सब एक एकीकृत प्रारूप में मूल्यांकन किया जा सकता है और एक दूसरे के खिलाफ मॉडल की तुलना करने के लिए इस्तेमाल किया जा सकता है।

  • शतरंज - दीर्घकालिक योजनाओं का निर्माण करने और विविधताओं की गणना करने की क्षमता का परीक्षण करना।
  • "Werewolf" - सामाजिक खुफिया का आकलन करना: कौन झूठ बोल रहा है, जो सच्चाई को बता रहा है, और क्या एक मैनिपुलेटर की पहचान की जा सकती है।
  • पोकर - अधूरे जानकारी, अनुमान लगाने की संभावना, और जोखिम प्रबंधन के साथ काम करना।

यह बताता है कि "Werewolf" ने एआई सुरक्षा का अध्ययन करने के लिए एक सुविधाजनक वातावरण साबित किया है। एक सुरक्षित आभासी सेटिंग में, मॉडल स्पॉट हेरफेर करना सीखते हैं और इसका विरोध करते हैं। यह भविष्य की प्रणालियों को सुनिश्चित करने की दिशा में एक महत्वपूर्ण कदम है जो वास्तविक दुनिया के संवादात्मक परिदृश्यों में दुर्भावनापूर्ण चालों के लिए नहीं आते हैं।

मिथुन 3 प्रो और फ्लैश - सभी श्रेणियों में नेता

मंच के विस्तार के बाद, डेवलपर्स ने तुरंत रैंकिंग को अद्यतन किया। Google के मॉडल - मिथुन 3 प्रो और Gemini 3 Flash - सभी खेल विषयों में शीर्ष स्थान लिया। इससे पता चलता है कि वे तर्क, सामाजिक समझ और संतुलित तरीके से अनिश्चितता के साथ काम करने की क्षमता को जोड़ते हैं।

गूगल डीपमिण्ड सीईओ डेमीस हासबिस का मानना है कि क्लासिक बेंचमार्क अब आधुनिक एआई क्षमताओं की पूरी तस्वीर प्रदान नहीं करते हैं। अधिक कठोर और विविध चुनौतियों की जरूरत है कि जटिल, जीवन की तरह स्थितियों में जगह मॉडल। गेम एरिना जैसे गेम-आधारित परीक्षण एक ऐसा उपकरण है।

नई चुनौतियों के बीच मिथुन 3 प्रो और फ्लैश की सफलता एक अच्छा संकेत है। इसका मतलब है कि Google के प्रशिक्षण मॉडल के दृष्टिकोण, न केवल ज्ञान पर बल्कि व्यवहारिक परिदृश्यों पर जोर देने के साथ, परिणाम प्रदान कर रहा है। यह देखा जा सकता है कि प्रतियोगी गेम टूर्नामेंट के अगले दौर में इस चुनौती को बढ़ा सकते हैं या नहीं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
मिथुन 3 प्रो और फ्लैश गेमिंग एआई रेटिंग के नेता हैं