Muse Glimmer क्या है?
मेटा ने एक नया मॉडल जारी किया है, Muse Glimmer, ओपन सोर्स के रूप में - एक 30-billion-parameter एजेंट जिसे क्लाउड क्लस्टर के बजाय सीधे उपयोगकर्ता GPU पर चलाने के लिए डिज़ाइन किया गया है। रिलीज अपाचे 2.0 लाइसेंस के तहत वितरित की जाती है, और रिलीज अपाचे 2.0 लाइसेंस के तहत वितरित की जाती है। मॉडल भार हगिंग फेस पर सुपरइंटेलिजेंस लैब्स द्वारा प्रकाशित किया गया था। ओपन लाइसेंस का मतलब डेवलपर्स स्वतंत्र रूप से मॉडल को उनके अनुप्रयोगों में एम्बेड कर सकते हैं, इसे ठीक-ट्यून कर सकते हैं, और इसे अनिवार्य रॉयल्टी के बिना वाणिज्यिक उत्पादों में उपयोग कर सकते हैं।
मुख्य शर्त है ऑन-डिवाइस परिदृश्य, यानी, उपयोगकर्ता के डिवाइस पर स्थानीय रूप से डेटा संसाधित करना। यह विशेष रूप से व्यक्तिगत एजेंटों के लिए महत्वपूर्ण है जिन्हें शेड्यूल, संदेश, फ़ाइलों और अन्य निजी संदर्भों तक पहुंच की आवश्यकता होती है। जब कोई भी उपकरण छोड़ देता है, तो गोपनीयता और जिम्मेदारी दोनों को सुनिश्चित करना आसान है। Muse Glimmer एक बहुमुखी वर्कहॉर्स के रूप में स्थित है: इसका उपयोग स्थानीय कोड जनरेशन, फंक्शन कॉलिंग, बिल्डिंग स्वायत्त एजेंट के लिए किया जा सकता है, और यहां तक कि LLM-a-judge मोड में अन्य भाषा मॉडल की प्रतिक्रियाओं का मूल्यांकन भी किया जा सकता है।

एजेंट स्तर: जीत और गुफाएं
मेटा दावा करता है कि Muse Glimmer दो प्रतियोगियों outperforms — Gemma4-31B गूगल से Qwen3.6-27B से in the पांच out आठ सामान्य परीक्षणों का। उदाहरण के लिए, एमसीपी एटलस में (बाहरी उपकरणों के साथ काम करने का एक परीक्षण), यह अपने प्रतिद्वंद्वियों के लिए 75.5 बनाम 54.2 और 62.5 स्कोर करता है। In DeepSearch QA - 74.6 बनाम 61.7 और 71.1। बैंकिंग परिचालनों (τ2-Banking): 23.5 बनाम 15.1 और 16.7 परीक्षण में भी उल्लेखनीय अंतर है। Muse Glimmer भी WildClawBench (47.6 बनाम 37.6 और 43.2) और GAIA2 (43.3 बनाम 36.4 और 40.0).
इस बीच, Qwen3.6-27B तीन टेस्ट लेता है: GDPval-AA (1141 बनाम 953 Muse Glimmer के लिए), SkillsBench with Skills (46.6 बनाम 44.3), and OSWorld-Verified (75.6 बनाम 65.9 और 58.5). समीक्षा लेखकों ने तुरंत ध्यान दिया कि इस तरह के बेंचमार्क काफी संकीर्ण कौशल को मापते हैं और यह नहीं दिखाते कि कैसे मॉडल वास्तव में फ़ाइलों, कैलेंडर, मैसेंजर और आंतरिक संगठनात्मक उपकरणों के साथ संयोजन में व्यवहार करेगा। इसलिए संख्याओं में अंतराल वास्तविक दुनिया की स्थितियों में सफलता की गारंटी की तुलना में एक दिशानिर्देश से अधिक है।

कोडिंग और टूल का उपयोग
प्रोग्रामिंग में, Muse Glimmer भी आश्वस्त दिखता है। एसडब्ल्यूई-बेंच प्रो बेंचमार्क पर, जो वास्तविक गिटहब मुद्दों को हल करने का परीक्षण करता है, यह 51.2 स्कोर करता है - जेम्मा4-31B के 36.9 और यहां तक कि Qwen3.6-27B के 50.2 से भी अधिक है। SciCode पर, परिणाम लगभग बराबर हैं: 43.6 Muse Glimmer बनाम 43.4 के लिए जेमा और 39.8 Qwen के लिए। लेकिन SWE-बेंच सत्यापित और टर्मिनलबेंच 2.1 पर, Qwen ने क्रमशः 77.2 बनाम 76.0 और 60.7 बनाम 51.7, ले लिया।
Muse Glimmer OpenClaw का समर्थन करता है, ऑर्केस्ट्रेटिंग एजेंट के लिए एक लोकप्रिय ढांचा, साथ ही अन्य एजेंट प्रबंधन पैटर्न; कस्टम मचान में वर्णित हैं आधिकारिक प्रलेखन एक महत्वपूर्ण nuance: मॉडल में रिट्री ट्रेनिंग शामिल है - यह असफल कॉल के बाद पुनः खोज उपकरण कर सकता है। डेवलपर के लिए, यह एक प्लस है, लेकिन यह एक जिम्मेदारी भी है: रिट्रीज़ को नियंत्रित करने की आवश्यकता है, खासकर अगर एजेंट को कोडबेस या बाहरी सिस्टम तक पहुंच मिलती है, तो अन्यथा आप अवांछित साइड इफेक्ट्स को जल्दी से जमा कर सकते हैं।
OpenClaw - वास्तव में इस बारे में है: एक खुला पारिस्थितिकी तंत्र जहां मॉडल मस्तिष्क बन जाता है, न सिर्फ एक पाठ जनरेटर।
बॉक्स से बाहर बहुसंख्यकता
Muse Glimmer एक समर्पित अवधारणात्मक एन्कोडर के माध्यम से interleaved पाठ और छवियों को स्वीकार कर सकते हैं। चार्सिव रीजनिंग बेंचमार्क पर, यह स्कोर 78.8 — थोड़ा ऊपर Gemma4-31B (77.7) और Qwen3.6-27B (78.4). स्क्रीनस्पॉट प्रो पर, जो GUI समझ का मूल्यांकन करता है, Qwen 76.1 की ओर जाता है, जबकि Muse Glimmer 75.4 (Gemma — 75.9) हो जाता है। OmniDocBench v1.5, Qwen फिर से (77.8) पर दस्तावेज़ मान्यता में, जबकि Muse Glimmer स्कोर 75.8 और Gemma 72.5. जटिल एमएमएमयू प्रो परीक्षा में परिणाम करीब हैं: 75, 74 और 73 क्यूवेन के पक्ष में।
व्यावहारिक टेकअवे: मॉडल आत्मविश्वास से मिश्रित इनपुट को संभालता है, जो एक एजेंट के लिए महत्वपूर्ण है जो चैट में "देखें" स्क्रीनशॉट, स्कैन और छवियों की आवश्यकता होती है।

सुरक्षा: व्यापार बंद
सुरक्षा चित्र मिश्रित है। CI Memories परीक्षण पर, जो जांचता है कि कितनी अच्छी तरह से मॉडल लंबी अवधि की स्मृति में निजी डेटा को बरकरार रखता है, Muse Glimmer 64.8% कवरेज पर 26.4% उल्लंघन है। Gemma4-31B में लगभग आधा उल्लंघन (12.1%) है, लेकिन कम कवरेज (53.0%) भी है। Qwen जोखिम भरा हो जाता है: 66.9% की अधिकतम कवरेज के साथ 53.4% पर उल्लंघन। सरेन एजेंटडोजो परीक्षण पर, जो हमलों के लिए लचीलापन का मूल्यांकन करता है, म्यूज़ Glimmer एक 28.4% हमले की सफलता दर और 94.2% उपयोगिता दिखाता है। जेमा के लिए, हमले अक्सर (25.6%) कम होते हैं, जबकि क्यूवेन के लिए - अक्सर (40.3%)।
तो Muse Glimmer कार्यक्षमता और सुरक्षा के बीच संतुलन प्रदान करता है: यह वास्तव में Qwen की तुलना में सुरक्षित है लेकिन इस विशेष परिदृश्य में Gemma के पीछे गिर जाता है। स्थानीय उपयोग के लिए, यह महत्वपूर्ण नहीं है, लेकिन वास्तविक प्रणालियों में तैनात होने पर विचार करना उचित है।
निष्कर्ष: स्थानीय संप्रभुता पर शर्त
Muse Glimmer सिर्फ एक और खुला मॉडल नहीं है - यह उपयोगकर्ता के पक्ष में एजेंटिक कार्यों के वजन को स्थानांतरित करने का प्रयास है। यह एजेंटिक और कोडिंग बेंचमार्क में परिणाम को आश्वस्त करता है, मल्टीमोडल डेटा को संभालता है और एक उचित सुरक्षा समझौता प्रदान करता है। कई परीक्षणों में Qwen को नुकसान हमें याद दिलाता है कि सार्वभौमिकता जैसी कोई चीज नहीं है और मॉडल विकल्प विशिष्ट कार्य पर निर्भर करता है।
लेकिन मुख्य परिवर्तन दार्शनिक है। इससे पहले, एआई एजेंट शक्तिशाली सर्वर और विशाल एपीआई बिल से जुड़े थे। अब, एक 30 बिलियन-पैरामीटर मॉडल जो जटिल कार्यों को करने में सक्षम है, एक साधारण GPU पर रहता है - और यह उन अनुप्रयोगों के लिए द्वार खोलता है जहां गोपनीयता क्लाउड की बेड़े की शक्ति से अधिक होती है। और ओपन कोड और अपाचे 2.0 लाइसेंस किसी भी डेवलपर को स्थानीय रूप से ऐसे एजेंट को चलाने की अनुमति देता है - और यहां से स्थानीय सॉफ्टवेयर की एक नई लहर शुरू होती है।



