Muse Glimmer by Meta: 30B-level AI agents now run on ordinary GPUs

20 أغسطس 202619 الآراء

نموذج (ميتا) المفتوح المصدر (ماوس غليمر) مع 30 مليار بارامتر يُستهدف السيناريوهات حيث يعمل العميل مباشرة على الجهاز من الكتابة الرمزية In benchmarks, it sometimes outperforms Gemma4-31B and Qwen3.6-27B, but in safety tasks and a number of multimodal tests, competitors prove stronger.

Muse Glimmer by Meta: 30B-level AI agents now run on ordinary GPUs

(ماوس غليمر)

(ميتا) أصدرت نموذجاً جديداً Muse Glimmerكمصدر مفتوح - عامل من عيار 30 ملياراً مصمم لتشغيله مباشرة على وحدات التوزيع العالمي بدلاً من المجموعات السحابية. ويوزع الإفراج بموجب رخصة " أباتشي " 2.0، و " نُشرت الأوزان النموذجية من قبل مختبرات التليفزيون على وجه الهضم. والرخصة المفتوحة تعني أن بإمكان المطورين أن يدمجوا النموذج بحرية في تطبيقاتهم، وأن يضبطوه، وأن يستخدموه في المنتجات التجارية دون إتاوات إلزامية.

الرهان الرئيسي هو على سيناريوهات الرفع، أي تجهيز البيانات محليا على جهاز المستخدم. ويكتسي هذا الأمر أهمية خاصة بالنسبة للوكلاء الشخصيين الذين يحتاجون إلى الوصول إلى جداول زمنية ورسائل وملفات وغير ذلك من السياق الخاص. عندما لا يترك أي من هذا الجهاز، فمن الأسهل ضمان الخصوصية والاستجابة على حد سواء. Muse Glimmer is positioned as a versatile workhorse: it can be used for local code generation, function calling, building autonomous agents, and even evaluating other language models' responses in an LLM-as-a-judge mode.

المستوى العميل: الفوز والهجوم

On agentic benchmarks, Meta claims that Muse Glimmer outperforms two competitors - Gemma4-31B من غوغل Qwen3.6-27B من العليبا - في خمسة ثمانية اختبارات عامة فعلى سبيل المثال، يسجل في نظام أطلس (اختبار العمل بأدوات خارجية) 75.5 مقابل 54.2 و 62.5 بالنسبة لمنافسيه. In DeepSearch QA - 74.6 versus 61.7 and 71.1. وهناك أيضا فجوة ملحوظة في الاختبارات التي تحفيز العمليات المصرفية 23.5 مقابل 15.1 و 16.7. Muse Glimmer also drags ahead in WildClaw Bench (47.6 versus 37.6 and 43.2) and GAIA2 (43.3 versus 36.4 and 40.0).

وفي غضون ذلك، تجري شركة Qwen3.6-27B ثلاثة اختبارات هي: الناتج المحلي الإجمالي - ألف (1141 مقابل 953 لمتجر غليمر)، وسكيلز بينش مع المهارات (46.6 مقابل 44.3)، وشركة OOS World-Verified (75.6 مقابل 65.9 و58.5). ويشير أصحاب الاستعراض عن حق إلى أن هذه المعايير تقيس المهارات الضيقة إلى حد ما ولا تبين كيف سيتصرف النموذج في الواقع بالاقتران مع الملفات، والتقويم، والرعاة، والأدوات التنظيمية الداخلية. لذا فإن الثغرات في الأرقام هي أكثر من ضمان النجاح في ظروف العالم الحقيقي.

الترميز واستخدام الأدوات

وفي البرمجة، يبدو ماوس غليمر أيضا واثقا. على معيار SWE-Bench Pro، الذي يختبر حل قضايا جيت هوب الحقيقية، يسجل 51.2 - On SciCode, results are nearly equal: 43.6 for Muse Glimmer versus 43.4 for Gemma and 39.8 for Qwen. But on SWE-Bench Verified and TerminalBench 2.1, Qwen takes the lead: 77.2 versus 76.0 and 60.7 against 51.7, respectively.

Muse Glimmer supports OpenClaw, a popular framework for orchestrating agents, as well as other agent management patterns; custom scaffolds are described in the الوثائق الرسمية. An important nuance: the model includes retry training - it can re-request tools after failed calls. بالنسبة لمطور، هذا مضاف، لكنه أيضا مسؤولية: يجب السيطرة على عمليات الإنقاذ، خاصة إذا حصل العميل على قاعدة بيانات أو أنظمة خارجية،

OpenClaw - هو بالضبط حول هذا: نظام إيكولوجي مفتوح حيث يصبح النموذج الدماغ، وليس مجرد مولد للنص.

التعددية خارج الصندوق

(ماوس غليمر) يمكنه أن يقبل النص والصور المتقطعة من خلال جهاز مُكرّس للتصوير الافتراضي. وفيما يتعلق بمؤشر " تشاركسيف " ، فإنه يبلغ ٧٨,٨ - أعلى قليلا من جيما٤ - ٣١ باء )٧٧٧( وكين٣,٦ - ٢٧ باء )٧٨-٤(. On ScreenSpot Pro, which evaluates GUI understanding, Qwen leads with 76.1, while Muse Glimmer get 75.4 (Gemma — 75.9). In document recognition on OmniDocBench v1.5, Qwen again leads (77.8), while Muse Glimmer scores 75.8 and Gemma 72.5. في إم إم إم إم إم إم إم إم إم إم إم إم إم الإختبار المعقد، النتائج قريبة: 75، 74، و 73 في خدمة كوين.

المأزق العملي، النموذج يتعامل بثقة مع مدخلات مختلطة، وهو أمر حاسم بالنسبة لوكيل يحتاج إلى "انظر" الشاشات، والمسح الضوئي، والصور في الدردشة.

السلامة: المقايضة

صورة الأمان مختلطة On the CI Memories test, which checks how well the model retains private data in long-term memory, Muse Glimmer has 26.4% violations at 64.8% coverage. ويناهز عدد الخروقات (12.1 في المائة) نصف عدد الانتهاكات (53.0 في المائة). واتضح أن كوين هي الأكثر عرضة للخطر: إذ أن الانتهاكات تبلغ 53.4 في المائة، وتبلغ التغطية القصوى 66.9 في المائة. On the Siren agentDojo test, which evaluates resilience to attacks, Muse Glimmer shows a 28.4% attack success rate and 94.2% utility. وبالنسبة لجيما، فإن الهجمات تنجح بشكل أقل قليلا )٢٥,٦ في المائة(، بينما تنجح بالنسبة لكوين - في كثير من الأحيان )٤٠,٣ في المائة(.

إذاً (ماوس غليمر) يقدم توازناً بين الوظيفة والحماية، إنه أكثر أماناً من (كوين) من أجل الاستخدام المحلي، هذا ليس بالغ الأهمية، لكنه يستحق النظر عند نشر في النظم الحقيقية.

الاستنتاجات: رهان على السيادة المحلية

(ماوس غليمر) ليس فقط نموذج مفتوح آخر بل محاولة لنقل وزن المهام العميلة إلى جانب المستخدم وهو يبين نتائج مقنعة في النقاط المرجعية للعوامل والترميز، ويعالج البيانات المتعددة الوسائط، ويقدم حلا وسطا معقولا للسلامة. الخسائر التي لحقت بـ(كوين) في عدة اختبارات تذكرنا أنه لا يوجد شيء مثل الشمولية والخيار النموذجي يعتمد على المهمة المحددة

لكن التغيير الرئيسي فلسفي سابقاً، كان عملاء منظمة العفو الدولية مرتبطين بخواديم قوية وفواتير ضخمة من شركة AI. الآن، نموذج 30 بليون بارامتر قادر على القيام بأعمال معقدة يعيش على وحدة عامة عادية والرمز المفتوح ورخصة Apache 2.0 تسمح لأي مطور بإدارة هذا الوكيل محليا - ومن هنا يبدأ موجة جديدة من البرامج المحلية.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
Muse Glimmer by Meta Review of the AI agent on 30B parameters