什么是缪斯闪电
Meta发布了一个新的模型, 缪斯闪烁,作为开源——一个300亿参数的代理设计,可以直接运行在用户GPU上,而不是在云群中运行. Apache 2.0 许可证下发布, 模型权重由超智能实验室发布于Hugging Face上. 开放许可证意味着开发者可以自由地将模型嵌入他们的应用中,对其进行微调,并在没有强制版税的商业产品中使用.
主要赌注是 上设备,即本地处理用户设备上的数据。 这对于需要访问时间表、信息、文件和其他私人背景的个人代理人尤为重要。 当这些都没有离开设备时,就更容易确保隐私和反应能力. Muse Glimer被定位为多功能的工作马:它可以用于本地代码生成,函数调用,构建自主代理,甚至以LLM-as-a-judge模式评价其他语言模型的响应.

代理级别:胜负和警告
在代理基准方面,Meta声称Muse Glimme胜过两个竞争者—— Gemma4-31B 数据 从谷歌和 中文无 来自阿里巴巴,五分之一 8项一般性测试。 例如,在MCP Atlas(使用外部工具的测试)中,它的对手得分为75.5比54.2和62.5。 在DeepSearch QA中——74.6对61.7和71.1。 在模拟银行业务的测试中也存在明显差距("2·2-银行"):23.5对15.1和16.7. Muse Glimmer也在WildClaw Bench(47.6对37.6和43.2)和GAIA2(43.3对36.4和40.0)中领先.
同时,Qwen3.6-27B进行了三次测试:GDPval-AA(1141对953对Muse Glimer),技能本奇(46.6对44.3)和OSWorld-Verifed(75.6对65.9和58.5). 评论作者正确地指出,这些基准衡量的是相当狭窄的技能,而不表明模型如何与文件、日历、信使和内部组织工具相结合。 因此,数字差距更多的是一种准则,而不是在现实世界条件下保证成功。

编码和工具使用
在编程中,缪斯·格利默也显得自信. 在SWE-Bench Pro基准上,测试解决真正的GitHub问题,它得分51.2——明显高于Gemma4-31B的36.9,甚至Quen3.6-27B的50.2. 在SciCode上,结果几乎相等:Muse Glimmer43.6对Gemma43.4,Quen39.8对. 但在SWE-Bench Verifed和Terminal Bench 2.1上,Quen分别领先:77.2对76.0和60.7对51.7.
Muse Glimmer支持OpenClaw,这是管弦乐代理的流行框架,以及其他代理管理模式;定制脚手架在其中描述 正式文件。 一个重要的细微之处:模型包括复试训练——在失败的呼叫后可以重新请求工具. 对于开发者来说,这是一个附加,但也是一种责任:重试需要被控制,特别是如果代理机能够访问一个代码库或外部系统,否则可以迅速积累不必要的副作用.
OpenClaw ——正是关于这一点:一个开放的生态系统,模型在那里变成了大脑,而不仅仅是文本生成器.
箱外的多式联运
Muse Glimer可以通过专用的透视编码器接受互页文本和图像. 在Charxiv原因基准上,它得分78.8——略高于Gemma4-31B(77.7)和Qune3.6-27B(78.4). 在评价GUI理解的ScreenSpot Pro上,Quen领先76.1,而Muse Glimmer获得75.4(Gemma–75.9). 在OmniDoc Bench v1.5上的文档识别中,Quen再次领先(77.8),而Muse Glimmer则得分75.8和Gemma72.5. 在复杂的MMMU Pro考试上,成绩接近:75,74,和73,对Quen有利.
实用的外卖:模型自信地处理混合输入,这对需要"看到"截图,扫描,聊天中的图像的代理来说至关重要.

安全:权衡
安全情况参差不齐。 在CI Memories测试中(该测试检查模型在长期内存中保留私人数据的程度),Muse Glimmer有26.4%的违规率,覆盖率为64.8%. Gemma4-31B有近一半的侵权行为(12.1%),但覆盖率较低(53.0%)。 Quen证明风险最大:违规率为53.4%,最高覆盖率为66.9%。 在Siren Agent Dojo测试中评价了抵御攻击的能力,Muse Glimmer显示28.4%的攻击成功率和94.2%的效用. 对Gemma来说,攻击成功的次数略少(25.6%),而对Quen来说则多得多(40.3%)。
因此Muse Glimmer提供了功能与保护之间的平衡:它明显比Quen安全,但在这种特殊情况下却落后于Gemma. 对于本地使用来说,这并不重要,但是在实际系统部署时值得考虑.
结论:关于地方主权的赌注
Muse Glimmer不仅仅是另一个开放型号——这是试图将代理任务的重量转移到用户一方. 它显示在代理和编码基准、处理多式联运数据以及提供合理的安全妥协方面取得了令人信服的结果。 Qwen在几个测试中的损失提醒我们,不存在普遍性,模型选择取决于具体的任务.
但主要变化是哲学. 以前,AI代理与强大的服务器和巨大的API账单有关. 现在,一个能够执行复杂动作的300亿参数模型生活在普通的GPU上——这为隐私比云的瞬间动力更重要的应用打开了大门. 而开放代码和Apache 2.0许可允许任何开发者在当地运行这样的代理——从这里开始新的本地软件浪潮.



