Muse Glimmer от Meta: ИИ-агенты уровня 30B теперь живут на обычных видеокартах

20 августа 20260 просмотров

Открытая модель Muse Glimmer от Meta с 30 миллиардами параметров нацелена на сценарии, где агент работает прямо на устройстве: от написания кода до доступа к календарю и сообщениям. По бенчмаркам она местами обходит Gemma4-31B и Qwen3.6-27B, но в задачах безопасности и ряде мультимодальных тестов конкуренты оказываются сильнее.

Muse Glimmer от Meta: ИИ-агенты уровня 30B теперь живут на обычных видеокартах

Что такое Muse Glimmer

Meta выложила в открытый доступ новую модель Muse Glimmer — 30-миллиардного агента, который рассчитан на запуск прямо на пользовательских видеокартах, а не в облачных кластерах. Релиз распространяется под лицензией Apache 2.0, а веса модели опубликовала компания Superintelligence Labs на платформе Hugging Face. Открытая лицензия означает, что разработчики могут свободно встраивать модель в свои приложения, дорабатывать её и использовать в коммерческих продуктах без обязательных отчислений.

Главная ставка сделана на on-device сценарии, то есть обработку данных локально на устройстве пользователя. Это особенно важно для персональных агентов, которым нужен доступ к расписанию, сообщениям, файлам и другому приватному контексту. Когда всё это не уходит в облако, проще обеспечивать и конфиденциальность, и скорость реакции. Muse Glimmer позиционируется как универсальная рабочая лошадка: её можно задействовать для локального написания кода, вызова функций, построения автономных агентов и даже для оценки ответов других языковых моделей в режиме LLM-as-a-judge.

Агентский уровень: победы и оговорки

По агентским бенчмаркам Meta заявляет, что Muse Glimmer опережает двух конкурентов — Gemma4-31B от Google и Qwen3.6-27B от Alibaba — в пяти из восьми общих тестов. Например, в MCP Atlas (тест на умение работать с внешними инструментами) у неё 75,5 балла против 54,2 и 62,5 у соперников. В DeepSearch QA — 74,6 против 61,7 и 71,1. Заметный разрыв и в тестах, имитирующих банковские операции (τ²-Banking): здесь 23,5 против 15,1 и 16,7. Также Muse Glimmer вырывается вперёд в WildClawBench (47,6 против 37,6 и 43,2) и GAIA2 (43,3 против 36,4 и 40,0).

При этом Qwen3.6-27B забирает три теста: GDPval-AA (1141 против 953 у Muse Glimmer), SkillsBench with Skills (46,6 против 44,3) и OSWorld-Verified (75,6 против 65,9 и 58,5). Авторы обзора справедливо замечают: подобные бенчмарки замеряют довольно узкие навыки, и они не показывают, как модель реально поведёт себя в связке с файлами, календарями, мессенджерами и внутренними инструментами организации. Так что разрывы в цифрах — это скорее ориентир, чем гарантия успеха в боевых условиях.

Кодинг и работа с инструментами

В программировании Muse Glimmer тоже смотрится уверенно. На бенчмарке SWE-Bench Pro, который проверяет решение реальных задач из GitHub, она получает 51,2 — заметно больше, чем 36,9 у Gemma4-31B и даже чем 50,2 у Qwen3.6-27B. В тесте SciCode результаты почти равны: 43,6 у Muse Glimmer против 43,4 у Gemma и 39,8 у Qwen. А вот на SWE-Bench Verified и TerminalBench 2.1 лидирует уже Qwen: 77,2 против 76,0 и 60,7 против 51,7 соответственно.

Muse Glimmer поддерживает OpenClaw — популярный фреймворк для оркестрации агентов, а также другие паттерны управления ими; кастомные сценарии (scaffolds) описаны в официальной документации. Важный нюанс: в модели заложен retry training — она умеет перезапрашивать инструменты после неудачных вызовов. Для разработчика это плюс, но одновременно и зона ответственности: повторные попытки нужно контролировать, особенно если агент получает доступ к кодовой базе или внешним системам, иначе можно быстро наловить лишних побочных эффектов.

OpenClaw — именно про это: открытая экосистема, где модель становится мозгом, а не просто генератором текста.

Мультимодальность из коробки

Muse Glimmer умеет принимать перемежающиеся текст и изображения через специальный перцепционный энкодер. На бенчмарке Charxiv Reasoning она набирает 78,8 — чуть выше Gemma4-31B (77,7) и Qwen3.6-27B (78,4). В тесте ScreenSpot Pro, который оценивает понимание графических интерфейсов, впереди Qwen с 76,1, а Muse Glimmer получает 75,4 (у Gemma — 75,9). В распознавании документов OmniDocBench v1.5 снова лидирует Qwen (77,8), тогда как у Muse Glimmer — 75,8, а у Gemma — 72,5. По сложному экзамену MMMU Pro результаты близки: 75, 74 и 73 в пользу Qwen.

Практический вывод: модель уверенно справляется со смешанными входами, что критично для агента, который должен «видеть» скриншоты, сканы и изображения в чатах.

Безопасность: компромиссы

С безопасностью картина неоднозначная. На тесте CI Memories, который проверяет, насколько модель сохраняет приватные данные в долгой памяти, у Muse Glimmer нарушений 26,4% при покрытии 64,8%. У Gemma4-31B нарушений почти вдвое меньше (12,1%), но и покрытие ниже (53,0%). Qwen оказывается самым рискованным: нарушения на уровне 53,4% при максимальном покрытии 66,9%. В тесте Siren AgentDojo, где оценивается устойчивость к атакам, Muse Glimmer показывает успешность атак 28,4% и полезность (utility) 94,2%. У Gemma атаки проходят чуть реже (25,6%), а у Qwen — намного чаще (40,3%).

То есть у Muse Glimmer — баланс между функциональностью и защитой: она заметно безопаснее Qwen, но уступает Gemma в этом отдельном сценарии. Для локального использования это некритично, но при развёртывании в реальных системах стоит учитывать.

Выводы: ставка на локальный суверенитет

Muse Glimmer — не просто очередная открытая модель, а попытка перенести тяжесть агентских задач на сторону пользователя. Она показывает убедительные результаты в агентских и кодовых бенчмарках, умеет работать с мультимодальными данными и предлагает разумный компромисс по безопасности. Проигрыши Qwen в ряде тестов напоминают: универсальности не бывает, и выбор модели зависит от конкретной задачи.

Но главное изменение — философское. Раньше ИИ-агенты ассоциировались с мощными серверами и огромными счетами за API. Теперь 30-миллиардная модель, способная выполнять сложные действия, живёт на обычной видеокарте — и это открывает дорогу приложениям, где приватность важнее облачной сиюминутной мощи. А открытый код и Apache 2.0 позволяют любому разработчику поднять такого агента у себя — и уже отсюда начинается новая волна локального софта.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Muse Glimmer от Meta: обзор ИИ-агента на 30B параметров