Muse Glimmer by Meta: 30B-level agen AI sekarang berjalan di GPUs biasa

20 Agustus 202619 tampilan

Meta terbuka sumber Muse model Glimmer dengan 30 miliar parameter skenario di mana agen berjalan langsung pada perangkat: dari kode menulis untuk mengakses kalender dan pesan. Di benchmark, kadang mengalahkan Gemma431B dan Qwen3.627B, tapi dalam tugas keamanan dan sejumlah tes multimodal, pesaing terbukti lebih kuat.

Muse Glimmer by Meta: 30B-level agen AI sekarang berjalan di GPUs biasa

Apa itu Muse Glimmer

Meta telah merilis model baru, Muse Glimmer, sebagai open source - sebuah 30- billion-parameter agen dirancang untuk menjalankan langsung pada pengguna GPU daripada di cluster awan. Rilis didistribusikan di bawah lisensi Apache 2.0, dan Bobot model diterbitkan oleh Superintelligence Labs di Hugging Face. Lisensi terbuka berarti pengembang dapat secara bebas embed model ke aplikasi mereka, fine- tune itu, dan menggunakannya dalam produk komersial tanpa royalti wajib.

Taruhan utama adalah pada skenario on- perangkat, yaitu, memproses data lokal pada perangkat pengguna. Hal ini terutama penting bagi agen pribadi yang membutuhkan akses ke jadwal, pesan, berkas, dan konteks pribadi lainnya. Ketika semua ini tidak meninggalkan perangkat, lebih mudah untuk memastikan baik privasi dan responsif. Muse Glimmer diposisikan sebagai kuda kerja serbaguna: dapat digunakan untuk pembuatan kode lokal, panggilan fungsi, membuat agen otonom, dan bahkan mengevaluasi model bahasa lain 'tanggapan dalam mode LLM-as- a - hakim.

Agentik tingkat: menang dan caveats

Pada benchmark agentic, Meta mengklaim bahwa Muse Glimmer outplays dua pesaing - Gemma4- 31B dari Google dan Qwen3.6-27B dari Alibaba - dalam lima keluar delapan tes umum. Sebagai contoh, di MCP Atlas (tes kerja dengan alat eksternal), nilainya 75.5 vs 54.2 dan 62,5 untuk saingannya. Di DeepSearch QA - 74.6 melawan 61.7 dan 71.1. Ada juga kesenjangan yang dapat dilihat dalam tes simulasi operasi perbankan (yaku² -Banking): 23.5 vs 15.1 dan 16.7. Muse Glimmer juga menarik ke depan di WildClawBench (47.6 vs. 37.6 dan 43.2) dan GAIA2 (43.3 melawan 36.4 dan 40.0).

Sementara itu, Qwen3.627B menerima tiga tes: GDPval- AA (111 vs 953 untuk Muse Glimmer), SkillsBench dengan Skills (46.6 vs 44.3), dan OSWorld- Verifikasi (75.6 vs 65.9 dan 58.5). Penulis review mencatat bahwa benchmark seperti mengukur keterampilan cukup sempit dan tidak menunjukkan bagaimana model akan berperilaku dalam kombinasi dengan berkas, kalender, utusan, dan alat-alat organisasi internal. Jadi kesenjangan dalam angka lebih dari pedoman daripada jaminan keberhasilan dalam kondisi dunia nyata.

Penggunaan koding dan alat

Dalam pemrograman, Muse Glimmer juga terlihat percaya diri. Pada SWE-Bench Pro benchmark, yang menguji pemecahan isu GitHub yang sebenarnya, nilainya 51.2 - lebih tinggi dari Gemma4- 31B 36.9 dan bahkan Qwen3.6- 27B 50.2. Pada SciCode, hasilnya hampir sama: 43.6 untuk Muse Glimmer melawan 43.4 untuk Gemma dan 39.8 untuk Qwen. Tapi pada SWE-Bench Verifikasi dan TerminalBench 2.1, Qwen memimpin: 77.2 melawan 76.0 dan 60.7 melawan 51.7, secara terhormat.

Muse Glimmer mendukung OpenClaw, kerangka kerja populer untuk mengatur agen, serta pola manajemen agen lainnya; scaffolds kustom dijelaskan dalam dokumentasi resmi. Nuansa penting: model termasuk pelatihan coba ulang - dapat kembali permintaan alat setelah panggilan gagal. Untuk seorang pengembang, ini adalah sebuah plus, tapi ini juga merupakan tanggung jawab: mengulang-ulang perlu dikendalikan, terutama jika agen mendapatkan akses ke sistem kodebase atau eksternal, jika tidak, anda dapat dengan cepat mengumpulkan efek samping yang tidak diinginkan.

OpenClaw - adalah persis tentang hal ini: sebuah ekosistem terbuka di mana model menjadi otak, bukan hanya sebuah generator teks.

Multimodalitas keluar dari kotak

Muse Glimmer dapat menerima teks dan gambar interleaved melalui enkoder perseptual yang berdedikasi. Pada Charxiv Reasoning benchmark, itu mencetak 78,8 - sedikit di atas Gemma4- 31B (77,7) dan Qwen3.6- 27B (78.4). Di ScenSpot Pro, yang mengevaluasi pemahaman GUI, Qwen memimpin dengan 76.1, sementara Muse Glimmer mendapat 75.4 (Gemma - 75.9). Dalam pengakuan dokumen OmniDocBench v1.5, Qwen lagi memimpin (77,8), sementara Muse Glimmer skor 75.8 dan Gemma 72,5. Pada ujian MMMU Pro yang kompleks, hasilnya dekat: 75, 74, dan 73 mendukung Qwen.

Pengambilan praktis: model dengan percaya diri menangani masukan campuran, yang penting bagi agen yang perlu "lihat" cuplikan layar, scan, dan gambar dalam percakapan.

Keselamatan: trade-off

Gambar keamanan dicampur. Pada tes memori CI, yang memeriksa seberapa baik model mempertahankan data pribadi dalam memori jangka panjang, Muse Glimmer memiliki 26.4% pelanggaran pada 64.8% cakupan. Gemma4- 31B memiliki hampir setengah pelanggaran (12.1%), tetapi juga cakupan lebih rendah (53.0%). Qwen ternyata paling berisiko: pelanggaran sebesar 53,4% dengan cakupan maksimum 66.9%. Pada tes Siren AgentDojo, yang mengevaluasi ketahanan untuk menyerang, Muse Glimmer menunjukkan 28.4% serangan tingkat keberhasilan dan utilitas 94.2%. Untuk Gemma, serangan berhasil sedikit lebih jarang (25.6%), sementara untuk Qwen - jauh lebih sering (40.3%).

Jadi Muse Glimmer menawarkan keseimbangan antara fungsi dan perlindungan: lebih aman daripada Qwen tapi berada di belakang Gemma dalam skenario ini. Untuk penggunaan lokal, ini tidak penting, tapi itu layak mempertimbangkan ketika menyebar dalam sistem nyata.

Kesimpulan: taruhan untuk kedaulatan lokal

Muse Glimmer bukan hanya model terbuka lain - itu adalah upaya untuk menggeser berat tugas agentic ke sisi pengguna. Ini menunjukkan hasil yang meyakinkan dalam agentic dan coding benchmark, menangani data multimodal, dan menawarkan kompromi keselamatan yang wajar. Kehilangan Qwen dalam beberapa tes mengingatkan kita bahwa tidak ada hal seperti universalitas, dan pilihan model tergantung pada tugas tertentu.

Tapi perubahan utama adalah filosofis. Sebelumnya, agen AI dikaitkan dengan server kuat dan tagihan API besar. Sekarang, model 30.000- parameter yang mampu melakukan aksi kompleks hidup pada GPU biasa - dan yang membuka pintu ke aplikasi di mana privasi lebih penting daripada kekuatan sekilas awan. Dan lisensi terbuka dan Apache 2.0 memungkinkan setiap pengembang untuk menjalankan seperti agen lokal - dan dari sini memulai gelombang baru perangkat lunak lokal.

Pertanyaan yang sering ditanyakan

Muse Glimmer by Meta Review of the AI agent on 30B parameter