Pengumuman dan nomor headline
Pada tanggal 14 Agustus, Zhipu (juga dikenal sebagai Z.ai) terselubung GLM-5.3, model fokus pada pemrograman. Dalam rilis teknis, itu segera membandingkan model baru dengan terkemuka internasional perkembangan. Centerpiece adalah hasil dari benchmark CyberGym: 84,5% versus 83.8% untuk Anthropic Mythos 5 dan 83.6% untuk OpenAI GPT-5.6 Sol. Keuntungan yang terlihat solid dan diterima pengumuman tempat dalam berita utama. Tetapi jika Anda menggali lebih dalam, ternyata kemenangan ini hampir satu-satunya tempat di mana GLM- 5.3 benar-benar outstep kompetitornya. Pengembang itu sendiri pada dasarnya mengakui ini, meskipun dengan cara terselubung.
Sebuah klarifikasi penting: ini bukan tentang keamanan komprehensif, tetapi tentang menemukan kerentanan dalam kode sumber. Ini adalah titik yang sering hilang ketika berita diceritakan kembali, menciptakan kesan palsu kepemimpinan.

CyberGym: mengapa tes sempit tidak membuat model pemimpin
CyberGym cukup sederhana: model diberikan kode sumber, dan model harus menemukan kerentanan di dalamnya dan mengkonfirmasinya. Ini memang keterampilan yang berguna, tapi hanya mencerminkan tahap pertama dari serangan cyber nyata. Zhipu sendiri menyebut CyberGym yang terkecil dari tiga metrik keamanan yang diterbitkan. Dua tes lainnya, ExploitBench dan ExploitGym, menunjukkan bahwa dengan seluruh siklus "find Astripuse", hal-hal yang tidak begitu kemerahan untuk GLM-5.3. Selain itu, kesenjangan di CyberGym hanya 0.7 persen poin - mengingat satu run (pass @ 1 pada 1.507 tugas) dan tidak ada perbedaan dilaporkan, perbedaan ini tidak mungkin signifikan secara statistik. Sederhananya, hasil ini tidak membuktikan superioritas, hanya menunjukkan bahwa model kira-kira setara dalam satu tugas sempit tertentu.
ExploitBench dan ExploitGym: keadaan nyata urusan
Mari kita mulai dengan ExploitBench. Di sini GLM-5.3 skor 54.4%, yang dua kali lipat apa pendahulunya dicapai (24.4%). Pertumbuhannya mengesankan, tapi kekurangan pesaing: Anthropic Mythos 5 skor 78,0%, dan OpenAI GPT-5.6 Sol skor 76.5%. Dinamika ExploitGym bahkan lebih memberitahu. Dalam dua jam, GLM-5.3 menyelesaikan 105 tugas; dalam enam jam, 130. Mythos 5 memecahkan 181 dan 247 tugas dalam jangka waktu yang sama, secara terhormat. Jarak kelipatan. Zipu sendiri mencatat: semakin jauh sepanjang "penemuan kerentanan eksploitasi" rantai, semakin besar model lag. Dengan kata lain, jika CyberGym adalah satu-satunya titik di mana GLM-5.3 memegang sendiri, maka segera setelah tugas menjadi lebih kompleks, model kehilangan lebih dan lebih terlihat.

Coding: hasil campuran dan perbandingan ganjil
Karena model diposisikan sebagai alat untuk pengembang, wajar untuk mengharapkan hasil yang kuat pada stanchmark coding. Pada kenyataannya, hal-hal yang dicampur. Di meja utama, Zhipu membandingkan GLM-5.3 dengan Anthropic Opus 4.8 - dan menang pada beberapa tes dan kalah pada orang lain. Dalam grafik kinerja, model yang berbeda terdaftar sebagai saingan - Claude Fable 5 - dan pada tes internal Zhipu, pendatang baru jejak di belakang. Pendekatan ini - membandingkan terhadap model yang berbeda di bagian yang berbeda - membuatnya mustahil untuk melihat gambaran penuh. Terlebih lagi, evaluasi GLM-5.3 dijalankan dalam agen Anthropic, yaitu Claude Code 2.1.207. Ini berarti kita melihat hasil bukan dari model standar, tapi kombinasi "lingkungan model +", yang juga mempengaruhi metrik terakhir.
Methodological caveats dan mengakui kelemahan sendiri
Zipu membuat komentar penasaran dalam laporan: kemampuan cybersecurity "tumbuh cepat tepat di mana paling lambat". Ini adalah pengakuan jujur bahwa dasar untuk perbandingan saat ini lemah dan kemajuan dimulai dari titik rendah. Pada saat yang sama, perbandingan metodologi menimbulkan pertanyaan. Bagian yang berbeda dari laporan tersebut menggunakan model Anthropic yang berbeda - Anthropic Opus 4.8, Claude Fable 5, dan Anthropic Mythos 5. Memilih saingan "untuk memenuhi tes tertentu" dapat menciptakan kesan menyimpang. Ditambah, anggaran waktu untuk ExploitGym dinormalkan berdasarkan proses analisa buatan; koefisien konversi diberikan untuk Kimi K3 dan Qwen3.8 Max, tapi tidak untuk Mythos 5. Tanpa koefisien ini, hasil pesaing mungkin tidak sepenuhnya sebanding. Namun, Zhipu mengambil langkah yang tepat: beban GLM-5.3 akan diterbitkan, sedangkan kerja Anthropic yang sebanding tetap berada di bawah akses terbatas. Hal ini memberikan peneliti independen kesempatan untuk memverifikasi angka-angka yang diklaim.
2,436 kerentanan: angka yang membutuhkan konteks
Laporan juga rincian bersama bekerja dengan tim keamanan Cina. Model ini menganalisa proyek open source dan akhirnya menemukan 2,436 kerentanan di seluruh 269 repositori. Ini sudah disaring dan hasil deduplikasi yang telah mengalami tinjauan ahli. Distribusi keparahan terlihat seperti ini:
- kritis: 107;
- tinggi: 990;
- sedang: 1.286;
- rendah: 53.
Mengesankan, tapi ada nuansa. Panel ringkasan dalam daftar rilis yang sama 1.097 "penemuan kritis dan tinggi" - yang merupakan jumlah dari 107 dan 990. Namun, teks laporan menggambarkan 1.097 ini sebagai "medium-high". Beberapa outlet berita tampaknya disalin versi kedua tanpa memperhatikan perbedaan tersebut. Inkonsistensi ini menunjukkan laporan itu disatukan dengan terburu-buru. Fakta penasaran lainnya: kelemahan tertua ditemukan pada tahun 1981, dan rata-rata usia penemuan adalah 26.6 tahun. Dengan kata lain, model ini unggul dalam menemukan isu-isu lama yang diketahui, tetapi keberhasilan dalam mendeteksi kerentanan segar jauh lebih jelas.

Kesimpulan
Pengumuman GLM-5.3 adalah cerita tentang bagaimana pemasaran dan perubahan realitas. Pada satu benchmark sempit, modelnya muncul di atas, namun tes yang lebih komprehensif membawa kita kembali ke bumi: ada celah serius di belakang para pemimpin dalam keamanan cyber dan coding. Pada saat yang sama, Zhipu layak menghormati keterbukaan nya: ia menerbitkan bobot dan data tentang titik kelemahan model. Ada kemajuan signifikan jelas atas versi sebelumnya, yang memungkinkan untuk melihat ke masa depan dengan optimisme hati-hati. Tapi memanggil GLM-5.3 seorang pemimpin keamanan berdasarkan nomor tunggal dari satu run akan menjadi pernyataan berlebihan.



