Анонс и главная цифра
14 августа компания Zhipu (также известная как Z.ai) представила модель GLM-5.3, ориентированную на программирование. В техническом релизе она сразу сравнила новинку с ведущими зарубежными разработками. Витриной стал результат на бенчмарке CyberGym: 84,5% против 83,8% у Anthropic Mythos 5 и 83,6% у OpenAI GPT-5.6 Sol. Такое преимущество выглядит солидно и обеспечило анонсу место в новостных заголовках. Однако если копнуть глубже, оказывается, что эта победа — почти единственное место, где GLM-5.3 действительно опережает конкурентов. Сам разработчик это, по сути, признаёт, хотя и в завуалированной форме.
Важное уточнение: речь идёт не о комплексной безопасности, а о поиске уязвимостей в исходном коде. Именно этот момент часто теряется при пересказе новости, создавая ложное впечатление о лидерстве.

CyberGym: почему узкий тест не делает модель лидером
CyberGym устроен довольно просто: модели выдают исходный код, и она должна найти в нём уязвимость и подтвердить её. Это, безусловно, полезный навык, но он отражает лишь первый этап реальной кибератаки. Zhipu и сама называет CyberGym самым узким из трёх опубликованных показателей по безопасности. Два других теста, ExploitBench и ExploitGym, показывают, что с полным циклом «поиск → эксплуатация» у GLM-5.3 всё не так радужно. К тому же разрыв на CyberGym составляет всего 0,7 процентного пункта — на фоне единичного прогона (pass@1 на 1 507 задачах) и без указания дисперсии эта разница вряд ли статистически значима. Проще говоря, этот результат не доказывает превосходства, он лишь говорит о том, что модели находятся примерно на одном уровне в конкретной узкой задаче.
ExploitBench и ExploitGym: настоящее положение дел
Начнём с ExploitBench. Здесь GLM-5.3 набирает 54,4%, что вдвое больше, чем было у предшественника (24,4%). Рост впечатляющий, но не дотягивает до результатов конкурентов: у Anthropic Mythos 5 — 78,0%, у OpenAI GPT-5.6 Sol — 76,5%. Ещё более показательна динамика на ExploitGym. За два часа GLM-5.3 выполняет 105 задач, за шесть — 130. Mythos 5 в те же сроки решает 181 и 247 задач соответственно. Разрыв кратный. Zhipu сама отмечает: чем дальше по цепочке «поиск уязвимости → эксплуатация», тем сильнее отставание модели. Иными словами, если CyberGym — единственная точка, где GLM-5.3 не уступает, то как только задача усложняется, модель проигрывает всё заметнее.

Кодинг: смешанные результаты и странные сравнения
Поскольку модель заявлена как инструмент для разработчиков, логично ожидать сильных результатов на бенчмарках по кодингу. На деле всё неоднозначно. В основной таблице Zhipu сравнивает GLM-5.3 с Anthropic Opus 4.8 — и на одних тестах выигрывает, на других проигрывает. В графиках производительности соперником указана уже другая модель — Claude Fable 5, и по внутреннему тесту Zhipu новинка позади. Такой подход — сравнивать с разными моделями в разных разделах — не позволяет увидеть целостную картину. Более того, оценка GLM-5.3 выполнялась внутри агента Anthropic, а именно Claude Code 2.1.207. Это означает, что мы видим результаты не самостоятельной модели, а связки «модель + окружение», что тоже влияет на итоговые показатели.
Методологические оговорки и признание собственных слабостей
Zhipu в своём отчёте делает любопытное замечание: их capability в области кибербезопасности «растёт быстрее всего именно там, где они сильнее всего отстают». Это честное признание того, что база для сравнения сейчас слабая, а прогресс идёт с низкой точки. При этом методология сравнения вызывает вопросы. В разных разделах отчёта используются разные модели Anthropic — Anthropic Opus 4.8, Claude Fable 5 и Anthropic Mythos 5. Выбор соперника «под конкретный тест» может создавать искажённое впечатление. Плюс, временные бюджеты на ExploitGym нормализованы с учётом пропускной способности от Artificial Analysis; коэффициенты пересчёта указаны для Kimi K3 и Qwen3.8 Max, но не для Mythos 5. Без этих коэффициентов результаты конкурентов могут быть не полностью сопоставимы. И всё же Zhipu делает правильный шаг: веса GLM-5.3 будут опубликованы, тогда как аналогичная работа Anthropic остаётся под ограниченным доступом. Это даёт шанс независимым исследователям проверить заявленные цифры.
2436 уязвимостей: цифры, которые требуют контекста
В отчёте отдельно рассказывается о совместной работе с китайскими командами по безопасности. Модель анализировала реальные open-source проекты и в итоге обнаружила 2 436 уязвимостей в 269 репозиториях. Причём это уже отфильтрованные и дедуплицированные результаты, прошедшие экспертную проверку. Распределение по серьёзности выглядит так:
- критические: 107;
- высокие: 990;
- средние: 1 286;
- низкие: 53.
Внушительно, но есть нюанс. Сводная панель в том же релизе указывает 1 097 «критических и высоких» находок — это ровно сумма 107 и 990. Однако текст отчёта описывает эти 1 097 как «средне-высокие». Некоторые новостные издания, по всей видимости, скопировали именно второй вариант, не заметив расхождения. Такая нестыковка наводит на мысль, что отчёт готовился в спешке. Ещё один любопытный факт: самая старая из найденных уязвимостей датируется 1981 годом, а средний возраст находок — 26,6 года. Иными словами, модель превосходно находит давно известные проблемы, но успехи в обнаружении свежих уязвимостей не столь очевидны.

Выводы
Анонс GLM-5.3 — это история о том, как маркетинг и реальность расходятся. На одном узком бенчмарке модель действительно оказалась первой, но более комплексные тесты возвращают нас на землю: по кибербезопасности и кодингу есть серьёзное отставание от лидеров. При этом Zhipu заслуживает уважения за открытость: она публикует и веса, и данные о слабых местах модели. Виден значительный прогресс относительно прошлой версии, что позволяет смотреть в будущее с осторожным оптимизмом. Но называть GLM-5.3 лидером по безопасности, основываясь на единственном числе из единственного прогона, было бы преувеличением.



