GLM-5.3 без новой базовой модели: как Z.ai выжала рост в кодинге и кибербезопасности из пост-обучения

22 августа 202617 просмотров

Обновление работает на прежней 743B-основе, а все улучшения связаны с расширенным пост-обучением: сложные задачи с длинным горизонтом стали заметно доступнее, а результаты на бенчмарках безопасности выросли сильнее ожиданий. До публикации весов остаётся около двух недель, сейчас модель подключена через API, GLM Coding Plan и ZCode.

GLM-5.3 без новой базовой модели: как Z.ai выжала рост в кодинге и кибербезопасности из пост-обучения

Введение: без новой базовой модели

Когда выходит новая версия большой языковой модели, обычно ожидают, что её заново обучили на ещё большем массиве данных. Но у компании Z.ai другой подход: представленная GLM-5.3 работает на той же базовой модели с 743 миллиардами параметров, что и GLM-5.2. Все улучшения — результат масштабированного пост-обучения. Модель гоняли на большем числе сред, добавляли новые типы окружений, а обучение длилось дольше, чем у предыдущей версии. По сути, это эксперимент, который показывает, сколько ещё можно выжать из уже существующей архитектуры, если как следует поработать с её настройкой под конкретные задачи.

743 миллиарда параметров — это колоссальная модель, и её предобучение стоит огромных денег. Пост-обучение обходится значительно дешевле, хотя и требует тщательного подбора данных и длительного времени. Такой подход важен не только для Z.ai: он намекает, что в индустрии есть запас прочности. Не обязательно каждый раз тратить ресурсы на обучение с нуля — иногда достаточно умного пост-обучения.

Кодинг: главный скачок

На задачах программирования GLM-5.3 совершает настоящий прорыв. На бенчмарке Terminal-Bench 3.0 результат вырос с 4.6 до 28.3 — это почти шестикратное улучшение. На DeepSWE v1.1 показатель поднялся с 46.2 до 66.9, а на Agents' Last Exam (CLI) — с 23.8 до 28.5. Отдельно отмечается тест GDPval-AA v2, в котором участвуют 44 профессии: здесь GLM-5.3 набирает 1769 очков.

Внутренний бенчмарк Z.ai Code Bench показывает улучшение на 50% по сравнению с GLM-5.2. Модель решает 31.4% задач при примерно 50 000 выходных токенов на задачу. Для контекста: Claude Opus 4.8 достигает 29.5%, но тратит 120 000 токенов, а Claude Fable 5 — 39.5%, правда при максимальном усилии. Z.ai отмечает, что частный бенчмарк менее подвержен контаминации — это важный аргумент, ведь на публичных наборах данных GLM-5.3 всё ещё проигрывает GPT-5.6 Sol и Fable 5 на ряде сложных кодинг-оценок. Напомним, что все цифры предоставлены самим вендором, хотя и с документированными настройками, так что независимая проверка ещё впереди.

Terminal-Bench 3.0 — это тест, где модели нужно работать в терминале, выполнять команды, обращаться с файлами и окружением. Рост почти в шесть раз выглядит фантастично, но надо учитывать, что это синтетические задачи, и риск контаминации никто не отменял. Для практики это означает, что модель стала заметно полезнее в задачах автономного написания и отладки кода: она дольше удерживает контекст, лучше планирует шаги и реже требует вмешательства человека.

Кибербезопасность: неожиданный эффект

Ещё более удивительная история разворачивается в области кибербезопасности. Инженеры Z.ai добавляли в обучающие данные примеры обнаружения уязвимостей и ожидали, что модель станет лучше рассуждать об отдельных багах. Однако при масштабировании обучения способности начали накапливаться, и в какой-то момент модель стала формировать связные, многошаговые планы по полным цепочкам эксплуатации. Это произошло эмерджентно, то есть без явного программирования таких навыков.

Результаты впечатляют. На CyberGym GLM-5.3 показывает 84.5% против 77.2% у GLM-5.2, обходя при этом Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%). На ExploitBench успешность удвоилась: с 24.4% до 54.4%. Но здесь Mythos 5 остаётся лидером с 78.0%. На ExploitGym модель за два часа решает 105 задач, а за шесть — 130. У GLM-5.2 эти показатели скромнее: 29 и 39 задач. Mythos 5 справляется с 181 и 247 задачами соответственно.

Любопытная деталь: чем глубже задача в цепочке эксплуатации, тем значительнее выигрыш GLM-5.3 над предыдущей версией. Однако одновременно с этим растёт разрыв с закрытыми frontier-моделями, так что говорить о полном паритете пока рано. Цифры на ExploitBench это хорошо показывают: несмотря на двукратный рост, отставание от Mythos 5 остаётся существенным.

Такое эмерджентное поведение вызывает и вопросы безопасности: если модель способна планировать атаки, её открытое распространение может быть рискованным. Возможно, именно поэтому веса не публикуются сразу.

Доступность и перспективы

Сейчас веса модели не публичны. GLM-5.3 доступна через Z.ai API, GLM Coding Plan и ZCode. Компания планирует открыть веса примерно через две недели после запуска — после оценки безопасности и укрепления модели. Учитывая её возможности в области эксплуатации уязвимостей, такая осторожность вполне разумна.

Для стартапов и средних инженерных организаций это означает, что модель можно интегрировать уже сейчас, получая доступ через облачные сервисы. А вот предприятиям с требованиями к резидентности данных или строгой проверкой вендоров стоит дождаться появления весов — тогда появится возможность развернуть модель в собственной инфраструктуре и полностью контролировать её использование.

Итог: GLM-5.3 — яркий пример того, как пост-обучение может заметно усилить модель без изменения базовой архитектуры. Но окончательные выводы делать рано: нужны независимые тесты и анализ открытых весов. Вполне возможно, что этот подход станет новым трендом: если другие компании увидят, что так можно быстро и относительно недорого получить улучшения, циклы обновления моделей ускорятся, а акцент сместится с гигантских предобучений на точечную настройку под конкретные сценарии.

Часто задаваемые вопросы

Похожие материалы

Все материалы
GLM-5.3: обзор обновления Z.ai без новой базовой модели