GLM-5.3 sin nuevo modelo base: cómo Z.ai exprimió el crecimiento en codificación y ciberseguridad del post-entrenamiento

22 agosto 202617 vistas

La actualización funciona sobre la misma base de 743B, y todas las mejoras están relacionadas con un post-entrenamiento ampliado: las tareas complejas de horizonte largo se han vuelto notablemente más accesibles, y los resultados en los benchmarks de seguridad superaron las expectativas. Quedan aproximadamente dos semanas para la publicación de los pesos; por ahora, el modelo está disponible a través de API, GLM Coding Plan y ZCode.

GLM-5.3 sin nuevo modelo base: cómo Z.ai exprimió el crecimiento en codificación y ciberseguridad del post-entrenamiento

Introducción: sin un nuevo modelo base

Cuando una nueva versión de un modelo de lenguaje grande sale , normalmente lo esperaría para haber sido reentrenado en un conjunto de datos aún mayor. Pero Z.ai toma un enfoque diferente: el GLM-5.3 lanzado se ejecuta en el mismo modelo base con 743 mil millones de parámetros como GLM-5.2. Todas las mejoras son el resultado de la ampliación de la capacitación después de la capacitación. El modelo se ejecutó en más ambientes, se agregaron nuevos tipos de entornos , y el entrenamiento duró más que en la versión anterior. Esencialmente, este es un experimento que muestra cuánto más se puede exprimir de una arquitectura existente con un ajuste adecuado para tareas específicas.

743 mil millones de parámetros es un modelo colosal, y su pre-entrenamiento cuesta una fortuna. El post-entrenamiento es significativamente más barato, aunque requiere cuidadosa curación de datos y mucho tiempo. Este enfoque no sólo importa para Z.ai: indica que la industria tiene un margen de seguridad. Usted no siempre tiene que gastar recursos en el entrenamiento desde cero — a veces inteligente post-entrenamiento es suficiente.

Codificación: el mayor salto

En las tareas de programación, GLM-5.3 hace un gran avance. En el parámetro Terminal-Bench 3.0, la puntuación saltó de 4.6 a 28.3 — una mejora casi seis veces. En DeepSWE v1.1, la puntuación aumentó de 46.2 a 66.9, y en el último examen de los agentes (CLI) de 23.8 a 28.5. También se señala la prueba GDPval-AA v2, que implica 44 profesiones: aquí GLM-5.3 puntua 1769 puntos.

El parámetro de referencia del código interno de Z.ai muestra una mejora del 50% sobre GLM-5.2. El modelo resuelve el 31,4% de las tareas en aproximadamente 50.000 fichas de salida por tarea. Para contexto: Claude Opus 4.8 logra un 29,5% pero gasta 120.000 fichas, mientras que Claude Fable 5 alcanza el 39,5%, aunque con el máximo esfuerzo. Z.ai observa que un punto de referencia privado es menos propenso a la contaminación, un argumento importante, ya que en los conjuntos de datos públicos GLM-5.3 todavía pierde a GPT-5.6 Sol y Fable 5 en varias evaluaciones complejas de codificación. Tenga en cuenta que todas las cifras son proporcionadas por el propio proveedor, aunque con ajustes documentados, por lo que la verificación independiente sigue adelante.

Terminal-Bench 3.0 es una prueba donde el modelo necesita trabajar en un terminal, ejecutar comandos, y manejar archivos y el medio ambiente. Un aumento casi seis veces suena fantástico, pero vale la pena notar que estas son tareas sintéticas, y el riesgo de contaminación no se puede descartar. En la práctica, esto significa que el modelo se ha vuelto notablemente más útil en la escritura y depuración de códigos autónomos: tiene contexto más largo, planes mejor, y requiere una intervención humana menos a menudo.

Ciberseguridad: un efecto inesperado

Una historia aún más sorprendente se desarrolla en ciberseguridad. Los ingenieros de Z.ai agregaron ejemplos de detección de vulnerabilidad a los datos de entrenamiento y esperaban que el modelo mejorara al razonar sobre errores individuales. Sin embargo, a medida que la capacitación se escalaba, las capacidades comenzaron a acumularse, y en algún momento el modelo comenzó a formar planes coherentes y de múltiples pasos para cadenas de explotación completa. Esto sucedió de manera emergente, sin programar explícitamente tales habilidades.

Los resultados son impresionantes. En CyberGym, GLM-5.3 puntua 84,5% contra 77,2% para GLM-5.2, superando a Mythos 5 (83,8%) y GPT-5.6 Sol (83,6%). En ExploitBench, las tasas de éxito se duplicaron: del 24,4% al 54,4%. Pero aquí Mythos 5 sigue siendo el líder al 78,0%. En ExploitGym, el modelo resuelve 105 tareas en dos horas y 130 en seis. Los números de GLM-5.2 son más modestos: 29 y 39 tareas. Mythos 5 maneja tareas 181 y 247, respectivamente.

Un detalle interesante: cuanto más profunda sea la tarea en la cadena de explotación, mayor ganancia de GLM-5.3 sobre la versión anterior. Al mismo tiempo, sin embargo, la brecha con los modelos fronterizos cerrados se ensancha, por lo que es demasiado pronto para hablar de la plena paridad. Los números de ExploitBench ilustran este pozo: a pesar del doble aumento, la brecha detrás de Mythos 5 sigue siendo significativa.

Tal comportamiento emergente también plantea preocupaciones de seguridad: si un modelo puede planear ataques, su distribución abierta podría ser arriesgada. Esto puede ser exactamente por qué los pesos no se publican inmediatamente.

Disponibilidad y perspectivas

Actualmente, los pesos modelo no son públicos. GLM-5.3 está disponible a través de Z.ai API, GLM Coding Plan y ZCode. La empresa planea abrir los pesos aproximadamente dos semanas después del lanzamiento, tras una evaluación de seguridad y un endurecimiento del modelo. Dada su capacidad de explotación de la vulnerabilidad, esa cautela es bastante razonable.

Para las startups y las organizaciones de ingeniería de tamaño medio, esto significa que el modelo se puede integrar ahora mismo a través de servicios en la nube. Sin embargo, las empresas con requisitos de residencia de datos o una verificación estricta de proveedores deben esperar a que aparezcan los pesos, y entonces será posible desplegar el modelo en su propia infraestructura y controlar plenamente su uso.

Tema básico: GLM-5.3 es un ejemplo sorprendente de cómo la post-entrenamiento puede fortalecer significativamente un modelo sin cambiar la arquitectura base. Pero las conclusiones finales son prematuras: se necesitan pruebas independientes y análisis de los pesos abiertos. Es muy posible que este enfoque se convierta en una nueva tendencia: si otras empresas ven que las mejoras se pueden lograr de forma rápida y relativamente barata de esta manera, los ciclos de actualización de modelos se acelerarán, y el enfoque pasará de la formación previa masiva a la formación específica para escenarios específicos.

Preguntas frecuentes

GLM-5.3: Una revisión de la actualización Z.ai sin un nuevo modelo base