GLM-5.3未采用新基础模型:Z.ai如何通过后训练提升编码与网络安全能力

22 八月 202617 视图

更新基于原有的743B基础,所有改进都源于扩展的后训练:长时程复杂任务变得明显更易处理,安全基准测试结果提升超出预期。距离权重发布还有约两周时间,目前模型已通过API、GLM Coding Plan和ZCode接入。

GLM-5.3未采用新基础模型:Z.ai如何通过后训练提升编码与网络安全能力

导言:没有新的基准模式

当大语言模型的新版本出来时 ,你通常会期待 在更大的数据集上重新训练。 但Z.ai采取了不同的方法:发布的GLM-5.3运行在与GLM-5.2相同的基模型上,参数为7,430亿. 所有改进都是扩大后培训的结果。 模型运行在更多的环境上,增加了新的环境类型 ,而训练持续的时间比前一版本还要长. 基本上,这是一个实验 显示有多少可以挤出 现有结构,并有适当的特定任务调整。

7,430亿的参数是一个庞大的模型,它的预训花费了一大笔钱. 培训后的费用要低得多,尽管需要仔细的数据整理和长时间。 这种做法不仅对Z.ai很重要:它暗示该行业有安全保障。 你并不总是从零开始将资源花在训练上——有时聪明的后训练就够了.

编码:最大的飞跃

在编程任务方面,GLM-5.3取得了真正的突破. 在"终端-奔驰3.0"基准上,得分从4.6跃升至28.3——近6倍的改进. 在DeepSWE v1.1上,得分从46.2升至66.9,在代理最后考试(CLI)上——从23.8升至28.5. 也注意到GDPval-AA v2测试,涉及44个专业:这里GLM-5.3分1769分.

Z.ai的内部代码座椅基准显示比GLM-5.2改进了50%. 该模型以约5万个输出令牌每个任务解决31.4%的任务. 上下文:Claude Opus 4.8实现29.5%,但花费12万令牌,而Claude Fable 5则点击39.5%,尽管付出了最大努力. Z.ai指出,私人基准较不易受到污染——这是一个重要的论据,因为在公共数据集上,GLM-5.3仍然输给GPT-5.6 Sol和Fable 5, 在一些复杂的编码评价上。 牢记所有数字都是由供应商自己提供的,尽管有文件记载的设置,因此仍然在进行独立核查。

终端-Bench 3.0是一种测试,模型需要在一个终端中工作,运行命令,并处理文件和环境. 近六倍的增加听起来棒极了,但值得指出的是,这些是合成任务,污染的风险是无法排除的。在实践中,这意味着模型在自主代码写作和调试中明显变得更加有用:它保持了更长的语境,计划步骤更好,并且需要较少的人类干预。

网络安全:一种意想不到的影响

一个更令人惊讶的故事 在网络安全中展开。 Z.ai工程师在培训数据中增加了脆弱性检测实例,并期望该模型能更好地对单个bug进行推理. 然而,随着培训规模的扩大,能力开始积累,在某个时候,该模式开始形成协调一致的多步骤计划,以充分利用链条。 发生这种情况时很突然——没有明确编程这种技能。

结果令人印象深刻。 在CyberGym上,GLM-5.3的成绩为84.5%,而GLM-5.2的成绩为77.2%,击败了神话5(83.8%)和GPT-5.6 Sol(83.6%). 在Bench案中,成功率翻了一番:从24.4%增至54.4%。 但在这里,神话5仍然是领先的78.0%. 在OpenitGym上,该型号在2小时内解决105项任务,在6小时内解决130项任务. GLM-5.2的数字比较小:29和39个任务. 神话5分别处理181和247项任务.

一个有趣的细节:开发链中的任务越深,GLM-5.3的增益比之前的版本要大. 然而与此同时,与封闭的边疆模式的差距扩大,因此谈论完全平等还为时过早. 探索奔驰数字很好地说明了这一点:尽管增加了两倍,神话5背后的差距仍然很大.

这种突发行为也引发了安全关注:如果一个模型能够策划攻击,其公开分发可能会有风险. 这可能是为什么 权重没有立即发表。

可用性和前景

目前,模型重量并不公开. GLM-5.3通过Z.ai API,GLM编码计划和ZCode提供. 公司计划在发射大约两周后——经过安全评估和模型硬化后——打开重量. 鉴于其利用脆弱性的能力,这种谨慎是相当合理的。

对于初创企业和中等规模的工程组织,这意味着这个模型现在可以通过云服务进行整合. 但是,有数据居住要求或严格供应商审查的企业应等到权重出现之后,才能在自己的基础设施中部署该模型并充分控制其使用。

底线:GLM-5.3是一个突出的例子,说明训练后如何能在不改变基础架构的情况下显著加强模型. 但最终结论还为时过早:需要对开放重量进行独立的测试和分析. 这种方法很有可能成为一个新的趋势:如果其他公司看到这样可以快速和相对便宜地实现改进,模型更新周期就会加快,重点会从大规模预训转向针对特定情景的定向调整.

常问问题

GLM-5.3:无新基模Z.ai更新回顾