来自Zhipu的GLM-5.3:在闪闪发光的CyberGym图背后

19 八月 202612 视图

在其最新的报告中,Zhipu的GLM-5.3模型在一次安全测试上取得了最佳结果,但明显落后于竞争对手在 还有两个 该公司本身承认,最大的增长发生在差距最大的领域.

来自Zhipu的GLM-5.3:在闪闪发光的CyberGym图背后

通知和标题编号

8月14日,Zhipu(又称Z.ai)揭幕GLM-5.3,该模型专注于编程. 在技术发布中,它立即将新模式与领先的国际发展进行比较. 其中心部分是CyberGym基准的结果:Anthropic Mythos 5为84.5%,83.8%;OpenAI GPT-5.6 Sol为83.6%。 这个优势看起来很稳固, 但如果你挖得更深,结果这个胜利 几乎是唯一一个 GLM-5.3 真正超过竞争对手的地方。 开发商本身基本上承认这一点 ,虽然在蒙羞的方式。

一个重要的澄清:这不是关于全面安全,而是关于找出源代码中的脆弱性。 这正是当新闻被重播时经常迷路的一点,造成了对领导的错误印象.

CyberGym:为什么一个狭窄的测试不能让一个模型成为领导者

CyberGym相当简单:模型被赋予源代码,模型必须在其中找到一个弱点并证实. 这当然是一种有用的技能,但它只反映了真正的网络攻击的第一阶段. Zhipu本身称CyberGym是三个公布的安全度量衡中最窄的. 另外两项测试,即"探索奔驰"和"探索Gym"显示,随着完整的"发现~开发"循环,对于GLM-5.3来说,事情并不那么美好. 此外,CyberGym上的差距只有0.7个百分点——鉴于一次运行(1 507项任务的Pass@1),而且没有报告差异,这种差异在统计学上不太可能是显著的。 简言之,这个结果并不证明优越性;它只是表明模型在一项具体狭义的任务中大致处于同等地位。

剥削奔驰与剥削Gym:真实现状.

先释本殊. 在此GLM-5.3评分54.4%,是其前身(24.4%)的两倍. 增长令人印象深刻,但不及竞争对手:Anthropic Mythos 5分78.0%,OpenAI GPT-5.6 Sol分76.5%. 探索体的动态更能说明问题。 2小时后,GLM-5.3完成105项任务;6小时130. 神话5分别在相同的时间范围内解决了181和247项任务. 间隙为多. Zhipu本身指出:沿着"脆弱性发现 ~ 剥削"链越进一步,模型的滞后度就越大. 换句话说,如果CyberGym是GLM-5.3拥有自身的唯一点,那么一旦任务变得更加复杂,模型就会越来越明显地失去.

编码:结果好坏参半和奇数比较

由于该模型被定位为开发者的工具,因此在编码基准上期望有强烈的结果是合理的. 现实中,事物是混杂的. 在主表中,Zhipu将GLM-5.3与Anthropic Opus 4.8比较——它在一些测试上获胜,在另一些测试上输. 在性能图中,一个不同的型号被列为对手——克劳德·福尔5,在日普的内部测试中,新人追尾. 这种方法——与不同章节的不同模型相比较——使得无法看到全貌. 此外,GLM-5.3的评估是在Anthropic毒剂,即Claude Code 2.1.207内进行的。 这意味着我们看到的结果不是 一个独立的模型,但 在“模型+环境”组合中,这也影响到最终的衡量标准。

B. 方法说明和承认其本身的弱点

其网络安全能力“增长最快, 这是一种诚实的承认,即比较基准目前薄弱,进展是从低点开始的。 同时,比较方法提出了问题。 报告的不同章节使用不同的Anthropic模型——Anthropic Opus 4.8,Claude Fable 5和Anthropic Mythos 5. 选择一个对手"适合特定测试"可以造成扭曲的印象. 此外,根据人工分析的吞吐量,将利用基因组的时间预算正常化; Kimi K3和Quen3.8 Max的转换系数给出,但Mythos 5. 没有这些系数,竞争者的结果可能不完全可比。 然而,Zhipu正在采取正确的步骤:GLM-5.3的权重将会公布,而Anthropic的可比作品仍然处于限制进入状态. 这使独立研究人员有机会核实声称的数字。

2,436个脆弱性:需要说明情况的数字

报告还详细介绍了与中国安全小组的联合工作。 该模型分析了真正的开源项目,最终发现269个储存库有2 436个弱点。 已经对这些结果进行了过滤和复制,并经过专家审查。 严重性分布是这样的:

  • 关键:107;
  • 高:990;
  • 中型:1 286;
  • 低:53岁。

令人印象深刻,但有一个细微的。 同一版中的摘要小组列出了1,097个"关键和高"的发现——这正好是107和990的总数. 然而,报告文本将这1,097描述为"中高". 一些新闻媒体显然复制了第二版,但没有注意到差异。 这种不一致的情况表明,报告是匆忙编写的。 另一个奇怪的事实是,发现的最古老的脆弱性可追溯到1981年,发现的平均年龄是26.6岁。 换句话说,该模式在发现众所周知的问题方面非常出色,但它在发现新的弱点方面取得成功。 没那么明显

结论

GLM-5.3公告是一个关于营销与现实如何分歧的故事. 在一个狭窄的基准上,这个模型的确出现在顶部,但更全面的测试使我们回到了地球:在网络安全和编码两个方面,领导人背后都存在着严重的缺口. 同时,Zhipu也值得对其开放性予以尊重:它同时发布模型弱点的权重和数据. 与之前的版本相比有明显的显著进展,这使得以谨慎的乐观观望未来成为可能. 但是,将GLM-5.3称为安全领导者,根据一次运行的单一数字计算,是夸大其词。

常问问题

Zhipu的GLM-5.3成果和弱点审查