8 月 14 日,Z.ai 发布了开源模型 GLM-5.3。它没有做新的预训练——官方明确表示与 GLM-5.2 使用同一底座,"所有增益都来自后训练"。真正超出厂商预期的是网络安全能力:公司本想让模型更好地发现漏洞,结果能力沿着"利用链"一路向上生长,直到公司决定把开放权重压后两周,并给最敏感的网络安全功能加上分层访问。这是 Z.ai 自 GLM 系列开放权重以来,第一次以安全为由暂停发布。
能力不是练出来的,是"长"出来的
GLM-5.3 的后训练只做了一件事:把环境做得更大、更多样,投入更多强化学习算力。Z.ai 描述了这些环境如何从"像编程练习"变成"像真实工程工作"——模型拿到的是和工程师一样的工作环境:计算集群、存储系统、内部文档、代码库、实验记录,要诊断训练栈的瓶颈、做优化、跑实验,在保持正确性的前提下交出可量化的提速。部分任务被设计成"有经验的工程师要干几天"的量级。
这套做法直接沿用 GLM-5.2 打下的底子:IndexShare 做长上下文、SAO 做长程任务的强化学习、slime 做大规模异步训练。网络安全能力就藏在这轮环境扩展里:Z.ai 把"漏洞发现"的数据和环境放进训练混合,预期让模型更会找漏洞、推理漏洞。出乎意料的是,能力随训练规模化后没有停在"识别孤立缺陷",而是开始跨多个利用阶段做推理,为完整的利用链制定连贯计划。
数字印证了这一点。编码侧,GLM-5.3 在 Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9,AutomationBench 从 26.2 涨到 48.2,自研的 Z.ai Code Bench 比 GLM-5.2 提升约 50%。这些全部来自后训练,没有换底座。
84.5% 是第一,也是三张图里最不重要的一张
网络安全部分,Z.ai 发布了三个基准,分别测漏洞分析与利用链的不同阶段。把三张图放在一起看,结论与"84.5% 登顶"的标题完全不同。
CyberGym 测的是从白盒源码出发、识别并验证漏洞——通过触发故障确认漏洞真实存在。GLM-5.3 得 84.5%,超过 OpenAI GPT-5.6 Sol 的 83.6% 和 Anthropic 移除网络安全护栏的受限模型 Mythos 5 的 83.8%,是 Z.ai 所列比较模型里的最高分。但五个模型挤在 77.2% 到 84.5% 之间,只差 7.3 分。跟踪该基准的 D-Central 进一步指出,Z.ai 用的是白盒设定(题目给到补丁信息一级),与更难、从零发现漏洞的 Level 0 设定(论文报道复现率约 3.5%)不可直接比较——84.5% 证明的是"在足够线索下验证漏洞"到了前沿,而不是"独立发现漏洞"。
ExploitBench 测的是另一头:拿到真实漏洞,推理出根因并构造出能用的 exploit。GLM-5.3 得 54.4%,比 GLM-5.2 的 24.4% 翻了一倍多,但仍落后 Mythos 5 的 78.0% 和 GPT-5.6 Sol 的 76.5%,差距约 24 分。ExploitGym 测时间预算内完成 exploit 的数量:GLM-5.3 两小时 105 个、六小时 130 个,是 GLM-5.2(29 和 39)的约 3.5 倍,而 Mythos 5 是 181 和 247。
规律很清楚:越往利用链后端走,GLM-5.3 相对上一代的增益越大——发现只涨 7.3 分,利用分数翻倍、数量约 3.5 倍——同时与闭源前沿的差距也越大。Z.ai 自己的总结是,能力增长最快的地方,恰是它落后最远的地方。
这些数字是 Z.ai 自报,但 D-Central 整理的一处对照提供了独立旁证:Kimi K3 在 ExploitBench 上的 32.2 分,与英国 AI 安全研究所和美国 AI 标准与创新中心 7 月联合评测的 32% 一致;GLM-5.2 的 24.4 分也与其 24% 一致。Z.ai 自用的评测框架能复现两个政府机构的数字,说明它没有系统性地给自己加分——但这不改变"GLM-5.3 本身尚无第三方复现"的事实。
2436 个真实漏洞,和一个"开放之盾"
Z.ai 没有只停留在基准上。自 GLM-5.2 以来,它与中国多家安全团队合作,让模型跑真实代码库,经专家复核、筛选、去重后,在 269 个项目里找到 2436 个漏洞,其中 1097 个被列为严重或高危(107 个 Critical、990 个 High)。公司为此建了公开的 Z.ai Security Disclosure Ledger:53 个已公开披露,2383 个仍在保密期。最老的一个漏洞 1981 年就被引入,平均每个漏洞在代码里躺了 26.6 年才被发现。这些发现覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议;Axios 补充说,部分漏洞位于 Linux 内核,以及广泛使用的 VMware 和 Apache 项目。
Z.ai 把这个结果包装成与"开放权重"一体的叙事。同一天,它在 X 上写道,"一个开放的世界不能只有开放的进攻面,还必须有开放的盾",并上线 OpenVuln 项目,让开源维护者用 GLM 模型扫描自己的仓库。Reuters 报道,公司还计划启动"Open Source Shield"计划,审计选定的开源项目、为防御性工作提供模型访问,并在 ZCode 里加入代码审计功能。Axios 指出,Hugging Face 此前就曾用 GLM-5.2 调查一起涉及 OpenAI 模型的入侵——当时美国前沿模型的护栏拒绝配合。
开源阵营第一次按下暂停
在"开放"这件事上,GLM-5.3 的发布方式是一个转折。GLM-5.2 在发布后数天内就放出了 MIT 许可的权重;GLM-5.3 却把权重推迟了两周,理由是"完成安全评估和加固"。Reuters 报道,公司还给最敏感的网络安全功能加上"可信访问"(trusted access)——只有通过验证的用户才能使用,并叠加了风险请求筛查、模型工作监控、训练模型拒绝恶意任务等几层保护。Z.ai 尚未公布 GLM-5.3 的许可证。
同样的权衡正在美国一侧发生:OpenAI 8 月 7 日因 Astra 的网络安全能力接近"关键"阈值而放缓开发;Anthropic 把移除护栏的 Mythos 5 只开放给经过审查的机构;Axios 同日报道,特朗普政府正考虑对开源模型进行监管。Z.ai 过去一年的策略是用宽松许可、低价推理和编码 Agent 生态兼容性打开源牌;GLM-5.3 显示,当这套策略在一个敏感领域"过于成功"时,它也撞上了闭源实验室面对的同一个"能力—分发"取舍。
还没人能验证的部分
这篇文章写下的每一组分数都来自 Z.ai 自己的评测,权重尚未开放,外界无法复现。VentureBeat 转述 Z.ai 开发者布道师 Lou 的 X 帖,称 GLM-5.3 已在 Cursor 中发现一个"可能严重的漏洞",但该说法仅有这一处来源,Cursor 尚未回应,不能当作事实。
还有一个来源层面的细节值得记一笔:Z.ai 的博客正文把对手写作 Mythos 5,同一篇博客的表格里该列却标为 "Fable 5 (w/ fallback)"。Reuters 澄清了两者的关系——Mythos 是移除网络安全护栏的 Claude Fable 5 变体,只提供给经过审查的机构。本文的网络安全对比数字均按 Mythos 5 理解,与 Reuters 和 Z.ai 正文一致。
下一项可观察的变量是确定的:两周后权重是否真的开放、以什么许可证开放;以及一旦权重落盘,第三方能否复现 84.5%、54.4% 和 105/130 这三个数字。如果复现成立,"开源模型在漏洞发现上追平闭源前沿、在利用上把差距减半"就不再是厂商的一家之言。