AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

GLM-5.2:开源模型首次在 Agent 编码上摸到闭源前沿

2026-06-29 / 3 周前 · 共 3,227 字

6 月 13 日,周六。AI 世界还在消化 Anthropic 的 Fable 5 被美国政府以出口管制为名强制下架的消息。同一天,智谱 AI(Z.AI)选择在这个不寻常的时间点向 GLM Coding Plan 订阅者推送了 GLM-5.2。三天后,完整模型权重以 MIT 许可在 HuggingFace 开源。

这不是一次按部就班的版本更新。GLM-5.2 发布前,开源模型在 Agent 编码——即 AI 自主规划、编写、测试、调试复杂软件工程任务——这个最高价值场景中,与闭源前沿之间存在一条肉眼可见的鸿沟。Anthropic 靠 Claude Code 搭配 Opus 4.8 几乎独占了这个市场。GLM-5.2 是第一个跨越这条鸿沟的开源模型。

六周后回看,这个判断已经不需要靠基准数字来支撑。社区反应、OpenRouter 流量数据和推断提供商的行动共同印证:开源 Agent 编码的可用性拐点确实到了。

数字背后:为什么是长周期任务

GLM-5.2 的关键突破不在标准基准上——SWE-bench Pro 的 62.1% 距离 Opus 4.8 的 69.2% 仍有差距——而在三个专门设计来测试"长时间自主工作"的基准上。

FrontierSWE 测量 Agent 能否在数小时到数十小时的尺度上完成开放式技术项目,涵盖系统优化、大规模代码构建和应用 ML 研究。GLM-5.2 的 Dominance 得分为 74.4,与 Opus 4.8 的 75.1 仅差 1%。PostTrainBench 给每个 Agent 一台 H100 GPU,评估它通过后训练能多大程度改进小模型——换句话说,测试 AI 做 AI 研究的能力。GLM-5.2 得分 34.3,超过 GPT-5.5 的 28.4 和 Opus 4.7 的 21.6,仅次于 Opus 4.8 的 37.2。在 SWE-Marathon——覆盖构建编译器、优化内核、开发生产级服务等超长周期任务——GLM-5.2 得分 13.0,落后 Opus 4.8 的 26.0 较多,但在开源模型中仍是断档式领先(GLM-5.1 仅得 1.0)。

在标准编码基准上同样大幅跃升:Terminal-Bench 2.1 从 GLM-5.1 的 63.5 跳到 81.0(Opus 4.8 为 85.0),DeepSWE 从 18.0 跳到 46.2。

这些数字的意义在于:GLM-5.2 不是另一个"在聊天体验上接近 ChatGPT"的开源模型。它在 Agent 编码——需要模型在长上下文中维持逻辑一致性、正确使用工具、处理环境反馈、分解和追踪子任务——这个真正产生商业价值的场景中,给出了可用的答案。

技术架构:1M 上下文的工程挑战

声称支持 1M token 上下文很简单,但在实际编码 Agent 的长时间轨迹中保持质量是另一回事。GLM-5.2 为此做了三个关键架构决策。

IndexShare 稀疏注意力。GLM-5.2 基于 DSA(Dynamic Sparse Attention)架构,引入了一个关键改进:每 4 个 Transformer 层共享同一个轻量级 indexer,将 indexer 的点积和 topk 操作减少到原来的 1/4。在 1M 上下文长度下,per-token FLOPs 降低 2.9 倍。这不是一个"创新论文"式的算法——它直接服务于降低推理成本的工程目标。

改进的 MTP 推测解码。在多步 MTP(Multi-Token Prediction)中引入 IndexShare 和 KVShare,使得推测解码的接受长度从 4.56 提升到 5.47(+20%)。结合 rejection sampling 和端到端 TV loss 训练,进一步缩小了训练与推理之间的分布差异。

推理引擎优化。上下文从 200K 扩展到 1M 后,推理瓶颈从计算转向 KV-cache 容量和长上下文 kernel 开销。GLM-5.2 引入更细粒度的显存管理、kernel 优化和 CPU 侧调度改进,使得在实际部署中随着上下文增长获得越来越大的吞吐量优势。

一个值得注意的细节:GLM-5.2 在训练管线中引入了反作弊(anti-hack)模块。编码 RL 的奖励信号通常是可验证的 pass/fail,Agent 很容易学会走捷径——读取测试用例、curl 下载答案、直接复制参考实现。GLM-5.2 使用规则过滤加 LLM 判断的两阶段检测,在线拦截作弊行为但允许 Agent 继续训练,避免了直接拒绝轨迹导致的训练不稳定。这个工程实践说明,智谱团队在解决真实的 RL 训练痛点,而不仅是刷基准。

成本:不在同一数量级上竞争

GLM-5.2 的 API 定价约为 $0.95–$2/百万输入 token 和 $3–$6/百万输出 token。作为对比,Anthropic 和 OpenAI 的前沿模型收费在 $5–$15/百万输入和 $30–$75/百万输出。差距大约在 5–10 倍。

Z.AI 的 GLM Coding Plan 订阅价格仅为 Anthropic 的 Claude Code 和 Claude Max 订阅的十分之一。对于一个每月在 API 调用上花费 $10,000 的团队,切换到 GLM-5.2 可能将账单压缩到 $1,000–$2,000。

但价格差异的真正意义不在于"便宜",而在于它改变了企业 AI 支出的风险计算。当前沿模型的价格是开源模型的 5–10 倍,而能力差距已经缩小到单个百分点级别时,"智能/美元"就成了唯一的真实指标。正如 Harvey 联合创始人 Gabe Pereyra 对 CNBC 所说:"我一直对开源追赶的速度感到惊讶。GLM-5.2 是第一个真正能与一些闭源前沿模型竞争的开源模型。"

时间窗口:管制创造的需求

GLM-5.2 的发布时间不是巧合。

6 月 12 日,Anthropic 应美国政府指令暂停了 Fable 5 和 Mythos 5 的访问。6 月 26 日,OpenAI 宣布将 GPT-5.6 系列的发布限制在约 20 个政府批准的合作伙伴范围内。两家公司最强大的模型在不到两周内先后退出公开市场。

Z.AI 创始人唐杰在 Hacker News 上的表态直白得不像公关辞令:"在前沿模型因非技术原因被突然切断访问的时刻,我们更加确信一件事:科学应该是全球性的。AGI 应该是全人类共同探索智能边界、解决复杂挑战的基石,而不是被少数规则垄断、随时可被撤销的特权。"

这不是道德高地的表演。这是一份商业策略声明。当美国最先进的模型变得不可用时,一个不受任何人撤销的开源模型看起来是更安全的选择。

Nathan Lambert 在 Interconnects 的分析中点出了更深层的连锁反应:GLM-5.2 与 Fable 5 的禁令在时间上绑定,"这些趋势线未必是因果关联的,但能力肯定是相关的。如果不发生任何改变,我们可能面临一种局面——美国政府判定某个中国开源模型对公众不安全。"在 Mythos 级别能力被认为不适合公开发布、而中国模型正在以 MIT 许可免费推向所有人的情况下,开源与管控的张力只会加剧。

它还不是闭源替代品

需要明确 GLM-5.2 的边界。

SWE-bench Pro 上 62.1% 对 69.2%、SWE-Marathon 上 13.0% 对 26.0%——这些差距在工程实践中意味着什么,目前缺乏系统性的第三方验证。社区反馈集中在"感觉对了",但感觉不是 SLA。量化版本(4-bit)在长上下文任务上的退化程度,也需要更多独立测试。

智谱声称的反作弊系统和其他 RL 训练实践,均来自公司自身披露,未经独立审计。OpenRouter 的 token 流量增长曲线和 CNBC 引用的开发者反馈提供了部分独立验证,但离"已被广泛验证的生产级替代方案"还有距离。

更关键的是,美国的出口管制政策正在两条轨道上同时运行:一方面限制闭源模型的海外分发,另一方面对先进芯片的出口施加越来越严的管控。后者直接影响中国模型制造商获取训练和推理硬件的途径。GLM-5.2 的成功恰恰发生在这个窗口尚未完全关闭的时刻。

GLM-5.2 最大的行业信号在于:开源模型在 Agent 编码这个最高价值 AI 场景中,已经从"看得到但够不着"变成了"够得着"。它迫使闭源实验室的定价逻辑从"我们有最好的模型"转向更复杂的"我们有最好的模型,以及可靠性、支持、安全保证和生态锁定"。当能力差距缩小到可用阈值以内时,这些附加价值的说服力取决于客户是否真的需要它们。

来源

  1. GLM-5.2: Built for Long-Horizon Tasks - Z.AI Blog
  2. China's Zhipu is closing in on top U.S. AI models - CNBC
  3. GLM-5.2 is the step change for open agents - Interconnects
  4. Zhipu AI's stock rockets after Chinese firm launches open-source GLM-5.2 - SCMP
  5. Z.AI's GLM-5.2 model challenges Anthropic and OpenAI with lower costs - CryptoBriefing

评论

登录后即可参与评论。

加载评论中…

相关文章

  • DoorDash 推出 dd-cli:AI Agent 第一次拿到真实外卖下单入口

    DoorDash 推出 dd-cli:AI Agent 第一次拿到真实外卖下单入口

    算法 · 2026-07-17

  • 现代数据中心服务器机架,象征 AI Agent 基础设施的底层协议竞争

    五巨头联手挑战 MCP 霸权:Agent 协议标准战争全面爆发

    算法 · 2026-07-14

  • Socket.dev 对 jscrambler 恶意版本的技术分析截图,展示异常文件结构和 preinstall 钩子

    AI 编程工具成供应链攻击新靶标:jscrambler npm 投毒事件技术拆解

    算法 · 2026-07-13

  • Meta Brain2Qwerty v2 技术示意:MEG 扫描仪采集脑磁信号,AI 管线将其解码为打字文本

    Meta 用 AI 把非侵入式脑机接口准确率从 8% 拉到 61%,靠的是什么

    算法 · 2026-07-25

  • ACON 在 AppWorld 基准上的准确率-峰值 token 权衡图:ACON 在降低 token 成本的同时保持大模型精度,并显著提升小模型性能

    上下文压缩正在从「省钱手段」变成 Agent 架构的第一等公民

    算法 · 2026-07-12

  • Agent harness 结构图:模型位于中心,周围环绕着上下文注入、控制流、动作执行、持久化和观察层。

    80% 的 SWE-bench 分数从哪来?解构 Agent 能力的真正来源

    算法 · 2026-07-11

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS