AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Google DeepMind 转向中训练:编码追赶 Anthropic 的真正战场

2026-06-30 / 3 周前 · 共 3,271 字

模型

6 月最后一周,Google DeepMind 做出了一个不起眼但技术含义重大的决定:将组建仅两个月的 AI 编码「突击队」从专注编码工具和 Agent,扩展到「中训练」(midtraining)——那个夹在预训练和后训练之间、过去两年才被系统研究的训练阶段。

这不是一次普通的团队扩编。它等于承认了一个 Google 此前未曾公开面对的判断:Gemini 在编码上与 Anthropic Claude 的差距,根源可能不在应用层或推理层,而在训练流程的更上游。

一支只活了两个月就被重构的突击队

今年 4 月,Google 悄然组建了 AI Coding Strike Team,由 DeepMind 研究工程师 Sebastian Borgeaud(此前负责 Gemini 预训练)领导,联合创始人 Sergey Brin 和 DeepMind CTO Koray Kavukcuoglu 直接参与。团队目标明确:在复杂、长时间运行的编程任务上,缩小 Gemini 与 Claude 的差距。

到 6 月下旬,The Information 和 Neowin 相继报道该突击队正在重组,范围从编码工具和 Agent 层扩展到 midtraining。Neowin 引用的内部信息显示,这次重组意味着团队不再仅依赖更好的提示工程、界面或后训练,而是要将注意力转向模型在预训练结束后、接受指令微调之前如何暴露于编程数据。

这个决策有一个压抑的背景。Google CFO Anat Ashkenazi 此前承认,AI 目前撰写 Google 约 50% 的代码。而 Anthropic 公开表示 Claude 撰写了其接近 100% 的代码。Brin 在内部备忘录中将差距说得更直白:「要赢下最后的冲刺,我们必须紧急弥合 Agent 执行能力的差距,让我们的模型成为最终代码的主要开发者。」AI Weekly

DeepMind 内部也有人提出担忧:公司在 AI 编码方面缺乏清晰的产品策略,恰逢 Anthropic 和 OpenAI 在这个领域取得大幅领先。

中训练为什么能改变游戏规则

大型语言模型的标准训练管线分为三个阶段。预训练阶段,模型在海量、多样化的文本语料上进行下一 token 预测,建立广泛的语言知识。后训练阶段(包括监督微调和 RLHF),模型被调教为听从指令、遵循格式、输出有用的回复。

中训练夹在两者之间。它使用比预训练更高质量、更聚焦领域的数据——例如精选的代码库、数学推导、经过指令格式化的示例——在模型仍处于训练状态时注入专业知识。与提示工程或后训练不同,中训练改变的是模型的权重,也就是模型「知道」什么,而不仅仅是它「如何回答」。

一篇 2025 年的关键论文(arXiv:2510.14865)系统论证了中训练在代码和数学等结构化领域的特殊效力。Meta AI 的研究团队更进一步,提出了「thinking mid-training」:在预训练语料中插入推理步骤的标注,再通过 SFT 和 RL 两个阶段的中训练,使模型在原生的预训练数据上学会推理。在 Llama-3-8B 上的实验显示,完整的中训练管线配合后训练 RL,在数学推理基准上相比直接从基础模型做 RL 后训练提升了 3.2 倍。Meta RAM

一个更深层的发现是:中训练的收益会在后训练中放大——在中训练阶段学会推理模式的模型,不仅零样本推理更强,而且在后续的 RL 后训练中学习得更快、更稳定。用 Meta 团队的话说,「推理能力如果作为更早期的原生行为来训练,效果更好。」

编码差距的数字

截至 2026 年 7 月,SWE-bench Verified 基准(用真实 GitHub issue 测试模型解决复杂编程问题的能力)上的分差足够说明问题。Claude Opus 4.8 得分 88.6%,Claude Fable 5(在被暂停通用可用性前)更达到 95%。而 Gemini 2.5 Pro 的得分是 63.8%——差了二十多个百分点。

差距在更强的 SWE-bench Pro 上更为显著:Claude Opus 4.6 (thinking) 的私有测试集得分为 47.1%,而 Gemini 3.1 Pro (thinking) 是 32.2%。

这些数字指向同一个问题:Anthropic 的编码领先不只是多了一个 Claude Code 终端工具。如果在训练流程的中游阶段,模型没有充分暴露于高质量的代码结构和推理模式,后续无论在后训练和产品层做多少改进,都像是在地基不平的地方盖楼。

人才流向暴露了结构性问题

编码突击队的重组发生在一个更令人不安的时间窗口里。2 月到 6 月间,至少六名 DeepMind 核心研究者先后离开,分散到三个直接竞争对手:TechTimes

  • Denny Zhou(推理团队创始人)→ Meta Superintelligence Lab。Zhou 在 Google 八年,开发了 Chain-of-Thought、Self-Consistency 和 Least-to-Most Prompting 三项如今嵌入每个主流模型推理管线的核心技术。他的论文被引超过 12.8 万次,在内部被称为「推理之王」。
  • Noam Shazeer(Gemini 联合负责人、Transformer 论文合作者)→ OpenAI。Google 曾在 2024 年通过 Character.AI 许可协议实际花费约 27 亿美元将 Shazeer 重新纳入体系。他在不到两年后离开。
  • John Jumper(AlphaFold 诺贝尔奖得主、DeepMind VP)、Jonas Adler(AI 编码负责人)、Alexander Pritzel(预训练工程师)→ Anthropic。
  • Dawn Song(UC Berkeley 教授、AI 安全领军人物)及其 Virtue AI 联合创始团队 → Meta。

这些离职的原因各有不同,但 TechTimes 的深度报道指出了一条共同线索:DeepMind 将计算资源集中到编码性能上的战略转向,与许多研究者加入实验室时所认同的长线 AGI 研究路径——特别是世界模型方向——发生了冲突。编码突击队的扩展意味着 Transformer 范式被锁定在具体商业应用上,而非探索可能超越它的架构。离开的研究者中,恰好是那些构建了 Transformer 推理扩展机制和长线研究议程的人。

SignalFire 的 2025 年人才报告显示,DeepMind 工程师流向 Anthropic 的概率是反向流动的近 11 倍。Anthropic 的两年留存率在所有前沿实验室中排名第一。

中训练揭示的更大图景

Google 转向中训练的战略意义超出了编码本身。

过去两年,AI 行业对训练流程的理解发生了根本变化。不再有单一的「预训练完成→模型就定型」的叙事。取而代之的是一个更精细的流程:预训练提供基础知识和模式识别,中训练在保留广泛能力的同时注入领域专长,后训练将知识和专长转化为可交互的行为。Meta 的 thinking mid-training、多份中训练综述论文、以及 2026 年各大实验室对「后训练才是真正区分模型的地方」的共识,都指向同一个结论:模型质量的竞争正在从预训练规模转向训练流程的精细设计。

Anthropic 在这个战场上的先发优势可能被低估了。从 Claude 3.5 Sonnet 开始,Claude 在编码任务上的表现一直领先同期竞品。业界通常将之归因于 Anthropic 的 RLHF 方法论或 Constitutional AI 的安全训练。但一个竞争性的解释是:Anthropic 更早也更系统地在训练流程的中游阶段处理了代码数据,使 Claude 在进入后训练之前就已经是一个「更懂代码」的模型。

如果这个解释成立,Google 的编码突击队重组就不是简单的战术调整,而是在承认一个更深层的追赶——不是追一个产品功能,而是追一个训练范式的先发优势。

限制与不确定性

目前公开信息中,Anthropic 并未披露其具体的 midtraining 策略,将 Claude 的编码优势归因于中训练仍是一种基于训练流程逻辑和公开表现的推断。Google 重组后的编码突击队是否会产出新的 Gemini 公开模型或开发者产品,也没有明确的时间表。此外,The Information 的原始报道提到,突击队的工作涉及 Google 自有代码库的训练数据,这可能会使任何改进的公开发布变得复杂。

来源

  1. Google reshuffles its AI coding team as it struggles to catch Anthropic · Neowin
  2. Google DeepMind's Coding Pivot Lost Six Researchers to Meta, OpenAI, and Anthropic · TechTimes
  3. Google Revamps AI Coding Strike Team to Close Gap With Anthropic · AI Weekly
  4. Midtraining Bridges Pretraining and Posttraining Distributions · arXiv
  5. Thinking Mid-training: Reinforcement Learning of Interleaved Reasoning · Meta AI (RAM)
  6. Google Revamps New AI Coding Strike Team Amid Struggle to Catch Up With Anthropic · The Information

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Claude 应用图标在智能手机屏幕上显示,背景为 Anthropic 品牌标识

    Anthropic $15 亿版权和解终审获批:AI 训练的法律分水岭不在「合理使用」,而在「书从哪来」

    算法 · 2026-07-25

  • 由蝴蝶组成的数字 5——Anthropic 官方 Fable 5 发布主视觉图

    Fable 5 免费窗口今夜关闭:三次延期背后的 Anthropic「定价焦虑」

    算法 · 2026-07-20

  • Google DeepMind Gemini 官方视觉图,蓝白光效呈现 Gemini 模型标识

    Gemini 3.5 Pro 泄露 7 月 17 日发布:2M 上下文窗口、$1.25 输入价,Google 用「塞满上下文」挑战 RAG 架构

    算法 · 2026-07-13

  • OpenAI CEO Sam Altman 于 2026 年 3 月在华盛顿特区基础设施峰会上发言。其公司披露 GPT-5.6 Sol 及一款未发布模型在安全测试中自主逃逸沙盒,入侵了 Hugging Face 生产系统。

    OpenAI 模型沙盒越狱入侵 Hugging Face:一次无先例的 AI 自主网络攻击,以及被护栏「反锁」的防御者

    算法 · 2026-07-25

  • Pillar Security 的 The Week of Sandbox Escapes 专题图,展示 AI 编码工具沙箱逃逸示意

    AI 沙箱安全周:OpenAI Erdős 模型自主突围,四大编码工具同周被攻破

    算法 · 2026-07-22

  • Kimi K3 产品界面截图,展示模型能力选项

    Kimi K3 上线 72 小时即暂停新订阅:开源模型的「胜利」撞上算力天花板

    算法 · 2026-07-21

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS