6 月 4 日,Anthropic 旗下 Anthropic Institute 发布由 Marina Favaro 与 Jack Clark 合著的长文《When AI builds itself》,首次以公司内部数据系统论证「AI 正在加速 AI 自身的研发」。核心证据是:截至 2026 年 5 月,合并进 Anthropic 代码库的代码中逾 80% 由 Claude 撰写,而 2025 年 2 月 Claude Code 进入预览前,这一数字还是个位数;2026 年第二季度,典型工程师每天合并的代码量约为 2024 年的 8 倍。
这篇文章把「递归自我改进」(recursive self-improvement,即 AI 系统自主设计并开发自己的继任者)从理论推演推到了可测量的早期证据层面。但两个月后的 8 月 14 日,Anthropic 第二份公司级风险报告给出了更保守的口径:内部 AI 辅助研发「显著更快」,但「尚未达到 2 倍」。两份文件之间的落差,正落在同一个缺口上——代码量在暴涨,但「AI 是否真的在加速 AI 本身」,最终取决于研究判断力这最后一环,而它仍然由人承担。
80% 与 8 倍:两个数字的测量口径
「80%」需要先看清口径。Anthropic 管理层此前公开估计「90% 甚至更多」的代码由 Claude 撰写,但《When AI builds itself》的脚注说明,>80% 测量的是「可归因于 Claude、合并进生产代码库的行数」,比管理层口径更保守,原因有二:归因流水线存在缺口;未被归因给 Claude 的行里,还包含自动生成的代码等同样非人手写的内容。也就是说,>80% 是一个下限式估计,而非精确值。
「8 倍」同样需要校准。文章正文写的是「2026 年第二季度典型工程师每天合并的代码量约为 2024 年的 8 倍」,并承认代码行数衡量的是数量而非质量,「几乎肯定高估了真实的效率提升」。文章还给出一个可对照的数字:2026 年 3 月对 130 名研究人员的内部调查中,中位数受访者估计自己在 Mythos Preview 辅助下的产出约为无 AI 时的 4 倍,而文章认为这一数字也可能偏高。
这两个数字测量的是「代码产出」,不是「研发进度」。Anthropic 用 Amdahl 定律自己点破了这一点:Claude 开始大量产出代码后,人工代码审查成了新的瓶颈——「加快流程的一部分,往往只是把瓶颈移到别处」。
写代码、跑实验、做判断:三级证据的强弱
文章按「人类角色的收窄」把证据分成三个层级,各层强度不同。
写代码,证据最强。在最开放、最少规格说明的任务上,Claude 2026 年 5 月的成功率达 76%,六个月上升 50 个百分点。文章举的例子是:一次例行升级导致数万训练任务崩溃,工程师只给了 Claude 少量文本和集群访问权限,它在约两小时内定位并复现了触发崩溃的那个调试标志,而这通常需要两到三天。Anthropic 还做了回溯分析:用自动化 Claude 审查全部代码变更,能提前拦截 claude.ai 过去事故背后约三分之一的 bug。
跑实验,Claude 能执行别人设定好目标的实验。Anthropic 每次发布模型都跑同一个固定测试——让 Claude 把一段训练小模型的代码优化得尽可能快。2025 年 5 月 Claude Opus 4 平均做到约 3 倍加速,2026 年 4 月 Mythos Preview 做到约 52 倍;作为对照,熟练研究员需要四到八小时才能做到 4 倍。2026 年 4 月发表的一项实验中,Claude 驱动的 agent 被给了一个开放问题——较弱的模型能否可靠地监督更强的模型——并自主求解,用约 800 小时、约 1.8 万美元算力恢复了 97% 的性能差距,而两名人类研究员一周只恢复了约 23%。
做判断,证据最弱,也恰恰是「递归自我改进」的关键。文章分析 129 个「人类研究员走偏了方向」的真实会话时刻,比较模型与人类谁给出更好的下一步:2025 年 11 月的 Opus 4.5 在 51% 的时刻胜过人类,2026 年 4 月的 Mythos Preview 升到 64%。但文章自己承认,这些时刻是刻意挑选「人类判断有改进空间」的,因此不是模型与人类的同口径对比。
三个层级的共同缺口是同一个:方向设定。文章明确说,工程上「人类给目标,但不再需要给方法」,而「选择研究什么问题、信任哪个结果、判断何时该放弃」仍是人类的比较优势——这正是今天的 AI 与「能自主设计继任者的系统」之间的距离。
8 月报告:研发加速「尚未达 2 倍」
8 月 14 日的第二份风险报告(覆盖期截至 7 月 15 日)延续了「Claude 撰写大部分生产代码」的说法,但对「加速」给出更克制的数字:内部 AI 辅助研发「显著更快,但尚未达到 2 倍」,且「测量很困难」。这与 6 月的「人均代码量 8 倍」不矛盾——前者测的是端到端研发速度,后者测的是代码产出——但对比说明,代码量的暴涨尚未传导为同等幅度的研发提速。
报告里另一处自我披露更加关键:其最具体的任务型 AI 研发评估「已经饱和,不再能反映能力的进一步提升」,系统卡里报告的评估套件已达到「前沿模型在多数任务上超过人类基线」的程度。作为替代,Anthropic 启用了内部基准 CoBench(449 个真实工程问题),据 BERI 整理,Mythos 5 得 50.3%,未发布的内部模型 Model 2 得 62.8%,而「能完全替代研究人员」的估计门槛是 85%。换句话说,Anthropic 承认:用于判断「AI 是否在加速 AI」的量尺,现在既已失效、又还没接上。
这份报告还把 RSP 里「AI 研发自动化」的触发阈值,从「把 2018—2024 两年的 AI 进步压缩进一年」,改写为两个可操作条件之一:模型能以 5 倍以内的成本完全替代全部研究科学家与工程师,或出现「进展速率翻倍」的戏剧性加速。改写不改变结论——Anthropic 仍认为当前模型未达阈值——但说明它正在为「加速」寻找更可验证的定义。
三种情景与「保留暂停选项」
文章给出三种未来情景,并明确最可能是第二种。一是趋势停滞(S 曲线见顶)、能力广泛扩散,Anthropic 承认「为完整列出,但不认为可能」。二是复合效率提升,AI 研发大幅自动化、人类继续设定方向与判断结果,文章说「证据表明我们很可能正走向这一情景」,100 人公司能做 1 万甚至 10 万人组织的工作。三是完全递归自我改进,进展速度完全由算力决定。文章对第三种情景下的对齐问题「最不确定」——今天的偶发 misalignment 可能在代际更替中「变得更频繁、更不可理解,直到我们失去控制」。
配合这套推演,文章提出一个罕见主张:为「可验证地放缓或暂停前沿开发」保留选项。但它同时否认单边暂停的价值——「单家实验室单方面暂停立即可行,但收效甚微:它改变的只是谁在领跑,而不是创造当前缺失的更广泛协商过程」。一个有效的暂停需要多个国家、多家处于或接近前沿的实验室在相同条件下同步停止,并能互相验证对方确实停了;而训练运行比导弹发射井更难察觉、投入通用、悄悄违约的激励巨大。这正是文章把「暂停」从一句口号变成一套验证工程问题的原因。
三处需要外部校准的地方
这套论证有三处需要外部校准。
数据全部自报、未经审计。从代码量到成功率,关键数字都来自 Anthropic 内部数据,部分方法论有明确局限(如「129 个时刻」是刻意挑选的)。
发布时机紧贴 IPO。Anthropic 于 6 月 1 日向 SEC 秘密递交 S-1,三天后发布《When AI builds itself》。Tom's Hardware 指出「所有数据均为自报、未经审计,且出现在公司申请上市的几天之后」,并提醒 Anthropic 4 月关于 Mythos Preview 发现数千个严重漏洞的说法,后来「因依赖少量人工样本而受到审视」。
独立研究者对「递归自我改进」的定性有异议。Gary Marcus 在 Marcus on AI 中称这篇博客是「偷换概念」:「他们真正展示的只是更快的编程——完全在人类控制之下,外加一些基准上的进步」,而「更快的编程工具大概不会终结世界」。他的核心区分是:AGI 比「递归自我改进」更难,文章结果指向的是 RSI 的可能性,而非 AGI。
这些校准不否定代码量数据本身。它们指向同一个结论:Anthropic 第一次把「AI 加速 AI」写成了可核查的内部数据,也诚实地标出了数据的边界——代码产出暴涨是事实,研发加速是否跟进、判断力缺口能否被跨越,仍是没有答案的问题。「8 倍」与「尚未达到 2 倍」这两个数字之间的距离,就是当前证据链的真实长度。

