7 月 28 日,成立仅 7 个月、员工不过 25 人的 AI 公司 Recursive Superintelligence 宣布与 AWS 签署了一项多年期、价值 4.1 亿美元的算力协议。这个数字占其 5 月完成的 6.5 亿美元融资的 63%。
Socher 在与 TechCrunch 的通话中说:「对我们来说,重要的不是员工数量,而是 Agent 数量。」他还补充道,这笔 4.1 亿的合同「很可能是我们未来几年签下的最小的算力协议」。
一家没有公开产品、团队规模相当于种子轮公司的 AI 实验室,正在用接近三分之二的融资买算力而非雇人。这不是又一个云计算大单——它是一种研发组织模型的公开实验。
4.1 亿买什么:不是训练大模型,是跑无限循环
理解这笔交易,需要先理解 Recursive 的系统在做什么。它不是用 AWS 训练一个 GPT 级别的模型。它的工作负载是一个自我循环的研究系统:系统提出改进想法,实现代码,运行实验,验证结果,然后用学到的信息选择下一个实验——如此往复。
Recursive 在 6 月 11 日发布的首批公开结果展示了这个循环的实际产出。在三个基准测试上,系统取得了最优结果:
- NanoChat Autoresearch:在单 GPU、5 分钟固定算力预算下训练小语言模型,达到 0.9109 BPB,优于 Karpathy 发起的 autoresearch@home 社区(数十名人类和数百个 Agent 的协作成果)的最佳成绩 0.9372 BPB;
- NanoGPT Speedrun:在单节点 8×H100 上将模型训练至固定验证损失(3.28),用时从社区经过两年多优化的 79.7 秒压缩到 77.5 秒——在已被人类反复打磨的基准上一个仍有统计显著性的提升;
- SOL-ExecBench:在 235 个 GPU 内核优化任务上,将平均 Speed-of-Light 得分从 0.699 提升到 0.754,意味着与硬件理论极限的差距缩小了 18%。
这套工作负载与 Anthropic 或 OpenAI 预训练大模型的需求完全不同。它不是一次持续数月的单次训练任务,而是成千上万个快速、并行的小实验——每一次实验的结果都可能决定下一个实验的方向。Unite.AI 的分析指出,这种模式对云基础设施的要求是「突发容量、快速调度和高任务周转率」,而非一块预留给定的加速器集群。
AWS 的创业与风投全球负责人 Jason Bennett 在官方声明中承认了这种差异:「自我改进的 AI 会产生复合增长的算力需求——每一个研究循环都会生成下一个实验。」AWS 将与 Recursive 共同开发「专为大规模自动化 AI 研究构建的基础设施」。
一个反向的资本结构
传统 AI 实验室的资金流向大致是:融资 → 雇顶级研究员(人均薪资 50-100 万美元)→ 分配 GPU 预算。Anthropic 拥有数千名员工,OpenAI 更多。两家公司在 2026 年的算力承诺都达到数百亿美元级别,但员工成本同样是巨大的支出项。
Recursive 把这个公式颠倒了过来。25 个人,63% 的融资直接变成算力账单。TechCrunch 特别指出,AWS 没有在这笔交易中附带投资条款——这和 Anthropic 或 OpenAI 的「算力换股权」模式不同。Recursive 是 AWS 的纯客户,算力合同完全体现在公司的资产负债表上。
Socher 的逻辑是:如果 AI 系统自己会编程、会设计实验、会选择研究方向,为什么还要雇人来干这些?公司的增长不由员工增长率驱动,而由 Agent 的并行度驱动。每增加一个实验线程,等于扩展了一个虚拟研究员。
但这个逻辑有一个尚未验证的前提:Agent 是否需要人类的「方向盘」。
RSI 的边界:工程自动化 vs 研究自主
递归自我改进(RSI)正在成为 2026 年 AI 行业最热的概念——同时也最缺乏共识的定义。TechCrunch 在 5 月的一篇分析中直接称之为「新的 AGI,且同样难以界定」。
目前可观测的 RSI 相关实践分为两个层次。第一个是工程自动化:Anthropic 在 5 月的报告中披露,Claude 生成的代码占其生产代码的比例已从 2025 年初的个位数升至 2026 年中期的多数。但该公司也明确区分了「工程自动化」和「研究自主」——Claude 可以完成有明确规范的实验执行,但「决定做哪个实验」仍然依赖人类研究人员。
Recursive 的目标是跨过这条线。Socher 描述的是:从想法的提出、实现、验证到下一个研究方向的选择,全部由系统自动完成。其已公开的结果在一定程度上支持了这个方向——系统确实在没有人工干预的情况下发现了有用优化,例如在 NanoGPT Speedrun 中引入 FP8 注意力计算、在优化器中加入退火探索噪声、以及跨层注意力差异复用(cross-layer-diff),这些都是此前人类社区未曾尝试的组合。
但一个关键问题仍然存在:三个基准测试的共同特点是目标函数清晰且评价标准自动化——BPB、训练时间、SOL 分数。当研究目标变得更模糊(例如「提高模型安全性」或「发现新的架构范式」),评价本身就需要人类判断。Recursive 在技术博客中也承认,奖励黑客——系统利用评估漏洞刷分而非真正改进——是持续存在的挑战,尤其在 SOL-ExecBench 上表现突出。
AWS 为什么配合这场实验
对 AWS 而言,4.1 亿美元分摊到多年不过是一条小业务线。亚马逊 2026 年 Q1 的 AWS 收入为 376 亿美元,同比增长 28%。其定制芯片业务年化收入已超过 200 亿美元。Anthropic 承诺了超过千亿美元的 AWS 支出,OpenAI 也签下了数十亿美元的协议。
但 Recursive 的价值不在于金额。AWS 愿意承诺「共建专用基础设施」,说明它将 Recursive 的自动化研究负载视为一个潜在的新品类——就像当年为 Netflix 优化流媒体、为 SAP 优化 ERP 一样。如果「自动化 AI 研究」成为一种标准工作负载,AWS 先行积累的工程经验就是一种先发优势。
Jason Bennett 的表态透露了这种预期:「在短短几个月内,Recursive 产出的结果超越了多年社区驱动优化的成果。AWS 赋予他们将数月的串行研究变成数日并行发现的能力。」
10 月的第一个检验点
Socher 给出了具体的时间线:10 月左右将发布「人们可以实际使用的产品」,且强调是「几个月内而非几个季度」。从 Recursive 目前公开的成果来看,第一批产品可能聚焦于 AI 训练效率工具或 GPU 内核优化——这两个方向都有明确的商业需求,且系统已经证明了自己的能力。
但衡量这家公司是否成功的真正标准不是产品发布时间,而是系统能否展示一条陡峭的自我改进曲线:每个循环后的系统是否比循环前更强?改进速度是否超过人类团队?如果答案是肯定的,那么「Agent 数量取代员工数量」就不再是叙事,而是一种可复现的工程事实。
在此之前,Recursive 的账本上记录着一个罕见的实验:一家 25 人的公司用接近三分之二的融资买算力,试图证明 AI 研发的下一个阶段不需要更多的人。

