8 月 26 日盘后,Nvidia 发布 2027 财年第二季度财报,营收同比翻倍,但市场反应平淡——「GPU 竞争正在侵蚀护城河」的担忧,已经压过了「又一次全面超预期」。随后几天,一种新的解释开始成形:Nvidia 真正的优势可能不在 GPU 本身,而在 GPU 之外。8 月 29 日,TechCrunch 的 Russell Brandom 在访谈 Nvidia 团队后提出,随着 AI 算力进入吉瓦(GW)级,「造一颗更快的 GPU」不再是竞争的主战场,「让整机系统高效运转的数据编排」才是。
瓶颈不在算力,在数据移动
在单机时代,把更多晶体管塞进一张加速卡就能换来更多算力。但到了 GW 级数据中心,性能不再由峰值计算决定,而是由数据在芯片、内存、网络和存储之间如何流动决定。Nvidia 在自己的技术博客里把话挑明:AI 工厂的「计算单元」不是一台 GPU 服务器,而是整个数据中心;「即便是很小的低效,乘上数万亿 token 也会侵蚀成本与吞吐」。
这个瓶颈有两个直接来源。其一是 KV cache(键值缓存)——模型生成每个 token 时都要回看之前所有 token 的状态,长上下文和 agent 的多步推理让这份状态快速膨胀,装不进昂贵的 HBM,就只能在 GPU 与存储之间来回搬运。其二是 MoE(混合专家)模型的 all-to-all 通信:token 每步都要在分布在不同 GPU 上的「专家」之间路由,通信一旦拥堵,GPU 就空转。Nvidia 存储技术副总裁 Jason Hardy 说得更朴素:「单台服务器里能放的内存是有限的。」问题于是变成:在内存有限的前提下,怎么让数据在正确的时间到达正确的地方。
Nvidia 的答案:把「编排」做成专门的芯片
Nvidia 的对策不是让 GPU 更强,而是在 GPU 四周补齐一批专门做「数据编排」的芯片,并把这套组合打包成 Vera Rubin 平台。
最核心的是 Vera CPU。它不再是传统意义上「喂数据给 GPU」的宿主处理器,而是被 Nvidia 定位为「数据引擎」:88 个自研 Olympus 核心、与 Rubin GPU 之间 1.8 TB/s 的 NVLink-C2C 一致内存通道、最高 1.5 TB 的 LPDDR5X 内存,专门承担数据搬运、调度、编排和 agent 沙箱这类控制密集的工作。Nvidia 的说法是,过去这类工作在 x86 CPU 上成为瓶颈,Vera 则让「编排和数据处理的吞吐随核心数线性扩展」。
另一块是 Groq 3 LPX 机架,一个专门做低延迟推理的加速器。它源自 Nvidia 2025 年 12 月与 AI 芯片公司 Groq 达成的一笔约 200 亿美元非排他技术授权——这是 CNBC 当时报道的价格,两家公司均未确认。LPX 把 256 颗基于 Groq LPU(语言处理单元)架构的芯片装进一个机架,靠 40 PB/s 的片上 SRAM 带宽,用「注意力-FFN 分离」(AFD)把 decode 环节拆开:Rubin GPU 处理对 KV cache 的注意力计算,LPU 处理对延迟最敏感的 FFN/MoE 部分,中间结果逐 token 在两者间交换。Nvidia 称,这套组合相对上一代 GB200 NVL72 可带来「每兆瓦最高 35 倍」的推理吞吐提升。
再往下还有一层存储:BlueField-4 DPU 配合 ICMS(推理上下文内存存储),把 KV cache 从 GPU 内存和传统存储之间「救」出来,放进一个以太网连接的闪存中间层。Nvidia 称这能带来「最高 5 倍 token/s 与 5 倍能效」。正是在这里,Hardy 给出了那个 3 倍的说法——「我们看到这些操作有超过 3 倍的提升,Vera CPU 让加速成为可能……现在我们能把闪存用到极致」。
需要标清口径:3x、35x、5x 都是 Nvidia 的单方说法。3x 出自高管访谈、无独立验证,且指的是存储/编排操作的加速,不是整机推理性能。
OpenAI 的相反路径:干脆不让数据动
面对同一个问题,OpenAI 选了另一条路。它 8 月 25 日公布的首颗自研推理芯片 Jalapeño(与 Broadcom 合作)把答案写成一句话:「我们设计 Jalapeño 就是为了最小化数据移动和通信延迟。」做法是给芯片一个足够大的「域」,让整个负载——包括 KV cache——留在同一个相连系统内,把模型状态显式放置并保持本地,而不是在芯片之间搬运。
Jalapeño 的结果同样亮眼,也同样出自自家口径:在 SemiAnalysis 的 InferenceX 基准上,相对 Nvidia 的 GB200/GB300,它每瓦吞吐高 1.5 到 1.9 倍、端到端延迟低 1.7 到 3.6 倍。芯片额定 700 瓦,实测持续功耗不高于 550 瓦。OpenAI 明确说,它更愿意用「每瓦」而非「每芯片」作为比较标准。
两种路线的对立很清晰:Nvidia 接受异构,靠加专用组件把数据「聪明地调度」起来;OpenAI 则用一颗大芯片把需要移动的数据量本身压到最小。它们指向同一个判断——推理的下一个瓶颈是数据移动,而不是峰值算力。
竞争焦点上移,但胜负未定
把这件事说成「Nvidia 的新护城河」是 Brandom 的判断,也是本文的立场,但它是一个分析性结论,不是已被验证的事实。真正能确定的趋势是:竞争的单位正在从「芯片」上移到「系统」。造出一颗对标 Rubin 的 GPU,不再等于能造出一个高效运转的 GW 级数据中心。
这不自动等于 Nvidia 赢。它要在编排层与自研芯片的超大规模厂商竞争——Amazon、Google 都在加码自研,而 OpenAI 用 Jalapeño 证明「最小化移动」也是一条可行的技术路线。OpenAI 在 Jalapeño 的发布里还留了一句:「我们会继续大规模部署 Nvidia 及其他伙伴的加速器」——两条路线至少在现阶段不是二选一。
判断这条竞争走向,要看三个尚未落地的变量:Vera Rubin 平台在真实部署中的利用率能否兑现 Nvidia 给出的这些数字;Jalapeño 年底上线后能否经得起独立基准检验;以及 Amazon、Google 等厂商是否会把「编排层」作为自研芯片之外的第二条战线。这三件事,比任何一句「护城河还在不在」都更能说明问题。