AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Nvidia 的优势正越过 GPU:竞争焦点从单卡性能移向整机数据编排

今天 · 共 2,420 字

NVIDIA

8 月 26 日盘后,Nvidia 发布 2027 财年第二季度财报,营收同比翻倍,但市场反应平淡——「GPU 竞争正在侵蚀护城河」的担忧,已经压过了「又一次全面超预期」。随后几天,一种新的解释开始成形:Nvidia 真正的优势可能不在 GPU 本身,而在 GPU 之外。8 月 29 日,TechCrunch 的 Russell Brandom 在访谈 Nvidia 团队后提出,随着 AI 算力进入吉瓦(GW)级,「造一颗更快的 GPU」不再是竞争的主战场,「让整机系统高效运转的数据编排」才是。

瓶颈不在算力,在数据移动

在单机时代,把更多晶体管塞进一张加速卡就能换来更多算力。但到了 GW 级数据中心,性能不再由峰值计算决定,而是由数据在芯片、内存、网络和存储之间如何流动决定。Nvidia 在自己的技术博客里把话挑明:AI 工厂的「计算单元」不是一台 GPU 服务器,而是整个数据中心;「即便是很小的低效,乘上数万亿 token 也会侵蚀成本与吞吐」。

这个瓶颈有两个直接来源。其一是 KV cache(键值缓存)——模型生成每个 token 时都要回看之前所有 token 的状态,长上下文和 agent 的多步推理让这份状态快速膨胀,装不进昂贵的 HBM,就只能在 GPU 与存储之间来回搬运。其二是 MoE(混合专家)模型的 all-to-all 通信:token 每步都要在分布在不同 GPU 上的「专家」之间路由,通信一旦拥堵,GPU 就空转。Nvidia 存储技术副总裁 Jason Hardy 说得更朴素:「单台服务器里能放的内存是有限的。」问题于是变成:在内存有限的前提下,怎么让数据在正确的时间到达正确的地方。

Nvidia 的答案:把「编排」做成专门的芯片

Nvidia 的对策不是让 GPU 更强,而是在 GPU 四周补齐一批专门做「数据编排」的芯片,并把这套组合打包成 Vera Rubin 平台。

最核心的是 Vera CPU。它不再是传统意义上「喂数据给 GPU」的宿主处理器,而是被 Nvidia 定位为「数据引擎」:88 个自研 Olympus 核心、与 Rubin GPU 之间 1.8 TB/s 的 NVLink-C2C 一致内存通道、最高 1.5 TB 的 LPDDR5X 内存,专门承担数据搬运、调度、编排和 agent 沙箱这类控制密集的工作。Nvidia 的说法是,过去这类工作在 x86 CPU 上成为瓶颈,Vera 则让「编排和数据处理的吞吐随核心数线性扩展」。

另一块是 Groq 3 LPX 机架,一个专门做低延迟推理的加速器。它源自 Nvidia 2025 年 12 月与 AI 芯片公司 Groq 达成的一笔约 200 亿美元非排他技术授权——这是 CNBC 当时报道的价格,两家公司均未确认。LPX 把 256 颗基于 Groq LPU(语言处理单元)架构的芯片装进一个机架,靠 40 PB/s 的片上 SRAM 带宽,用「注意力-FFN 分离」(AFD)把 decode 环节拆开:Rubin GPU 处理对 KV cache 的注意力计算,LPU 处理对延迟最敏感的 FFN/MoE 部分,中间结果逐 token 在两者间交换。Nvidia 称,这套组合相对上一代 GB200 NVL72 可带来「每兆瓦最高 35 倍」的推理吞吐提升。

再往下还有一层存储:BlueField-4 DPU 配合 ICMS(推理上下文内存存储),把 KV cache 从 GPU 内存和传统存储之间「救」出来,放进一个以太网连接的闪存中间层。Nvidia 称这能带来「最高 5 倍 token/s 与 5 倍能效」。正是在这里,Hardy 给出了那个 3 倍的说法——「我们看到这些操作有超过 3 倍的提升,Vera CPU 让加速成为可能……现在我们能把闪存用到极致」。

需要标清口径:3x、35x、5x 都是 Nvidia 的单方说法。3x 出自高管访谈、无独立验证,且指的是存储/编排操作的加速,不是整机推理性能。

OpenAI 的相反路径:干脆不让数据动

面对同一个问题,OpenAI 选了另一条路。它 8 月 25 日公布的首颗自研推理芯片 Jalapeño(与 Broadcom 合作)把答案写成一句话:「我们设计 Jalapeño 就是为了最小化数据移动和通信延迟。」做法是给芯片一个足够大的「域」,让整个负载——包括 KV cache——留在同一个相连系统内,把模型状态显式放置并保持本地,而不是在芯片之间搬运。

Jalapeño 的结果同样亮眼,也同样出自自家口径:在 SemiAnalysis 的 InferenceX 基准上,相对 Nvidia 的 GB200/GB300,它每瓦吞吐高 1.5 到 1.9 倍、端到端延迟低 1.7 到 3.6 倍。芯片额定 700 瓦,实测持续功耗不高于 550 瓦。OpenAI 明确说,它更愿意用「每瓦」而非「每芯片」作为比较标准。

两种路线的对立很清晰:Nvidia 接受异构,靠加专用组件把数据「聪明地调度」起来;OpenAI 则用一颗大芯片把需要移动的数据量本身压到最小。它们指向同一个判断——推理的下一个瓶颈是数据移动,而不是峰值算力。

竞争焦点上移,但胜负未定

把这件事说成「Nvidia 的新护城河」是 Brandom 的判断,也是本文的立场,但它是一个分析性结论,不是已被验证的事实。真正能确定的趋势是:竞争的单位正在从「芯片」上移到「系统」。造出一颗对标 Rubin 的 GPU,不再等于能造出一个高效运转的 GW 级数据中心。

这不自动等于 Nvidia 赢。它要在编排层与自研芯片的超大规模厂商竞争——Amazon、Google 都在加码自研,而 OpenAI 用 Jalapeño 证明「最小化移动」也是一条可行的技术路线。OpenAI 在 Jalapeño 的发布里还留了一句:「我们会继续大规模部署 Nvidia 及其他伙伴的加速器」——两条路线至少在现阶段不是二选一。

判断这条竞争走向,要看三个尚未落地的变量:Vera Rubin 平台在真实部署中的利用率能否兑现 Nvidia 给出的这些数字;Jalapeño 年底上线后能否经得起独立基准检验;以及 Amazon、Google 等厂商是否会把「编排层」作为自研芯片之外的第二条战线。这三件事,比任何一句「护城河还在不在」都更能说明问题。

来源

  1. Nvidia's AI advantage is moving beyond the GPU · TechCrunch
  2. Inside the NVIDIA Vera Rubin Platform: Six New Chips, One AI Supercomputer · NVIDIA Technical Blog
  3. Inside NVIDIA Groq 3 LPX: The Low-Latency Inference Accelerator for the NVIDIA Vera Rubin Platform · NVIDIA Technical Blog
  4. NVIDIA Vera CPU · NVIDIA
  5. Jalapeño's first results show industry-leading speed and efficiency in AI inference · OpenAI
  6. Nvidia-Groq deal keeps fiction of competition alive: analyst says · CNBC

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 英伟达 CEO 黄仁勋;对应英伟达被曝以 129 亿美元收购 Hugging Face 的报道

    英伟达被曝 129 亿美元收购 Hugging Face:买下开源分发中枢,也买下中立性难题

    算力 · 2026-08-27

  • 英伟达 CEO 黄仁勋,2026 年 7 月 16 日在东京

    Nvidia 二季报营收 962 亿美元超预期,毛利率指引降至 74%

    算力 · 2026-08-27

  • Perplexity AI 标志的示意图(Reuters/Dado Ruvic 摄于 2024 年 1 月)

    英伟达拟入股 Perplexity:从授权挖角转向持有下游推理股权

    算力 · 2026-08-24

  • Cloverleaf Infrastructure 官网 Red Granite 项目页头图,展示其清洁能源与数据基础设施选址项目

    英伟达少数入股电力开发商 Cloverleaf:把资本前移到数据中心的「地、电、壳」

    算力 · 2026-08-23

  • Starcloud 三位创始人,左起:CTO Ezra Feilden、CEO Philip Johnston、首席工程师 Adi Oltean

    Starcloud 再融 2.5 亿美元、估值 23 亿:轨道 AI 的瓶颈正从算力转向发射

    算力 · 2026-08-21

  • 2026 上半年全球人形机器人出货份额按厂商分布图,前五名均为中国厂商,合计占 86%

    美国的机器人壁垒,挡不住中国的制造规模

    算力 · 2026-09-01

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS