7 月 17 日,2026 世界人工智能大会(WAIC)开幕当天,华为将 Atlas 950 SuperPoD 真机搬进了上海世博展览馆。16 个机柜、1024 颗昇腾 NPU 组成的黑色阵列首次对公众展示,华为给出的数字是 FP8 算力 1 EFLOPS、FP4 算力 2 EFLOPS、256TB 全局可寻址内存。
这不是华为第一次谈论 Atlas 950——该产品最早在 2025 年 9 月华为全联接大会上由轮值董事长徐直军正式发布,今年 3 月在 MWC 巴塞罗那首次面向海外亮相。但 WAIC 是它第一次以完整物理形态出现在人们面前。从 PPT 到真机,这中间的距离对一个被美国出口管制层层封锁的国产 AI 芯片生态而言,不是小步。
从 64 卡到 8192 卡:SuperPoD 的扩展逻辑
Atlas 950 SuperPoD 的基础单元是单机柜 64 张昇腾 950DT NPU 卡,通过华为自研的灵衢(UnifiedBus)互联协议将多台物理服务器整合为一台逻辑计算机。WAIC 现场展示的是 1024 卡配置(16 机柜),但这只是中间规模。满配版本可连接 8192 张 NPU 卡,总 FP8 算力 8 EFLOPS、FP4 算力 16 EFLOPS、总内存 1152TB(统一 HBM)、互联带宽 16.3 PB/s。
更上层还有 Atlas 950 SuperCluster——由 64 个满配 SuperPoD 组成,超过 52 万颗昇腾 950DT 芯片、超过 1 万个机柜协同工作,华为宣称其 FP8 总算力 524 EFLOPS、FP4 推理算力可达 1 ZettaFLOPS。
核心芯片昇腾 950DT 的关键参数:单颗芯片互联带宽 2 TB/s(约为前代 910C 的 2.5 倍),计划 2026 年 Q4 量产交付。灵衢协议实现了 3 微秒超低 RTT 时延,这是让数千张 NPU 像一台机器一样协同工作的关键。
6.7 倍的对比:华为选了一个尚未出货的对手
华为在宣传材料中直接对标 NVIDIA Vera Rubin NVL144——这个选择本身就值得解读。
NVL144 是 NVIDIA 下一代数据中心旗舰平台,搭载 Vera CPU 和 Rubin GPU,总计 144 个 GPU Die(72 个双 Die 封装),计划 2026 年下半年出货。据 NVIDIA 官方数据,NVL144 CPX 版本单机架 FP4 算力 8 EFLOPS、快速内存池 100TB。
华为的对比口径是:满配 8192 张 NPU 的 Atlas 950 SuperPoD,总算力为 NVL144 的 6.7 倍、内存容量 15 倍(1152TB vs. 100TB)、互联带宽 62 倍(16.3 PB/s vs. 约 260 TB/s)。卡的规模更是 NVL144 的 56.8 倍。
这里需要明确标注两点。第一,这些对比数字全部来自华为自报,未经独立第三方验证。华为并未公开其测试方法、所用基准和对比配置细节。第二,NVL144 是 NVIDIA 尚未出货的下一代产品,华为实质上是在用自己的满配超节点去对比 NVIDIA 的单机架方案——双方的物理规模(8192 卡 vs. 144 Die)和功耗等级完全不同,严格对等比较并不成立。
但华为选择这个对比对象本身传达了清晰的信号:它不满足于和现有产品竞争,而是瞄准了 NVIDIA 路线图上最先进的那一档。
不是孤例:昇腾生态的实战验证
Atlas 950 并非停留在展台上的概念产品。在同一天的 WAIC 上,月之暗面(Moonshot AI)发布了 Kimi K3——一个 2.8 万亿参数的开源模型,号称全球已公开最大规模的开源权重模型,在多项基准测试中与前沿闭源模型持平。
虽然月之暗面未公开 Kimi K3 的全部训练基础设施细节,但在美国先进 GPU 出口受限的背景下,一个 2.8T 参数的模型在中国本土训练到前沿水平,本身就是对国产算力生态的实战验证。此外,华为自研的 OpenPangu-2.0 MoE 模型(92B 总参数、6B 激活参数、512K 上下文)也完全在昇腾 NPU 上完成训练。京东的 Oxygen AIIC 平台已使用昇腾 NPU 进行工业级 LLM/VLM 推理部署,每天处理数亿次商品更新。
在商业部署层面,华为透露前代昇腾 384 超节点已有超过 750 套商用落地,覆盖互联网、运营商、金融、电力等行业。Atlas 950 SuperPoD 的量产时间定在 2026 年 Q4。
双轨并行:H200 进口松动与国产替代不矛盾
就在 Atlas 950 亮相 WAIC 的同一时期,中美 AI 芯片贸易呈现出一个微妙的双轨格局。
2026 年 1 月,美国商务部工业安全局(BIS)将 H200 和 MI325X 对华出口许可审查从"推定拒绝"调整为"逐案审查",附加 25% 关税和 50% 总量上限。美国在名义上为 H200 对华出口打开了门。
但据南华早报报道,中国政府反而在有意限制本国企业对 H200 的采购,将其视为推进技术自给自足战略的一部分。截至 2026 年 2 月,英伟达 H200 对华实际销售量为零——中国客户在审批结果明朗前未下达订单,部分供应商甚至暂停了关键组件生产。
这种"美国松、中国紧"的态势表明,中国的算力策略并非简单的"能买就买",而是有意为国产替代留出市场空间。Atlas 950 在 WAIC 的高调亮相,正是在这一政策背景下展开的。
尚待回答的问题
Atlas 950 SuperPoD 的首次公开亮相标志着中国 AI 超算基础设施的一个重要节点,但仍有大量关键问题悬而未决:
独立基准测试缺失。 华为提出的所有性能数据——尤其是 6.7 倍算力领先——均来自自身测试。目前没有任何独立第三方对 Atlas 950 进行过标准化的 AI 训练或推理基准测试(如 MLPerf)。
量产与实际交付。 Q4 2026 是目标时间,但昇腾 950DT 芯片本身的量产进度、良率和供应链稳定性仍需观察。从展台真机到客户数据中心,中间还有不短的路。
软件生态成熟度。 华为的 CANN 异构计算架构已适配 PyTorch、vLLM 等主流框架,但开发者体验、算子覆盖度和社区生态与 CUDA 相比仍有差距。Kimi K3 和 OpenPangu 跑通了,不代表所有模型都能无缝迁移。
价格与 TCO。 华为未公布 Atlas 950 SuperPoD 的定价和总拥有成本。对于潜在客户而言,性能倍数固然重要,但每 EFLOPS 的价格才是决定性指标。
从纸面到物理、从芯片到集群、从自用到商用——Atlas 950 SuperPoD 的 WAIC 首秀完成了第一层验证。但华为是否真的拥有一个能与 NVIDIA 在全球市场正面竞争的计算生态系统,答案要到 2027 年量产部署后才能揭晓。