8 月 13 日,OpenAI 预览了一个叫 Ultrafast 的新 API 服务层级:把旗舰模型 GPT-5.6 Sol 部署到 Cerebras 的晶圆级芯片上,宣称生成速度最高 750 输出 token/秒、比「Standard processing」快至多 14 倍,目前只对一小批受邀客户开放。这是 OpenAI 第一次公开把旗舰闭源模型放到英伟达 GPU 之外的推理硬件上运行——此前它的 gpt-oss 开源权重模型已经适配过 Cerebras 和 AMD 芯片,但旗舰模型跑在别家芯片上还是头一回。
真正值得注意的不是「14 倍」这个数字,而是它把一件事第一次摆上台面:对前沿模型而言,「快」可以不再通过「换更小的模型」来换取,而可以直接换成不同的硬件。但这个判断目前只建立在 OpenAI 和 Cerebras 自报的数字上。
速度来自硬件,而不是更小的模型
大语言模型每生成一个 token,都要把整套权重从内存里至少读一遍。这就是为什么大模型推理在 GPU 上通常不是算力受限,而是内存带宽受限:算力单元大部分时间在等权重从片外的 HBM 里搬过来。OpenAI 的 API 文档把已有的「Fast mode」标为对 GPT-5.6 Sol 提供「至多比 Standard 快 2.5 倍」的速度——这大致是软件层面能挤出的空间。
Cerebras 的晶圆级引擎走的是另一条路:不把整片硅晶圆切成几十颗独立小芯片,而是把它当成一颗芯片,并把内存直接做进芯片里。每颗晶圆级芯片上有 44 GB 片上 SRAM,权重留在片上,token 在跨晶圆流水线的各层之间流动,不再反复跨越片外存储的总线。Cerebras 称,这消除了 GPU 推理的内存带宽瓶颈——在 GPU 上,权重必须在片上缓存与片外存储之间来回搬运才能逐 token 生成。
「14 倍」量的是什么
14 倍的基准是「Standard processing」,不是 OpenAI 已经有的最快层级。OpenAI 的 API 文档写明,Fast mode(7 月 30 日由 Priority 更名)提供「至多比 Standard 快 2.5 倍」。把两个「至多」数字放在一起粗略折算,Ultrafast 相对 OpenAI 自家最快的既有层级,实际差距大约在 5 到 6 倍,而不是 14 倍。此外,14 倍和 750 token/秒都是「至多」的峰值口径,截至目前没有针对这一特定配置的独立第三方基准,访问仍限于小范围预览客户。
Cerebras 给出的对比都标注了是自己跑的评测:在 Humanity's Last Exam 上,Ultrafast 答完 2500 道题用了 11 小时 11 分,而 Claude Fable 5 用了 78 小时 27 分,Cerebras 称「精度相当、快了近 7 倍」;在 GDP-Val 上,端到端快 5.6 倍、「无质量损失」。需要注意,HLE 的对比一边用 Codex 加 xhigh 推理、一边用 Claude Code 加 xhigh 推理,两套 agent 外壳并不相同,这不是一次受控的同条件比较。
「智能不变」需要拆开看
OpenAI 与 Cerebras 都强调 Ultrafast 跑的是「同样的智能」「无质量妥协」。这句话的关键不在结论,而在它没说的部分:GPT-5.6 Sol 这样的前沿模型权重远大于单颗晶圆级芯片的 44 GB 片上内存,实际部署必然要做跨晶圆切分,并很可能配合低精度量化。厂商没有公开线上服务是否使用了量化、权重是否与 Standard 逐比特一致,而支撑「无质量损失」的 GDP-Val 和「精度相当」的 HLE,都出自 Cerebras 自己的评测。在第三方复现之前,「同样的智能」是厂商主张,不是已被验证的事实。
商业含义落在 Cerebras 身上
这件事的商业含义,落在 Cerebras 身上比落在 OpenAI 身上更重。今年 1 月 14 日,OpenAI 与 Cerebras 签下多年协议,部署 750 兆瓦的晶圆级推理算力;CNBC 当时报道称协议金额超过 100 亿美元、容量在 2028 年前分批上线。对 Cerebras 来说,OpenAI 是一个能帮它摆脱单一客户依赖的关键客户——CNBC 指出,G42 在 2024 上半年贡献了 Cerebras 87% 的收入。让 OpenAI 的旗舰模型公开跑在自己的芯片上,等于给晶圆级推理路线做了一次最高规格的背书。
但它不改变一个基本事实:这是一次推理部署,不是训练替代。前沿模型的大规模训练仍深度依赖英伟达的 GPU 生态和软件栈。Ultrafast 冲击的是推理环节的「英伟达独占」,而不是整个 AI 计算格局。
还没回答的问题
价格、可用区域、并发容量、上下文长度上限、SLA,OpenAI 一项都还没有公布;Ultrafast 目前只是邀请制的小范围预览。这些缺口决定了现在无法判断它在真实高并发负载下能否维持 750 token/秒,以及单位成本是否真的低于 GPU。下一项可观察的变量是:OpenAI 何时公布 Ultrafast 的定价与容量扩展时间表,以及首批预览客户之外是否出现可复现的第三方吞吐数据。

