8 月 13 日,OpenAI 正式预览了一个名为 Ultrafast 的新 API 服务层级:把旗舰模型 GPT-5.6 Sol 放到 Cerebras 的晶圆级芯片上运行,宣称最高比标准模式快 14 倍、输出速度最高 750 token/秒。这是一个"速度层级",不是新模型——Sol 本身已于 6 月预览、7 月 9 日全面开放。更值得读的是官方公告里没写的东西:没有定价、没有独立的模型 ID、没有全面开放的时间表,而且几乎每一个支撑"快"这个结论的数字,都出自 OpenAI 或 Cerebras 自己。
本站 6 月 26 日曾报道 OpenAI 确认 Sol 将在 7 月部署到 Cerebras、速度达 750 token/秒;7 月 13 日的开发者验收稿也记录了该模式把 Agent 循环从分钟级压缩到秒级。8 月 13 日的新增量在于:这个此前只停留在预告里的模式,第一次有了正式命名、一套对比基准和一批试运行客户——但 OpenAI 当天实际交出的,是一个等待名单。
交付物是等待名单,不是产品
Ultrafast 率先在 OpenAI API 上线,目前仅向"一小批选定客户"开放,措辞是"随容量增长逐步扩大访问",配套表单只收集意向、不承诺日期。Cerebras 还并行了另一个自己的注册通道——两家公司在共同培育同一份等待名单,这本身说明这是一次厂商与芯片伙伴的联合宣发,而非一个即用产品。
三个关键信息在 OpenAI 公告与 Cerebras 新闻稿里都缺席:Ultrafast 相对标准模式的溢价是多少(Sol 标准价仍是 5 美元/百万输入 token、30 美元/百万输出 token);是否有独立的模型 ID(目前读起来只是现有模型上的一个服务层级选项);以及何时全面开放("随容量增长"之外没有任何承诺)。
还要留意一个命名陷阱。GPT-5.6 已有一个"Ultra mode"——那是 7 月 GA 时发布的并行化功能,把工作扇出给多个并行子 Agent。Ultrafast 与之无关,它是把单个模型的单流输出变快的硬件速度层级:一个是加人手,一个是让一个人跑得更快。
晶圆级芯片为什么能变快
速度的来源是 Cerebras 的 Wafer-Scale Engine(WSE-3)架构,其逻辑可以压缩成一句话:大模型在 GPU 上做推理的瓶颈不是算力,而是数据搬运——每生成一个 token,都要把模型权重在片上缓存与片外存储之间反复搬进搬出。Cerebras 的做法是把 44 GB SRAM 直接做在每颗晶圆大小的芯片上,权重常驻片上,token 沿流水线化的各层不断流下去。WSE-3 在单个 46,225 mm² 的硅片上集成 4 万亿晶体管、约 90 万个 AI 核心,Cerebras 称之为"世界最大的 AI 芯片"。这一架构本站 6 月的稿件已详细拆解,这里不再展开。
对理解 Ultrafast 而言,只需记住它承诺的是:不必换成更小、更专的模型,就能拿到接近实时响应的速度。这是 OpenAI 第一次把"速度"当作与"智能"并列、而非对立的卖点。
速度账本:谁测的,测了什么
Ultrafast 的数字必须按"谁测的"来读,因为"OpenAI 说 Ultrafast 比 Claude 快"这句话其实隔着三层。
最基础的两个数字——"最高 14 倍"与"最高 750 token/秒"——是 OpenAI 自己的说法。"最高"意味着上限而非均值,且公告没有披露这个倍数是在什么负载、什么上下文长度、什么推理力度下测得。
所有与竞品的对比都出自 Cerebras 而非独立评测。Cerebras 引述 Artificial Analysis 的输出速度数据称,Ultrafast 比 Claude Fable 5 快 11 倍、比 Claude Opus 4.8 的 Fast 模式快 5 倍;在 Humanity's Last Exam(HLE,2500 道博士级题目)上,Sol Ultrafast 用 11 小时 11 分跑完全部题目,Fable 5 用了 78 小时 27 分,称"准确率相当"、约快 7 倍。但细看方法:两次跑分不在同一天、用了不同框架——Sol Ultrafast 是 7 月 10 日配 Codex 在 xhigh 推理档位跑,Fable 5 是 7 月 13–15 日配 Claude Code 跑;"准确率相当"只是断言,没有公布分数。
相对最站得住的是 GDP-Val 上 5.6 倍的端到端加速、"质量无退化"——这是 7 月 31 日 Cerebras 用 Sol 对比 Sol Ultrafast 的同模型对比,至少避开了跨厂商的苹果橘子问题。"厂商自报"不等于假,Cerebras 硬件此前确实跑出过亮眼吞吐;但它意味着未经验证,这在规划上是与"已验证"不同的输入。
速度改变的是什么
OpenAI 列出的五个场景有一个共同点:都有一个活人(或一条仍在出故障的线上系统)在等答案——事故响应时边读日志边准备修复、市场还在波动时做金融研究、语音客服里不停顿的多轮复杂对话、结账页面上趁用户犹豫前给出答案、把"隔夜跑实验、早上看结果"压缩成当天多轮迭代。
早期客户名单包括 Jane Street、Podium、Basis、Rogo,给出的是定性评价:做语音的 Podium 称 Ultrafast"彻底改变了复杂对话的通话体验";做金融研究的 Rogo 称它"让复杂的金融研究像实时交互"。
一个量级参考:750 token/秒意味着一个约 500 token 的 Agent 响应约 0.7 秒落地;用 OpenAI 自己给的 14 倍反推,标准模式基线约在 54 token/秒,同样长度的响应要 9 秒以上——前者能撑住一通电话或一次结账,后者不能。这个反推基线是编辑根据 OpenAI 两个数字的推导,且两个数字都是"最高"上限、未必对应同一负载,因此只是量级参考,不是 OpenAI 公布的数。
边界:快不等于便宜,也不等于已验证
两点必须写清楚。其一,Ultrafast 没有定价,而快往往意味着贵——Cerebras 的晶圆级硬件单价高昂,本站 7 月的稿子已提醒"速度快不等于便宜":一个 14 倍速层级若按 token 收溢价,用户只是用更贵的 token 换更短的等待。其二,"与标准模式同等智能、无质量妥协"是本次发布最承重的承诺,也恰恰是预览阶段外部无法核验的那条——几乎没有第三方能在等待名单之外跑一次独立质量评测。
商业背景同样值得留意:就在 Ultrafast 发布同一天,The Information 报道 Cerebras 股价因硬件收入下滑下跌 16%,其第二份财报电话会议"喜忧参半"。这笔 750 兆瓦、分多批到 2028 年才全部上线的合作,对 Cerebras 是把晶圆级技术推向数亿用户的押注,对 OpenAI 则是在 GPU 之外再开一条低延迟推理供给线。它真正验证的,是"最智能的模型也能跑在专用加速硬件上"这条路线本身能否规模化——而这一答案,要等价格、容量和第三方评测全部落地后才能判断。

