8 月 12 日,xAI(现名 SpaceXAI)发布 Grok 4.6。官方给它的定位只有一句话:在 Grok 4.5 基础上,把重点放在「长程运行的 agent」和「更宏大的交互式与视觉工作」上。真正让这次发布区别于又一轮模型刷榜的,是独立评测机构 Artificial Analysis 同日给出的数字——Grok 4.6 在其智能指数上拿到 61 分,与 OpenAI 的 GPT-5.6 Sol 持平,同时把输出 token 价格压到了后者的五分之一。
追平不是自报,而是独立确认
xAI 官方博客称 Grok 4.6「在 Artificial Analysis 智能指数上追平 GPT-5.6 Sol」。这类厂商自报通常需要打折看待,但 Artificial Analysis 同日发布的独立评测证实了这一点:两者同为 61 分。该指数是九项评测的复合分——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 与 AA-LCR——综合覆盖推理、知识、数学、编码和 agent 工具使用。
61 分意味着它已回到前沿梯队,但并非登顶:仍落后于 Anthropic 的 Claude Opus 5(63 分)和 Claude Fable 5(62 分),仅以微弱优势领先 Moonshot 的 Kimi K3。相比 Grok 4.5 的 56 分,本次提升 5 分;相比 Grok 4.3 则高出 23 分。
提升最集中的地方在 agent 维度。GDPval-AA v2(真实世界 agent 知识工作的 Elo 分)拿到 1753,仅次于 Claude Opus 5,与 Claude Fable 5、Qwen3.8 Max 的置信区间重叠;τ³-Banking(多轮客服与工具调用)50.7%,与 Qwen3.8 Max(51.3%)并列前二;Terminal-Bench v2.1(终端软件任务)88.4%,与领先模型持平。Artificial Analysis 的概括是:很少有模型能同时在知识工作、客服和终端使用三类任务上保持竞争力。
便宜的不仅是单价,更是回合数
Grok 4.6 维持 Grok 4.5 的定价:输入 $2/M、输出 $6/M,另有一个价格翻倍的 fast 变体;缓存命中价从 $0.3/M 上调至 $0.5/M。作为对照,Claude Opus 5 为 $5/$25,GPT-5.6 Sol 为 $5/$30。Artificial Analysis 测算每个智能指数任务成本约 $0.84,与 Kimi K3 持平但智能分略高,因此落在「智能 vs 每任务成本」的帕累托前沿上。
比单价更有信息量的是回合效率。在 AA 的私有长程 agent 知识工作基准 AA-Briefcase 上,Grok 4.6 拿到 Elo 1577——Artificial Analysis 称其为「Fable 5 档」,仍在 Claude Opus 5 家族之下——但完成任务平均只用了约 53 回合、约 0.5B 输入 token,而 Claude Opus 5(max)需要约 103 回合、约 2.0B 输入 token。长程 agent 任务中上下文会随回合快速累积,因此「用一半回合、四分之一输入 token 到达相近答案」带来的成本优势,远大于每 token 标价本身。
训练侧改了什么
xAI 没有在官方博客里披露参数量。7 月 28 日 Musk 的路线图把 Grok 4.6 描述为 1.5T、复用 Grok 4.5 的 V9 基础架构,但正式发布文档未确认这一数字。训练方法上,官方描述了三步:更长的补充训练(策展的模型生成数据与高质工程数据,加上改进的优化器和训练配方);用 Grok 4.5 重新生成 SFT 轨迹(覆盖推理努力、agent harness、STEM、软件工程、知识工作,并用基于模型的检查过滤问题轨迹);以及在更广的 agentic RL 任务上训练(知识工作、通用编码,以及内核优化、Web 开发、计算机辅助设计等特定环境)。
官方博客还提到两个行为层面的观察:更长轨迹上模型「开始更多自测与验证」,以及视觉/交互式项目「首轮产出强于 Grok 4.5」。这两点目前只有厂商描述,没有第三方评测佐证。
基础设施方面,NVIDIA 同日确认 Grok 4.6 在 GB300 NVL72 上以 NVLink 训练和运行。渠道上,模型首发接入 Cursor 与 Grok Build(首周双倍用量),并通过 API、OpenRouter、Vercel、Cloudflare 提供。
边界与未验证项
需要约束的结论有四点。其一,61 分追平 GPT-5.6 Sol 是「追平一个点」而非全面领先:它在长程 agent 的 AA-Briefcase 上仍低于 Claude Opus 5 家族,「性价比前沿」不等于「能力前沿」。其二,参数量未获正式披露,1.5T 只有 Musk 路线图口径。其三,「视觉/交互更强」「更多自测」是厂商自报。其四,缓存命中价上调($0.3→$0.5/M)意味着高频复用场景的实际成本改善小于标价暗示的幅度。
前沿竞争转向成本曲线
Grok 4.6 的参照系是一个正在成形的分层市场:Anthropic 以 Claude Opus 5/Fable 5 占据能力与长程 agent 的顶端;GPT-5.6 Sol 以 61 分、$5/$30 守住 OpenAI 的前沿定价;Qwen3.8 Max($2/$6)与 DeepSeek V4 Pro(开源权重、定价更低)在下层以更激进的价格进攻。Grok 4.6 的策略是插入这个结构:以 GPT-5.6 Sol 级别的智能分、Anthropic 之下的价格,承接需要长程 agent 又对成本敏感的工作负载。
xAI 已把 Grok 4.7(路线图称 2.1T)排在「数周后」。对观察者而言,下一个可验证变量不是 Grok 4.7 的分数,而是两件事:Grok 4.6 的回合效率优势能否在真实客户的长程工作负载中复现,而不是停留在 AA 的受控基准里;以及 Anthropic 与 OpenAI 面对「同分低价」的新对手时,是否会在下一次定价中松动——那才是性价比真正改写前沿竞争格局的时刻。