AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Musk 公布 Grok 4.6→4.7 路线:1.5T 先行,2.1T 接力

2026-07-28 / 1 天前 · 共 3,777 字

模型
xAI

7 月 28 日,Elon Musk 在 X 上以一条不到 50 词的帖子,公布了 xAI 未来一个月的模型发布路线图:Grok 4.6 约在 8 月 7 日发布,是 1.5 万亿参数模型,监督微调(SFT)与强化学习(RL)显著改进;Grok 4.7 将在数周后推出,2.1 万亿参数,「在各方面都优于 4.6,只是推理稍慢,但 token 效率更高」。

同帖中 Musk 引用了 Vercel CEO Guillermo Rauch 发布的 deepsec.sh 基准测试结果——Grok 4.5 在网络安全漏洞检测中以性价比胜出:分数接近 Kimi K3,成本仅为 GPT-5.6 Sol 的十分之一、Claude Opus 5 的 5.7 分之一。两条消息并列发布,意图明确:xAI 不仅在技术路线上有自己的节奏,在成本维度上也已经构成实质性竞争。

但最值得注意的并非发布日期本身,而是 Musk 在十天内对同一路线图的叙述调整:7 月 18 日他首次提及 Grok 4.6 时称之为「2T model」,而 7 月 28 日正式公告中,Grok 4.6 变成了 1.5T(与 Grok 4.5 共享 V9 基础架构),原本的 2T+ 规模被推迟为 Grok 4.7。这 10 天的变化揭示了一个比发布时间表更重要的策略选择——xAI 正在实践「后训练先行、规模跟进」的迭代方法论。

从「直接跳 2T」到「后训练先行」

Grok 4.5 于 7 月 16 日正式上线,基于 xAI 的 V9 基础模型,官方宣称参数规模约 1.5 万亿。定位明确:专为编程、Agent 任务和知识工作设计,与 Cursor 联合训练。定价 $2/百万输入 token、$6/百万输出 token,服务速度 80 TPS。从官方公布的有限基准对比来看,Grok 4.5 处于「Opus 级别但更快更便宜」的区间——在 SWE-bench 类编程任务上接近 Claude Opus 4.8 和 GPT-5.5,同时 token 消耗量和推理成本显著更低。

仅仅两天后的 7 月 18 日,Musk 在回复中首次提及 Grok 4.6,称之为「2T model」并预计初始训练将在当周完成。当时多家媒体据此报道 Grok 4.6 将是 2 万亿参数模型,目标是超越 Moonshot 约 2.8T 参数的 Kimi K3。但在 7 月 28 日的最终公告中,Grok 4.6 被明确定义为 1.5T 模型,2.1T 被分配给了 Grok 4.7。

这一调整不应简单理解为延期。它反映的是 xAI 对模型迭代路径的实际权衡:在 V9(1.5T)基础训练已完成的前提下,继续投入 SFT 和 RL 后训练可以快速产出一个显著改进的版本(4.6),而不必等待 2.1T 基础模型的完整训练周期。xAI 在 Grok 4.5 的官方博客中描述了其 RL 训练体系——覆盖数十万个任务、以多步软件工程为中心、采用高度异步架构使 Agent 回滚可以在数万 GPU 上运行数小时——这为「同一基础模型 + 强化后训练 = 新版本」提供了工程基础。

这意味着 Grok 4.6 并非参数规模的跃升,而是训练质量的跃升。当行业习惯用参数数量衡量代际进步时,xAI 正在用发布节奏本身证明:后训练改进足以定义一个独立版本。

公开参数规模:在透明度洼地建立信号

xAI 公开 Grok 4.5 为 1.5T、Grok 4.7 为 2.1T,这一行为在 2026 年的行业语境下本身就是一种立场表达。

Stanford HAI 发布的 2026 年 Foundation Model Transparency Index 显示,主流模型开发者的平均透明度评分从上一年的 58 分降至 40 分,连续两年的改善趋势被逆转。训练代码、参数规模、数据集大小和训练时长等此前逐步公开的指标,在多个前沿模型中重新变为未披露状态。OpenAI 自 GPT-4 起不再公开参数规模,GPT-5.6 系列的参数完全未知。Anthropic 的 Claude Opus 5 系统卡同样不包含参数数量。Google DeepMind 的 Gemini 系列也未披露完整架构尺寸。

Musk 选择在 X 上直接公布参数规模和发布日期,与竞品的信息管控形成鲜明对比。这不只是个人风格问题——xAI 的最新融资(2026 年 1 月 Series E $200 亿)和 SpaceX IPO 使其处于资本市场的高度关注之下,参数规模的可验证增长为「全球最大 AI 训练集群」的叙事提供了可量化的产出指标。但需要注意的是,公开参数规模不等于实质透明:xAI 未公开架构细节(密集还是 MoE)、训练数据构成、安全测试结果,也未发布完整的模型卡。截至目前,Grok 4.5 在 SWE-bench Verified 等关键公开基准上的官方数据仍不完整。

deepsec.sh 基准:性价比维度的不对称竞争

Rauch 发布的 deepsec.sh 基准测试为 Grok 的价值主张提供了独立验证。DeepsecBench 在一个包含 231 个已知漏洞的真实代码库上评估模型的安全扫描能力,评分以 F2 分数计算(召回率权重为精确率的两倍)。

Grok 4.5 在 high 推理设置下得分 15.58,成本仅 $5.60;相比之下,GPT-5.6 Sol 在 xhigh 设置下得分 35.58(2.3 倍),但成本高达 $55.98(10 倍)。Kimi K3 得分 17.56,成本 $12.38(2.2 倍)。换句话说,在安全扫描这一垂直任务上,Grok 4.5 的「单位美元得分」约为 GPT-5.6 Sol 的 4.3 倍。

但 benchmark 故事的另一面同样值得留意:GPT-5.6 Sol 的绝对分数仍然是最高,且其 precision(96.3%)远超 Grok 4.5(77.8%),意味着 Grok 会产出更多误报。在实际部署中,误报率直接影响安全工程师的工作量——一个节省 API 费用但增加人工审核成本的扫描方案,未必像单价对比看起来那么划算。

此外,Anthropic 的安全专长在 DeepsecBench 上也体现为一种缺席:Fable 5 直接拒绝执行安全扫描任务。这恰好衬托出 Grok 4.5 的产品定位——不做拒绝回答的「安全模型」,而是做性价比足够好、什么都能干的工作模型。

Colossus:基础设施如何兑现迭代节奏

xAI 的两周迭代节奏能否持续,最终取决于其训练基础设施。Colossus 超算集群目前运行超过 55 万块 NVIDIA GPU——包括 GB200 和最新的 GB300——分布在 Memphis 地区的三个数据中心,总电力容量约 2 GW。Colossus 2 于 2026 年 1 月成为全球首个 GW 级 AI 训练集群,GPU 采购总额估计约 $180 亿。

Grok 4.5 官方博客提到其训练跨越「数万块 GB300 GPU」,同时支持高度异步的 RL 训练——Agent 回滚可运行数小时而学习过程不中断。这种基础设施使得 xAI 可以同时训练多个模型(Musk 此前表示同时在训练 7 个模型,从 1T 到 10T 参数不等),从而将基础模型训练和后训练改进并行化。

但这种节奏的可持续性面临两个约束。第一,电力。2 GW 的数据中心集群在 Memphis 引发了对电网负荷和环境的担忧,进一步扩容需要新的发电基础设施。第二,资本。$180 亿 GPU 投资需要持续的用户增长和 API 收入来支撑——Grok 4.5 的低定价策略(仅 $2/$6 每百万 token)有利于获取市场份额,但对短期盈利能力构成压力。

两周迭代的代价:安全评估跟得上吗

Musk 的路线图承诺约四周内连续发布两个模型版本,这种速度在 AI 行业几乎没有先例。OpenAI 的 GPT-5 系列迭代周期以季度计,Anthropic 的 Claude Opus 系列间隔约 3-6 个月。两周迭代带来了一个无法回避的问题:安全评估是否跟得上。

ROIC.ai 在报道中引用了一位匿名机器学习教授的观点:「以这种速度迭代,红队测试不够充分的风险是真实存在的。」xAI 尚未发布 Grok 4.5 的完整安全测试报告或第三方审计结果,也未说明 4.6 和 4.7 将经历什么级别的安全评估。在美国政府近期已对多款前沿模型(包括 GPT-5.6 Sol 和 Claude Mythos 5)施加管控措施的背景下,快速迭代可能引发监管关注。

不过,将安全问题简单归因于速度并不准确。Grok 4.5 发布时,xAI 强调其训练数据经历了严格的过滤和去重——去重、质量评分、领域聚焦选择——以确保数据混合保持高覆盖和高信号。这套数据管线如果能延续到后续版本,至少能为内容安全提供基础保障。真正的盲区在于 Agent 能力——当模型具备自主执行多步骤任务的能力时,安全测试需要覆盖的不是单轮对话而是数小时的回滚轨迹,这对任何速度的迭代都是挑战。

值得观察的下一变量

Musk 公布的时间表存在固有的不确定性——他在帖子中使用了「around August 7」和「a few weeks later」等措辞,且 xAI 过去的产品发布经常晚于 Musk 在社交媒体上的预告。Grok 4.5 从 Musk 首次提及到正式上线间隔约三周,Grok 4.6 的时间窗口更窄。

两个关键检验点将决定这次路线图对行业的影响程度。第一,8 月 7 日前后 Grok 4.6 是否能按时发布,以及「显著改进的 SFT 与 RL」是否在可量化的基准(而不仅是公司自选的测试)上体现出可感知的提升。第二,Grok 4.7 的 2.1T 参数规模能否在合理延迟和成本下实际可用——当模型参数从 1.5T 跃升到 2.1T 时,token 效率的提升是否足以抵消原始推理成本的增加。

无论结果如何,xAI 已经将「公开路线图 + 快速迭代」确立为一种不同于 OpenAI/Anthropic 的竞争范式。在透明度评分下降的行业环境中,哪怕只是公开参数规模,也已经构成一个有分量的信号。

来源

  1. Elon Musk on X: Grok 4.6 and 4.7 release timeline · X / Elon Musk
  2. Guillermo Rauch on X: Grok 4.5 deepsec.sh benchmark results · X / Guillermo Rauch
  3. Introducing Grok 4.5 · SpaceXAI
  4. DeepsecBench: evaluating model performance in finding cybersecurity vulnerabilities · Vercel
  5. Stanford 2026 AI Index: Foundation Model Transparency · Secure Privacy / Stanford HAI

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Freenow by Lyft 与百度 Apollo Go 自动驾驶车辆在伦敦街道

    伦敦 Robotaxi 三路交锋:Waymo、百度与 Uber+Wayve 的技术路线对决

    算法 · 2026-07-28

  • 蓝色、粉色和紫色盾牌叠加的抽象插图,代表 Microsoft 的网络安全 AI 模型

    Microsoft 用自研安全模型把 AI 网安竞争从能力拉到成本

    算法 · 2026-07-27

  • Kimi K3 模型发布视觉主图

    Kimi K3 权重落地:首个开源 3T 模型的架构突破与部署账单

    算法 · 2026-07-27

  • OpenAI Presence 界面截图,展示客户支持对话与工具操作面板
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS

OpenAI 发布 Presence:告别卖模型,开始卖「受管控的 Agent」

算法 · 2026-07-27

  • Reid Hoffman,Prentis 联合创始人之一

    Prentis 融资 1 亿美元:32B 小模型在 computer use 赛道挑战 GPT-5.4

    算法 · 2026-07-27

  • Anthropic Claude 平台升级示意图

    Anthropic 两连发:录屏转 Skill 与 Agent 集群运维升级,Claude 加速平台化

    算法 · 2026-07-26