AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Qwen3.8-2.4T 开源:Max 级权重开放,但单节点要靠 4-bit 量化

2026-08-12 / 2 天前 · 共 2,308 字

模型

8 月 12 日,阿里把 Qwen3.8-2.4T-A95B 的权重放上了 Hugging Face 和 ModelScope,兑现了 8 月 3 日发布 Qwen3.8-Max 时"下周开源"的承诺。这是 Qwen 首次把 Max 级模型开放权重,规模也足够醒目:2.4 万亿总参数、每 token 激活 95B、512 个路由专家、92 层混合注意力。但这个标题背后,真正的门槛在部署端——官方只发布了 BF16 和 FP8,其中 BF16 权重就有 4.45 TiB,需要 3 台 8 卡节点才能装下;把它压进单节点的 4-bit 路径,要靠 AMD、NVIDIA 和社区来完成,而发布方没有给出量化后的完整能力证据。

开放的是"Max 级",不是完整的 Max

先厘清口径。Qwen 模型卡写的是"Qwen3.8 首次把 Qwen-Max 级模型开放",不是"最大的开源模型"。这句话有两层保留。

其一,按参数规模,Moonshot 的 Kimi K3 已在 7 月底以 2.8T 参数开放权重,成为更大的开放权重模型,Qwen3.8 的 2.4T 排在后面。

其二,开放权重的 A95B 并不是 API 上 Qwen3.8-Max 的完整镜像。模型卡明确区分:Qwen3.8-Max 是基于 A95B 的官方版本,额外带有视觉输入、可关闭的思考模式、默认 1M 上下文和内置工具;而 A95B 是纯文本、强制思考、不支持多模态输入、原生上下文 262K。HN 上多条评论注意到这个落差——"开源版本把视觉能力去掉了,上下文也砍到 250K"。所谓"Max 级开源",开放的是主干推理能力,视觉、工具调用和更长的默认上下文仍留在付费 API 里。

架构:混合注意力让 2.4T 变得可运行

A95B 在 2.4T 规模下仍能维持可接受的成本结构,靠两个设计。

一是细粒度 MoE。512 个路由专家中,每个 token 只激活 10 个,外加 1 个共享专家,实际参与计算的参数量只有约 95B,服务成本跟随激活参数而非 2.4T 总参数。作为对照,Kimi K3 是 896 个专家激活 16 个,DeepSeek V4 Pro 是 1.6T 总参、49B 激活。

二是混合注意力。92 层里只有 23 层跑全注意力(间隔为 4),其余 69 层用线性注意力,把随序列长度增长的 KV 缓存替换成有界的循环状态。NVIDIA 的技术博客解释,这套交替结构让计算和显存在上下文增长时保持有界,支撑了把原生 262K 扩展到约 1M 的能力。模型还内置了 MTP 草稿头,用于加速解码。

这两点说明,2.4T 不是靠堆密度的噱头,而是用稀疏专家摊薄激活成本、用线性注意力摊薄长上下文成本的结构性选择。

单节点的代价是 4-bit,而 4-bit 的证据还很薄

真正的门槛在部署。vLLM 的部署矩阵把四种精度配置的单节点可行性列得很清楚:

精度 权重大小 8×B300 8×MI355X 8×H200
BF16 4.45 TiB 3 节点 3 节点 6 节点
FP8 2.27 TiB 2 节点 2 节点 4 节点
MXFP4(AMD) 1.45 TiB — 1 节点 2 节点
NVFP4 W4A4(NVIDIA) 1.32 TiB 1 节点 — 2 节点

从"权重开放"到"单节点能跑",中间隔的是一次 4-bit 量化。而这一步并不在 Qwen 的官方发布里:Qwen 只放出了 BF16 和 FP8,单节点的 MXFP4 与 NVFP4 构建由 Inferact 账号提供,AMD 的文章用 Quark 从 FP8 检查点做 MXFP4 量化,NVIDIA 走 NVFP4 W4A4。这与 Kimi K3 形成反差——Moonshot 从 SFT 阶段就做量化感知训练,发布即 MXFP4,权重约 1.5 TB;Qwen 则是在发布后由生态去量化。

HN 上最集中的担忧因此不是"模型好不好",而是"它比 K3 更难服务":没有 QAT 的 4-bit,第三方服务商要么用 FP8 跑多节点,要么等有人用足够的校准数据做出可靠的 NVFP4,评论里点名的正是 NVIDIA。

精度证据同样薄弱。AMD 的文章给出的是 MXFP4 在 GSM8K(小学数学题)上的准确率 97.49%,与 FP8 持平;NVIDIA 给出的 FP8 在 GB300 NVL72 上的吞吐是单卡 4K+ tok/s、单用户 350+ tok/s。但 GSM8K 是对量化误差最不敏感的一类任务,用它证明 4-bit 不影响编码或长程 Agent 能力,几乎说明不了问题。模型卡上的完整基准表全部来自 Qwen 自测,发布时没有独立第三方评测;HN 上"这张卡好得不像真的"的评论,指向的正是这种自报数据的问题。

"首个 Max 级开源"意味着什么

抛开部署门槛,这次发布本身是一个战略转向。过去 Qwen 的 Max 系列只通过 Qwen Cloud 的 API 提供;把 Max 级权重开放,意味着阿里在"开放权重 + 云推理"双轨上同时押注,用开源权重换取研究社区和第三方托管商(vLLM、SGLang、TokenSpeed,以及 AMD、NVIDIA 的 Day 0 支持)的生态绑定。

它也让中国三家实验室的超大开源竞争在同一天亮牌:DeepSeek V4 Pro(1.6T-A49B,MIT 许可,4 月已开放权重)被曝出 0813 版本基准接近 Fable 5 水平;Kimi K3(2.8T)7 月底开放权重;Qwen3.8(2.4T)补上"Qwen 首个 Max 级开源"的位置。三条路径不同——DeepSeek 走小激活的高效 MoE,Moonshot 走 2.8T 的规模上限,Qwen 走 512 专家的细粒度稀疏——共同点是把接近前沿能力的模型从 API 后墙里拿出来,交给生态去跑。

对大多数想真正用起来的人,更实际的节点在两天后:社区与 HN 评论都提到 Qwen3.8-27B 版本预计周五发布。那才是普通硬件能承载、也真正改变本地推理体验的模型。2.4T 的 A95B 更像一场部署经济学的压力测试:它证明 2.4T 参数可以被量化压进单节点,但把"压进去之后还能用"的验证,留给了 AMD、NVIDIA 和社区,而不是发布方自己。

来源

  1. Qwen/Qwen3.8-2.4T-A95B 模型卡 (Hugging Face)
  2. vLLM Recipes: Qwen/Qwen3.8-2.4T-A95B
  3. Day 0 Support for Qwen 3.8 on AMD Instinct GPUs
  4. Serve Qwen3.8-2.4T-A95B on NVIDIA GB300 NVL72
  5. Qwen3.8-Max: A New Bar for Coding and Cowork (Qwen Blog)
  6. Kimi K3: Open Frontier Intelligence (Moonshot)
  7. Hacker News 讨论: Qwen/Qwen3.8-2.4T-A95B

评论

登录后即可参与评论。

加载评论中…

相关文章

  • X 应用设置中的 Under the Hood 透明度工具截图,展示可下载账户与帖子排序标签 JSON 数据的功能

    X 开源推荐排序代码,违规判定仍留在黑箱里

    算法 · 2026-08-13

  • Muse Glimmer 模型发布概念图,展示蓝色 Meta 笔记本电脑

    Glimmer:Apache 2.0 许可 + 完整推理栈,Meta 的开源反击不只是又一个模型

    算法 · 2026-08-10

  • WorldClaw 三阶段 pipeline:意图分析→全局地形生成→区域物体生成与放置

    腾讯 WorldClaw:用 Agent 编排取代端到端生成,3D 世界构建路线之争浮现

    算法 · 2026-08-10

  • 微软 Copilot 的动画角色 Mico,本次将从 Copilot Voice 中移除并迁往 Learn Live

    微软合并 Copilot 应用、下线五个功能,Deep Research 改为付费项

    算法 · 2026-08-13

  • 该预印本的泛化热力图,展示训练后的说服者对不同目标模型在五个基准数据集上的说服成功率

    一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

    算法 · 2026-08-13

  • Anthropic 地盘战实验的结局分布图:Mythos 5 约 98% 的试验以停战告终,而 Sonnet 4.6 与 Opus 4.6 多数以武力解决或悬而未决

    更强的模型不会自动带来协调:Anthropic 的多智能体失败实验

    算法 · 2026-08-13

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS