AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Qwen 开源 Qwen3.8-Flash-Next:125B 主干、每 token 激活 6B,提前预览 Qwen4 架构

2026-08-26 / 1 天前 · 共 2,585 字

模型
Alibaba / Qwen

8 月 26 日,阿里 Qwen 团队开放了 Qwen3.8-Flash-Next 的权重,并把它的定位写得直白:不是一次常规迭代,而是 Qwen4 架构的"提前预览"。官方博客明确说,它扮演的角色与当年的 Qwen3-Next 之于 Qwen3.5 相同——那次引入的 Gated DeltaNet 加 Gated Attention 混合架构,后来被 Qwen3.5 到 Qwen3.8 全系沿用。这一次,Qwen 把下一代架构在注意力、残差、嵌入、优化器四个方向上的改动提前交给社区,押注的是一条靠稀疏激活和确定性查找表压低每 token 成本的路线。

6B 激活、约 180B 存盘:稀疏激活省的是计算,不是显存

Qwen3.8-Flash-Next 是一个多模态混合专家(MoE)模型:125B 主干,外加 51B 的 N-gram 嵌入表和 4B 的多 token 预测(MTP)模块,磁盘上约 180B 参数,但每个 token 只激活 6B。作为对照,上一代 Qwen3.7-Plus 是 397B 总参数、17B 激活,Flash-Next 的激活量只有它的约三分之一。

"6B 激活"容易让人误以为这是台工作站能跑的轻量模型。事实相反:稀疏激活砍掉的是每个 token 的矩阵乘法计算量,并不减少权重占用的存储。FP8 checkpoint 有 172.78 GiB,BF16 是 335.28 GiB;按 vLLM 的部署配方,FP8 在 GB300 上至少需要 TP2、推荐 TP4,8×H200 节点要用 TEP8。自托管意味着多卡节点,而不是单张消费级 GPU。

四项架构改动,围绕同一个目标:长上下文下的每 token 成本

官方把改动归结为四个方面。注意力的核心是 GDN 与 QSA 的混合:48 层里每 4 层为一组,其中 3 层用 Gated DeltaNet(GDN)——一种线性注意力,把历史信息持续压缩进一个固定大小的循环状态;第 4 层用 Qwen Sparse Attention(QSA),由轻量 indexer 先把序列聚成 micro-block、在块级别估计重要性,再只对选中的区域做全局注意力。用官方的话说,GDN 负责高效地"记",QSA 负责精确地"取";QSA 的预算被设为 512 个块、2048 token。

Qwen3.8-Flash-Next 架构图

残差方面,Gated Residual 把单一残差流扩成 4 条并行分支,用逐元素读门和每分支标量写门动态控制读写,瓶颈秩 320,残差状态还支持 FP8 存储以进一步减少内存访问。嵌入方面,N-gram Embedding 在第 2 层放了一张 2000 万条目的二元/三元短语查找表,用局部上下文做确定性查表;因为查表位置可以预先确定,这 51B 参数能放在主机内存、用异步预取与计算重叠,不必常驻 GPU 显存。优化方面,主优化器换成 Muon,与 AdamW 分工,并重拟合了 scaling law——团队还发现大批量训练常用的 batch-size warmup 不再必要,直接以目标 batch 起步反而省掉 18.8% 的优化步数。

"1/9 训练成本"是厂商自报,基准分数有方法论取舍

官方宣称训练成本约为 Qwen3.7-Plus 的 1/9,同时在编码和办公任务上表现更好——这句话的每一半都来自 Qwen 自己的测量,尚无第三方复现。

看自报的基准分数,领先集中在 agentic 编码和办公任务:DeepSWE 1.1 得 58.7(Qwen3.7-Plus 为 16.5)、SWE-bench Pro 62.5、CoWorkBench 73.9(DeepSeek-V4-Flash 为 45.1)、JobBench 55.7(Qwen3.7-Plus 为 27.6,接近翻倍)、LiveCodeBench v6 91.9、GPQA Diamond 91.7。但它并非处处领先:多学科推理 HLE 得 35.9,落后 Claude Opus 4.6 (Max) 的 40.0;仓库级代码生成 NL2Repo-Bench 48.1,落后 DeepSeek-V4-Flash 的 54.2。

这些数字背后有几处官方自己披露的方法论取舍:DeepSWE 1.1 取的是两个 harness(Claude Code 与 mini-SWE-agent)里的最高分;SWE-bench Pro 修正了部分题目并据此重评了所有基线;CoWorkBench 是内部基准;HLE 用 GPT-4o 而非基准默认 grader 评判。这些做法本身透明,但意味着分数不能与其他模型在原始基准上的报告值直接并排比较。

从 Qwen3-Next 到 Qwen4:一个自我复制的预览机制

理解这次发布的关键在 "Next" 这个后缀。官方博客写明,Qwen3-Next 引入的 GDN + Gated Attention 混合架构,后来被 Qwen3.5、Qwen3.6、Qwen3.7、Qwen3.8 全系采用。这一次,Flash-Next 用 QSA 替换了作为"检索"那一半的 Gated Attention,作为 Qwen4 的架构先导。也就是说,这不是一款孤立的模型,而是 Qwen 把尚未定型的下一代设计提前开源、接受社区检视的机制——上一轮这套做法最终被全系采纳,于是同一机制第二次运转。

许可证不是 Apache,商业使用有条件

与 Qwen3.8-27B 使用 Apache-2.0 不同,Qwen3.8-Flash-Next 采用 Qwen Community License 1.0。许可证正文允许自由使用、复制、修改、分发、托管和微调,但附加两条商业条件:商业产品或服务若月活超 1 亿或月营收超 2000 万美元,必须在用户界面显著展示模型名;若被用于 Model as a Service 或 AI 工作助手(AI Work Assistant)业务,则需在商用前单独向 Qwen 取得许可,仅限内部使用、不向第三方暴露能力的情况除外。

生产版本 Qwen3.8-Flash 通过 QwenCloud 提供,定价输入 $0.16、输出 $0.47 每百万 token,约为旗舰 Qwen3.8-Max($2.00 / $6.00)的 1/12。官方强调的长上下文加速——QSA kernel 在 1M token 下 prefill 7.6×、decode 4.9×,90% 前缀缓存命中率时 prefill 吞吐是 Qwen3.7-Plus 的 8.6×——同样是厂商自报;SGLang 与 vLLM 的配方里还出现过 10.2× 与 6.6× 的另一组数字,在独立测量之前只能当作区间看待。

下一项可观察的变量是明确的:权重已经落盘,第三方能否复现 1/9 的训练成本、能否独立跑出这组基准分数,将决定 Qwen4 架构预览是"真省"还是"自报省"。

来源

  1. Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency · Qwen
  2. Qwen Community License 1.0 · Qwen
  3. Qwen3.8-Flash-Next (GitHub) · Qwen
  4. Alibaba releases Qwen3.8-Flash-Next, targeting 'ultimate cost efficiency' · The Decoder
  5. Alibaba's Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture · MarkTechPost
  6. Qwen3.8-Flash-Next Previews Qwen4 Architecture With 6B Active Parameters · Unite.AI

评论

登录后即可参与评论。

加载评论中…

相关文章

  • OpenAI 旧金山 Mission 区 Pioneer 大楼,OpenAI 总部所在地

    OpenAI 正式关停 Assistants API,官方迁移路径指向的 Prompt 也被弃用

    算法 · 2026-08-27

  • Tom's Hardware 报道中使用的 Claude 品牌配图

    Anthropic 的「AI 加速 AI」论证:80% 代码为据,递归自我改进仍是推测

    算法 · 2026-08-25

  • Anthropic 透明中心(Transparency Hub)页面题图

    Anthropic 上调 misalignment 风险评级,并自曝生物分类器缺位近一年

    算法 · 2026-08-25

  • 以问号形芯片象征匿名模型 ox-alpha 的题图,标注 1M token 上下文、免费一周、作者未知

    ox-alpha 的“登顶”被夸大了,但匿名上架已成真实发布流程

    算法 · 2026-08-24

  • 多台彩色人形机器人在北京国家速滑馆开幕式前整齐列阵

    百米 9.39 秒、跳高 2.88 米:人形机器人「破纪录」背后是评测方式之变

    算法 · 2026-08-24

  • 示意图:Codex 通过 Chrome DevTools 驱动应用验证自己的工作——选择目标、快照界面状态、触发操作、观察运行时事件、应用修复并循环重跑,展示 Harness 管理的执行循环。

    OpenAI 开源 Codex Harness:智能体的护城河正从权重转向脚手架

    算法 · 2026-08-24

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS