2026 年 8 月 2 日,阿里 Qwen 团队正式发布 Qwen3.8-Max——2.4 万亿参数(95B 激活),1M token 上下文窗口,API 即日上线,权重下周开源。这是 Qwen 家族迄今最强模型,也是阿里首次将 Max 级模型权重开放。
但真正让这次发布区别于常规旗舰升级的,不是参数规模,而是 Qwen 团队选择用一组长周期自主任务案例——而非单纯的 benchmark 分数——来定义模型能力的上限。官方博客将叙述重心放在三个跨度从 24 小时到 16 天的任务上:自主构建一个自进化的 CLI 工具、完全从零复现并改进一篇研究论文、以及在一场真实竞赛中击败 87% 的人类队伍。
这是一种明确的叙事转向:模型的价值不再仅仅是"能回答什么",而是"能在多天内独立交付什么并自我改进"。但伴随这一转向的,是大量自建 benchmark、有限的独立评测和尚未交付的开源承诺——证据链的强度决定了这一叙事能否成立。
三个长周期案例:新叙事的三根支柱
16 天自主编码:oh-my-cli
Qwen3.8-Max 被要求从空文件夹开始创建 oh-my-cli 项目,并在超过 10 天的时间里构建一个自进化的工程闭环——将用户反馈、社区实践和模型自身的自测结果整合到一个持续迭代的流水线中:需求被标准化为 issue,由 agent 自动认领和执行,经过代码生成、测试、预览和日志分析后持续迭代。
截至 2026 年 7 月 30 日,在约 16 天完全自主运行后,该仓库累计产生了 265 次提交、127 个 PR 和 151 个 issue。完整的项目轨迹已公开在 GitHub 仓库 qwen-code-dev-bot/oh-my-cli。
这个案例展示的不是一次性代码生成,而是一个持续运行的系统:包含 issue 状态机、调度器、监控和看门狗的完整执行循环,每次更新后自动触发构建、单元测试、E2E 测试和桌面生命周期验证,异常状态被路由回相关 issue 进行修复。
但它同时也是最难以独立验证的案例。16 天的时间跨度和闭环自主运行意味着:没有已知的独立团队尝试复现这一实验。GitHub 仓库是公开的,但这只能证明代码存在,不能证明整个过程中没有人类干预。
5 天复现论文——然后改进它
Qwen3.8-Max 拿到了一篇关于 LLM 推理数据选择的论文(arXiv:2605.22389),要求是:用代码复现论文实验,然后尝试做得更好。模型从零开始——没有起始代码、没有现成流水线——需要自己设计和编写数据处理脚本、训练代码和评估设置。
在大约 5 天(约 125 小时)的连续工作中,模型编写了约 7600 行代码,执行了超过 1100 次操作,运行了 33 轮 GPU 训练。它先用约 37 小时复现了论文的完整流水线并确认了六项主要发现(在 AIME24 上比随机选数据高出 +7.7%),然后用约 88 小时进行了四轮自我改进循环——"形成假设→编写代码→在 GPU 上运行→分析结果→再试"——发明并测试了 18 个改进想法,最终通过一种计数"难决策点"(nhighgate)的方法将 AIME24 成绩提升 +2.71 点,超过原论文。
这个案例的方法论比 oh-my-cli 更清晰:论文和方法都是公开可审计的,四轮改进的中间结果以表格形式呈现。但"完全自主"的声明同样缺乏独立复现。
24 小时击败 87% 人类队伍
Qwen3.8-Max 参加了阿里云天池平台上的 WWW2025 多模态对话意图识别挑战赛,与 526 支人类队伍同场竞技。任务是从包含文本和截图的客服对话中正确识别客户意图。在严格的 24 小时时间限制下,模型自主阅读比赛规则,构建了完整的代码方案:对文本侧微调并集成了 BERT、MacBERT 和 RoBERTa,对截图侧微调了 Qwen2.5-VL-7B 并用 Chinese-CLIP 处理不确定的图像,最后融合为加权投票系统。经过 45 次提交,准确率从 0.60 稳步提升至 0.853,击败了 458 支队伍。
这是三个案例中最接近"可独立验证"的一个:比赛平台公开、提交记录可查、排名透明。不过需要注意,这场比赛的人类队伍构成(学生、从业者还是专业竞赛团队)未被披露,87% 的击败率在不同参照系下含义差异很大。
Benchmark 全景:领先与落后并存
Qwen 官方发布的 benchmark 表格覆盖了 60 多项评测,分为编码智能体、通用智能体、通用能力、多模态推理、视觉 Agent 与编码、文档与办公智能、真实世界与空间理解、视觉感知与定位、视频智能与 Agent 九大类别。
在编码智能体维度,表现明显分化:
- 领先项:Terminal Bench 2.1 达到 86.6(Fable5 84.6,GPT5.6 Sol 88.8),PaperBench 达到 93.0(全面领先 Fable5 的 88.8 和 GPT5.6 Sol 的 90.5),FrontierSWE 达到 73.5(约 Fable5 88.8 的 83%)。
- 落后项:SWE-bench Pro 仅 67.7(Fable5 80.0),DeepSWE 1.1 仅 56.6(GPT5.6 Sol 73.0),MLS-Bench-Lite 41.0(Fable5 49.9),NL2Repo-Bench 55.9(Opus4.8 69.4)。在多个被行业广泛引用的软件工程 benchmark 上,Qwen3.8-Max 与前沿模型存在 10-20 个百分点的差距。
在多模态和视觉维度,Qwen3.8-Max 表现强劲:MMMU-Pro 82.3(仅次于 GPT5.6 Sol 83.0),OSWorld-Verified 86.1(领先所有对比模型),HiPhO 90.0,Parametric CAD Bench 91.5——这些数字确实处于第一梯队。
但 benchmark 表格中约 10 项为 Qwen 自建指标——QwenSWEBench、QwenQoderBench、QwenReactBench、QwenSVGBench、CoWorkBench、QwenBlenderBench、QwenVisualOffice 等。这些指标缺乏外部基准和独立复现,在与其他模型的比较中参考价值有限。
独立评测:极少的灯塔
截至 8 月 3 日,Qwen3.8-Max 的外部独立评测极为稀缺。
Trilogy AI 通过其 StackPerf 平台进行了一次盲测软件架构评估:Qwen3.8-Max-Preview 和 Kimi K3 各自分析两个真实项目的 269 个文件(SHA-256 校验一致),独立提交系统设计方案,经盲审和事实核查后评分。两项设计得出了相同的核心架构结论——一个系统负责全局规划和最终组装,另一个负责 provider 专属的生成、重试和溯源。但 Qwen 在系统边界定义和回放元数据记录上更强,而 Kimi 在修订管理、再生和场景历史上更全面。最终:Kimi K3 83/100,Qwen3.8-Max-Preview 80/100。44 次工具调用全部成功,工具使用维度 9/10(Kimi 为 8/10)。但两份报告的核查均发现了 7 组超出代码证据的声明——模型能准确引用数百行代码,仍可能从中得出不安全结论。
BenchLM 的聚合排名提供了更完整的参照系:Qwen3.8-Max 综合排名第 31/215(65.4/100),其中推理能力第 1/2(95.5/100),多模态第 2/34(88.1/100),指令遵循第 2/33(93.9/100),但编码仅第 25/130(59.5/100),智能体第 16/129(59.0/100)。BenchLM 明确指出其全部 52 行 benchmark 证据均来自 Qwen 官方发布("Provider exact")。
NanoGPT 在 7 月 20 日(官方 blog 发布前两周)的分析中曾指出:"我们未能找到公开可查的 Qwen 发布文章、模型卡、架构报告或 benchmark 表……没有来自成熟独立 benchmark 服务的结果。"这一状况在 8 月 2 日官方博客发布后部分改善——完整的 benchmark 表格已公开——但独立评测的数据点仍然稀少。
这意味着 Qwen 官方博客中那个横跨 60+ 项的 benchmark 表格,几乎所有数字都来自 Qwen 自己的评测管线。这本身不是问题——前沿实验室都发布自测结果——但独立验证的缺位使得"second only to Fable 5"的定位无法被外部审计。
开源 Max 级:真正改变格局的变量
抛开 benchmark 争议不论,Qwen3.8-Max 的开源承诺是一个真正的行业变量。
此前所有 Qwen-Max 系列模型(3-Max、3.5-Max、3.7-Max)均为闭源 API 专供。Qwen3.8-Max 是第一个承诺开放权重的 Max 级模型——尽管"下周发布"意味着在本文发稿时权重尚未交付,License 条款也未公布。同时,Qwen3.8-27B 也将开源,为本地部署提供了一个更实际的选项。
这直接对标 Kimi K3 的开源路线。Kimi K3(2.8T 参数,7 月 16 日发布)同样承诺开放权重(计划 7 月 27 日),但截至发稿时 K3 权重也未实际交付。两家中国公司正在将万亿级模型的开放承诺变为一种竞争策略——先宣布开源吸引关注,实际交付时间则在发布后数周。
在定价上,Qwen3.8-Max 的 API 费率为输入 $2.0/M tokens、输出 $6.0/M tokens,高于 Qwen3.7-Max 的 $1.25/$3.75,但低于 Kimi K3 的 $3/$15。考虑到 MoE 架构下活跃参数(95B)远小于总参数(2.4T),推理成本的实际竞争力还需等待第三方 benchmarking。
权重开放的实际影响取决于三个仍未回答的问题:License 条款(Apache 2.0 还是附加限制?)、实际部署的硬件门槛(2.4T 参数的推理需要多大集群?)、以及开源后社区能否复现官方的长周期案例结果。
Yotta Labs 分析指出:"对于生产团队,选择与 GLM 5.2 vs Qwen 3.7-Max 时相同:开放权重给你部署控制权、微调权和 GPU 级别成本管理;闭源前沿 API 给你供应商最好的模型而无需基础设施投入。"
竞争坐标系:中国三强与全球前沿
Qwen3.8-Max 的发布距 Kimi K3(2.8T)仅两周,距 GLM 5.2(744B)不到两个月。加上 DeepSeek V4 Pro(1.6T),中国模型市场已经形成四家万亿/千亿级模型的密集竞争态势。
在全球坐标系上,Qwen3.8-Max 的定位需要多维度审视:
- 编码智能体:在 Terminal Bench 2.1 和 PaperBench 上追平甚至超越 Fable5,但 SWE-bench Pro(67.7 vs Fable5 80.0)和 DeepSWE(56.6 vs GPT5.6 Sol 73.0)差距显著。模型在特定类型的编码任务上表现突出,但在需要深度理解和修改大型代码库的任务上仍有瓶颈。
- 多模态:BenchLM 排名第 2/34,OSWorld-Verified(86.1)和 HiPhO(90.0)均处于第一梯队。
还缺什么
Qwen3.8-Max 的发布是一个重要的行业事件,但有三个关键问题需要在未来几周得到回答:
权重的实际交付。"下周开源"的承诺能否兑现?License 条款是 Apache 2.0 级别的宽松许可还是附加限制?这些决定了它能否真正进入企业自部署的选项清单。
长周期案例的独立复现。三个案例——尤其是 16 天自主编码和 5 天论文改进——展示了令人兴奋的能力边界,但在独立团队成功复现之前,它们仍是 Qwen 团队的单方展示。
benchmark 的外部审计。当 benchmark 表格中约 1/6 的项目为自建指标、且独立评测数据点仅有个位数时,"second only to Fable 5"的定位缺乏可被外部审计的基础。BenchLM 已将所有 52 行可用数据标注为 Qwen 官方来源——前沿实验室的自测结果需要独立基准的交叉验证才能转化为可信的竞争定位。
这一轮中国 AI 模型的密集发布正在改变前沿模型的供给格局——从美国实验室的寡头垄断转向更分散的竞争。但模型的真实能力最终不由任何一方的 blog post 或 benchmark 表决定,而是由那些在实际工作负载中反复测试它们的开发者和企业决定。