7 月 31 日,DeepSeek 将 V4 Flash 从 Preview 升级为正式版(0731),API 模型名 deepseek-v4-flash 直接指向最新版本,调用方式不变。这次升级的核心矛盾一目了然:一个通过纯后训练优化的「轻量」模型,在全部 9 项 Agent benchmark 上超越了自家更大、更贵的 V4-Pro-Preview——而架构、参数量和 API 价格完全没变。
Benchmark:Flash 正式版在每一项 Agent 任务上超过 Pro Preview
DeepSeek 官方公布的 9 项 Agent benchmark 数据中,V4 Flash 0731 对 V4-Pro-Preview 形成全面压制。以下为官方数据,使用 DeepSeek Harness minimal mode、max effort、temperature=1.0、top_p=0.95 配置:
| Benchmark | Flash 0731 | Flash Preview | Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
† DSBench 为 DeepSeek 内部测试集,分别评估全栈开发和 Coding Agent 难题。
三个数据点值得单独来看。
DeepSWE 从 7.3 到 54.4。 同样架构、同样参数量的模型,仅靠后训练改进就在软件工程任务上将性能提升了 7.4 倍。这意味着 Flash Preview 在 DeepSWE 上的糟糕表现不是模型容量问题,而是训练不充分——后训练空间比此前认知的大得多。
Cybergym 从 38.7 翻倍到 76.7。 Cybergym 是网络安全领域的 Agent 测试,要求模型在多步交互中完成渗透测试类任务。Flash 0731 的分数与 Opus-4.8(83.1)的差距缩小到 6.4 分。
NL2Repo 从 39.4 到 54.2,同时 Pro Preview 仅 38.5。 Flash 正式版在代码仓库级理解任务上比 Pro Preview 高出 15.7 分,说明并非所有能力都随模型规模线性增长——后训练质量和针对性远比参数量关键。
Artificial Analysis:Intelligence Index 跃升 10 分,接近 GPT-5.6 Luna
独立评测机构 Artificial Analysis 在同日发布了第三方评估。Flash 0731 在 Intelligence Index v4.1(涵盖 GDPval-AA v2、Terminal-Bench v2.1、GPQA Diamond、Humanity's Last Exam 等 9 项评估)获得 50 分,较 Flash Preview(40 分)提升 10 分,比 Pro Preview 高出 6 分。
与竞品的相对位置:仅比 GPT-5.6 Luna(max,51 分)低 1 分,与 Gemini 3.6 Flash(50 分)持平,比 GLM-5.2(max,51 分)低 1 分,比开源权重前沿 Kimi K3(max,57 分)低 7 分。Artificial Analysis 指出 Flash 0731 已进入其「Intelligence vs Cost」帕累托前沿。
成本端差距更为显著。Flash 0731 定价 $0.14/$0.28/1M tokens(输入/输出),与 Flash Preview 完全一致。Artificial Analysis 计算,即使 OpenAI 在 7 月 31 日当天将 GPT-5.6 Luna 降价 80%,Flash 0731 的每任务成本仍低约 60%。DeepSeek 的 cache hit 折扣为 98%($0.0028/1M tokens),远超行业通行的 90%。
Agent 能力方面,GDPval-AA v2(模拟真实工作任务的 Agent 评估)Elo 从 1189 跃升至 1559,提升 370 分。一旦权重正式开放下载,这将是开源模型中第二高的分数,仅次于 Kimi K3(max,1687),高于 GLM-5.2(max,1510)。Terminal-Bench 2.1 从 Flash Preview 的得分提升 17 个百分点至 79%。
Token 效率也有改善。Flash 0731 运行完整 Intelligence Index 消耗约 2.06 亿输出 token,比 Flash Preview 的约 2.34 亿减少 12%——更高的分数用了更少的 token。幻觉率降至 84%(Flash Preview 约 96%),但准确率未变(37%),说明改进集中在「少说错话」而非「多说对话」。
「仅重新后训练」意味着什么
DeepSeek 在 Changelog 中用了精确措辞:「DeepSeek-V4-Flash-0731 keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.」模型规格完全不变:284B 总参数、13B 激活参数(MoE)、1M token 上下文窗口、DSpark 推测解码模块。唯一的变化来自新的后训练流程。
DeepSeek 没有公开具体的后训练技术细节。但从结果反推,这次后训练至少覆盖了几个方向:Agent 工具使用(Toolathlon 从 49.7 到 70.3)、多步推理与执行(DeepSWE 从 7.3 到 54.4)、以及安全交互式任务(Cybergym 从 38.7 到 76.7)。这些改进并非均匀分布——知识密集型任务(GPQA Diamond 仅提升 1 分至 91%)和物理推理(CritPt 提升 9 分至 17%)的增幅远小于 Agent 任务,指向后训练对 Agent 行为的针对性优化。
这一结果对「模型规模决定 Agent 能力」的假设构成直接挑战。V4-Pro-Preview 激活参数是 Flash 的约 3.8 倍,但在每一项 Agent benchmark 上均被超越。Agent 能力瓶颈不在模型容量,而在如何教模型在多步交互中正确使用工具、规划子目标和从反馈中修正。
开源与生态:权重、Codex 适配、GGUF 已在路上
模型权重以 MIT License 发布在 HuggingFace,支持 vLLM 和 SGLang 部署,配备 DSpark 推测解码。DeepSeek 还发布了 encoding 工具包,以 Python 脚本而非 Jinja 模板的形式提供 tokenizer 编码方案,并新增 reasoning_effort 参数(low/high/max)控制推理深度。
API 层面,Flash 0731 原生支持 OpenAI Responses API 格式,同时专门适配了 Codex CLI。对已使用 OpenAI Agent 管线的开发者,这是最小迁移成本的替代方案。Unsloth 团队在官方发布后数小时内即启动了 GGUF 量化,其 HuggingFace 仓库目前标记为「Work in progress」。
价格方面,Flash 0731 保持 $0.14/$0.28(输入/输出,per 1M tokens),cache hit 价格 $0.0028。以 flowtivity.ai 的计算为例,一个完整 Agent 任务在 Flash 上的成本约 $0.007,而 GPT-5.5 同类任务约 $0.40,差距接近 57 倍。即使与降价后的 GPT-5.6 Luna 相比,成本优势仍在 60% 左右。
V4-Pro 预告与未解问题
DeepSeek 明确表示「The official release of DeepSeek-V4-Pro will follow soon」,但未给出具体日期。V4-Pro API 和 App/Web 模型目前仍停留在 Preview 版本。
Flash 0731 的表现给 V4-Pro 正式版设定了一个高基准。如果 Pro 正式版能从 Flash 的后训练经验中受益——考虑到 Pro 的激活参数是 Flash 的 3.8 倍——其 Agent 能力有可能超过当前开源前沿 Kimi K3 和闭源模型 Opus-4.8。但这是假设,不是预测。后训练改进未必能线性迁移到更大模型,Pro 正式版也可能选择不同的优化方向。
另一个未解问题是 DSBench-FullStack 和 DSBench-Hard 作为 DeepSeek 内部测试集无法独立复现。Flash 0731 在这两个测试集上的分数(68.7 和 59.6)是官方自报,与第三方 benchmark 的增幅一致但无法交叉验证。Flash 0731 在 AutomationBench Public(25.1 对 Opus-4.8 的 27.2)上的相对落后也提示,在部分 SaaS 自动化场景下仍有差距。
论文未经同行评审。所有结论基于 DeepSeek 官方公告和 Artificial Analysis 的第三方评测。