AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

DeepSeek V4 Flash 正式版 Agent 能力超越 Pro Preview,同价开源不变

今天 · 共 3,653 字

模型
DeepSeek 官方

7 月 31 日,DeepSeek 将 V4 Flash 从 Preview 升级为正式版(0731),API 模型名 deepseek-v4-flash 直接指向最新版本,调用方式不变。这次升级的核心矛盾一目了然:一个通过纯后训练优化的「轻量」模型,在全部 9 项 Agent benchmark 上超越了自家更大、更贵的 V4-Pro-Preview——而架构、参数量和 API 价格完全没变。

Benchmark:Flash 正式版在每一项 Agent 任务上超过 Pro Preview

DeepSeek 官方公布的 9 项 Agent benchmark 数据中,V4 Flash 0731 对 V4-Pro-Preview 形成全面压制。以下为官方数据,使用 DeepSeek Harness minimal mode、max effort、temperature=1.0、top_p=0.95 配置:

Benchmark Flash 0731 Flash Preview Pro Preview GLM-5.2 Opus-4.8
Terminal Bench 2.1 82.7 61.8 72.1 81.0 85.0
NL2Repo 54.2 39.4 38.5 48.9 69.7
Cybergym 76.7 38.7 52.7 — 83.1
DeepSWE 54.4 7.3 12.8 46.2 58.0
Toolathlon-Verified 70.3 49.7 55.9 59.9 76.2
Agents' Last Exam 25.2 15.8 16.5 23.8 25.7
AutomationBench Public 25.1 10.8 12.8 12.9 27.2
DSBench-FullStack † 68.7 37.0 41.8 61.8 71.6
DSBench-Hard † 59.6 25.8 31.1 54.5 71.7

† DSBench 为 DeepSeek 内部测试集,分别评估全栈开发和 Coding Agent 难题。

三个数据点值得单独来看。

DeepSWE 从 7.3 到 54.4。 同样架构、同样参数量的模型,仅靠后训练改进就在软件工程任务上将性能提升了 7.4 倍。这意味着 Flash Preview 在 DeepSWE 上的糟糕表现不是模型容量问题,而是训练不充分——后训练空间比此前认知的大得多。

Cybergym 从 38.7 翻倍到 76.7。 Cybergym 是网络安全领域的 Agent 测试,要求模型在多步交互中完成渗透测试类任务。Flash 0731 的分数与 Opus-4.8(83.1)的差距缩小到 6.4 分。

NL2Repo 从 39.4 到 54.2,同时 Pro Preview 仅 38.5。 Flash 正式版在代码仓库级理解任务上比 Pro Preview 高出 15.7 分,说明并非所有能力都随模型规模线性增长——后训练质量和针对性远比参数量关键。

Artificial Analysis:Intelligence Index 跃升 10 分,接近 GPT-5.6 Luna

独立评测机构 Artificial Analysis 在同日发布了第三方评估。Flash 0731 在 Intelligence Index v4.1(涵盖 GDPval-AA v2、Terminal-Bench v2.1、GPQA Diamond、Humanity's Last Exam 等 9 项评估)获得 50 分,较 Flash Preview(40 分)提升 10 分,比 Pro Preview 高出 6 分。

与竞品的相对位置:仅比 GPT-5.6 Luna(max,51 分)低 1 分,与 Gemini 3.6 Flash(50 分)持平,比 GLM-5.2(max,51 分)低 1 分,比开源权重前沿 Kimi K3(max,57 分)低 7 分。Artificial Analysis 指出 Flash 0731 已进入其「Intelligence vs Cost」帕累托前沿。

成本端差距更为显著。Flash 0731 定价 $0.14/$0.28/1M tokens(输入/输出),与 Flash Preview 完全一致。Artificial Analysis 计算,即使 OpenAI 在 7 月 31 日当天将 GPT-5.6 Luna 降价 80%,Flash 0731 的每任务成本仍低约 60%。DeepSeek 的 cache hit 折扣为 98%($0.0028/1M tokens),远超行业通行的 90%。

Agent 能力方面,GDPval-AA v2(模拟真实工作任务的 Agent 评估)Elo 从 1189 跃升至 1559,提升 370 分。一旦权重正式开放下载,这将是开源模型中第二高的分数,仅次于 Kimi K3(max,1687),高于 GLM-5.2(max,1510)。Terminal-Bench 2.1 从 Flash Preview 的得分提升 17 个百分点至 79%。

Token 效率也有改善。Flash 0731 运行完整 Intelligence Index 消耗约 2.06 亿输出 token,比 Flash Preview 的约 2.34 亿减少 12%——更高的分数用了更少的 token。幻觉率降至 84%(Flash Preview 约 96%),但准确率未变(37%),说明改进集中在「少说错话」而非「多说对话」。

「仅重新后训练」意味着什么

DeepSeek 在 Changelog 中用了精确措辞:「DeepSeek-V4-Flash-0731 keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained.」模型规格完全不变:284B 总参数、13B 激活参数(MoE)、1M token 上下文窗口、DSpark 推测解码模块。唯一的变化来自新的后训练流程。

DeepSeek 没有公开具体的后训练技术细节。但从结果反推,这次后训练至少覆盖了几个方向:Agent 工具使用(Toolathlon 从 49.7 到 70.3)、多步推理与执行(DeepSWE 从 7.3 到 54.4)、以及安全交互式任务(Cybergym 从 38.7 到 76.7)。这些改进并非均匀分布——知识密集型任务(GPQA Diamond 仅提升 1 分至 91%)和物理推理(CritPt 提升 9 分至 17%)的增幅远小于 Agent 任务,指向后训练对 Agent 行为的针对性优化。

这一结果对「模型规模决定 Agent 能力」的假设构成直接挑战。V4-Pro-Preview 激活参数是 Flash 的约 3.8 倍,但在每一项 Agent benchmark 上均被超越。Agent 能力瓶颈不在模型容量,而在如何教模型在多步交互中正确使用工具、规划子目标和从反馈中修正。

开源与生态:权重、Codex 适配、GGUF 已在路上

模型权重以 MIT License 发布在 HuggingFace,支持 vLLM 和 SGLang 部署,配备 DSpark 推测解码。DeepSeek 还发布了 encoding 工具包,以 Python 脚本而非 Jinja 模板的形式提供 tokenizer 编码方案,并新增 reasoning_effort 参数(low/high/max)控制推理深度。

API 层面,Flash 0731 原生支持 OpenAI Responses API 格式,同时专门适配了 Codex CLI。对已使用 OpenAI Agent 管线的开发者,这是最小迁移成本的替代方案。Unsloth 团队在官方发布后数小时内即启动了 GGUF 量化,其 HuggingFace 仓库目前标记为「Work in progress」。

价格方面,Flash 0731 保持 $0.14/$0.28(输入/输出,per 1M tokens),cache hit 价格 $0.0028。以 flowtivity.ai 的计算为例,一个完整 Agent 任务在 Flash 上的成本约 $0.007,而 GPT-5.5 同类任务约 $0.40,差距接近 57 倍。即使与降价后的 GPT-5.6 Luna 相比,成本优势仍在 60% 左右。

V4-Pro 预告与未解问题

DeepSeek 明确表示「The official release of DeepSeek-V4-Pro will follow soon」,但未给出具体日期。V4-Pro API 和 App/Web 模型目前仍停留在 Preview 版本。

Flash 0731 的表现给 V4-Pro 正式版设定了一个高基准。如果 Pro 正式版能从 Flash 的后训练经验中受益——考虑到 Pro 的激活参数是 Flash 的 3.8 倍——其 Agent 能力有可能超过当前开源前沿 Kimi K3 和闭源模型 Opus-4.8。但这是假设,不是预测。后训练改进未必能线性迁移到更大模型,Pro 正式版也可能选择不同的优化方向。

另一个未解问题是 DSBench-FullStack 和 DSBench-Hard 作为 DeepSeek 内部测试集无法独立复现。Flash 0731 在这两个测试集上的分数(68.7 和 59.6)是官方自报,与第三方 benchmark 的增幅一致但无法交叉验证。Flash 0731 在 AutomationBench Public(25.1 对 Opus-4.8 的 27.2)上的相对落后也提示,在部分 SaaS 自动化场景下仍有差距。

论文未经同行评审。所有结论基于 DeepSeek 官方公告和 Artificial Analysis 的第三方评测。

来源

  1. DeepSeek API Changelog - V4 Flash Update · DeepSeek
  2. DeepSeek V4 Flash 0731 on HuggingFace · HuggingFace
  3. DeepSeek V4 Flash 0731 on Artificial Analysis · Artificial Analysis
  4. Artificial Analysis X Thread on DeepSeek V4 Flash 0731 · Artificial Analysis
  5. DeepSeek Official X Announcement · DeepSeek
  6. DeepSeek V4 Flash 0731 GGUF on HuggingFace (Unsloth) · Unsloth
  7. DeepSeek Models & Pricing · DeepSeek

评论

登录后即可参与评论。

加载评论中…

相关文章

  • ORCA-bench 核心结果:五个前沿 Agent 在三个难度级别的 RCA Accuracy 和 RCA Depth

    ORCA-bench 揭示 Coding Agent 的 oncall 能力鸿沟:最佳准确率仅 25.3%

    算法 · 2026-07-31

  • MineExplorer 基准中,AI Agent 在 Minecraft 开放世界中执行长程探索任务的示意图

    BrowseComp 饱和之后:美团两基准如何重新定义 Agent 评测

    算法 · 2026-07-24

  • 4.5天入侵活动时间线,显示每日事件量和各阶段活动分布

    17,600 次动作、4.5 天:一个 AI Agent 如何穿透 Hugging Face 全线防线

    算法 · 2026-07-29

  • OpenAI Presence 界面截图,展示客户支持对话与工具操作面板

    OpenAI 发布 Presence:告别卖模型,开始卖「受管控的 Agent」

    算法 · 2026-07-27

  • Reid Hoffman,Prentis 联合创始人之一

    Prentis 融资 1 亿美元:32B 小模型在 computer use 赛道挑战 GPT-5.4

    算法 · 2026-07-27

  • Anthropic Claude 平台升级示意图

    Anthropic 两连发:录屏转 Skill 与 Agent 集群运维升级,Claude 加速平台化

    算法 · 2026-07-26

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS