AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

两个不同 Harness,同一个 82.7%:DeepSeek V4 Flash 的 Terminal-Bench 分数被罕见复现

今天 · 共 3,577 字

Harbor Framework

8 月 9 日,Ante benchmark 的作者在 r/LocalLLaMA 上发布了一组数据:他用自己开发的、完全独立于 DeepSeek 的评测框架 Ante 0.preview.71,在 Terminal-Bench 2.1 上对 DeepSeek V4 Flash 0731 跑了 445 次试验。结果——368 次成功,准确率 82.7%,标准误差 ±1.79%。与 DeepSeek 官方 7 月 31 日公布的数字完全一致。

在 AI 行业,厂商自报的 benchmark 分数被独立第三方复现——而且是精确到小数点后一位的复现——几乎从未发生过。这一结果值得认真对待,不仅因为分数本身,更因为它无意中暴露了 agent 评测领域一个长期被淡化的事实:同一个模型,在不同评测框架下,分数可以相差几个百分点。而 82.7% 恰恰来自两个完全不同的框架,这本身就是值得追问的巧合。

一次不太可能的完美复现

先看两组测试配置的差异。

DeepSeek 官方在 API changelog 中注明了评测条件:使用尚未开源的 "DeepSeek Harness minimal mode",max reasoning effort,top_p=0.95,temperature=1.0。Ante 作者则用了完全不同的技术路径:Ante 0.preview.71 框架,通过 OpenRouter 调用模型 deepseek/deepseek-v4-flash-0731,同样设置 max reasoning effort,但不启用 skills 模块。两套框架在代码实现、提示词模板、工具调用封装和结果解析上没有任何共享代码。

结果:445 次试验,368 次成功,82.7%(±1.79 SE)。

完整的评测记录托管在 Harbor 上,任何人都可以查阅——锁定的配置文件、全部 445 条试验的 reward 值、异常记录、持续时间和 token 消耗。数据显示总输出 token 约 3893 万、输入 token 约 2703 万、缓存 token 约 32.8 亿,42 次错误、0 次重试,平均 reward 为 0.83。

Ante 作者在帖子开头即声明自己就是 Ante 的开发者,没有回避利益关系。但正是这种声明,让数据的可信度更高而非更低:如果结果经不起推敲,没有人会把 445 条原始试验记录连同配置文件一起公开。

同一个模型,三个框架,两个分数

完美的复现原本可以在 "82.7% 被独立验证" 的叙事下结束——但还有另一个数字。

Artificial Analysis 在同一天(7 月 31 日)发布了对同一模型的独立评估结果。他们同样在 Terminal-Bench 2.1 上测试了 DeepSeek V4 Flash 0731,用的是自己的评测框架。分数是 79%——比 Ante 和 DeepSeek 官方低了 3.7 个百分点。

这不是误差范围能解释的差距。同一个模型、同一个 benchmark、不同的评测框架:82.7% vs 79%。3.7 个百分点的差异恰好落在 benchmark 对比中最尴尬的位置——它不够小到能被理解为随机波动,又不够大到能断言某个框架"做错了"。它说明的只是一件事:agent benchmark 的得分部分取决于你用什么来测。

HuggingFace 上 DeepSeek V4 Flash 官方发布的社区分析文章对此早有预警。作者明确写道:"Agentic benchmark scores are framework-dependent... harness choice alone can shift these numbers by 10+ points."但在本文的案例中,两个得到 82.7% 的不同框架碰巧撞在了一起,而第三个框架得到了不同的结果,这让"harness 敏感性"不再停留在分析文章的警示框里,而成为一个可量化、在公开记录中确凿可见的偏差。

在 Leaderboard 上定位 82.7%

理解 82.7% 的含义,需要把它放在 Terminal-Bench 2.1 的官方 leaderboard 中。

截至 8 月 9 日,tbench.ai 官方 leaderboard 排名前五的是:Claude Code + Fable 5(xhigh)83.8%、Codex + GPT-5.5(xhigh)83.1%、Terminus 2 + Fable 5(high)80.4%、Cursor CLI + Grok 4.5(high)79.3%、Claude Code + Opus 4.8(high)78.9%。

但这张表存在一个根本性的不可比性:每条 leaderboard 条目同时取决于模型和 agent 框架。Claude Code + Fable 5 的 83.8% 与 Ante + DeepSeek V4 Flash 的 82.7% 之间,隔着的不仅是模型能力的差异,还有 Claude Code 和 Ante 两个框架在提示工程、工具调度策略和错误处理上的设计差异。直接说"DeepSeek V4 Flash 在 Terminal-Bench 上排名第三"在统计上是站不住脚的——除非它们在同一个框架下跑过。

更审慎的比较来自 DeepSeek 自己的对照表:在统一的 DeepSeek Harness minimal mode 下,Opus 4.8 是 85.0%,V4 Flash 0731 是 82.7%。这 2.3 个百分点的差距远小于两者之间的价格差距——Opus 4.8 的 API 输入价格是 V4 Flash 的十余倍。

为什么 Agent Benchmark 比常规 Benchmark 更难复现

常规 benchmark——MMLU、GPQA、HumanEval——是单轮、固定输入的。只要 temperature 设为 0 或使用 greedy decoding,结果是可精确复现的。

Agent benchmark 则是多轮、状态依赖的。Terminal-Bench 的任务要求模型在真实的 shell 环境中操作多个回合:安装依赖、调试构建、配置服务器、管理 git 仓库。模型在每一步的选择都会改变后续的状态空间。评测框架需要处理:

  • 提示词模板如何向模型描述可用工具和约束——直接影响行为策略;
  • 工具调用的序列化和解析——模型输出的结构化指令如何被转换为真实的 shell 命令;
  • 错误恢复逻辑——当模型生成无效命令时,是否自动重试、如何把错误信息传回模型;
  • 超时和资源限制——每个任务允许多少轮交互、每轮允许多少 token 消耗;
  • 环境配置——Docker 镜像版本、系统包版本、网络可用性。

这些变量的任何差异都可能导致分数偏移。Ante 和 DeepSeek Harness 在所有这些维度上都是独立实现的——却得到了完全相同的结果。Ante 作者对此未做过度解读;他在帖子末尾只写了一句:"Deep seek v4 seems to be sensitive to harness and this is probably useful data for anyone who is interested."

公开评估基础设施的意义

Ante 这次验证最有价值的部分,可能不是 82.7% 本身,而是它展示了一种可操作的独立评估模式。

Harbor 是一个用于运行和共享 benchmark 评测的公开平台。Ante 作者将完整的配置和 445 条试验记录上传到 Harbor:任何人都可以查看每条试验的 reward、异常、耗时和 token 消耗。这 42 次错误到底是模型生成了无效命令、超时、还是环境问题——所有这些信息都是公开可查的。公开到这种程度在 agent benchmark 领域仍然罕见。

这也定义了一个"正确做独立评估"的最低标准:不是只报告一个聚合分数,而是公开配置、原始记录和失败模式。行业里多数厂商和第三方评测仍然只报告最终分数,这让任何形式的交叉验证都无从下手。

当然,这次验证也有明确的局限。它来自 Ante 项目作者——数据完全公开,但利益关系仍然存在。它只覆盖了 Terminal-Bench 2.1 一个 benchmark。它只测试了一个模型。这些都不减损数据的价值,但真正的目标状态是:不同的独立方,用不同的工具,跑同一个模型,并且所有数据都公开。

结论

DeepSeek V4 Flash 0731 在 Terminal-Bench 2.1 上的 82.7% 分数,被一个使用完全不同评测框架的独立方精确复现。在 DeepSeek Harness 尚未开源、外界无法直接用官方工具链验证的背景下,这是一个有价值的可靠性信号。

但这个案例也做实了 agent benchmark 的核心困境:同一个模型、同一个 benchmark,在不同框架下可以给出 79% 或 82.7%。3.7 个百分点的差距不是误差,是框架差异。在行业能够就评测框架的标准化达成共识——或者至少要求每份分数附带完整的、可审计的评测记录之前,任何单一的 agent benchmark 分数都不应被当作模型能力的最终结论。

下一个关键变量是 DeepSeek 承诺即将开源的 Harness 框架本身。当官方评测工具也可以被独立审计时,才能判断 82.7% 的完美复现,到底是因为分数的稳健,还是因为两个框架在关键设计上恰好一致。

来源

  1. DeepSeek V4 Flash 0731 hits 82.7% on Terminal-Bench 2.1 (Reddit r/LocalLLaMA)
  2. DeepSeek API Changelog - July 31, 2026 · DeepSeek
  3. Harbor Job: deepseek-v4-flash-0731 Terminal-Bench 2.1 (public)
  4. Terminal-Bench 2.1 Leaderboard · tbench.ai
  5. DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index · Artificial Analysis
  6. DeepSeek V4 Flash Is Now Official: What Changed in the 0731 Build · Hugging Face Blog

评论

登录后即可参与评论。

加载评论中…

相关文章

  • AI 招聘流程示意图:求职者提交申请,同一供应商的算法跨多个雇主进行筛选,产生推荐或不推荐的结果

    AI 招聘的「算法单一文化」:340 万人数据揭示系统性排斥与隐藏的种族偏见

    数据 · 2026-08-09

  • CompanyBench benchmark 封面图,展示企业环境中 AI Agent 的测试流程

    GPT-5.5 在真实企业任务中仅完成 44%:Turing CompanyBench 揭开了 AI Agent 评测的盲区

    数据 · 2026-08-08

  • SQLite 官方横幅

    54 个 AI 编造的漏洞进了美国官方数据库,其中一个拿过满分

    数据 · 2026-08-03

  • 法律书籍与欧盟法规文件,象征 AI 监管与合规

    EU AI Act 今天开罚:Article 50 透明度规则生效,所有使用 AI 聊天和生成内容的公司都在管辖范围

    数据 · 2026-08-02

  • Truffle Security 扫描 HuggingFace 7.6 PB 训练数据发现 221,303 个活跃凭证

    扫描 7.6 PB 训练数据发现 22 万活跃密钥——AI 训练数据是最持久的泄露

    数据 · 2026-08-02

  • DeepSeek V4 系列模型性能基准对比图,包含 V4-Flash、V4-Pro 与 Opus、GPT、Gemini 等前沿模型的多维度比较

    DeepSeek V4 Flash 发布一周:从 150 美元开发板到双 GH200,社区在一周内覆盖了完整硬件谱系

    算法 · 2026-08-04

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS