8 月 9 日,Ante benchmark 的作者在 r/LocalLLaMA 上发布了一组数据:他用自己开发的、完全独立于 DeepSeek 的评测框架 Ante 0.preview.71,在 Terminal-Bench 2.1 上对 DeepSeek V4 Flash 0731 跑了 445 次试验。结果——368 次成功,准确率 82.7%,标准误差 ±1.79%。与 DeepSeek 官方 7 月 31 日公布的数字完全一致。
在 AI 行业,厂商自报的 benchmark 分数被独立第三方复现——而且是精确到小数点后一位的复现——几乎从未发生过。这一结果值得认真对待,不仅因为分数本身,更因为它无意中暴露了 agent 评测领域一个长期被淡化的事实:同一个模型,在不同评测框架下,分数可以相差几个百分点。而 82.7% 恰恰来自两个完全不同的框架,这本身就是值得追问的巧合。
一次不太可能的完美复现
先看两组测试配置的差异。
DeepSeek 官方在 API changelog 中注明了评测条件:使用尚未开源的 "DeepSeek Harness minimal mode",max reasoning effort,top_p=0.95,temperature=1.0。Ante 作者则用了完全不同的技术路径:Ante 0.preview.71 框架,通过 OpenRouter 调用模型 deepseek/deepseek-v4-flash-0731,同样设置 max reasoning effort,但不启用 skills 模块。两套框架在代码实现、提示词模板、工具调用封装和结果解析上没有任何共享代码。
结果:445 次试验,368 次成功,82.7%(±1.79 SE)。
完整的评测记录托管在 Harbor 上,任何人都可以查阅——锁定的配置文件、全部 445 条试验的 reward 值、异常记录、持续时间和 token 消耗。数据显示总输出 token 约 3893 万、输入 token 约 2703 万、缓存 token 约 32.8 亿,42 次错误、0 次重试,平均 reward 为 0.83。
Ante 作者在帖子开头即声明自己就是 Ante 的开发者,没有回避利益关系。但正是这种声明,让数据的可信度更高而非更低:如果结果经不起推敲,没有人会把 445 条原始试验记录连同配置文件一起公开。
同一个模型,三个框架,两个分数
完美的复现原本可以在 "82.7% 被独立验证" 的叙事下结束——但还有另一个数字。
Artificial Analysis 在同一天(7 月 31 日)发布了对同一模型的独立评估结果。他们同样在 Terminal-Bench 2.1 上测试了 DeepSeek V4 Flash 0731,用的是自己的评测框架。分数是 79%——比 Ante 和 DeepSeek 官方低了 3.7 个百分点。
这不是误差范围能解释的差距。同一个模型、同一个 benchmark、不同的评测框架:82.7% vs 79%。3.7 个百分点的差异恰好落在 benchmark 对比中最尴尬的位置——它不够小到能被理解为随机波动,又不够大到能断言某个框架"做错了"。它说明的只是一件事:agent benchmark 的得分部分取决于你用什么来测。
HuggingFace 上 DeepSeek V4 Flash 官方发布的社区分析文章对此早有预警。作者明确写道:"Agentic benchmark scores are framework-dependent... harness choice alone can shift these numbers by 10+ points."但在本文的案例中,两个得到 82.7% 的不同框架碰巧撞在了一起,而第三个框架得到了不同的结果,这让"harness 敏感性"不再停留在分析文章的警示框里,而成为一个可量化、在公开记录中确凿可见的偏差。
在 Leaderboard 上定位 82.7%
理解 82.7% 的含义,需要把它放在 Terminal-Bench 2.1 的官方 leaderboard 中。
截至 8 月 9 日,tbench.ai 官方 leaderboard 排名前五的是:Claude Code + Fable 5(xhigh)83.8%、Codex + GPT-5.5(xhigh)83.1%、Terminus 2 + Fable 5(high)80.4%、Cursor CLI + Grok 4.5(high)79.3%、Claude Code + Opus 4.8(high)78.9%。
但这张表存在一个根本性的不可比性:每条 leaderboard 条目同时取决于模型和 agent 框架。Claude Code + Fable 5 的 83.8% 与 Ante + DeepSeek V4 Flash 的 82.7% 之间,隔着的不仅是模型能力的差异,还有 Claude Code 和 Ante 两个框架在提示工程、工具调度策略和错误处理上的设计差异。直接说"DeepSeek V4 Flash 在 Terminal-Bench 上排名第三"在统计上是站不住脚的——除非它们在同一个框架下跑过。
更审慎的比较来自 DeepSeek 自己的对照表:在统一的 DeepSeek Harness minimal mode 下,Opus 4.8 是 85.0%,V4 Flash 0731 是 82.7%。这 2.3 个百分点的差距远小于两者之间的价格差距——Opus 4.8 的 API 输入价格是 V4 Flash 的十余倍。
为什么 Agent Benchmark 比常规 Benchmark 更难复现
常规 benchmark——MMLU、GPQA、HumanEval——是单轮、固定输入的。只要 temperature 设为 0 或使用 greedy decoding,结果是可精确复现的。
Agent benchmark 则是多轮、状态依赖的。Terminal-Bench 的任务要求模型在真实的 shell 环境中操作多个回合:安装依赖、调试构建、配置服务器、管理 git 仓库。模型在每一步的选择都会改变后续的状态空间。评测框架需要处理:
- 提示词模板如何向模型描述可用工具和约束——直接影响行为策略;
- 工具调用的序列化和解析——模型输出的结构化指令如何被转换为真实的 shell 命令;
- 错误恢复逻辑——当模型生成无效命令时,是否自动重试、如何把错误信息传回模型;
- 超时和资源限制——每个任务允许多少轮交互、每轮允许多少 token 消耗;
- 环境配置——Docker 镜像版本、系统包版本、网络可用性。
这些变量的任何差异都可能导致分数偏移。Ante 和 DeepSeek Harness 在所有这些维度上都是独立实现的——却得到了完全相同的结果。Ante 作者对此未做过度解读;他在帖子末尾只写了一句:"Deep seek v4 seems to be sensitive to harness and this is probably useful data for anyone who is interested."
公开评估基础设施的意义
Ante 这次验证最有价值的部分,可能不是 82.7% 本身,而是它展示了一种可操作的独立评估模式。
Harbor 是一个用于运行和共享 benchmark 评测的公开平台。Ante 作者将完整的配置和 445 条试验记录上传到 Harbor:任何人都可以查看每条试验的 reward、异常、耗时和 token 消耗。这 42 次错误到底是模型生成了无效命令、超时、还是环境问题——所有这些信息都是公开可查的。公开到这种程度在 agent benchmark 领域仍然罕见。
这也定义了一个"正确做独立评估"的最低标准:不是只报告一个聚合分数,而是公开配置、原始记录和失败模式。行业里多数厂商和第三方评测仍然只报告最终分数,这让任何形式的交叉验证都无从下手。
当然,这次验证也有明确的局限。它来自 Ante 项目作者——数据完全公开,但利益关系仍然存在。它只覆盖了 Terminal-Bench 2.1 一个 benchmark。它只测试了一个模型。这些都不减损数据的价值,但真正的目标状态是:不同的独立方,用不同的工具,跑同一个模型,并且所有数据都公开。
结论
DeepSeek V4 Flash 0731 在 Terminal-Bench 2.1 上的 82.7% 分数,被一个使用完全不同评测框架的独立方精确复现。在 DeepSeek Harness 尚未开源、外界无法直接用官方工具链验证的背景下,这是一个有价值的可靠性信号。
但这个案例也做实了 agent benchmark 的核心困境:同一个模型、同一个 benchmark,在不同框架下可以给出 79% 或 82.7%。3.7 个百分点的差距不是误差,是框架差异。在行业能够就评测框架的标准化达成共识——或者至少要求每份分数附带完整的、可审计的评测记录之前,任何单一的 agent benchmark 分数都不应被当作模型能力的最终结论。
下一个关键变量是 DeepSeek 承诺即将开源的 Harness 框架本身。当官方评测工具也可以被独立审计时,才能判断 82.7% 的完美复现,到底是因为分数的稳健,还是因为两个框架在关键设计上恰好一致。