8 月 27 日,斯坦福大学与 Laude Institute 发布 Terminal-Bench-Science 0.1,一个让科学家——而非模型厂商——来定义「AI 科学能力」的基准。它用 70 项来自研究者真实工作的计算任务评测 Agent,首次发布就给出一个冷峻的校准:9 个受测模型里最强的 Claude Opus 5 配 Claude Code,解决率只有 30.0%。而按该基准资助方之一 Snorkel 的对照,前沿模型在通用编码基准上通常能拿到 50%–80% 的解决率。真实科研工作流显著难于软件工程,「AI 科学家」目前更接近一个辅助角色,而不是替代者——这是第一次有人把这句话变成可复现的测量。
同一天,Anthropic 发布了面向物理设备的 Model Hardware Standard(MHS),让 Agent 操作显微镜、机械臂等实验硬件。AI 用于科研在一日之内拿到了两份规格:一份管「怎么操作设备」,一份管「怎么评测能力」——后者就是 Terminal-Bench-Science。
科学家,而不是厂商,定义能力门槛
Terminal-Bench-Science 的核心增量不在题目数量,而在「谁出题」。70 项任务覆盖生命科学(19)、物理(17)、数学(17)、工程(9)与地球科学(8)五个领域,每一项都来自一名研究者实际做过的工作,而不是教科书习题或标准考试题。项目给任务立了三条标准:来自真实科研工作流、可用确定性的 pytest 检验客观判定(排除假设生成、文献综述这类开放式工作)、并且确实能难住当今最强的 Agent。
出题经过严格的漏斗筛选:920 个提案,464 个获批进入实现,386 个提了 pull request,最终只有 70 个进入 0.1 版;376 位贡献者来自 22 个国家。评审不是单次打分:提案先经 LLM 初筛,再由领域评审与技术评审并行审查,最后一道「把关人」签字;合并前还要跑 frontier、oracle 与「作弊 Agent」三轮试跑,确认任务可解、可判分、无法用捷径绕过。评测时,Agent 的工作容器与判分容器相互分离,判定由确定性程序完成,而不是让模型自评——上一代评测已经证明,依赖 Agent 自检会系统性漏掉「自信地出错」的失败。
30% 意味着什么
结果按「每任务三次独立试验、70 任务全跑」的口径给出。Claude Opus 5(Claude Code)30.0%,GPT-5.6 Sol(Codex)22.4%,Claude Fable 5(Claude Code)21.4%,随后断层式跌到 Claude Opus 4.8 的 10.5%、GPT-5.6 Terra 的 8.6%;开源侧最强的是 GLM 5.3(8.1%),GPT-5.6 Luna 以 3.3% 垫底。团队给出的最关键对照是:与自家软件工程基准 Terminal-Bench 3.0 相比,每个同时受测的模型解决率都被压低了超过 10 个百分点。
分领域看,差距并不均匀。Opus 5 在物理科学做到 45.8%,是其最强领域;但在数学科学跌到第三(25.5%),被 Fable 5(33.3%)与 Sol(31.4%)反超。几乎所有领域的前两名都被 Anthropic 与 OpenAI 包揽,唯一例外是工程科学:Grok 4.6 与 Sol 并列第二(14.8%),成本与 token 用量却低得多。
成本维度同样暴露问题。跑完全部 70 项任务,Opus 5 花了约 7,000 美元;Sol 用 4,200 美元就追平了 Fable 5 的性能(后者要 14,200 美元);按 token 算,Fable 5 又比 Sol 少用约四分之一(64 亿对 84 亿)。只有 Kimi K3 与 Opus 5 同时出现在「成本—解决率」和「token—解决率」两条帕累托前沿上——便宜与强,目前仍难以兼得。
连续基准:防饱和,也防污染
与一次性发表的论文式基准不同,Terminal-Bench-Science 把自己定义为「连续基准」。每次发布都针对当时的前沿校准(0.1 校准到 Opus 5 与 Sol),任务被饱和或被发现规格不清时会退役,新任务持续进入;任务版本化后可以只重跑、重判已有试验,不必重做整套基准。0.2 版的 pull request 截止日期是 10 月 5 日。
防污染被做成了显式约束:仓库明文标注「基准数据永远不应出现在训练语料中」,并嵌入一个 canary GUID 字符串,供训练数据方过滤。这个机制只能降低、不能根除污染风险,但它把「不进训练集」从口头约定变成了可检索的标记。
边界与下一项变量
先把结论收窄。这些数字是项目团队自己跑出来的,尚未经第三方大规模复现;70 项任务样本有限,领域覆盖也不均衡——地球科学只有 8 项,个别子领域(如大气科学)在公开任务表里还是 0。30% 测的是「工作流完成率」,不能外推成「模型只有三成科研能力」。透明度上有一处需要读者知晓:项目 lead advisor 之一 Ludwig Schmidt 同时在 Stanford 与 Anthropic 任职,Anthropic 又与 Google、Moonshot、xAI、Z.ai 一起为评测提供了 API 额度——这一点是项目自己在致谢中披露的,属于常见的评测资助模式,但也意味着「谁出钱」与「谁被测」之间存在利益相邻。
最值得观察的下一项变量,不是某个模型能否在下一个版本刷高分,而是这套「科学家出题」的机制能否被独立复现并扩散:0.2 版能否在 10 月 5 日截稿前把 70 项扩大到更均衡的覆盖面,以及是否有第三方用不同 harness 重跑这些结果。「AI 科学家」的叙事已经存在多年,Terminal-Bench-Science 的价值在于第一次给了它一把科学家自己定的、可复查的尺子——而尺子目前的读数是 30%。