AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

最强模型只解决 30% 真实科研工作流:科学家开始定义 AI 的科学能力

今天 · 共 2,266 字

Terminal-Bench-Science

8 月 27 日,斯坦福大学与 Laude Institute 发布 Terminal-Bench-Science 0.1,一个让科学家——而非模型厂商——来定义「AI 科学能力」的基准。它用 70 项来自研究者真实工作的计算任务评测 Agent,首次发布就给出一个冷峻的校准:9 个受测模型里最强的 Claude Opus 5 配 Claude Code,解决率只有 30.0%。而按该基准资助方之一 Snorkel 的对照,前沿模型在通用编码基准上通常能拿到 50%–80% 的解决率。真实科研工作流显著难于软件工程,「AI 科学家」目前更接近一个辅助角色,而不是替代者——这是第一次有人把这句话变成可复现的测量。

同一天,Anthropic 发布了面向物理设备的 Model Hardware Standard(MHS),让 Agent 操作显微镜、机械臂等实验硬件。AI 用于科研在一日之内拿到了两份规格:一份管「怎么操作设备」,一份管「怎么评测能力」——后者就是 Terminal-Bench-Science。

科学家,而不是厂商,定义能力门槛

Terminal-Bench-Science 的核心增量不在题目数量,而在「谁出题」。70 项任务覆盖生命科学(19)、物理(17)、数学(17)、工程(9)与地球科学(8)五个领域,每一项都来自一名研究者实际做过的工作,而不是教科书习题或标准考试题。项目给任务立了三条标准:来自真实科研工作流、可用确定性的 pytest 检验客观判定(排除假设生成、文献综述这类开放式工作)、并且确实能难住当今最强的 Agent。

出题经过严格的漏斗筛选:920 个提案,464 个获批进入实现,386 个提了 pull request,最终只有 70 个进入 0.1 版;376 位贡献者来自 22 个国家。评审不是单次打分:提案先经 LLM 初筛,再由领域评审与技术评审并行审查,最后一道「把关人」签字;合并前还要跑 frontier、oracle 与「作弊 Agent」三轮试跑,确认任务可解、可判分、无法用捷径绕过。评测时,Agent 的工作容器与判分容器相互分离,判定由确定性程序完成,而不是让模型自评——上一代评测已经证明,依赖 Agent 自检会系统性漏掉「自信地出错」的失败。

30% 意味着什么

结果按「每任务三次独立试验、70 任务全跑」的口径给出。Claude Opus 5(Claude Code)30.0%,GPT-5.6 Sol(Codex)22.4%,Claude Fable 5(Claude Code)21.4%,随后断层式跌到 Claude Opus 4.8 的 10.5%、GPT-5.6 Terra 的 8.6%;开源侧最强的是 GLM 5.3(8.1%),GPT-5.6 Luna 以 3.3% 垫底。团队给出的最关键对照是:与自家软件工程基准 Terminal-Bench 3.0 相比,每个同时受测的模型解决率都被压低了超过 10 个百分点。

分领域看,差距并不均匀。Opus 5 在物理科学做到 45.8%,是其最强领域;但在数学科学跌到第三(25.5%),被 Fable 5(33.3%)与 Sol(31.4%)反超。几乎所有领域的前两名都被 Anthropic 与 OpenAI 包揽,唯一例外是工程科学:Grok 4.6 与 Sol 并列第二(14.8%),成本与 token 用量却低得多。

成本维度同样暴露问题。跑完全部 70 项任务,Opus 5 花了约 7,000 美元;Sol 用 4,200 美元就追平了 Fable 5 的性能(后者要 14,200 美元);按 token 算,Fable 5 又比 Sol 少用约四分之一(64 亿对 84 亿)。只有 Kimi K3 与 Opus 5 同时出现在「成本—解决率」和「token—解决率」两条帕累托前沿上——便宜与强,目前仍难以兼得。

连续基准:防饱和,也防污染

与一次性发表的论文式基准不同,Terminal-Bench-Science 把自己定义为「连续基准」。每次发布都针对当时的前沿校准(0.1 校准到 Opus 5 与 Sol),任务被饱和或被发现规格不清时会退役,新任务持续进入;任务版本化后可以只重跑、重判已有试验,不必重做整套基准。0.2 版的 pull request 截止日期是 10 月 5 日。

防污染被做成了显式约束:仓库明文标注「基准数据永远不应出现在训练语料中」,并嵌入一个 canary GUID 字符串,供训练数据方过滤。这个机制只能降低、不能根除污染风险,但它把「不进训练集」从口头约定变成了可检索的标记。

边界与下一项变量

先把结论收窄。这些数字是项目团队自己跑出来的,尚未经第三方大规模复现;70 项任务样本有限,领域覆盖也不均衡——地球科学只有 8 项,个别子领域(如大气科学)在公开任务表里还是 0。30% 测的是「工作流完成率」,不能外推成「模型只有三成科研能力」。透明度上有一处需要读者知晓:项目 lead advisor 之一 Ludwig Schmidt 同时在 Stanford 与 Anthropic 任职,Anthropic 又与 Google、Moonshot、xAI、Z.ai 一起为评测提供了 API 额度——这一点是项目自己在致谢中披露的,属于常见的评测资助模式,但也意味着「谁出钱」与「谁被测」之间存在利益相邻。

最值得观察的下一项变量,不是某个模型能否在下一个版本刷高分,而是这套「科学家出题」的机制能否被独立复现并扩散:0.2 版能否在 10 月 5 日截稿前把 70 项扩大到更均衡的覆盖面,以及是否有第三方用不同 harness 重跑这些结果。「AI 科学家」的叙事已经存在多年,Terminal-Bench-Science 的价值在于第一次给了它一把科学家自己定的、可复查的尺子——而尺子目前的读数是 30%。

来源

  1. Terminal-Bench-Science 0.1 官方公告 · Stanford University / Laude Institute
  2. Terminal-Bench-Science(GitHub 仓库) · harbor-framework
  3. Terminal-Bench-Science Leaderboard · Snorkel AI
  4. Previewing the Model Hardware Standard · Anthropic

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 一名佩戴头戴式摄像设备的创作者在家中整理床铺,为 Figure 采集第一视角训练数据

    Figure 发布 Index:付费众包 1600 万段真人视频,训练人形机器人 Helix

    数据 · 2026-08-26

  • 汤森路透发布自研法律大模型 Thomson 的新闻配图

    汤森路透发布自研法律大模型 Thomson:4000 万美元挑战前沿实验室的规模逻辑

    数据 · 2026-08-25

  • Pew 图表:AI 写作痕迹在 .com 域名网页中约占一成,在 .edu 与 .gov 域名中仅约 1%

    ChatGPT 发布后超三分之一网页带 AI 写作痕迹:Pew 的 49 万页测量

    数据 · 2026-08-22

  • Reuters 为 Anthropic 数据留存政策报道配发的编辑插图:机械手、键盘与 Anthropic 标识

    OpenAI 推零留存安全监控,Anthropic 的 30 天数据留存政策松动

    数据 · 2026-08-21

  • OpenAI 首席执行官 Sam Altman 在美国参议院商务委员会就 AI 竞赛举行听证时作证(资料图)

    企业 AI 的领先并不黏:Fable 5 卖不动,半价的 Sol 帮 OpenAI 反攻

    数据 · 2026-08-20

  • 一名身着商务装的人与身旁透明的人物轮廓,四周环绕聊天提示词

    厂商 AI 使用报告漏掉近一半真实对话,独立测量挑战「工作用途」叙事

    数据 · 2026-08-20

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS