AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Claude Fable 5 横扫多项基准:SWE-Bench Verified 95%、LMSys Arena 登顶

2026年6月14日 · 2026-06-14

榜单与结果

Claude Fable 5 横扫多项基准:SWE-Bench Verified 95%、LMSys Arena 登顶

Anthropic 于 6 月 9 日发布 Claude Fable 5——首个面向公众开放的 Mythos 级模型(与 Claude Mythos 5 使用同一权重,附加安全护栏)。随后数日,该模型在多个主流基准上确立了领先地位:

  • SWE-Bench Verified(Vals AI 独立评测):95.00%±0.98,远超第二名 Claude Opus 4.8(88.60%)和 GPT-5.5(82.60%)。每任务成本 $2.05,耗时约 356 秒。
  • SWE-Bench Pro(厂商自报):80.3%,对比 Opus 4.8 的 69.2%。但需注意 Scale AI 的 SEAL 标准化榜单上,Fable 5 尚未出现——当前 SEAL 公共集榜首仍为 GPT-5.4(xHigh)的 59.1%。
  • LMSys Arena(6 月 10 日数据):综合 Elo 1510,排名 #1,领先 Claude Opus 4.6(thinking)的 1504 和 Gemini 3.1 Pro Preview 的 1487。
  • Scale Labs 多榜更新:在 HLE(Humanity's Last Exam)、MCP Atlas、Professional Reasoning 等多个榜单上,Fable 5 均被标记为 NEW 上榜。

安全护栏是关键限定条件:涉及网络安全、生物学、化学或模型蒸馏的请求会回退至 Claude Opus 4.8,因此 Fable 5 仅在不受限领域体现 Mythos 级性能。

来源:Anthropic《Claude Fable 5 and Claude Mythos 5》(2026-06-09)https://www.anthropic.com/news/claude-fable-5-mythos-5 ;Vals AI《SWE-bench Verified》(数据截至 2026-06-13)https://vals.ai/benchmarks/swebench ;Scale Labs Leaderboard https://labs.scale.com/leaderboard ;LMSys Arena Leaderboard Dataset(2026-06-10)https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset

Agents' Last Exam 发布:GPT-5.5 以 24.0% 险胜 Claude Fable 5,最难 tier 多数模型 0%

6 月 11 日,UC Berkeley 负责任去中心化智能中心(RDI)联合 300 余名行业专家顾问委员会,发布了 Agents' Last Exam(ALE)——一个面向长周期、具有经济价值的专业工作流的 agent 评测基准。

首版 ALE-V1 包含 147 个公开任务(覆盖 55 个子行业),另有 1,500+ 任务的私有题库用于官方排名。核心结果:

  • GPT-5.5(Codex harness):24.0% pass rate,总排名第一
  • Claude Fable 5(Claude Code):22.0%,排名第三
  • 在最高难度的 "Last-Exam" tier,大多数配置——包括 Claude Opus 4.8 和 Gemini CLI——得分0.0%

ALE 的设计关键:每约 6 个月轮换公开子集、私有任务与公开任务交替进出,以此限制基准泄漏(benchmark leakage)。评测采用 Snorkel AI 的滚动评估框架,所有任务均需可验证的产出。

这一基准揭示了当前 agent 评测的核心困境:即使最前沿模型在真实专业工作流上的绝对通过率仍极低,而模型间的差距被压缩在几个百分点内——远小于传统编码基准上 50+ 个百分点的跨度。

来源:Dawn Song(LinkedIn)《Introducing Agents' Last Exam》(2026-06-11)https://www.linkedin.com/pulse/introducing-agents-last-exam-ale-new-standard-evaluating-dawn-song-dntuc ;Snorkel AI《Agents' Last Exam Leaderboard》https://snorkel.ai/leaderboard/agents-last-exam ;VentureBeat(2026-06-11)https://venturebeat.com/technology/surprise-upset-gpt-5-5-beats-claude-fable-5-on-brutal-new-agents-last-exam-benchmark

Kimi K2.7-Code 发布:厂商自报 +21.8%,独立验证待定

6 月 12 日,Moonshot AI 发布 Kimi K2.7-Code,一款基于 K2.6 的编码专用开源模型(Modified MIT 许可,1T 参数 / 32B 激活,256K 上下文)。

厂商公布的六项基准对比:

基准 K2.6 K2.7-Code GPT-5.5 Claude Opus 4.8 提升
Kimi Code Bench v2 50.9 62.0 69.0 67.4 +21.8%
Program Bench 48.3 53.6 69.1 63.8 +11.0%
MLS Bench Lite 26.7 35.1 35.5 42.8 +31.5%
Kimi Claw 24/7 42.9 46.9 52.8 50.4 +9.3%
MCP Atlas 69.4 76.0 79.4 81.3 +9.5%
MCP Mark Verified 72.8 81.1 92.9 76.4 +11.4%

K2.7-Code 在 MCP Mark Verified 上超越 Opus 4.8(81.1 vs 76.4),在 MLS Bench Lite 上接近 GPT-5.5。Moonshot 同时宣称推理 token 消耗较 K2.6 降低约 30%。

然而,所有成绩均为厂商自报(K2.7-Code 运行于 Kimi Code CLI,对手模型分别运行于 Codex xhigh 和 Claude Code xhigh),未经独立验证。VentureBeat 报道,多位从业者公开质疑基准选择——该模型尚未提交至 DeepSWE 等更具区分度的独立基准。Hermes Agent 平台的开发者 Sugumaran Balasubramaniyan 在社交平台上直接质疑 Moonshot 的基准选择策略。

来源:MarkTechPost《Moonshot AI Releases Kimi K2.7-Code》(2026-06-12)https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6 ;VentureBeat《Kimi K2.7-Code cuts thinking tokens 30%》(2026-06-12)https://venturebeat.com/technology/kimi-k2-7-code-cuts-thinking-tokens-30-practitioners-say-benchmarks-dont-check-out

方法与争议

ALE 设计揭示 agent 基准的结构性挑战:任务难度与区分度的权衡

ALE 的发布引发了关于 agent 评测方法论的深层讨论。最引人注目的发现不是哪家模型赢了,而是区分度消失:

  • 在 ALE 全量任务上,GPT-5.5(24.0%)与 Claude Fable 5(22.0%)之间仅差 2 个百分点,而置信区间尚未公布。
  • 在 "Last-Exam" tier 上,多个前沿配置直接被清零——但彼此之间无法区分。
  • 对比之下,编码基准如 DeepSWE 可将同一批模型拉开至 65 个百分点,SWE-Bench Pro 约 30 个百分点。

这指向一个根本性的评测困境:任务越接近真实专业工作流,绝对通过率越低——但当通过率接近零时,基准的排序能力也随之丧失。ALE 以约 6 个月的滚动脉冲轮换机制尝试延缓基准饱和与泄漏,但首版 147 个公开任务难以支撑统计上稳健的模型排名。

此外,Snorkel AI 托管的排行榜显示,不同 harness(Codex、Claude Code、ALE Claw 等)对同一模型的得分影响显著——Cursor CLI + GPT-5.5 组合(20.7%)与 Codex + GPT-5.5 组合(24.0%)之间有 3.3 个百分点的差异,再次验证了评测基础设施对结论的关键影响。

来源:Snorkel AI《Agents' Last Exam Leaderboard》https://snorkel.ai/leaderboard/agents-last-exam ;UC Berkeley RDI Blog《How We Broke Top AI Agent Benchmarks》https://rdi.berkeley.edu/blog/trustworthy-benchmarks-cont

Kimi K2.7-Code 基准争议:厂商自报数字与 DeepSWE 生态位缺失

K2.7-Code 的发布引发了关于开源模型评测透明度的新一轮讨论。争议集中在两点:

  1. 厂商自报 vs 独立评测:全部六个基准均为 Moonshot 自行运行。对比对象(GPT-5.5、Opus 4.8)在不同 harness(Codex xhigh、Claude Code xhigh)中运行,而 K2.7-Code 使用自有的 Kimi Code CLI,harness 差异未被控制。
  2. DeepSWE 缺失:DeepSWE 作为目前区分度最高的独立编码基准(前沿模型跨度 65 个百分点),已成为模型路由系统(如 Hermes Agent)的参考信号。K2.7-Code 未提交至 DeepSWE,其开发者被从业者公开呼吁提交以消除信息不对称。

这一问题并非 K2.7-Code 独有——它折射出开源模型评测市场的结构性缺陷:厂商有动机选择最大化自身优势的基准组合,而独立评测资源有限、覆盖面不足,形成信息真空。

来源:VentureBeat(2026-06-12)https://venturebeat.com/technology/kimi-k2-7-code-cuts-thinking-tokens-30-practitioners-say-benchmarks-dont-check-out

工具与标准

Anthropic 更新 RSP:撤回阻止外部安全研究者评测的条款

6 月 11 日,Anthropic 发布了更新版的 Responsible Scaling Policy,撤销了一项此前会阻止外部 AI 安全研究者使用 Claude 进行评测和红队测试的条款。这一修订直接回应了学术界和独立评测机构对其 RSP v3.0(2 月生效)中限制外部评估访问的批评。

此更新虽非新基准发布,但对评测生态有直接影响:作为当前在多个主流基准上领先的模型家族,Claude 对外部安全评测的可及性决定了第三方审计的覆盖深度。METR 此前在 3 月与 Anthropic 合作完成了对其内部 agent 监控系统的红队测试,但更大范围的独立评测能否常态化仍取决于此类政策条款的设计。

来源:AI Productivity《Anthropic Updates RSP After Provision Would Have Blocked Safety Researchers》(2026-06-11)https://aiproductivity.ai/news/date/2026-06-11


本期说明:窗口(6 月 10 日–13 日)内评测圈的核心事件集中在三个方向:(1) Claude Fable 5 发布后的基准格局重塑——SWE-Bench Verified 95%、LMSys Arena #1,但 Scale SEAL 标准化评测尚未收录;(2) Agents' Last Exam——UC Berkeley RDI 的新 agent 基准,GPT-5.5 以 24.0% 略胜 Claude Fable 5 的 22.0%,但最难 tier 上多数模型归零,引发对 agent 基准区分度的讨论;(3) Kimi K2.7-Code 厂商自报基准与独立验证之争——开源评测透明度的老问题在新模型发布中再度激化。上期已覆盖的 DeepSWE、RuntimeWire 精准度对比、UC Berkeley AI 教育评估冲击、LongJudgeBench 等不再重复。

Product Hunt

Vercel Drop

6 月 13 日榜单第 1 名。通过拖放把文件或项目快速发布为在线页面。

Kimi K2.7 Code

6 月 13 日榜单第 2 名。月之暗面面向复杂工程任务的高能力代码模型。

Prometheus by Firecrawl

6 月 13 日榜单第 3 名。面向网页数据任务的 Forward Deployed Agent。

来源:Product Hunt 6 月 13 日榜单

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • SpaceX 今日登陆纳斯达克:人类史上最大 IPO,开盘 $162,Musk 成为首位万亿富翁SpaceX 今日登陆纳斯达克:人类史上最大 IPO,开盘 $162,Musk 成为首位万亿富翁Daily · 6月13日
  • SpaceX IPO 今夜定价、明日上市——人类历史上最大 IPO 的最后一夜SpaceX IPO 今夜定价、明日上市——人类历史上最大 IPO 的最后一夜Daily · 6月12日
  • DeepSWE 更新:GPT-5.5 以 70% 绝对领先,Claude Opus 4.8 以 58% 居次DeepSWE 更新:GPT-5.5 以 70% 绝对领先,Claude Opus 4.8 以 58% 居次Daily · 6月11日
  • AGIBOT World Challenge 2026 参赛团队在真实AGIBOT G2机器人上调试AGIBOT World Challenge 2026:具身智能竞赛从仿真走向真实机器人闭环验证,vivo PrismBot 夺魁Daily · 6月10日
  • Apple WWDC 2026:Gemini 驱动的 Siri AI 终于落地,Tim Cook 告别Apple WWDC 2026:Gemini 驱动的 Siri AI 终于落地,Tim Cook 告别Daily · 6月9日
  • 特朗普与桑德斯罕见趋同:美国政府应考虑持有 AI 公司股权特朗普与桑德斯罕见趋同:美国政府应考虑持有 AI 公司股权Daily · 6月8日
  • ICRA 2026 ViennaICRA 2026揭晓最佳论文奖:FP3以3D相机姿态驱动视角不变策略学习,获机器人学习最佳论文Daily · 6月7日
  • Cosmos 3生成的机器人pick-and-place场景NVIDIA发布Cosmos 3:首个全开源物理AI全模态基础模型,7项基准登顶,Mixture-of-Transformers架构统一推理与生成Daily · 6月6日
  • LiveBench:GPT-5.5 Thinking xHigh 以 80.71 综合分领跑,GPT-5.4 仅差 0.43 分紧随LiveBench:GPT-5.5 Thinking xHigh 以 80.71 综合分领跑,GPT-5.4 仅差 0.43 分紧随Daily · 6月5日
  • S2:视觉-语言-动作模型泛化能力大幅提升——\\\"少看多描述\\\"策略使真实机器人成功率提高24.8个百分点S2:视觉-语言-动作模型泛化能力大幅提升——\"少看多描述\"策略使真实机器人成功率提高24.8个百分点Daily · 6月4日
  • NVIDIA RTX Spark 与 Microsoft Build 同日亮剑,「AI 原生 PC」从概念变成产品NVIDIA RTX Spark 与 Microsoft Build 同日亮剑,「AI 原生 PC」从概念变成产品Daily · 6月3日
  • Anthropic 向 SEC 秘密提交 IPO 申请,AI 最大独角兽争相抢滩公开市场Anthropic 向 SEC 秘密提交 IPO 申请,AI 最大独角兽争相抢滩公开市场Daily · 6月2日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS