Claude Fable 5 横扫多项基准:SWE-Bench Verified 95%、LMSys Arena 登顶
Anthropic 于 6 月 9 日发布 Claude Fable 5——首个面向公众开放的 Mythos 级模型(与 Claude Mythos 5 使用同一权重,附加安全护栏)。随后数日,该模型在多个主流基准上确立了领先地位:
- SWE-Bench Verified(Vals AI 独立评测):95.00%±0.98,远超第二名 Claude Opus 4.8(88.60%)和 GPT-5.5(82.60%)。每任务成本 $2.05,耗时约 356 秒。
- SWE-Bench Pro(厂商自报):80.3%,对比 Opus 4.8 的 69.2%。但需注意 Scale AI 的 SEAL 标准化榜单上,Fable 5 尚未出现——当前 SEAL 公共集榜首仍为 GPT-5.4(xHigh)的 59.1%。
- LMSys Arena(6 月 10 日数据):综合 Elo 1510,排名 #1,领先 Claude Opus 4.6(thinking)的 1504 和 Gemini 3.1 Pro Preview 的 1487。
- Scale Labs 多榜更新:在 HLE(Humanity's Last Exam)、MCP Atlas、Professional Reasoning 等多个榜单上,Fable 5 均被标记为 NEW 上榜。
安全护栏是关键限定条件:涉及网络安全、生物学、化学或模型蒸馏的请求会回退至 Claude Opus 4.8,因此 Fable 5 仅在不受限领域体现 Mythos 级性能。
来源:Anthropic《Claude Fable 5 and Claude Mythos 5》(2026-06-09)https://www.anthropic.com/news/claude-fable-5-mythos-5 ;Vals AI《SWE-bench Verified》(数据截至 2026-06-13)https://vals.ai/benchmarks/swebench ;Scale Labs Leaderboard https://labs.scale.com/leaderboard ;LMSys Arena Leaderboard Dataset(2026-06-10)https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset
Agents' Last Exam 发布:GPT-5.5 以 24.0% 险胜 Claude Fable 5,最难 tier 多数模型 0%
6 月 11 日,UC Berkeley 负责任去中心化智能中心(RDI)联合 300 余名行业专家顾问委员会,发布了 Agents' Last Exam(ALE)——一个面向长周期、具有经济价值的专业工作流的 agent 评测基准。
首版 ALE-V1 包含 147 个公开任务(覆盖 55 个子行业),另有 1,500+ 任务的私有题库用于官方排名。核心结果:
- GPT-5.5(Codex harness):24.0% pass rate,总排名第一
- Claude Fable 5(Claude Code):22.0%,排名第三
- 在最高难度的 "Last-Exam" tier,大多数配置——包括 Claude Opus 4.8 和 Gemini CLI——得分0.0%
ALE 的设计关键:每约 6 个月轮换公开子集、私有任务与公开任务交替进出,以此限制基准泄漏(benchmark leakage)。评测采用 Snorkel AI 的滚动评估框架,所有任务均需可验证的产出。
这一基准揭示了当前 agent 评测的核心困境:即使最前沿模型在真实专业工作流上的绝对通过率仍极低,而模型间的差距被压缩在几个百分点内——远小于传统编码基准上 50+ 个百分点的跨度。
来源:Dawn Song(LinkedIn)《Introducing Agents' Last Exam》(2026-06-11)https://www.linkedin.com/pulse/introducing-agents-last-exam-ale-new-standard-evaluating-dawn-song-dntuc ;Snorkel AI《Agents' Last Exam Leaderboard》https://snorkel.ai/leaderboard/agents-last-exam ;VentureBeat(2026-06-11)https://venturebeat.com/technology/surprise-upset-gpt-5-5-beats-claude-fable-5-on-brutal-new-agents-last-exam-benchmark
Kimi K2.7-Code 发布:厂商自报 +21.8%,独立验证待定
6 月 12 日,Moonshot AI 发布 Kimi K2.7-Code,一款基于 K2.6 的编码专用开源模型(Modified MIT 许可,1T 参数 / 32B 激活,256K 上下文)。
厂商公布的六项基准对比:
| 基准 | K2.6 | K2.7-Code | GPT-5.5 | Claude Opus 4.8 | 提升 |
|---|---|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | 69.0 | 67.4 | +21.8% |
| Program Bench | 48.3 | 53.6 | 69.1 | 63.8 | +11.0% |
| MLS Bench Lite | 26.7 | 35.1 | 35.5 | 42.8 | +31.5% |
| Kimi Claw 24/7 | 42.9 | 46.9 | 52.8 | 50.4 | +9.3% |
| MCP Atlas | 69.4 | 76.0 | 79.4 | 81.3 | +9.5% |
| MCP Mark Verified | 72.8 | 81.1 | 92.9 | 76.4 | +11.4% |
K2.7-Code 在 MCP Mark Verified 上超越 Opus 4.8(81.1 vs 76.4),在 MLS Bench Lite 上接近 GPT-5.5。Moonshot 同时宣称推理 token 消耗较 K2.6 降低约 30%。
然而,所有成绩均为厂商自报(K2.7-Code 运行于 Kimi Code CLI,对手模型分别运行于 Codex xhigh 和 Claude Code xhigh),未经独立验证。VentureBeat 报道,多位从业者公开质疑基准选择——该模型尚未提交至 DeepSWE 等更具区分度的独立基准。Hermes Agent 平台的开发者 Sugumaran Balasubramaniyan 在社交平台上直接质疑 Moonshot 的基准选择策略。
来源:MarkTechPost《Moonshot AI Releases Kimi K2.7-Code》(2026-06-12)https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6 ;VentureBeat《Kimi K2.7-Code cuts thinking tokens 30%》(2026-06-12)https://venturebeat.com/technology/kimi-k2-7-code-cuts-thinking-tokens-30-practitioners-say-benchmarks-dont-check-out