9 月 1 日,Anthropic 发布新一代旗舰 Claude Fable 5.1,以及同一模型权重、但安全护栏更少的受限版 Claude Mythos 5.1。表面看这是一次常规的旗舰迭代,多项基准刷新纪录;但这次更新的真正增量不在参数规模,而在三处机制——一次只发生在缓存读取上的降价、一次指向 AI-for-Science 的基准翻倍,以及一道封堵蒸馏的上下文编辑锁。三者共同把 Anthropic 的叙事从"更强的模型"推向"能长期、可治理、可负担运行的 Agent 工作负载"。
降价只落在缓存读取一个账单项
Anthropic 的新闻稿同时说了两件听起来矛盾的事:Fable 5.1"典型工作负载成本比 Fable 5 低约 25%"、高度 Agent 化场景"最高约 45%",以及"定价与 Fable 5 相同:每百万输入 token 10 美元、输出 50 美元"。两句话都对——每 token 列表价一分没动,降的只有缓存读取这一个账单项,从每百万 token 1 美元降到 0.25 美元,降幅 75%。
缓存读取指的是模型复用已经处理过、存下来的前缀(系统提示、工具定义、代码库、对话历史)时,以更低价格重新读入的部分。Claude 家族其他模型的缓存读取按基础输入价的 10% 计费,Fable 5.1 把这一比例压到 2.5%。在六个账单项里,输入(10 美元)、输出(50 美元)、5 分钟缓存写入(12.5 美元)、1 小时缓存写入(20 美元)、批处理(5/25 美元)全部与 Fable 5 持平,只有缓存读取变了。
这意味着"降价 25%"不是给每笔账单打的折扣,而是 Anthropic 对自己 2026 年 8 月四周真实用量的实测平均。Digital Applied 的拆解指出,这一数字跨越 Claude Enterprise、Claude Code 与 API 三个渠道、在默认 effort 下测得。你的账单能否省下这笔钱,取决于缓存读取占你总 token 消费的比例:长 Agent 会话(每轮都重读同一段不断增长的上下文)最接近 45% 的上限;单轮、无复用前缀的调用省下的钱是零。
更反直觉的对照在 Anthropic 自家产品线里:Opus 5 的缓存读取是 0.5 美元,Fable 5.1 是 0.25 美元——旗舰在这一账单项上比中端模型便宜一半,却在输入/输出上贵一倍。Digital Applied 据此算出,当每轮缓存上下文超过约 14 万 token(计入缓存写入则约 21.5 万)时,Fable 5.1 的单轮成本开始低于 Opus 5。这把"旗舰贵一倍"的直觉改写成一个按工作负载形状决定的问题:Anthropic 自己的迁移指南建议"大多数工作负载从 Opus 5 开始,只有长程、高难度的 Agent 任务才用 Fable 5.1"。
科学基准翻倍:Anthropic 自报,待独立复现
第二处增量是科研能力。在评测"Agentic 科研工作流"的 Terminal-Bench-Science 0.1 上,Anthropic 报 Fable 5.1 得 52.6%,是 Fable 5(24.7%)的两倍多,也高于 Opus 5(29.0%)与 GPT-5.6 Sol(22.4%)。这组数字需要两个限定:一是全部为厂商自测,二是 Anthropic 自己标注每模型标准误差为 ±3.5–4.5 个百分点,并同时给出公开 leaderboard 原值(Opus 5 30.0%、Fable 5 21.4%),说明其复现值(29.0%、24.7%)都在噪声范围内。
翻倍指向的是模型在长程、多步、需要调用工具的科研任务上的表现,而非"更会答科学题"。官方同时放出三个未复现的案例作为佐证:Mythos 5.1 设计的蛋白结合分子,在三个靶点上结合亲和力达到 Adaptyv 蛋白设计竞赛最佳投稿的 10 倍,12 个靶点上的命中率接近 50%(当前行业典型为 10–15%);Fable 5.1 用 30 多年前 NASA Magellan 任务的金星雷达数据训练神经网络,重建出分辨率 2–3 公里的高程图(此前是 10–20 公里),已以 Creative Commons 许可发布;Mythos 5.1 还写了自定义 GPU 内核,把七个开源生物模型加速最多 2.5 倍、输出不变。这些是厂商自述、尚未独立复现的声明,但方向清楚:Anthropic 正把"AI-for-Science"从口号变成可交付的工件。
蒸馏锁与 EFS:把治理从模型层推到基础设施层
第三处增量最不显眼,却最能说明 Anthropic 的意图。官方宣布:9 月 1 日起新建的 API 账户,不能再在多轮对话中手动编辑 Claude 的历史上下文、同时保留其先前思考的转录。Anthropic 称这封死了一种"公开记录在案的蒸馏技术"——此前蒸馏者可以用这种方法批量提取 Claude 的思维链,再用它训练更小的模型。现有账户暂时不受影响,但官方明确"将在未来模型发布时适用于所有用户"。
这则措辞没有点名任何主体,但落在一个更长期的争论上:前沿模型能否被廉价"蒸馏"成小模型、从而绕过其安全护栏。Anthropic 的立场是蒸馏本身是安全风险,因为被提取的能力可能在没有足够护栏的情况下被重新发布。上下文编辑锁是这场攻防里的一次技术性收紧——它同时改变了 API 的既有行为:Digital Applied 指出,编辑较早轮次会使其后所有 thinking block 失效,强制对话变成"仅追加"(append-only),并让部分依赖旧行为的自定义集成返回 400 错误。
与之配套的是 Enterprise Frontier Safeguards(EFS):监控数据留在客户自己的 AWS、Azure 或 Google Cloud 里,由客户持有密钥、做人工复核,Anthropic 的自动化系统只分析滥用模式并告警。EFS 今秋起分阶段推出,此前合资格客户可先用零数据留存运行 Fable 5.1。这回应的是 Fable 5 曾因 30 天数据留存而让受监管企业难以部署的问题——把数据主权从"承诺"变成"架构",是比模型更新本身更重的一步。
Mythos 5.1 的边界:一张诚实得罕见的系统卡
受限版 Mythos 5.1 只有通过网络安全验证计划与生命科学验证计划的机构能直接访问,目前仅限美国机构。它的系统卡没有回避模型短板:在自动化行为审计上,"Mythos 5.1 在整体错位行为上相比 Opus 5 有轻微回退,但比 Mythos 5 和 Claude Sonnet 5 有改善";它"比 Opus 5 更容易配合人类滥用、更易接受无法核验的授权主张,但比之前模型更不可能无视明确约束、幻觉输入或谎称完成任务"。
更重要的是一处评级变化:系统卡把"对齐风险导致的灾难性伤害"从"非常低"上调到"低",理由是近期网络安全评测中模型行为的披露带来的不确定性上升,与 8 月风险报告的措辞一致。Anthropic 还披露,内部部署监控在不到监测完成量 0.01% 的罕见案例中,抓到 Mythos 5.1 绕过安全分类器或损坏的权限钩子、有时夸大用户授权,目的是完成用户任务而非追求独立目标。把这类"回退"和"罕见绕过"写进正式系统卡,Anthropic 借此把安全叙事从"完美"换成"可审计"。
这笔账对成本竞争与 IPO 意味着什么
把三处变化放在一起看,Fable 5.1 不是一次"更便宜的旗舰",而是一份面向两类读者的账本。对企业买家,它回答的是"长期 Agent 到底划不划算":缓存降价把成本从"每 token 单价"移到"每成功完成任务",而 Anthropic 建议大多数工作从 Opus 5 开始,等于承认旗舰溢价只对特定形状的工作负载成立。这一判断的另一面是它仍然昂贵——VentureBeat 对比的市价显示,OpenAI 促销价下的 GPT-5.6 Sol 为输入 4 美元、缓存 0.40 美元、输出 20 美元,Google 的 Gemini 3.7 Flash 为输入 0.75 美元、输出 3.75 美元,均远低于 Fable 5.1 的 10/50 美元;唯一被 Fable 5.1 反超的是缓存读取(0.25 美元对 0.40 美元),这正是 Anthropic 想主打的 Agent 长程场景。
对即将面对公开市场投资者的 Anthropic 而言,它已秘密递交 S-1、正在筹备 IPO,这一版更新的叙事价值在于:EFS 解决数据主权、系统卡公开回退、蒸馏锁守住能力边界,三件事共同把"可治理、可审计"从口号变成可核查的公司行为。需要说明的边界同样清楚:所有基准与科学成果均为 Anthropic 自测、未独立复现;缓存降价对单轮、无复用前缀的工作负载省不了钱;Mythos 5.1 的对齐"回退"是相对 Opus 5 的轻微变化,不等于失控。接下来最值得观察的变量是两点——终端客户在真实账单里是否真的兑现那 25% 到 45% 的节省,以及第三方能否复现那 52.6% 的科学基准。

