Claude Fable 5.1 发布:1M 上下文、缓存价格降至四分之一、双版本安全策略

Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1,定位长时程智能体与复杂推理任务,同步推出仅限邀请的 Claude Mythos 5.1。这次发布有三个值得展开的信息点:1M token 上下文配合结构性降价(缓存读取价格降至四分之一)、对上一代 Fable 5 的全面 benchmark 提升,以及"同一个模型、两套安全护栏"的双版本设计。本文基于 Anthropic 官方公告与 Claude Platform 文档,整理规格、定价、评测数据与迁移注意事项。

Claude Fable 5.1 and Mythos 5.1 官方发布图

规格与定价

Fable 5.1 的核心规格:1M token 上下文窗口,128K token 最大输出,自适应思考(Adaptive Thinking,始终开启),默认推理强度为 high(在 Claude Code 中默认 High,在 Claude Cowork 和 Claude.ai 上默认 Medium),可靠知识截止日期为 2026 年 6 月。模型 ID 为 claude-fable-5-1,已在 Claude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 全平台可用,官方承诺至少服役到 2027 年 9 月 1 日。

定价方面,输入输出单价与 Fable 5 完全持平,变化集中在缓存链路:

项目价格(每百万 token)相对上一代
输入10 美元持平
输出50 美元持平
缓存写入(5 分钟)12.50 美元持平
缓存写入(1 小时)20 美元持平
缓存读取0.25 美元降至 1/4
Batch API输入输出五折持平

缓存读取(cache read)指模型复用已经处理过的上下文。智能体类负载的特点是每一步都要携带完整历史记录调用模型,缓存读取在总成本中占大头。Anthropic 给出的实测数据(2026 年 8 月四周真实用量,按默认推理强度计):典型工作负载总成本下降约 25%,重智能体(上下文重、工具重)负载降幅最高约 45%。对于跑长任务的智能体应用,这次降价幅度相当于一次隐形八折。

Benchmark 数据

官方公布了七项评测,对比上一代 Fable 5、Opus 5 和 OpenAI GPT-5.6 Sol:

评测Fable 5.1Fable 5Opus 5GPT-5.6 Sol
智能体科研 Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
智能体编程 Terminal-Bench 4.055.8%42.0%52.3%37.3%
知识工作 GDPval-AA v21853172318241711
计算机使用 OSWorld 2.0(partial)77.9%72.9%75.4%
计算机使用 OSWorld 2.0(strict)41.7%36.1%39.6%
多学科推理 Humanity's Last Exam(无工具)60.9%57.8%56.6%
多学科推理 Humanity's Last Exam(带工具)65.0%63.8%63.6%
业务流程 AutomationBench31.4%17.1%26.9%19.6%
智能体编程 CursorBench 3.2.073.4%70.5%70.0%67.2%

Claude Fable 5.1 官方 benchmark 对比表

几个值得单独看的数据点:

第一,智能体科研任务的提升幅度最大,52.6% 对上一代的 24.7%,接近翻倍。这类任务要求模型在终端里自主完成多步科学分析,是官方重点宣传的"长时程任务"能力的直接体现。

第二,Terminal-Bench 4.0 上 Mythos 5.1 拿到 60.9%,高于 Fable 5.1 的 55.8%。官方解释是两个版本为同一模型,分数差距来自早期网络安全护栏对部分任务的误拦截;随着本次护栏精度改进,两个版本的差距预期会缩小。

第三,低推理强度的性价比。官方称 Fable 5.1 在 Low 或 Medium 推理强度下即可达到与 Fable 5 相当或更好的成绩,配合缓存降价,实际账单差距比分数差距更大。

第四,GPT-5.6 Sol 在 OSWorld 2.0 和 Humanity's Last Exam 两项上未提交数据(表中为“—”),对比时注意口径不完整。

同一个模型,两套护栏

这次发布在产品设计上最特殊的点是双版本策略。官方文档明确:Fable 5.1 和 Mythos 5.1 是同一个模型,规格和定价相同,区别在安全护栏等级与开放范围。

Mythos 5.1 面向 Project Glasswing 参与者,仅限邀请,目前只对美国的一批组织开放(网络防御方向可通过 CVP 注册申请),Anthropic 正与美国政府协调扩大准入。它的护栏为网络安全和生命科学场景设计:允许安全研究人员用模型发现软件漏洞,但禁止开发漏洞利用工具;生物能力走与美国政府合作建立的准入计划,即将向科学家开放注册。

护栏本身的精度也在这次更新之列:网络安全场景的误拦截(把良性内容错误标记为风险)比之前减少 60%。误拦截率直接影响安全团队的实际使用体验,拦得太多等于不可用。

企业侧配套发布了 Enterprise Frontier Safeguards(EFS):数据存储在客户完全控制的云基础设施中(Anthropic 不可见),效果等同零数据保留政策,今年秋季起分阶段向企业客户开放;过渡期内容合资格的客户可以直接使用零数据保留模式。

Mythos 5.1 公布的蛋白质设计成果:Nipah G 靶点 30 次设计命中 18 次

从 Fable 5 迁移:三个破坏性变更

正在用 API 调用 Fable 5 的开发者需要注意,升级到 5.1 有三个破坏性变更:

  1. 强制工具调用(forced tool use)不再支持,请求会返回错误;
  2. 思考块(thinking blocks)与产生它的模型绑定,更早的模型无法读取 Fable 5.1 的思考块;
  3. 编辑对话中的较早轮次会使思考块失效。

另有五项增量变更:按消息设置推理强度(beta,中途切换不失效 prompt 缓存)、轮次级系统消息(beta)、工具调用间的可读进度更新(display: "updates",beta)、更低的缓存读取价格、内容来源标记(content provenance)。官方提供了迁移指南,改动集中在思考块生命周期管理上。

与家族内其他模型的定位

按官方文档的选购建议,大多数工作负载从 Opus 5 起步(输入/输出 5/25 美元),当 Opus 5 在高强度推理下仍达不到评测要求,或需要长时程智能体能力时,再上 Fable 5.1(10/50 美元)。Sonnet 5(2/10 美元)覆盖高频轻量场景,Haiku 4.5(1/5 美元,200K 上下文)负责最快的响应。四款模型中前三款都已到 1M 上下文。

结语

这次发布的产品信号比模型本身更有信息量:竞争重心已经挪到长任务的可靠性上(模型被要求连续工作数十小时不出错),降价动作落在缓存结构上(对重度用户更有效,对轻度用户无感),安全策略则开始按场景分版发行。早期客户在测试中给出过一个有代表性的案例:投资机构 Millennium 报告 Fable 5.1 定位了一个他们的工程师和其他模型都未能解释、悬置数年的偶发崩溃根因。这类"长时间自主排查"场景,正是 1M 上下文加缓存降价组合拳瞄准的市场。

来源:Anthropic 官方公告 · Claude Platform 文档