Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1,定位长时程智能体与复杂推理任务,同步推出仅限邀请的 Claude Mythos 5.1。这次发布有三个值得展开的信息点:1M token 上下文配合结构性降价(缓存读取价格降至四分之一)、对上一代 Fable 5 的全面 benchmark 提升,以及"同一个模型、两套安全护栏"的双版本设计。本文基于 Anthropic 官方公告与 Claude Platform 文档,整理规格、定价、评测数据与迁移注意事项。

规格与定价
Fable 5.1 的核心规格:1M token 上下文窗口,128K token 最大输出,自适应思考(Adaptive Thinking,始终开启),默认推理强度为 high(在 Claude Code 中默认 High,在 Claude Cowork 和 Claude.ai 上默认 Medium),可靠知识截止日期为 2026 年 6 月。模型 ID 为 claude-fable-5-1,已在 Claude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 全平台可用,官方承诺至少服役到 2027 年 9 月 1 日。
定价方面,输入输出单价与 Fable 5 完全持平,变化集中在缓存链路:
| 项目 | 价格(每百万 token) | 相对上一代 |
|---|---|---|
| 输入 | 10 美元 | 持平 |
| 输出 | 50 美元 | 持平 |
| 缓存写入(5 分钟) | 12.50 美元 | 持平 |
| 缓存写入(1 小时) | 20 美元 | 持平 |
| 缓存读取 | 0.25 美元 | 降至 1/4 |
| Batch API | 输入输出五折 | 持平 |
缓存读取(cache read)指模型复用已经处理过的上下文。智能体类负载的特点是每一步都要携带完整历史记录调用模型,缓存读取在总成本中占大头。Anthropic 给出的实测数据(2026 年 8 月四周真实用量,按默认推理强度计):典型工作负载总成本下降约 25%,重智能体(上下文重、工具重)负载降幅最高约 45%。对于跑长任务的智能体应用,这次降价幅度相当于一次隐形八折。
Benchmark 数据
官方公布了七项评测,对比上一代 Fable 5、Opus 5 和 OpenAI GPT-5.6 Sol:
| 评测 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 智能体科研 Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| 智能体编程 Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| 知识工作 GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| 计算机使用 OSWorld 2.0(partial) | 77.9% | 72.9% | 75.4% | — |
| 计算机使用 OSWorld 2.0(strict) | 41.7% | 36.1% | 39.6% | — |
| 多学科推理 Humanity's Last Exam(无工具) | 60.9% | 57.8% | 56.6% | — |
| 多学科推理 Humanity's Last Exam(带工具) | 65.0% | 63.8% | 63.6% | — |
| 业务流程 AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| 智能体编程 CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |

几个值得单独看的数据点:
第一,智能体科研任务的提升幅度最大,52.6% 对上一代的 24.7%,接近翻倍。这类任务要求模型在终端里自主完成多步科学分析,是官方重点宣传的"长时程任务"能力的直接体现。
第二,Terminal-Bench 4.0 上 Mythos 5.1 拿到 60.9%,高于 Fable 5.1 的 55.8%。官方解释是两个版本为同一模型,分数差距来自早期网络安全护栏对部分任务的误拦截;随着本次护栏精度改进,两个版本的差距预期会缩小。
第三,低推理强度的性价比。官方称 Fable 5.1 在 Low 或 Medium 推理强度下即可达到与 Fable 5 相当或更好的成绩,配合缓存降价,实际账单差距比分数差距更大。
第四,GPT-5.6 Sol 在 OSWorld 2.0 和 Humanity's Last Exam 两项上未提交数据(表中为“—”),对比时注意口径不完整。
同一个模型,两套护栏
这次发布在产品设计上最特殊的点是双版本策略。官方文档明确:Fable 5.1 和 Mythos 5.1 是同一个模型,规格和定价相同,区别在安全护栏等级与开放范围。
Mythos 5.1 面向 Project Glasswing 参与者,仅限邀请,目前只对美国的一批组织开放(网络防御方向可通过 CVP 注册申请),Anthropic 正与美国政府协调扩大准入。它的护栏为网络安全和生命科学场景设计:允许安全研究人员用模型发现软件漏洞,但禁止开发漏洞利用工具;生物能力走与美国政府合作建立的准入计划,即将向科学家开放注册。
护栏本身的精度也在这次更新之列:网络安全场景的误拦截(把良性内容错误标记为风险)比之前减少 60%。误拦截率直接影响安全团队的实际使用体验,拦得太多等于不可用。
企业侧配套发布了 Enterprise Frontier Safeguards(EFS):数据存储在客户完全控制的云基础设施中(Anthropic 不可见),效果等同零数据保留政策,今年秋季起分阶段向企业客户开放;过渡期内容合资格的客户可以直接使用零数据保留模式。

从 Fable 5 迁移:三个破坏性变更
正在用 API 调用 Fable 5 的开发者需要注意,升级到 5.1 有三个破坏性变更:
- 强制工具调用(forced tool use)不再支持,请求会返回错误;
- 思考块(thinking blocks)与产生它的模型绑定,更早的模型无法读取 Fable 5.1 的思考块;
- 编辑对话中的较早轮次会使思考块失效。
另有五项增量变更:按消息设置推理强度(beta,中途切换不失效 prompt 缓存)、轮次级系统消息(beta)、工具调用间的可读进度更新(display: "updates",beta)、更低的缓存读取价格、内容来源标记(content provenance)。官方提供了迁移指南,改动集中在思考块生命周期管理上。
与家族内其他模型的定位
按官方文档的选购建议,大多数工作负载从 Opus 5 起步(输入/输出 5/25 美元),当 Opus 5 在高强度推理下仍达不到评测要求,或需要长时程智能体能力时,再上 Fable 5.1(10/50 美元)。Sonnet 5(2/10 美元)覆盖高频轻量场景,Haiku 4.5(1/5 美元,200K 上下文)负责最快的响应。四款模型中前三款都已到 1M 上下文。
结语
这次发布的产品信号比模型本身更有信息量:竞争重心已经挪到长任务的可靠性上(模型被要求连续工作数十小时不出错),降价动作落在缓存结构上(对重度用户更有效,对轻度用户无感),安全策略则开始按场景分版发行。早期客户在测试中给出过一个有代表性的案例:投资机构 Millennium 报告 Fable 5.1 定位了一个他们的工程师和其他模型都未能解释、悬置数年的偶发崩溃根因。这类"长时间自主排查"场景,正是 1M 上下文加缓存降价组合拳瞄准的市场。