Claude Opus 5 发布:接近 Fable 5 性能,价格减半

Anthropic 在 7 月 24 日发布了 Claude Opus 5。这是 Opus 系列的一次重大代际升级——在编码、知识工作和智能体任务上创下新纪录,而价格与上一代 Opus 4.8 完全一致:每百万输入 token $5、每百万输出 token $25,只有同代旗舰 Fable 5 的一半。

更关键的信号是:在多项核心基准测试中,Opus 5 已经追平甚至超过了自家更贵的 Fable 5。Anthropic 给出的定位很明确——"设计为日常使用的模型",直接设为 Claude Max 订阅的默认模型,同时也是 Claude Pro 上可用的最强模型。

核心基准表现

Opus 5 在 Frontier-Bench v0.1 上的表现

上图是 Frontier-Bench v0.1——一个评估智能体编程能力的基准。横轴是每次任务的成本(美元,对数刻度),纵轴是得分。可以看到 Opus 5(橙色线)在每个成本点上全面领先:在最高 effort 级别下达到约 44%,而上一代 Opus 4.8(蓝色线)最高只有约 18%。Anthropic 称 Opus 5 在这个基准上"性能是 Opus 4.8 的两倍以上,且单位成本更低"。

Opus 5 在 CursorBench 3.2 上的表现

CursorBench 3.2 来自 Cursor 编辑器团队的内部评测。Opus 5 在最高 effort 级别下与 Fable 5 的峰值差距不到 0.5 个百分点,但成本只有后者的一半。在所有 effort 级别(low / medium / high / xhigh / max)上,Opus 5 在给定成本下的性能都优于所有其他模型。

除了编程之外,Opus 5 在多项能力评测上实现了显著突破:

基准测试表现
ARC-AGI 3得分是第二名的 3 倍(解决新问题的能力)
Zapier AutomationBench通过率约为第二名的 1.5 倍,最低 effort 下也能通过最多任务
OSWorld 2.0(计算机使用)超过 Fable 5 的最佳成绩,成本仅为其约三分之一
GDPval-AA v2知识工作评测新标杆

科学研究能力

Opus 5 在生命科学评测上相比 Opus 4.8 有全面提升,覆盖结构生物学、有机化学和生物信息学。最显著的进步在于:

  • 有机化学:从光谱数据推断分子结构的任务上,比 Opus 4.8 高 10.2 个百分点
  • 蛋白质研究:预测蛋白质序列变异对功能影响的任务上,高 7.7 个百分点

Opus 5 还展现了更强的可视化输出能力。官方公告中展示了一个风洞模拟(可视化气流通过不同物体的流动)和一个交互式细胞结构演示——这些是模型直接生成的代码可视化成果。

智能体行为的质变

Anthropic 在公告中分享了几个 Opus 5 展现出自主判断能力的案例:

从图纸重建 3D 模型:在一个 Frontier-Bench 任务中,Opus 5 被要求根据一张机器零件的图纸编写代码来重建 3D FreeCAD 模型。但任务设计刻意没有给它查看图纸的方式。Opus 5 的反应是:自己编写了一套计算机视觉流水线,从原始像素中提取几何信息,然后成功重建了整个零件。同一设置下的其他模型连续五次尝试均未成功。

定位根因而非表面修复:面对一个流行开源包管理器的真实 bug,Opus 5 找到了根因,还修复了社区补丁遗漏的边界情况。另一个竞争模型只修复了表面症状就报告"已解决"。

交易系统的市场数据源:一位交易公司工程师用 Opus 5 在单次会话中为一家新交易所构建了完整的行情数据接入。此前其他模型即使拿到详细方案也无法完成。在找不到实时数据源来验证的情况下,Opus 5 自己搭建了测试工具来检查代码是否能正确解析交易所数据。

第三方实测反馈

早期接入客户的实测数据提供了更具体的数字:

  • Box(CTO Ben Kus):整体性能比 Opus 4.8 提升 8%,数据分析场景提升 11%,尽调场景提升 17%
  • Lovable:在内部最难的智能体编程任务上比 Opus 4.7 提升 22%,且运行间方差显著降低
  • 某交易公司:交易基准测试中领先,使用的推理 token 量约为 Opus 4.8 的七分之一,延迟不到一半
  • Cursor(联合创始人 Sualeh Asif):在 CursorBench 上仅略低于 Fable 5,展现出"许多相同的行为"
  • Cognition/Devin(CEO Scott Wu):在 FrontierCode 1.1 上接近 Fable 级别性能,在困难调试和根因分析任务上表现突出

安全与对齐

Anthropic 的自动化行为审计将 Opus 5 评为"迄今最对齐的模型"——在整体行为偏差评分上得到 2.3 分,是近期模型中最低的。它在遵守 Claude 宪法方面优于 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为发生率最低,被诱导滥用的难度最高。

在网络安全方面,Opus 5 没有推进高风险双用途能力的前沿。Anthropic 开发的 OSS-Fuzz 评估显示:Opus 5 在发现软件漏洞方面接近 Mythos 5 的水平,但在将漏洞转化为可利用的攻击时远远落后。Opus 5 的网络安全分类器预计比 Fable 5 少干预约 85%,允许在源代码中查找漏洞,但阻止基于二进制的漏洞扫描、渗透测试和漏洞利用生成。

定价与可用性

项目Opus 5Fable 5Sonnet 5
输入价格 ($/MTok)$5$10$3(促销 $2)
输出价格 ($/MTok)$25$50$15(促销 $10)
上下文窗口1M tokens1M tokens1M tokens
最大输出128K tokens128K tokens128K tokens

Opus 5 即日起在 Claude.ai、Claude API、AWS Bedrock、Google Vertex AI 和 Microsoft Azure AI Foundry 上线。API model ID 为 claude-opus-5。Fast 模式以约 2.5 倍默认速度运行,价格为基线的两倍。

与 Opus 5 同步发布的两个 beta 功能:

  1. 对话中切换工具(Claude Platform):开发者可以在对话过程中更改 Claude 可用的工具,而不会使 prompt cache 失效
  2. API 自动降级:被安全分类器标记的请求可以自动路由到另一个模型,而非直接阻断

在 Claude 模型矩阵中的位置

Opus 5 是 Anthropic 在不到两个月内发布的第四个 Claude 5 系列模型。时间线如下:

  • 6 月 9 日:Fable 5 / Mythos 5(Mythos 级,安全限制解锁版仅限合作方)
  • 6 月 30 日:Sonnet 5(平衡档,默认模型,$3/$15)
  • 7 月 24 日:Opus 5(高端日常使用模型,$5/$25)

Anthropic 在 6 月发布 Fable 5 时引入了 Mythos 级——一个位于 Opus 之上的新层级。当时许多人认为 Fable 5 就是"Opus 5 的替代"。但 Opus 5 的发布表明,Opus 线仍然活着,而且获得了足以在多数实际任务上追平 Fable 5 的能力提升。

对开发者和企业用户来说,选择变得简单了:如果日常编码和知识工作是主要场景,Opus 5 在性能和成本效率上都优于花两倍价格购买 Fable 5。Fable 5 的优势主要收缩到网络安全和前沿生物研究等需要移除安全限制的窄领域。AI 模型部署正在从"重磅发布"转向在能力、成本和速度上的快速迭代——Opus 5 是这个趋势的又一个例证。

推荐阅读