Claude Haiku 5.5 发布解读:小模型的 effort 旋钮与 100k 分档定价

Anthropic 在 10 月 7 日发布了 Claude Haiku 5.5,把 5.5 家族的最后一块拼图补齐。这次更新有三件事同时发生:价格降到了上一代的四分之一左右,effort(思考深度调节)第一次下放到 Haiku 级小模型,Sonnet 5.5 的缓存读价格同步砍半。发布帖在 Hacker News 上迅速积累了近 600 分和 280 多条评论,讨论的焦点不在跑分本身,而在 100k token 的分档定价线划在哪里才合理。

Claude Haiku 5.5 官方发布图

官方 benchmark:小模型的两倍级跨越

先看官方公布的数据表,Haiku 5.5 与上一代 Haiku 4.5、GPT-6 Luna、Sonnet 5.5 的对比:

基准Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5(参考)
GDPval-AA v2.1(知识工作)162073514371840
AA-Briefcase v1.1(知识工作)157861413361824
OSWorld 2.1(计算机操作,离线子集)72.4%15.7%48.9%83.9%
Humanity's Last Exam(无工具)45.9%10.2%—56.9%
Humanity's Last Exam(带工具)57.4%18.7%—64.5%
Terminal-Bench 4.0(智能体编码)39.2%0.0%16.4%70.6%
FrontierCode 1.1(Main)46.4%—42.4%52.1%(Xhigh)
Chartography(视觉推理,无工具)46.4%6.4%29.1%61.6%

几个数字值得展开。GDPval-AA 衡量跨 44 个职业的真实专业工作,Haiku 5.5 拿到 1620 Elo,是上一代 735 的 2.2 倍,还越过了 GPT-6 Luna 的 1437。OSWorld 测试智能体操作真实计算机完成多步任务的能力,Haiku 4.5 的 15.7% 基本等于不可用,Haiku 5.5 直接跳到 72.4%,距离 Sonnet 5.5 的 83.9% 只差 11.5 个百分点。Terminal-Bench 4.0 上 Haiku 4.5 是 0.0%,Haiku 5.5 到了 39.2%,虽然与 Sonnet 5.5 的 70.6% 仍有明显差距,但作为定价 0.1 美元的模型,这个成绩意味着大量轻量编码子任务可以从大模型手里接管过来。

Hacker News 评论区里用户 dannyw 的观察与此吻合:在部分实现类编码任务上,Haiku 5.5 的表现能超过上一代 Sonnet 5,适合承接定义清晰的工单级任务。这类「小模型 + 明确边界」的用法正是 Anthropic 官方建议的定位:与 Opus 5.5 和 Sonnet 5.5 搭档,作为编码工作里的 subagent。

effort 旋钮:小模型第一次可以调「思考深浅」

Haiku 5.5 是 Haiku 级别第一个支持 effort 设置的模型。effort 参数控制模型在回答前做多少内部推理:档位从 Low 到 Max,代价是更高的 token 消耗和延迟,收益是更难的题目能解出来。官方文档给出的默认值是 medium。

官方发布页给了三张 accuracy vs cost 图,分别对应 OSWorld、GDPval-AA 和 Humanity's Last Exam 在五个 effort 档位下的表现。以 OSWorld 为例,Low 档约 42%,Med 档爬到 60% 上下,Max 档约 73%,与数据表的 72.4% 一致。同一个模型,低成本档和高成本档之间差了 30 个百分点以上的准确率。

Haiku 5.5 在 OSWorld 2.1 上各 effort 档位的准确率与成本(官方数据图)

Haiku 5.5 在 GDPval-AA v2.1 上各 effort 档位的 Elo 与成本,孤立点是 Haiku 4.5(官方数据图)

这件事的实际意义在于成本结构的改变。以前选模型的逻辑是「任务难就上大模型,任务简单就用小模型」,模型的能力上限在购买时就锁死了。effort 旋钮把一部分选择权从「选哪个模型」移到「给这个模型多少思考预算」:高峰期的批量分类任务用 Low 档跑满吞吐,疑难单子临时切到 High 档,不用换模型也不用改接入代码。对一个按 token 计费的 API 来说,这等于把能力变成了可以在单次请求内调节的变量。

100k 分档定价:便宜是真的,边界也是真的

价格是这次发布里讨论最多的部分。Haiku 5.5 采用两档定价:

每百万 token 价格≤100k prompt>100k promptHaiku 4.5(旧)
输入$0.10$0.50$1.00
输出$0.50$2.50$5.00
5m 缓存写$0.125$0.625$1.25
缓存读$0.01$0.05$0.10

按官方口径,100k token 以内的请求比 Haiku 4.5 便宜 90%,超过 100k 的部分便宜 50%,而 Haiku 4.5 的流量里有约 90% 落在 100k 以内,所以官方给的「平均便宜 75%」就是这么算出来的。缓存读 0.01 美元的价格意味着重复上下文的读取成本降到了原来的十分之一,对摘要、压缩、检索增强这类需要反复带同一份上下文的工作负载,这笔账很可观。Batch API 再打五折,输出 token 上限也放宽到 300k(需加 output-300k-2026-03-24 beta header)。

100k 这条线是 HN 评论区的争议中心。用户 minimaxir 的质疑很有代表性:相比 Sonnet 和 Opus 的定价机制,100k 是个偏低的门槛,做长上下文 agent 的工作很快就会越线。用户 Tiberium 补充了一个容易忽略的细节:Claude 新版 tokenizer 同样的文本比 GPT 系多算约三成 token,所以「100k Claude tokens」实际承载的内容量比看起来的要少。反方意见(alexchamberlain、jeremyjh)则指出,subagent 场景下单个任务通常远够不到 100k,摘要和分类类工作负载更是如此,这条线卡得不算苛刻。

把这条定价线和竞品放在一起看会更有意思。GPT-6 Luna 在 272k 以上才触发两倍输入价,同为 $0.10/$0.50 的表格价,Luna 的免税区比 Haiku 宽得多。HN 用户 HarHarVeryFunny 给出了另一个参照系:OpenAI 的 Decisions API 生态里,Jev 这类专用决策模型的价格在 $0.04/M 左右,Anthropic 和 OpenAI 的通用小模型都还贵着 2.5 倍。换句话说,这轮降价的实际作用,是把通用小模型的价格拉到了「决策模型」赛道的门口,用能力冗余换取场景通用性。

还有一个更根本的视角。用户 Eridrus 评论说,扁平的 per-token 定价本身就是历史产物:文本的编码和解码计算量都不是线性的,厂商实际在按「预期平均长度」定价,分档只是让价格表更接近真实的成本结构。这个解释比「定价玄学」更有说服力,100k 档大概率只是这套按真实成本收敛的定价体系的第一步。

一个反向细节:tokenizer 换新,token 数变多

发布说明里藏着一个容易被略过的细节:Haiku 5.5 用了与 Claude 4.7 及之后模型相同的新 tokenizer,同样一段文本按新 tokenizer 计数,比 Haiku 4.5 多出约 30% 的 token。官方脚注也确认了这一点,并说明性能对比数据已经把这个因素折算进去。

这对使用者有两层影响。一是名义价格的折扣要打个小折:单 token 变「便宜」了,但同样一段话要付钱的对象变多了,两相抵扣后实际账单降幅会低于价格表上的数字。二是 100k 分档线的实际覆盖范围跟着变化,旧模型下勉强塞进 100k 的上下文,迁到新模型上可能就越线了。官方提供了迁移指南,切模型前用 count_tokens 接口重新估算一遍是稳妥的做法。

API 行为上还有一个约束:temperature、top_p、top_k 三个采样参数必须保持默认值,传任何非默认值都会直接返回 400 错误。对从旧版 Haiku 迁移过来的调用方,采样参数要显式清理,否则上线就会报错。

Sonnet 5.5 缓存读降价前后在 Terminal-Bench 4.0 上的成本变化(官方数据图)

配套动作:Sonnet 5.5 缓存读砍半与订阅送额度

与 Haiku 同日,Sonnet 5.5 的缓存读价格从 $0.20/M 降到 $0.10/M,官方估算这让多数智能体任务的实际成本降了约 20%。HN 用户 minimaxir 的点评指出了这个动作的实质:旧缓存价格下,Sonnet 5.5 对 Opus 5.5 几乎没有存在价值(缓存读 $0.20 对 $0.40 的差距不足以弥补能力差距),降价之后两者才形成真正可用的梯队,也与 GPT-6.1 Sol 的缓存价格拉平。

对订阅用户,Anthropic 在本周内会给 Claude Max 和 Team 订阅加每月 API 额度:Max 5x 每月 $100,Max 20x 每月 $200,Team 按团队池化最多 $500,可用于全部模型。订阅费直接折算成 API 预算,鼓励用 Haiku 5.5 这类低价模型批量跑 agent。官方 SDK(Python 和 TypeScript)也在 beta 中加入了 computer use 和 browser use 支持,配合 Haiku 5.5 的速度定位(官方称其为目前最快的模型,快过 Opus 系 Fast Mode 之外的现有型号)。

安全评估与可用性

System card 记录的对齐评估显示,Haiku 5.5 相对 Haiku 4.5 在几乎全部对齐测试上有明显改善,误行为和配合滥用的倾向都更低。网络安全方向的护栏比 Haiku 4.5 更严、比 Sonnet 5.5 略松:允许更宽的防御性任务,渗透测试类请求仍然拦截。生物安全护栏与 Sonnet 5、Sonnet 5.5、Opus 5 一致。有更大范围需求的机构可以申请 Life Sciences Verification Program 和 Cyber Verification Program。

可用性方面,Haiku 5.5 已在 AWS、Google Cloud、Azure 全平台上架,Claude 平台的模型 ID 是 claude-haiku-5-5,上下文窗口 1M token,最大输出 128k,知识截止 2026 年 6 月,官方承诺至少服务到 2027 年 10 月 7 日。早期客户 Asana 的测试数据称,任务完成延迟降低超过 30%,单轮智能体推理最快提升 2.5 倍。

写在最后

Haiku 5.5 的发布把「便宜、快、能用」三个词重新连在了一起:上一代 Haiku 在 Terminal-Bench 上交白卷,这一代在大多数基准上越过 GPT-6 Luna、逼近自家中杯。effort 旋钮下放到小模型后,成本和能力的权衡从选型阶段移到了单次请求内部。100k 分档、tokenizer 计数变化、采样参数锁定这三处工程细节,则是迁移时真正需要动手核对的部分。后台发送 Haiku 5.5 全平台可用,第一批值得迁移的场景是摘要、压缩、分类和 subagent 流水线这些高频低价的工作负载。


参考来源: