
Segment 联合创始人 Calvin French-Owen 8 月 26 日发表了一篇在 Hacker News 引起广泛讨论的文章,标题只有四个词:Small Models Have Arrived(小模型已经到来)。他的论点建立在一组直接的对比上:过去做编码工作,他几乎总是选最贵最强的模型(Claude Fable 5、GPT-5.6 Sol),因此一直没注意到小型快速模型悄悄跨过了临界点。直到他连续几周使用 OpenAI 的 gpt-5.6-luna——按他的描述,速度约 100 tokens/秒,能流畅地处理他的代码库、邮件和知识库,而跑完一个横跨数千封邮件的复杂研究任务,API 账单只有几十美分。
这组体验背后是整条成本曲线的位移。上面这张 Artificial Analysis 的散点图把 2026 年 8 月的主流模型放在同一个坐标系里:横轴是单次任务成本(对数刻度),纵轴是 Artificial Analysis 智能指数。虚线是帕累托前沿——同样成本下智能最高、同样智能下成本最低的模型连线。
前沿上的两个新坐标
图上有两个位置值得单独读。
一个是 GPT-5.6 Luna (max):智能指数约 53 分,单任务成本约 0.04 美元。它的同门兄长 GPT-5.6 Sol (max) 拿到约 60.5 分,但要花约 1 美元一次任务。Luna 用二十五分之一的价格,保住了智能指数约 88% 的水平。
另一个是智谱的 GLM-5.3-Flash:指数约 57.5 分,成本约 0.08 美元,直接站进了此前只有旗舰模型所在的帕累托前沿。作为对照,拿下全场最高分的 Claude Fable 5(约 64 分)单价在 2 到 3 美元区间。也就是说,在图上从右端往左看,800 美分、60 美分、8 美分、4 美分四个价位上,现在都有接近上一个价位智能水平的选项。
| 模型 | 智能指数(约) | 单任务成本(约) |
|---|---|---|
| Claude Fable 5 (with fallback) | 64 | $2–3 |
| GPT-5.6 Sol (max) | 60.5 | $1 |
| GLM 5.3 (max) | 58.5 | $0.5 |
| GLM-5.3-Flash | 57.5 | $0.08 |
| GPT-5.6 Luna (max) | 53 | $0.04 |
| DeepSeek V4 Flash 0731 (max) | 52 | $0.09 |
(数据读自 Artificial Analysis 图表,为图中近似读数。)
French-Owen 自己的账单数据与图表吻合。他做过一个实验项目:让模型研究他的网络画像,搜索 Hacker News、Reddit、Twitter,为他生成一个个性化每日新闻微型网站。用上一代 Sonnet 级模型,跑出可用结果要花约 1 美元;换用 luna 后,结果相当,平均成本约 0.1 美元。1 美元和 0.1 美元的差别,决定的是消费级产品商业模型的有无——下文会展开。
为什么小模型突然够用了
小模型变强是能力下沉曲线的又一次显现:上一代前沿模型验证过的能力(长上下文、工具调用、多步推理),会以更低的成本进入下一代较小的模型。这一年竞争加剧把下沉速度拉快了——图上帕累托前沿的左半段现在挤着 OpenAI、智谱、DeepSeek 三家的模型,每家都在用低价换生态位。
值得指出的是,"小"在这里指的是价格档位,不必然指参数量。图中的 Luna 和 GLM-5.3-Flash 都是他们各自产品线里的快速档,厂商通常通过更小的激活参数量、更激进的推理优化把价格打到这个区间,具体架构两家均未在发布材料中完整公开。读者把图中数据当作价格-能力关系的记录即可,参数规格以官方后续披露为准。
对开发者,这条曲线的实际意义是:为任务选模型的空间打开了。过去"智能够用但太贵"和"便宜但不够用"之间是断层,现在 4 到 9 美分档位上有了一整排"够用"的选项。搜索、分类、摘要、邮件起草、代码库问答这类高频低难度任务,从旗舰模型迁移到小模型,单位成本下降一到两个数量级。
消费级 AI 的死结松了
French-Owen 文章最有洞察的部分,是用成本曲线解释了一个投资圈的老问题:为什么消费级 AI 公司迟迟没有出现。
传统消费互联网的打法是:建一个便宜的网站,靠病毒传播获客,融资扩规模,最后靠广告变现。Google、Facebook 都是这条路。但一旦往产品里加 AI,每一次请求都有真实的推理成本,所需资本急剧上升。一个向每个用户收 30 美元/月的个人化新闻产品没有生存空间——同样的钱用户宁可去买华尔街日报或经济学人,而后者的边际成本接近零。
按他给出的账单:Sonnet 级模型时代,个人化新闻站单用户单次生成成本约 1 美元,这个产品形态在商业上不成立;luna 时代成本降到约 0.1 美元,即使每天生成一次,月成本约 3 美元,一个 10 美元/月的订阅就能覆盖成本并留出毛利。消费级 AI 产品的单位经济模型第一次闭合了。这解释了为什么风险投资人最近开始重新翻消费 AI 的案子。
IQ 180 与 token spewer:企业工作的两层结构
文章的第二层论证来自他与 Segment 联合创始人 Peter Reinhardt 的徒步对话。Reinhardt 现在同时经营多家公司(除 Segment 外,Charm Industrial 融了超过 1 亿美元 B 轮,Revoy 刚完成 A 轮),他把企业工作分成两类:
第一类是"IQ 180 型":天才式的深度解题,想出别人想不到的方案。第二类是"token spewer 型":高响应度地推进 dozens 个方向——开会、催办、协调、扫清障碍。Reinhardt 的自测结果是:约 95% 的自身工作属于第二类。
这个划分对应着模型需求的两层结构。前沿模型的需求会继续复合增长,尤其是工程、硬科学、模型训练这类需要真正突破的领域——那里只有最高智能够用。但企业里绝大部分"人类 token"消耗在高频、中等难度的事务性工作上,而招聘市场本来就大量供给"快速、便宜、够用"型的人力。对应的模型需求——快速、便宜、足够好——正处于图上那条成本曲线刚刚跌进可用区间的位置。
两层需求不是替代关系。French-Owen 的判断是:前沿智能的需求继续涨,"快/便宜/够用"的需求即将起飞,两者同时扩大。这与芯片市场的结构性现象一致:旗舰 GPU 和推理优化卡各自有独立的需求曲线。
距离"小模型接管企业事务"还差什么
文章结尾很清醒:让小模型真正接管企业的 token spewer 型工作,还缺一整层基础设施——新的 agent 运行框架(harness)、提示注入防护、角色与权限系统。模型本身已经不是瓶颈,瓶颈在工程化配套。这些组件目前没有标准化方案,各家正在补课。
对开发者和企业用户的可操作结论是:盘点自己的 AI 工作负载,把任务按难度分层——高频事务型任务迁移到 4-9 美分档的模型,深度解题任务保留旗舰模型。按图中数据,一个混合调度两层模型的团队,在总产出不变的前提下,推理预算可以压缩到全旗舰方案的一小部分。这个迁移窗口就是 2026 年下半年。
参考来源:
- Calvin French-Owen: Small Models Have Arrived(2026-08-26)
- Artificial Analysis: Models Intelligence & Cost Comparison(图表数据)
- Hacker News 讨论帖(2026-08-27 前后,641 分)