OpenAI 史上最快的模型要下线了。9 月 11 日,Codex 负责人 Thibault Sottiaux 在 X 上宣布,GPT-5.3-Codex-Spark 将在下周退役。从 2 月 12 日上线到离开模型列表,这个模型的生命周期只有七个月。
官方对下线的解释很简短:用量持续下降,而且手里已经有明显更好的模型。Sottiaux 在帖子末尾补了一句玩笑,「真不敢相信,我们居然发布过名字这么长的模型。」

七个月前的排场
Spark 出生时的待遇完全不同。它是 OpenAI 第一个专为实时编程设计的模型,128k 上下文,每秒生成超过 1000 个 token,跑在创业公司 Cerebras 的晶圆级芯片 Wafer Scale Engine 3 上。这是 OpenAI 第一个跑在英伟达技术栈之外的生产模型,也是双方算力合作交出的第一份答卷。
这份合作背后的数字很大。今年 1 月,OpenAI 与 Cerebras 签下三年最多 750 兆瓦算力的采购协议,据 The Information 报道价值超过 100 亿美元;4 月,据 Reuters 报道,这笔投入扩大到超过 200 亿美元,OpenAI 还将获得 Cerebras 的认股权证,产能部署覆盖到 2028 年。Spark 是这盘棋里第一个落地的产品。
WSE-3 是一颗不像芯片的芯片:整片晶圆就是一个处理器,单颗片上 SRAM 达到 44GB,省掉了 GPU 访问显存的往返延迟,代价是单颗装不下太大的模型。Cerebras 的官方口径是 20B 参数模型装进一台 CS-3,70B 需要四台。Spark 本质上就是从这个限制里长出来的产品:为了塞进晶圆,它必须是旗舰模型的精简版。
早期开发者是真的兴奋。有人把工作流改成了三模型接力:GPT-5.4 负责规划,GPT-5.3-Codex 负责构建,Spark 负责探索代码库和给第二意见。Instructor 作者 Jason Liu 开了 20 个 Spark 子代理并行扫描文件系统,宣布「RAG 已死」,随后加入了 OpenAI 的 Codex 团队。
拿智能换速度的代价
问题出在产品定位的根基上。Spark 的速度来自「变小」,而变小是有账单的。
Terminal-Bench 2.0 上,Spark 的准确率是 58.4%,完整版 GPT-5.3-Codex 是 77.3%,差了接近 19 个百分点。OpenAI 自己放出的 SWE-Bench Pro 曲线更直观:Spark 把任务时长压到 1 到 2 分钟,准确率停在 47% 到 51% 之间;完整版从 3 分钟起步就有 51%,拉到 16 分钟能到 57%。省下的几分钟,对应的是往下掉五六个点。
发布时宣传的「15 倍提速」也被重新算过账。开发者拿同等准确率的口径对比 Spark 与标准档 Codex,实际提速约 1.37 倍,差距来自对比时给基线模型开了最高推理强度。这个重新计算后来在 Hacker News 上被反复引用。
实际编码场景的问题更具体:凭空捏造 API 端点、JSON 输出格式不稳定、多步任务容易跑偏。开发者 argofowl 的评价流传最广:「Spark 是个好玩的模型,也是个极度糟糕、没法用的模型。很高兴它走了,我好几个月没碰过了。」对写代码的人来说,等 17 分钟拿一个能跑通的结果,比 2 分钟拿一个满是 bug 的半成品划算。
真正被惋惜的是配额
退役消息公布后,Hugging Face 开发者 Vaibhav Srivastav 在评论区发起告别,邀请大家在下线前再发一条 prompt。但评论区的主流情绪没有感伤,热评直接问:所以它到底是干嘛用的?
真正让人惋惜的是 Spark 附带的独立配额。它有一份不占主额度的独立套餐,在旗舰模型 Astra 额度紧张的当下,很多开发者把 Spark 当主额度耗尽后的备用油箱。据 The Information 报道,OpenAI 在 9 月暂停了 200 美元档 Pro 订阅的新用户注册,理由正是 Astra 的算力紧张。备用油箱此时被撤走,对重度用户的实际影响大过模型本身下线。
有开发者在评论区许愿下一个同名模型:「我想要一个 GPT-6-Spark。」他们想要的未必是那个精简模型,而是那份独立额度。
旗舰本尊上了晶圆
给 Spark 终结判决的是 8 月 13 日 Cerebras 与 OpenAI 联合发布的 Ultrafast 模式。这一次跑在晶圆上的不再是精简版,而是旗舰模型 GPT-5.6 Sol 本尊:把大模型按层切分铺到多台 CS-3 节点上组成流水线,在保持与标准版同等智能的前提下,跑出每秒 750 个 token 的输出速度,比标准档快 14 倍。
Cerebras 拿 GDP-Val 里 6 个质量对齐的任务做了对比:标准档平均 7.7 分钟,其中 7.5 分钟花在模型生成上;Ultrafast 同样的任务总共 83 秒,端到端快 5.6 倍,质量几乎没有差别。

同一个逻辑反过来读就是 Spark 的死因:旗舰模型可以直接享受晶圆的速度了,「拿智能换速度」的妥协方案失去了存在理由。Cerebras 的晶圆产能有限,无人问津的精简版和排队抢用的旗舰版共享同一批产线,退役哪个,答案很清楚。
速度变成了付费档位
Spark 也不是唯一被清理的包袱。过去三个月,OpenAI 的模型列表经历了一轮密集换血:6 月 2 日 GPT-5.2 与 GPT-5.3-Codex 退役,8 月 31 日 GPT-5.4 与 5.4 Mini 退役,9 月 11 日轮到 Spark。伴随着旧世代离场,Codex 产品线换上了 Sol、Terra、Luna、Astra 的天体命名。
更深层的变化在商业模式。「快」这个属性,已经不需要一款独立模型来承载,它成了旗舰模型的一个服务档位。OpenAI API 现在的速度选项从 Standard、Priority 排到 Ultrafast,与推理强度档位并行,按档付费。Ultrafast 目前处于 limited preview 阶段,首批客户包括 Jane Street、Podium、Basis 和 Rogo,覆盖交易、语音、金融研究等对延迟敏感的场景。
从这个角度看,Spark 的七个月更像一次基础设施验证:它证明了 Cerebras 的晶圆扛得住生产级流量,证明了推理任务可以脱离英伟达生态运行,也证明了市场对「快」的真实需求落在档位而非独立模型上。探路完成,路线并入了主干。
模型列表里少了 一个名字,API 的速度表上多了一行价格。这是 Spark 留下来的东西。
参考来源:
- Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed in the API · OpenAI
- Introducing GPT-5.3-Codex-Spark · OpenAI
- Introducing OpenAI GPT-5.3-Codex-Spark Powered by Cerebras · Cerebras
- Accelerating GPT-5.6 Sol Ultrafast with OpenAI · Cerebras
- OpenAI to spend more than $20 billion on Cerebras chips · Reuters
- OpenAI to Pause New Pro Subscriptions, Cites Astra Demand · The Information
- 官宣,OpenAI关停史上最快模型 · 36氪/新智元