750 tokens per second. Cerebras 和 OpenAI 在 8 月 13 日联合发布的 GPT-5.6 Sol Ultrafast 模式达到了这个数字,比 GPT-5.6 Sol 的标准推理速度快 14 倍。更关键的是,这个速度没有牺牲任何智能水平:运行在 Ultrafast 模式下的 GPT-5.6 Sol 与标准模式输出完全相同的推理结果。

速度瓶颈的本质:内存带宽
要理解为什么 750 tok/s 是一个架构级突破,需要先理解大模型推理的根本瓶颈在哪里。
自回归生成(autoregressive generation)是大语言模型的标准工作方式:逐个 token 生成,每生成一个 token 就要把模型的所有参数加载一遍。对 GPT-5.6 Sol 这样的前沿模型,这意味着在生成每个 token 时,数十亿乃至数千亿参数需要从存储搬运到计算单元。
GPU 的推理流程如下:参数存储在芯片外部的 HBM(High Bandwidth Memory)中,每个 token 生成都需要把参数从 HBM 搬运到 GPU 芯片内部的计算核心(SRAM),完成矩阵乘法后再等待下一批参数。这个过程中,计算单元大部分时间在等待数据传输——这正是 GPU 推理的内存带宽瓶颈。NVIDIA H100 的 HBM 带宽为 3 TB/s,听起来很高,但当模型参数量达到千亿级别时,搬运每个参数的时间仍然远超计算本身。
Cerebras 选择了完全相反的路线。其 Wafer-Scale Engine(WSE-3)是一整块晶圆级芯片,面积达到 46,225 mm²,集成了 4 万亿晶体管和 90 万个 AI 优化核心。最核心的架构差异在于存储:WSE-3 直接在芯片上集成了 44 GB 的 SRAM,片上内存带宽达到 21 PB/s(拍字节/秒),是 H100 HBM 带宽的 7,000 倍。
参数驻留在芯片上,token 流水般穿过分布在多块晶圆上的模型层。这种设计从根本上消除了 GPU 推理中的"搬运"环节。Cerebras 在官方技术文档中将其概括为:权重不动,token 流动。
GPT-5.6 Sol 如何跑在 Cerebras 上
GPT-5.6 Sol 是 OpenAI 迄今能力最强的模型。根据第三方分析(X 用户 @bleysg 基于 Cerebras 部署配置的估算),Sol 的总参数量可能在 2-4 万亿之间,约 70-90 层。在 Cerebras 上部署时,模型被分布到 70-100 块 WSE 上,每块晶圆承载大约一层模型。这种设计让 token 像流水线一样在各晶圆之间传递:进入第一块晶圆、完成第一层推理、直接流入第二块晶圆,中间没有任何跨芯片的数据搬运延迟。
这种 pipeline 架构在学术文献中被称为"模型并行流水线"(pipeline parallelism),但传统 GPU 集群实现这一方案时受限于 GPU 之间的网络互连带宽(NVLink 为 57.6 GB/s)。WSE 通过片上互连网络实现了 214 Pb/s 的晶圆内通信带宽,比 NVLink 高出 3,715 倍。模型层的推理结果无需离开硅片就能到达下一层,延迟被压到物理极限。
OpenAI 计算战略副总裁 Sachin Katti 表示,OpenAI 从一个小规模客户群体开始,探索推理速度在哪些场景中创造显著价值,再根据这些发现逐步扩展服务范围。
Benchmark:速度差异有多大
Cerebras 用三个维度量化了 Ultrafast 的性能优势:
| 指标 | GPT-5.6 Sol Ultrafast | 对比基准 |
|---|---|---|
| 输出速度 | 最高 750 tok/s | 标准 GPU 推理 ~70 tok/s |
| vs Claude Opus 4.8 Fast | 快 5 倍 | 基于 Artificial Analysis 数据 |
| vs Claude Fable 5 | 快 11 倍 | 基于 Artificial Analysis 数据 |
| vs GPT-5.6 Sol Standard | 快 14 倍 | OpenAI 内部基准 |
Humanity's Last Exam(HLE)是衡量前沿模型能力的高难度基准,包含 2,500 道化学、经济学、文学等领域的博士级问题。Cerebras 让 Ultrafast 模式的 GPT-5.6 Sol(在 Codex 中使用 xhigh 推理强度)与 Claude Fable 5(在 Claude Code 中使用 xhigh 推理强度)各自完成全部 2,500 道题。
结果是:GPT-5.6 Sol Ultrafast 用时 11 小时 11 分钟,Claude Fable 5 用时 78 小时 27 分钟(超过 3 天的连续计算)。两者达到相近的准确率,但 Ultrafast 快了近 7 倍。在 7 月 31 日的 Codex 内部基准测试中,Ultrafast 用中等等级推理跑出了与标准模式完全一致的质量。
GDP-Val 是一个评估经济价值知识工作任务的基准,涵盖法律文书起草、金融建模和工程报告。Ultrafast 在 GDP-Val 上实现了 5.6 倍的端到端加速,质量零衰减。
为什么推理速度对 Agent 至关重要
Cerebras CEO Andrew Feldman 在公告中引用了一个框架:每一次计算范式的跃迁都由速度解锁。PC 时代需要从千赫兹到吉赫兹的跨越,互联网时代需要从拨号到宽带的升级。AI 也不例外——当模型的能力已经足够强,下一个制约因素就是运行速度。
这个框架在 Agent 场景中尤为明显。AI Agent 在处理任务时通常需要多轮模型调用:理解环境、规划步骤、执行操作、分析结果、决定下一步。每一轮调用都带来延迟累积。如果每轮调用需要等待 30 秒到数分钟(当前 GPU 推理的典型表现),一个涉及 10 轮迭代的任务可能需要 5-50 分钟。Ultrafast 把每轮调用的延迟压缩到原来的 1/14,同样的 10 轮迭代可以在不到 1 分钟内完成。
OpenAI 研究员 Jeffrey Wang 描述了这个变化对工作流的实际影响:以前需要等几分钟才能完成的任务,现在在上下文切换之前就完成了。这意味着开发者可以保持深度专注状态,而不需要在多个并行会话之间频繁切换。
在实际应用层面,Ultrafast 改变了 AI 在关键路径(critical path)中的角色。网页服务可以利用它来根因分析和处理生产事故,缩短 SLA 违约时间。安全团队在应对网络攻击时可以利用毫秒级响应检测和隔离威胁。这些场景的共同特点是:延迟不仅是体验问题,更是成本问题。
晶圆级架构 vs GPU 集群:两条路线的分野
Cerebras 和 NVIDIA 代表了两种截然不同的 AI 计算哲学。
NVIDIA 的路线是集群化:多块 GPU 芯片,各自拥有独立的 HBM 显存,通过 NVLink/InfiniBand 互连网络连接。优势在于灵活性——适合训练、高并发批处理和计算密集型任务。劣势在于推理时的内存带宽瓶颈:参数必须反复在 HBM 和计算核心之间搬运。
Cerebras 的路线是晶圆级:不切割硅片,把整块晶圆做成一颗巨大的芯片。优势在于推理速度——参数驻留在片上 SRAM,消除搬运开销。劣势在于适用范围:目前主要在推理延迟敏感场景中表现突出,训练和大规模并发批处理仍然以 GPU 集群为主。
WSE-3 的技术参数对比能更直观地展示这种差异:
| 规格 | Cerebras WSE-3 | NVIDIA H100 |
|---|---|---|
| 芯片面积 | 46,225 mm² | 826 mm² |
| 晶体管数量 | 4 万亿 | 800 亿 |
| AI 核心数 | 90 万 | 18,592 |
| 片上 SRAM | 44 GB | 50 MB |
| 内存带宽 | 21 PB/s(片上) | 3 TB/s(HBM) |
| 峰值算力 | 125 PFLOPS | 989 TFLOPS |
| 架构理念 | 权重驻留,token 流动 | 参数搬运,计算等待 |
WSE-3 的片上 SRAM 容量(44 GB)是 H100(50 MB)的近 1,000 倍。这 44 GB 足以容纳一个中等规模模型的全部参数,消除了推理过程中的外部内存访问需求。
竞争格局与产业影响
Ultrafast 目前以有限预览模式向部分 OpenAI 客户开放,容量将随时间扩展。Cerebras 同时在推进自身的商业化进程:2026 年第二季度财报显示,其快速推理云业务收入同比增长 281%,目前已有 600 MW 的数据中心容量处于合约状态,计划在 2026 年将制造产能扩大 10 倍以上。
在竞争层面,Cerebras 的晶圆级推理架构与 Groq(LPU 芯片)和 SambaNova(大芯片架构)走相似的技术路线,但 Cerebras 是第一个获得 OpenAI 作为参考客户的晶圆级推理提供商。这一合作的战略意义在于:如果 GPT-5.6 Sol 在 750 tok/s 的速度下稳定运行,就证明了专用推理硅片可以在客户最关心的工作负载上击败 NVIDIA GPU 集群。
Cerebras 在公告中特别强调,Ultrafast 模式的速度优势会随着模型规模增大而扩大。这是因为更大的模型意味着更多参数需要搬运,GPU 的内存带宽瓶颈越严重,而 WSE 的片上存储模型完全不受影响。换言之,前沿模型越大,Cerebras 的架构优势越明显。
当前限制与可用性
Ultrafast 目前有几个实际限制。首先是访问范围:仅向选定的 OpenAI 客户开放,尚未公布全面开放时间表。其次是定价:Cerebras 和 OpenAI 均未公布 Ultrafast 模式的 token 定价,标准模式的 GPT-5.6 Sol 定价为每百万输入 token $35、输出 token $140。第三是适用场景:Ultrafast 的速度优势在单流推理(低延迟、长输出)场景最明显,对于高并发批处理场景,GPU 集群的吞吐量优势仍然存在。
对开发者而言,Ultrafast 目前通过 OpenAI API 提供服务,不需要切换到 Cerebras Cloud。感兴趣的开发者可以在 Cerebras 官网注册获取容量扩展通知。