Cerebras 晶圆级推理:GPT-5.6 Sol Ultrafast 如何实现 750 tok/s
750 tokens per second. Cerebras 和 OpenAI 在 8 月 13 日联合发布的 GPT-5.6 Sol Ultrafast 模式达到了这个数字,比 GPT-5.6 Sol 的标准推理速度快 14 倍。更关键的是,这个速度没有牺牲任何智能水平:运行在 Ultrafast 模式下的 GPT-5.6 Sol 与标准模式输出完全相同…
750 tokens per second. Cerebras 和 OpenAI 在 8 月 13 日联合发布的 GPT-5.6 Sol Ultrafast 模式达到了这个数字,比 GPT-5.6 Sol 的标准推理速度快 14 倍。更关键的是,这个速度没有牺牲任何智能水平:运行在 Ultrafast 模式下的 GPT-5.6 Sol 与标准模式输出完全相同…
一台 16GB 内存的 Mac mini 跑 80B 参数的大模型,一台 iPhone 17 跑 35B 参数的模型——而且不是靠云端中转,全部在本地完成。开源项目 Swiftlet 用一种叫做「专家流式推理」(Expert Streaming)的技术做到了这一点,峰值内存占用分别只有 4.3GB 和 2.5GB。 Swiftlet 项目主页 Swiftle…