Ember-1 技术解读:Fireworks 给 Kimi K3 做推理瘦身,token 减 40% 质量持平

9 月 23 日,Fireworks Research 发布专精化模型 Ember-1:基于开源权重模型 Kimi K3 训练,官方数据显示答案质量与 K3 持平,token 消耗减少 40%。模型当天就在 Fireworks Serverless 上线,以 Research Preview 形式提供服务,与 K3 基座并列成为可选模型。

Ember-1 没有新的基座、没有更大的参数量,它解决的问题只有一个:推理模型花在「想」上的钱,大部分可以省下来。

Ember-1 官方发布主视觉

推理模型的 token 都花在哪了

Kimi K3 这类推理模型生成的 token 里,有时超过 90% 花在内部推理上,真正构成最终答案的只占小头。单次请求贵,多轮 agent 任务会贵得更厉害:每一轮对话都要把之前的推理过程重新回放给模型,上下文规模随轮数近似二次方增长,早期轮次产生的长推理链,会在后续每次调用中被重新读取、重新计费。

Fireworks 对这个问题做了系统测量,结论写在官方博客里:跨 7 个基准测试和两家客户的生产流量,Kimi K3 的推理过程可以缩短 35% 到 50%,准确率不受影响。换句话说,推理模型输出的思考内容里,有相当一部分是冗余空转,删掉不会碰答案。

调低推理力度为什么行不通

看到「推理太长」,最直接的方案是把模型的 reasoning effort 调低。K3 支持这个参数,token 立刻就能省下来,但质量同步塌掉:在 SWE-bench Verified 上,K3 低力度得分 80.4%,最高力度(默认档)93.2%,差了近 13 个百分点。省下的 token 钱抵不掉准确率损失。

Fireworks 给出的路径是训练:让模型自己学会更高效地推理。Research 团队为此跑了超过 50 组训练实验、200 多次评测,并在过程中开发了新的训练算法。

训练方法:保留有用的反思,砍掉无效空转

Ember-1 的训练不是对推理链做无差别压缩。K3 的推理内容里有相当部分是有价值的自我反思:重新审视一个假设、响应外部反馈、把当前结果追溯到更早的决策,这类行为帮助模型从错误中恢复。Ember-1 要保留的是这部分能力,同时消除不产出结果的推理循环。

训练数据的覆盖面刻意拉宽:数学、代码、指令遵循、对话、搜索、工具调用、软件工程七类任务,既有单轮问题也有长程多步交互。训练用任务反馈和环境反馈做 on-policy 学习,让模型在探索动作、吸收观察、修正推理的完整过程中学会省着想,目标是不挑工作负载——token 节省能从一类任务迁移到另一类。训练全部在 Fireworks Serverless Training 上完成,只用了自有数据,不含客户数据。

五个基准的成本对账

评测采用 K3 的公开 API 定价(未缓存输入 $3/M token、缓存输入 $0.30/M、输出 $15/M)计算每个任务的成本,对比四个配置:K3 低力度、高力度、最高力度(默认),以及 Ember-1。

基准样本数K3 低力度K3 高力度K3 最高力度Ember-1每任务成本 vs K3-max
Terminal Bench 2.18976.4%77.6%80.9%82.0%-51.9%(省 $23.1)
SWE-bench Verified50080.4%86.0%93.2%92.2%-15.5%(省 $68.1)
SWE-Interact756.7%13.3%21.3%20.0%-32.5%(省 $60.8)
DeepSWE 1.111355.8%62.8%66.4%75.2%-23.7%(省 $126.9)
τ-2 Bench Airline5064%64%64%66%-5.9%(省 $0.3)

两个细节值得展开看。其一,在样本数超过 50 的每个基准上,Ember-1 都落在或贴近质量-成本 Pareto 前沿,严格优于 K3 低力度档;对 GPT-6 Astra、Claude Opus 5、GLM 5.3 的同图对比中,Fireworks 给出的结论是 Ember-1 处于前沿的领先位置。其二,Ember-1 在五个基准里的三个上直接超过了它的基座:Terminal Bench 2.1 高 1.1 个百分点,τ-2 Bench 高 2 个百分点,DeepSWE 1.1 上高出 K3-max 整整 8.8 个百分点(75.2% 对 66.4%),同时每任务成本下降 23.7%。剩下两个基准(SWE-bench Verified、SWE-Interact)得分略低于 K3-max 约 1 个百分点,但每任务成本分别下降 15.5% 和 32.5%。

「学生超过老师」在压缩类后训练里不常见。一种解释是:削减冗余推理降低了模型在长任务里跑偏、陷入循环的概率,DeepSWE 这类长程软件工程任务恰好对此最敏感。Fireworks 没有在博客中给出这组数字的归因分析,这个解释属于推断,不是官方结论。

真实负载:内部无感切换,客户 A/B 省 35%

基准之外,Ember-1 经历了三层真实负载验证。第一层是 Fireworks 内部:公司自己的编码/cowork 流量跑在自己的推理服务上,切换过程开发者无感知,得分从 K3 的 0.751 到 Ember-1 的 0.753,平均步数 23.8 降到 21.4,单任务输出 token 从 49.3K 降到 29.9K——推理 token 减少 71.3%,总 token 减少 39%。

第二层是客户生产流量的 A/B 测试:两家客户在其生产编码工作负载上对照运行,Ember-1 每任务 token 减少约 35%,质量相当;任务完成率、成功评分、失败率等下游指标持平或改善。A/B 之后,其中一家客户已把 Ember-1 放进生产环境,计划逐步全面替换基座模型。

第三层是行业基准:Fireworks 前一周发布了 Specialized Intelligence Index(SII),用行业专家构建的真实任务给开源、闭源和专精模型打分。Ember-1 在 Doximity 提供的 Bedside Bench 上创造了新的 Pareto 前沿——该基准由医生验证,覆盖 10 个专科类别的 500 个临床案例,同图对比的闭源模型包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5。

Bedside Bench 上的成本-质量 Pareto 前沿(SII)

五个行业基准的平均成本对比

开发者怎么用

Ember-1 当前以 Research Preview 形式在 Fireworks Serverless 上提供,与 Kimi K3 基座并列作为服务选项,按 token 计费,推理密集的 agent 编码工作负载是它最直接的目标场景——token 账单占成本大头时,节省比例会直接体现在账单上。如果你的工作负载本身就是短回答、推理占比低,两者的差距会小得多。

配套还有一个机制:research releases。Fireworks 会给新的研究模型开放两周的 Serverless 访问窗口,社区需求足够就转为长期提供。这个机制明显在向开源生态示好——Kimi K3 是开源权重模型,Fireworks 在它上面做专精化再反哺社区,形成「开源基座 + 多个任务特化版本」的分层。对企业客户,Fireworks 同步开放了 Ember-1 的训练支持,用自己的数据训练定制化的省 token 模型。

Fireworks 在博客结尾给出的判断是:开源模型的未来,是针对具体工作负载训练的专精化模型。Ember-1 是这个系列的第一款,它的训练配方(开源基座 + 任务反馈强化学习 + 推理链压缩)大概率会在后续 Ember 模型上重复出现。对跑 agent 服务的团队来说,同一个开源基座衍生出多个成本档位,选模型的维度从「哪家强」多了一个「哪个特化版本匹配我的负载」。

来源: