Cognition SWE-2:开源基座上的RL后训练

Cognition 发布了新一代编码模型 SWE-2:FrontierCode 1.1 Main 得分 50.0%,距 Fable 5.1 的 50.9% 只差 0.9 个百分点,官方公布的单位任务成本便宜 64%。这次发布的技术细节比「又一个模型发布」多得多:Cognition 第一次把强化学习扩展到万亿参数规模的基座上,并公开了整套训练方法。本文拆解它的 benchmark 数据、训练算法和社区争议。

Cognition SWE-2 官方封面

先看数据:四个 benchmark 的完整对比表

Cognition 在官方博客中给出了 7 个模型、4 项基准的完整数据。先把表格抄下来,再谈怎么读:

BenchmarkSWE-2Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 AstraSWE-1.7
FrontierCode 1.1 Main50.0%44.2%48.0%50.9%47.5%53.3%42.0%
DeepSWE 1.173.0%68.5%67.5%67.4%72.7%74.1%37.7%
Terminal-Bench 2.192.8%88.3%88.4%91.4%88.8%89.9%81.5%
Terminal-Bench 427.3%21.5%20.3%55.8%37.3%57.9%7.6%

三行读法:

第一行(FrontierCode 1.1 Main):这是 Cognition 自家评测。SWE-2 的 50.0% 排在 Fable 5.1(50.9%)之后、GPT-6 Astra(53.3%)之前。官方宣称「距 Fable 5.1 不到一分、便宜 64%」「距 Astra 几分、成本四分之一」。「自家 benchmark 自测」的成色问题,后面单独讨论。

第二行(DeepSWE 1.1):73.0%,在 GPT-6 Astra(74.1%)和 GPT-5.6 Sol(72.7%)之间。这项基准由 Cognition 与 Scale AI 在 2026 年 7 月联合推出,不算严格意义上的第三方,但业界引用度较高。

第三行(Terminal-Bench 2.1):92.8% 是全表最高分,超过 GPT-6 Astra 的 89.9%。但要与第四行连着看。

第四行(Terminal-Bench 4):27.3%,与前一行落差 65.5 个百分点。TB4 是几周前刚发布的新基准,可以视为「出样本」考试。作为对照:GPT-5.6 Sol 在 TB2.1 拿 88.8%,到 TB4 掉到 37.3%;GPT-6 Astra 从 89.9% 掉到 57.9%。所有模型在 TB4 上都大幅缩水,只是幅度不同。这说明 TB2.1 已接近饱和,区分度有限;TB4 才是拉开差距的地方。HN 用户 postalcoder 指出这一落差,用户 mediaman 反驳:如果 TB2.1 饱和,那 Sol、Astra 同样「为老基准优化」——单看 TB4 落差指控 SWE-2「刷榜」并不成立,但 SWE-2 在 TB4 上 27.3% 对 Astra 57.9% 的差距是实打实的。

模型底座:站在 Kimi K3 上做后训练

SWE-2 的起点是月之暗面的 Kimi K3——一个 2.8 万亿参数、已经为 agentic coding 做过大量 RL 的开源权重模型。Cognition 的 RL 后训练在多项基准上再堆出 5–6 个百分点,并移动了 K3 整条成本性能曲线。

社区对此的反应可以概括为 HN 用户 htrp 那句传播很广的调侃:「为什么美国的 AI 模型基本上都是穿了风衣的 Kimi」。这是事实陈述加玩笑:SWE-1.7 的后训练起点同样是开源权重模型。Cognition 的模式已经清晰——不自训基座,选一个最强的开源模型,用 RL 后训练和工程系统把它推向前沿。Hugging Face 上 Kimi K3 的开源权重任何人都能下载,但把基座模型再提升 5–6 个百分点所需的 RL 基础设施、验证器体系和数据飞轮,目前只有少数团队能做到。

这一模式对行业的含义:开源权重基座 + 闭源后训练,正在成为一种独立的产品形态。模型能力来自可公开下载的权重,产品化的增量(后训练、agent 框架、企业集成)构成商业壁垒。

行为变化:从「过度探索」到 18 步开始动手

SWE-2 相对 SWE-1.7 的提升不只在分数。官方数据显示,在 FrontierCode 1.1 Main 上,SWE-2 medium 比 SWE-1.7 少用 58% 的轮次(平均 53 对 127)、成本低 81%,分数反而更高。首次真实代码编辑的中位步数从 48 步提前到 18 步。

SWE-1.7 的用户反馈是「过度探索」:动手前把代码库翻个底朝天,简单任务上也一样。SWE-2 的改进集中在「聚焦探索」——判断代码库中哪些部分真正与任务相关。官方总结了三种行为特征:

  • 测试覆盖:写出端到端检查实现的测试,更可靠地抓住回归和边界情况;
  • 边界内的资源能力:标准路径被堵时另找路线。官方举的例子:所需的 MCP 集成不可用时,模型从它有权访问的 Slack 频道历史中重建了数据;
  • 验证纪律:被质疑时重新推导结论而不是重复断言,验证用户的假设而不是简单附和。

三种推理力度(effort level)的行为差异同样清晰:medium 快速动手,适合简单和中等任务;high 和 max 规划更多、探索更全、用更复杂的验证管理不确定性。同一个模型,力度参数决定它的工作风格。

训练方法:一条公式和一个几何约束

这是这次发布技术含量最高的部分。Cognition 训练 SWE-2 时,把所有推理力度等级放进单次 RL 运行端到端训练,核心是带成本惩罚的奖励函数:

text
R = S - λe·C

S∈{0,1} 表示一次 rollout 是否成功,C 是成本(推理美元成本与耗时的混合),λe 是按力度等级调节的惩罚系数。对照:Kimi K3 的做法是为每个「领域 × 力度等级」组合训练单独的专家模型,再用多教师在线蒸馏合并。

λe 怎么取?Cognition 给出的答案绕开了网格搜索,直接用几何:把 λe 设为基座模型帕累托前沿在该力度点的局部斜率 m。直觉用一句话讲:奖励函数的等值线斜率等于 λe,当等值线与前沿相切时,沿着前沿移动不再改变奖励,此时提升奖励唯一的方向就是把整条前沿向外推。斜率取小了,模型学会偷工减料(高力度表现得像低力度);取大了,浪费成本不涨分。附录 B 还证明了一个更强的结论:只要要求 RL 目标只取决于平均成本和解题率,奖励函数在数学上必须是线性的——线性惩罚是唯一解,这是用 Jensen 函数方程严格证明的,不是启发式选择。

配套的第二个组件是长度加权奖励基线。策略梯度需要基线来降低方差,理论上最优基线 b* 需要 E[R‖∇log π‖²]/E[‖∇log π‖²],逐 rollout 计算要额外一次反向传播。Cognition 发现梯度范数与 rollout 长度强相关,于是用长度加权的组内奖励均值近似,零额外成本。消融显示这个基线显著压低了推理与训练策略之间的 KL 散度,训练更稳。

训练基础设施:三类系统工程

博客披露的工程细节有三块:

推理侧:prefill delayer 把相邻请求攒批调度,GPU 吞吐提升 10–20%;用 DSpark 投机解码加速 rollout 生成;RL 训练中策略持续变化,草稿模型的接受序列变短、吞吐衰减,Cognition 用 SpecForge 训练新草稿模型拿到 15% 更长的接受长度,再把在线草稿模型训练集成进 RL 系统,让草稿模型跟随策略演进。

数值精度:NVFP4 和 FP8 内核加量化感知训练,MLA 层的 K、Q、V 和 score 计算用 FP8。相比 SWE-1.7 的混合精度方案是简化,内存占用更低,在基座参数量接近 3 倍的条件下,训练-推理失配反而更小。

数据:RL 环境数量增至 3 倍,扩充仓库分布;新增指令遵循 overlay,训练模型在保持底层任务的同时记住多条约束;验证器硬化用一个递归飞轮——用 SWE-2 的历史 checkpoint 审查训练中的 rollout,发现并修补验证器的假阳性/假阴性,防止 K3 这种「更有资源」的基座钻验证器空子(reward hacking)。

可用性与价格:一个月的窗口

SWE-2 今天起在 Devin Desktop 和 CLI 可用,Devin Web 与 Fusion 正在推送。HN 上 Cognition 员工 samyok 确认:未来一个月对所有订阅者在 CLI 上免费(桌面端本地运行免费,云端 75 折)。不支持 OpenRouter 等第三方 API,官方答复是优先保障 Devin 产品线用户的推理容量。

对开发者,这意味着两个事实:想在自有 harness 里评测 SWE-2,目前只能进 Devin 生态;要对比 SWE-2 与 DeepSeek V4.1 Flash 这类开放权重模型,门槛不对等。HN 用户 scronkfinkle 的抱怨有代表性:「我有自己的 harness 和工作流,用 OpenRouter 评测所有模型,现在要多一套 bespoke 平台。」

争议:三个值得单独列出的质疑

1. 自家 benchmark 自测。 FrontierCode 1.1 是 Cognition 自己的评测(官方参考文献 [1]),Main 榜上「距 Fable 5.1 一分、距 Astra 三分」的头部声明依赖自测数据。HN 用户 thereitgoes456 的批评:「在自己的闭源生态里跑自己做的基准,任何人都无法复现。」DeepSWE 1.1 情况稍好,由 Cognition 与 Scale AI 联合推出,业界引用较多。

2. TB4 出样本落差。 前文已分析:27.3% 对 Astra 的 57.9%,在最新、最难出样本的基准上差距明显。辩护方(mediaman)指出 Sol 的落差同样大;反驳方(Lucasoato、solenoid0937)指出官方博客同时宣称「与 Astra 竞争」,不能在自家基准上按竞争宣传、到 TB4 上又按「算力少」辩护。两种说法各自成立,结论留给读者:SWE-2 在老基准上确实进入第一梯队价格段,在 TB4 上与最前沿还有明显距离。

3. 闭源权重。 SWE-2 不开放权重,不提供标准 API。HN 用户 nullbio 的发问代表相当一部分情绪:「已经有两个闭源权重巨头了,没人需要第三个。」与此同时 DeepSeek V4.1 Flash 同周发布开放权重(HN 用户引用的 HF 数据:TB4 31.2%,高于 SWE-2 的 27.3%),价格更低。开放与闭源阵营的性价比竞争,这一周正好构成了一个直接对照。

放回行业坐标

把这次发布放回 2026 年 9 月的行业格局,三条线值得记录:

RL 后训练成为独立赛道。 Cognition 不训基座、只做后训练和 agent 产品,两次发布(SWE-1.7、SWE-2)都验证了「开源基座 + RL 后训练」能把二手基座推到前沿价格性能段。这条路径的门槛是 RL 基础设施和验证器体系,不是预训练算力。

benchmark 信任危机在加剧。 FrontierCode(厂商自测)与 TB4(出样本第三方)的分数差被社区逐条计算,「benchmaxxing」(针对基准优化)成为 HN 讨论的主旋律。当厂商自报数据与出样本基准的落差可以逐条对照时,benchmark 营销的边际效果在递减。

性价比战争白热化。 同一周里,闭源阵营用「Fable 5.1 的性能、64% 的价格」进攻,开放权重阵营用 DeepSeek V4.1 Flash 的价格和 TB4 分数反击。HN 评论区的价格计算已经精确到「1M 缓存 token $0.006 对比 GPT 5.6 Luna 的三分之一」。编码模型的价格曲线还在陡降,买单的是所有把 agent 写进生产流程的团队。


参考来源

  • Cognition 官方博客:Introducing SWE-2: Pushing the Pareto Frontier(cognition.com/blog/swe-2)
  • Hacker News 讨论(item 49645443,333 分 137 评论)
  • Kimi K3 技术报告:arXiv:2607.24653
  • FrontierCode 1.1:cognition.com/blog/frontier-code-1.1
  • SWE-1.7:cognition.com/blog/swe-1-7