8 个顶尖编程 AI 做从未见过的企业代码,最好的也只解出四成

Real-SWE 的完整成绩单,第一次把「SWE-bench 分数」和「真实工程能力」之间的差距量化了出来。

9 月 10 日,Y Combinator 2026 年冬季赛道孵化(实际为 F25 批次)的 Specific Labs 团队发布了编程基准 Real-SWE。它和 SWE-bench 系最大的区别只有一条:所有任务都来自真实公司的私有代码库,模型在训练时不可能见过这些代码,也不可能见过答案。

三天后,Hacker News 上的讨论帖拿到 179 点和近百条评论。多位开发者留下的评价指向同一件事:这组分数与他们的日常体感一致。

规则:把工程师的真实工作原样搬进沙盒

Real-SWE 的任务全部「取自」或「逐字复刻」真实工程师在私有代码库里做过的工作。官方给出的样例代码库包括:一个 20 万用户以上、进入 App Store 前 100 的事件类应用;一个处理 10 万份以上银行对账单的消费金融平台;以及企业级 AI 销售工具。

每道任务把代码库和当时工程师拿到的上下文交给 agent,再验证修改是否真的可用。一个样例任务是:修好发票计费,让每个商家按正确税率计税、豁免客户不被误收。展开的完整指令里包含业务侧的全部约束:不同商家走不同的计税路径(自维护税率、按买家地址向税务服务商询价、完全不收税)、豁免客户怎么配置都不收税、询价失败要上报但不能阻塞开票、结算后要按发票号回写税务商让对账能平、欧盟主体之间的发票要显示双方 VAT 注册号。agent 面对的是 TaxJar 沙盒与生产环境、InfluxDB 账本、NestJS 服务构成的完整技术栈。

这与公开基准的出题方式是两种东西。SWE-bench 的任务来自 GitHub 公开仓库的 issue,顶尖模型在训练阶段几乎必然见过这些代码,甚至见过修复它的 commit。Real-SWE 的任务在互联网上不存在,Specific Labs 在发布说明里的表述是:真实企业里 99% 的代码 token 是前沿模型接触不到的。

Prompt 长度与参考解改动文件数对比:Real-SWE 指令更短,参考解却要动更多文件

任务形态也有两个可量化的差异。指令长度上,Real-SWE 中位数 1,742 字符,比 FrontierCode 的 2,056 和 DeepSWE 的 1,975 更短,介于 Terminal-Bench 3 的 1,584 与 FrontierSWE v2 的 992 之间;参考解需要修改的文件数中位数为 11 个,是 FrontierCode 和 DeepSWE(均为 6 个)的近两倍。指令说得更简略,实际的修改却铺得更开,缺的细节都要 agent 自己在代码库里找。

评测设置上,每个 agent 跑在隔离沙盒里,任务全部采用 Harbor 格式,验证器在评分时注入,参考验证器来自原公司代码库里真实存在的测试套件或直接沿用。团队没有把所有模型放在同一个 harness 下,而是用各家原生的 agent 工具:Anthropic 配 Claude Code,OpenAI 配 Codex CLI,Google 配 Gemini CLI,xAI 配 Grok Build,Moonshot 配 Kimi Code。测的是「模型+工具」的实际组合,每个任务每个配置独立跑 8 次,分辨率率(resolution rate)等价于 pass@1 的 8 次平均,附 95% 置信区间。

榜单:第一名也只有 38.8%

8 个模型加 harness 组合的成绩:

#模型Harness分辨率率单次任务估算成本
1Claude Fable 5.1Claude Code38.8%$6.96
2OpenAI GPT-6 AstraCodex CLI33.8%$4.67
3Google Gemini 3.8 FlashGemini CLI31.2%$2.50
4智谱 GLM 5.3Claude Code28.8%$5.12
=5xAI Grok 4.6Grok Build23.8%$3.44
=5Muse Spark 1.3Muse Code23.8%$2.74
7Moonshot Kimi K3Kimi Code18.8%$3.90
8OpenAI GPT-5.6 SolCodex CLI16.2%$2.65

Real-SWE 排行榜:8 个模型加 harness 组合的分辨率率

三件事值得单独看。

第一,没有模型过 40%。排在最后的 GPT-5.6 Sol 只解出 16.2%,与榜首相差 22.6 个百分点。这些模型在 SWE-bench Verified 一类公开基准上的分数普遍高得多,换到从未见过的私有代码库,成绩整体缩水。

第二,成本与成绩不同序。Gemini 3.8 Flash 单次 2.50 美元排第三,价格约其 2 倍的 GLM 5.3(5.12 美元)只排第四;最便宜的 Gemini 3.8 Flash 和最贵的 Fable 5.1(6.96 美元)差距是 7.6 个百分点(2.50 美元的 Gemini 3.8 Flash 得到 31.2%,6.96 美元的 Fable 5.1 得到 38.8%),价格拉到 2.8 倍,分数只拉开 7.6 个百分点。官方散点图把这一层意思直接画了出来:横轴成本、纵轴分辨率率,Gemini 3.8 Flash 落在图表左上方。

成本与分辨率率散点:更贵不等于更高分

第三,任务难度极度不均。10 个公开样例任务里,6 个任务的全模型分辨率率低于 15%。「Multi-region sweep」这种常规改动,8 个模型合计 64 次运行里过了 43 次(67.2%),GPT-6 Astra、Gemini 3.8 Flash 和 Muse Spark 1.3 三个模型;「API keys & environments」65.6%、「Entitlement overage lines」50.0%、「Customer identity migration」40.6%;而「Billing schedule migration」跌到 14.1%,「API token metering」12.5%,「S3 datastore measurement」10.9%,「Linearizable scan」4.7%,「Tax jurisdiction」3.1%;「Analytics stream reducer」是 0%,8 个模型 64 次全部失败。涉及分布式一致性、正确计税这类有硬性正确性要求的任务,模型几乎全军覆没。

失败模式:同一个模型,摔在同一类坑里

Specific Labs 沿用 DeepSWE 的分类法,把失败按提交行为归成五类:未验证的假设(unverified assumption)、漏掉需求(missed requirement)、集成错误(integration error)、引入回归(regression)、改错文件(wrong file)。

失败模式分布:不同模型的失败原因构成差异明显

分模型的失败构成差异很大。Grok 4.6 的失败运行里 67.2% 是漏掉需求(61 次失败里 41 次),Kimi K3 是 53.8%;GPT-5.6 Sol 则有 43.3% 的失败来自未验证的假设(67 次失败里 29 次)——它在没查证系统实际行为的前提下直接往前写。Gemini 3.8 Flash 一半的失败(49.1%)是集成错误:想法对,但接线接错了地方。

两个普遍结论也写在数据里。其一是没有任何一个模型解出全部任务(「No model solves every task」可视化里,每个格子是一次运行,没有一行全绿)。其二是短任务并不安全:10 分钟以内的 rollout 失败率 71.4%(98 次里失败 70 次),10 分钟以上的是 73.4%(542 次里失败 398 次)。失败的主因落在任务理解上:在堆满既有业务逻辑的代码里,理解需求本身就难,任务时长反而是次要因素。

##HN 讨论区里,一位自己搭了同类内部基准的开发者给出的独立印证是:在自己的 Rails 和前端代码库上,「大多数模型在有真人把关的情况下能做到可合并的 PR」,但整体成功率与 30% 量级的结果一致。也有评论指出 Gemini CLI 已于 5 月 19 日被 Google 弃用、改名为 antigravity(agy),基准页面仍标 Gemini CLI;Harness 配置与最新工具链的对应关系,Specific Labs 可能需要跟进更新。

私有代码库基准改变了什么

对买模型的人来说,这类基准提供的是决策依据:企业部署 coding agent,面对的是自家那套没人见过、充满历史包袱的代码,公开仓库只是训练材料。一个在公开榜上 70% 的模型,落到私有代码上可能只有 30% 出头,采购决策应该以后者为准。

对研究侧,它把「记忆」从评测里剥了出去。公开基准的分数里混着训练数据泄漏的贡献,私有代码库上的成绩更接近纯粹的泛化能力。Real-SWE 团队同时向公司征集代码库(承诺匿名化、任务保密),向实验室开放完整任务集用于训练评估,这个循环转起来后,榜单会更有代表性。

样品任务集已开放申请(官方页面 request access),完整榜单在 realswe.withspecific.com。

说明

  • 基准与全部数据来自 Specific Labs 官方页面(withspecific.com/benchmarks/real-swe)与 Y Combinator Launches 页(2026-09-10 发布);分辨率率为 pass@1 的 8 次运行平均,附 95% 置信区间。
  • 估算成本为官方口径的每任务均值,由 Specific Labs 按官方 API 定价计算。
  • Specific Labs 是该基准的开发方,榜单数据为厂商自报口径;各模型在公开基准上的对照分数不在本文引用范围内。
  • 配图 1 为 YC 官方发布图,其余截图自 Real-SWE 官方页面。