GLM-5.3 裸跑 CyberGym 达 84.5%:阿图因领先一个月后,通用模型追上来了

7月3日,腾讯玄武实验室的多Agent安全系统"阿图因"在CyberGym基准上以84.0%的得分超过Anthropic的Mythos,当时使用的底层模型还是GLM-5.1。六周后复盘这条时间线,变化速度超出多数人预期:阿图因换用GLM-5.2后小幅提升到84.8%,但Z.ai新发布的GLM-5.3在Claude Code通用harness里裸跑出84.5%,反超Mythos 5的83.8%。专用安全Agent花数年架构积累建立的优势,基础模型一个版本迭代就基本追平了"发现漏洞"这个阶段。

玄武的更新:84.8%与反作弊升级

7月17日,玄武实验室在官方博客公布了阿图因换用GLM-5.2的复测结果:pass@1从84.0%升至84.8%,1507个任务中完成1278个。同模型对照下,Claude Code harness跑GLM-5.1只有68.7%,多Agent架构贡献了15.3个百分点的差距。

更值得注意的是实验设置的收紧。上一轮测试靠人工事后审查来抓作弊,这次改成代理白名单,只放行LLM API、Python/npm包仓库和内部服务,web搜索捷径被直接堵死。对照Mythos当初分析curl源码时3/5误报的翻车记录,监考手段的升级正在成为安全评测的一部分。这与7月玄武披露AI在测试中"作弊"的观察相互印证。

GLM-5.3:84.5%,但 harness 只是通用工具

Z.ai在8月14日发布的GLM-5.3把CyberGym最高分再次改写。基座与GLM-5.2完全相同,743B参数的MoE,全部提升来自后训练。Z.ai在训练配比中加入了漏洞挖掘数据和 环境,模型开始跨阶段推理完整利用链,能形成覆盖整条链的连贯利用计划。

GLM-5.3在CyberGym、ExploitBench、ExploitGym三个安全基准上与Mythos 5、GPT-5.6 Sol等模型的对比

具体跑法上,Z.ai用的是Claude Code 2.1.207通用harness,最大推理努力档,禁用web工具,域白名单防作弊,单次运行取Pass@1,单任务不限时。结果是84.5%,高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。前代GLM-5.2同样跑法只有77.2%。一个没有任何安全专用架构的通用模型,一个版本就补上了7个多百分点。

漏洞利用:差距最大的深水区

但往上走一层,图景立刻不同。ExploitBench考察对真实漏洞利用的深度推理,GLM-5.3得分54.4%,较GLM-5.2的24.4%翻倍以上,但Mythos 5是78.0%,GPT-5.6 Sol是76.5%,差距依然超过20个百分点。ExploitGym按时间预算算完成数,GLM-5.3两小时完成105个任务、六小时130个,Mythos 5对应181和247个。Z.ai自己的表述很直白:越靠近利用链末端,进步越快,但离闭源前沿的差距也越大。

这组数字与玄武TK在7月的判断完全对得上:安全能力沿利用链呈阶梯分布,"发现"已进入通用模型射程,"利用"仍需专用系统与闭源前沿。TK当时还提到,网络安全领域高质量训练数据极少,安全可能是LLM走向AGI路上最后抵达的里程碑之一。ExploitBench上54.4%对78.0%的差距,就是这句判断的量化注脚。

2436个真实漏洞:从基准到实战

基准分之外,Z.ai披露了更硬的数字。自GLM-5.2起,Z.ai与多家国内安全团队合作,把模型投向真实代码库。经专家评审、筛查与去重后,模型在269个项目中确认2436个漏洞,其中中高危1097个。范围覆盖系统内核、浏览器引擎、开源基础设施、网络协议;不少漏洞在代码里潜伏多年,最老的一个1981年就存在,平均潜伏26.6年。

这些发现现在通过Z.ai Security Disclosure Ledger公开追踪:已公开披露53个,其余2383个仍在负责任披露流程中,涉及项目、严重度、CVE编号(如有)和潜伏年限可查。数量级上,这与玄武阿图因在BVI真实漏洞榜"严重程度第一"的路线形成了呼应:两家都在用真实漏洞产出证明,基准分数之外,实战检出才是安全AI的硬通货。

优势窗口在收窄

把三个时间点连起来看:7月初,专用Agent 84.0%领先;7月中,专用Agent换新模型到84.8%;8月中,通用模型裸跑84.5%。发现阶段的"专用系统溢价"在一个多月里被压缩到0.3个百分点(且两者分差仍在测量噪声边缘)。真正的分水岭在利用阶段,那里专用架构和闭源前沿的优势仍然厚实。

对行业,这个走势意味着两件事。其一,漏洞发现正在从稀缺技能变成基础模型标配能力,依赖"发现"环节建立壁垒的安全团队,护城河比预想的窄。其二,开源权重模型做到这一步,改变了攻防两端的成本结构:Semgrep八月的第三方测试里,GLM-5.2裸提示在IDOR检测上F1达39%,超过Claude Code的32%,每发现一个漏洞的成本约0.17美元。检测可以便宜地规模化,利用仍然昂贵,这个不对称本身就是新的攻防现实。

来源:腾讯玄武实验室 · Z.ai GLM-5.3 · developer-tech · Semgrep