GLM-5.3 技术解读:后训练Scaling与涌现攻防能力

Z.ai 发布 GLM-5.3。这个模型沿用 GLM-5.2 的基座,所有提升来自后训练阶段,官方的表述是「Scaling post-training is all we did」。提升集中在两个方向:复杂编码与长程 Agent 任务的大幅进步,以及一份超出团队预期的安全能力答卷。Terminal Bench 3.0 上 GLM-5.3 从 GLM-5.2 的 4.6 提高到 28.3;CyberGym 漏洞发现基准拿到 84.5%,排在所有受测模型第一,超过 GPT-5.6 Sol 的 83.6%。

后训练如何驱动这一代提升

GLM-5.2 时代搭好的技术栈(IndexShare 长上下文处理、面向长程任务的 SAO 强化学习框架、大规模异步训练框架 slime)在 GLM-5.3 上继续加码:更多环境、更多样化的任务、更多算力。

环境设计的变化最能说明这一代的思路。任务环境向「真实专家工作单元」靠拢,部分任务相当于一位有经验工程师数天的工作量。以 ML 基础设施任务为例,模型拿到与工程师相同的工作环境,可以访问计算集群、存储系统、内部文档、代码库和实验结果,需要定位训练栈中的瓶颈、实施优化、跑实验,并在保持正确性的前提下交付可度量的端到端加速。

环境规模化依赖两条合成管线。研究 Agent 从真实工作中收集任务模式,将其转化为带多步依赖和隐藏状态的可运行长程环境;裁判 Agent 随后尝试解出每个任务,验证其确实可解。验证器在不接触参考答案的情况下合成,求解轨迹则用来发现并封堵奖励捷径。通过 oracle、no-op 和未解状态检查的验证器,可以产出足够可靠的二值奖励直接用于训练。官方也承认这些管线仍需要相当数量的人工参与,让环境生成和验证更加自主是下一步的工作之一。

编码与 Agent 基准

官方公布的完整对比数据如下(数据来自 Z.ai 官方博客,Fable 5 列在官方正文中称 Mythos 5,两者分数一致):

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.188.281.088.385.088.088.8
Terminal Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.558.069.772.7
NL2Repo58.048.958.069.7--
ProgramBench Almost Solved19.09.517.515.533.023.0
FrontierSWE78.167.5-66.588.2-
SWE-Marathon v1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2

逐项看,GLM-5.3 在开源模型中拿到 Terminal Bench 3.0 和 Agents' Last Exam 的最优成绩,官方称其为当前最强的开源权重编码模型。Terminal Bench 2.1 的 88.2 已经挤进第一梯队,与 Kimi K3(88.3)、GPT-5.6 Sol(88.8)的差距在 1 分以内;更新更难的 Terminal Bench 3.0 上,28.3 与 GPT-5.6 Sol 的 34.6、Fable 5 的 33.7 仍有距离,但相对 GLM-5.2 的 4.6 是六倍量级的改善。

DeepSWE v1.1 从 46.2 到 66.9,与 Kimi K3 的 67.5 基本持平,距离 Fable 5 的 69.7 和 GPT-5.6 Sol 的 72.7 还有 3 到 6 分。SWE-Marathon v1.1 从 19.4 翻倍到 42.5,与 GPT-5.6 Sol 持平,超过 Fable 5 的 33.1,落后于 Opus 4.8 的 48.8 和 Kimi K3 的 48.1。NL2Repo 是对比表中 GLM-5.3 相对弱势的一项,58.0 落后 Opus 4.8 的 69.7。

Agent 侧,AutomationBench v1.0.6 从 26.2 提高到 48.2,超过所有对比模型;Agents' Last Exam ALE-CLI 从 23.8 到 28.5,仅比 GPT-5.6 Sol 的 28.6 低 0.1。

Z.ai Code Bench 与 token 效率

GLM-5.3 在 Z.ai Code Bench 上的表现与 token 消耗

除公开基准外,官方同时发布了内部基准 Z.ai Code Bench,在贴近真实用户的场景下评估编码 Agent,按不同努力等级沿两条维度打分:端到端任务完成率和细粒度检查项准确率。作为私有基准,它也规避了公开测试集的污染问题。

结果上有两个信息点。其一,GLM-5.3 在每个努力等级都同时做到性能更高、输出 token 更少:Max 努力下以约 7.5 万输出 token 拿到 34.5% 完成率,GLM-5.2 用 9.6 万 token 只有 23.4%。其二,High 努力下 GLM-5.3 以约 5 万 token 拿到 31.4%,超过 Claude Opus 4.8 用 12 万 token 达到的 29.5%,token 消耗不到对方一半。Fable 5 在 Max 努力下仍有 39.5% 的领先优势。

涌现的攻防能力

GLM-5.3 在三个安全基准上的表现

后训练阶段引入了漏洞发现数据和环境,团队的预期是让模型更擅长发现和推理漏洞。实际发生的事情超出预期:随着训练规模扩大,攻防能力的发展速度超过了团队预想。GLM-5.3 没有停留在识别孤立缺陷的层面,它开始跨多个利用阶段推理,形成针对完整利用链的连贯计划。

三个安全基准覆盖了从漏洞分析到利用的不同阶段。CyberGym 从白盒源码出发,测试模型能否通过触发故障来识别并验证漏洞,GLM-5.3 拿到 84.5%(GLM-5.2 为 77.2%),超过 Fable 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%,是这项基准目前的最高分。ExploitBench 要求对真实漏洞及其利用做更深的推理,GLM-5.3 达到 54.4%,相对 GLM-5.2 的 24.4% 翻倍有余,Fable 5 和 GPT-5.6 Sol 分别为 78.0% 和 76.5%。ExploitGym 在时间归一化预算内统计完成利用任务的数量,GLM-5.3 两小时完成 105 项、六小时完成 130 项,GLM-5.2 只有 29 和 39;GPT-5.6 Sol 为 216 和 293,Fable 5 为 181 和 247。

三个基准呈现出同一个模式:越靠近利用链上游,相对 GLM-5.2 的增益越大,与闭源前沿的差距也越大。官方博客的原话是「Capability is growing fastest exactly where we are furthest behind」,能力增长最快的位置恰是落后最多的位置。

2436 个真实漏洞

基准之外,Z.ai 自 GLM-5.2 起与国内多个安全团队合作,把模型投向真实代码库。经过专家评审、筛查和去重,模型在 269 个项目中识别出 2436 个漏洞,其中 1097 个为中高危。范围覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议,不少漏洞在代码库里存在了数年甚至数十年,最老的一条可以追溯到约 40 年前(1981 年引入)。

severity 分布:Critical 107、High 990、Medium 1286、Low 53。平均而言,一个漏洞在被发现前已经在代码库中存活了 26.6 年。

这项工作已经转为持续的披露流程。Z.ai 建立了 Security Disclosure Ledger(cvd.z.ai)公开记录这些发现的披露进度,目前 53 项已公开披露,2383 项仍在 embargo 中。对已披露条目,ledger 记录受影响项目、严重等级、CVE 编号(如可用)以及漏洞在代码库中存在的时间。

slime 训练基建的改进

支撑这一轮 scaling 的 slime 是 Z.ai 的开源后训练框架,训练侧用 Megatron、rollout 侧用 SGLang。设计上把训练、rollout 和数据缓冲区放在同一条 dataflow 上,数学、代码、沙箱、验证器和长程 Agent 环境都以数据生成的形式接入,不需要改动训练循环。GLM-5.2 到 GLM-5.3 持续添加环境而没有重建训练栈,靠的就是这个架构。

算法侧新增 top-p mask、top-k 和全词表 OPD,以及提升训练与 rollout 一致性的配置(R3 式设置、训练与 rollout 路径的数值对齐)。在训练与 rollout 一致性评估中,logprob 平均差异控制在 1e-7 量级,相比此前设置降低超过 99.99%。

系统侧的改进集中在资源效率:本地存储作为额外缓存层分层保存模型状态和数据,多教师 OPD 场景下可以动态切换教师并在训练侧预取,不需要为每个教师单独部署常驻推理服务;针对 Agent 和异步负载改进了路由与 slime 之间的联合调度与负载均衡,并加入从 rollout 环境特征推导吞吐导向配置的启发式。这些优化让长程编码 RL 任务的端到端训练吞吐提升超过 2.3 倍。

API 变更与迁移注意

GLM-5.3 的 API 有一个破坏性变更需要注意:不再支持关闭思考模式。thinking.type 只接受 enabled,思考深度改由 reasoning_effort 参数控制,可选 lowhighmax,默认 max,官方建议编码任务使用 max

如果现有应用使用了 thinking.type: "disabled",必须先改为 enabled 并将 reasoning_effort 设为 low,再更新模型 ID 为 glm-5.3,否则请求会直接失败。

计费方面,GLM Coding Plan 改为积分制,输入、缓存输入和输出 token 分开计点。工作日 14:00-18:00(UTC+8)为高峰时段,其余时段含周末按 50% 积分消耗。GLM-5.3 已向所有 GLM Coding Plan 用户开放,可在 ZCode、Claude Code、OpenCode 等编码 Agent 中使用。

权重开放时间表

GLM-5.3 的权重将在发布两周后公开,安全评估与加固完成即放出。HuggingFace 页面目前标注 Coming Soon。参照其开源节奏,这是 GLM-5 系列连续第三代在发布后短期内开放权重,对本地部署和二次开发群体来说,两周是一个明确的等待周期。

来源:Z.ai 官方博客Z.ai Security Disclosure Ledger