Z.ai 发布 GLM-5.3,仅通过后训练(强化学习+微调)实现相比 GLM-5.2 代码基准 50% 提升,并涌现意外的网络安全能力。
Z.ai 刚刚发布了 GLM-5.3,这是我们见过的 AI 模型中最显著的后训练改进之一。GLM-5.3 使用了与 GLM-5.2 完全相同的基础模型,却在编程基准测试上实现了 50% 的提升,在多个 Agent 基准测试上达到了 SOTA 性能——最令人惊讶的是,还涌现出了超出 Z.ai 预期的网络安全能力。该模型在一小时内登上了 Hacker News,收获 212 个点赞。
以下是发生了什么,以及这意味着什么。
GLM-5.3 最引人注目的地方在于没有变化的部分:基础模型。GLM-5.3 使用的是与 GLM-5.2 相同的基础。所有的改进都来自后训练——即基础模型预训练完成后进行的强化学习和微调。
这验证了 AI 社区中日益流行的一种观点:预训练的规模化可能正在接近极限,但后训练才刚刚起步。Z.ai 在三个方面进行了扩展:
更多环境 —— 任务环境更接近真实的专家工作单元,而非编程练习
更多样化的任务 —— 包括多步骤 ML 基础设施任务,模型需要诊断瓶颈、实现优化并运行实验
更多算力 —— 用于在这些长周期环境中进行训练
这些环境非常复杂,有些甚至相当于资深工程师数天的工作量。在一个 ML 基础设施任务中,模型被给予与人类工程师相同的工作环境——计算集群、存储系统、内部文档、代码库和实验结果——然后必须在保持正确性的同时实现可衡量的端到端加速。
GLM-5.3 在各项基准测试中的表现讲述了一个清晰的故事:
| 基准测试 | GLM-5.3 | GLM-5.2 | 变化 |
|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 6 倍提升 |
| DeepSWE v1.1 | 66.9 | 46.2 | +20.7 |
| Z.ai Code Bench | 最高难度:34.5%(约 75K 输出 tokens) | 最高难度:23.4%(约 96K tokens) | 相同 effort 级别下提升 50%,且消耗更少 tokens |
| Agents' Last Exam | 28.5 | 23.8 | +4.7 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 几乎翻倍 |
| Toolathlon Verified | 73.0 | 59.9 | +13.1 |
作为参考,GLM-5.3 在 High effort 级别下,在约 50K tokens 时达到 Z.ai Code Bench 的 31.4%,超越了 Claude Opus 4.8 在 120K tokens 时的 29.5%。它不仅变得更强——而且变得更加 token 高效。
这才是故事真正有趣的地方。作为后训练的一部分,Z.ai 将漏洞发现数据和环境引入了训练混合。他们期望这能提升模型发现和推理漏洞的能力。他们没有预期到的是,随着训练规模扩大,这项能力发展得如此之快。
GLM-5.3 不仅在识别孤立缺陷上变得更好——它开始跨多个利用阶段进行推理,形成完整的利用链的连贯计划。结果如下:
| 基准测试 | GLM-5.3 | GLM-5.2 | 备注 |
|---|---|---|---|
| CyberGym(漏洞识别) | 84.5% | 77.2% | 业界最佳,领先 GPT-5.6 Sol(83.6%) |
| ExploitBench(深度利用推理) | 54.4% | 24.4% | 超过 GLM-5.2 的两倍 |
| ExploitGym(时间归一化利用) | 2 小时 105 个任务,6 小时 130 个 | 2 小时 29 个,6 小时 39 个 | 大幅提升 |
模式是一致的:沿着利用链往上走,相比 GLM-5.2 的提升幅度就越大。模型原本最薄弱的地方,能力增长得最快。
这不仅仅是基准测试性能。Z.ai 一直在与中国多个安全团队合作,将 GLM-5.3 用于真实世界的代码库。经过专家审查和去重后,模型发现了:
Z.ai 建立了一个公开的安全披露台账来追踪这些发现随着披露流程的进展。截至发布时:已公开披露 53 个,2,383 个处于 embargo 状态。
最有趣的技术细节之一是 Z.ai 如何扩展他们的训练环境。一个有用的任务环境需要是可执行的、可验证的,并且接近真实的专业工作——而且你需要大量这样的环境。
Z.ai 构建了端到端合成环境的流水线。研究 Agent 从真实工作中收集任务模式,并将它们转化为可运行的长周期环境,包含多步骤依赖和隐藏状态。然后一个裁判 Agent 尝试每个任务来验证它确实是可解决的。验证器在无法访问参考解决方案的情况下被合成,而解题轨迹则用于发现并关闭奖励捷径。
这本质上是使用 AI 为 AI 构建训练环境——一个递归的改进循环,可能会极大地加速后训练的扩展。
对于编程: GLM-5.3 现在是编程任务方面最强大的开源模型。如果你正在使用 AI 编程 Agent,这个模型提供了前沿级别的性能,同时拥有开源权重(在安全评估后两周内发布)。
对于安全: 涌现的网络安全能力是一把双刃剑。一方面,如此规模的自动化漏洞发现可以极大地改善软件安全。另一方面,同样的能力也可能被滥用。Z.ai 专门 withholding 权重两周,正是为了进行安全加固。
对于 AI 行业: GLM-5.3 是强有力的证据,表明 AI 改进的下一个前沿不是更大的预训练运行——而是更复杂的后训练。同一个基础模型纯粹通过在更真实环境上更好的 RL,从中等水平变成了 SOTA。
对于开源: 一个开源模型能够在特定能力上匹配或超越闭源模型(CyberGym SOTA、有竞争力的编程能力),这表明开源/闭源差距可能正在以超出预期的速度缩小。
GLM-5.3 并非在所有方面都是最好的。Claude Fable 5 仍在 Z.ai Code Bench(Max effort 下 39.5% 对比 GLM-5.3 的 34.5%)和利用基准测试上领先。GPT-5.6 Sol 在各个维度上仍具有竞争力。但 GLM-5.3 结合了开源权重、强编程能力和涌现的安全能力,且 предположительно 成本更低,对于许多用例来说是一个引人注目的选择。
该模型现在可以通过 Z.ai 的编程计划和 ZCode 平台使用,权重将在两周内发布。
GLM-5.3 证明了后训练是新的前沿。同一个模型,截然不同的能力——纯粹通过在更真实的环境上进行更好的强化学习实现。涌现的网络安全能力既令人印象深刻,也提醒我们,当我们扩展后训练时,仍然不能完全理解会发生什么。对于开发者来说,这是编程和 Agent 任务的又一个强大的开源选择。对于 AI 行业来说,这是一个信号:规模化的故事远未结束——只是翻开了新的一章。