GLM-5.3 未重新训练基座,仅通过扩大后训练环境和训练时长提升性能,DeepSWE 提升 20+ 分,安全能力显著增强,权重将于两周内公开。
Z.ai 刚刚发布了 GLM-5.3。GLM-5.3 运行在与 GLM-5.2 相同的 743B 基座模型上。所有报告的提升均来自规模化后训练:更多的任务环境、更多的环境类型、更长的训练周期。结果体现在两个方面。在最长周期基准测试上,编码能力跃升最多,Terminal-Bench 3.0 从 4.6 升至 28.3。网络安全方向的表现超出了 Z.ai 的预期,CyberGym 达到了 84.5%。权重尚未公开。
部分地,GLM-5.3 已通过 Z.ai API、GLM Coding Plan 和 ZCode 上线。权重尚未放出。Z.ai 表示将在上线约两周后发布权重,待安全评估和加固完成后。
哪些公司现在就能用:初创公司和中型工程组织可以通过 Coding Plan 或 API 立即采用。有数据驻留或供应商审查要求的企业应等待权重。安全厂商和 MSSP 获得的信号最多,但面临最大的政策风险。
行业:开发者工具、云基础设施、应用安全、金融科技和电商工程,以及输出内核、浏览器引擎或网络协议栈的供应商。
应用场景:仓库级重构、长期 CLI Agent、CI 失败归因、白盒漏洞发现、崩溃归因和安全代码审查。
Terminal-Bench 3.0 相对 GLM-5.2 从 4.6 升至 28.3。DeepSWE v1.1 从 46.2 升至 66.9。Agents' Last Exam(CLI)从 23.8 升至 28.5。在覆盖 44 个职业的 GDPval-AA v2 上,GLM-5.3 得分 1,769。
在 Z.ai Code Bench(内部评估)上,公司报告相对 GLM-5.2 有 50% 的提升。每个任务约 50,000 输出 token 时达到 31.4%。Claude Opus 4.8 在 120,000 tokens 时得分 29.5%。Claude Fable 5 在最大努力下仍以 39.5% 领先。Z.ai 认为私有基准降低了污染风险。
在公开测试集上,GLM-5.3 在若干更难编码评估中落后于 GPT-5.6 Sol 和 Fable 5。所有数据均为厂商报告,测试框架、上下文长度和采样设置均在公告中有所说明。
Z.ai 将此标记为计划外。他们加入漏洞发现数据本意是提升单 bug 推理能力。然而随着训练规模扩大,能力持续复合增长。模型开始能够在完整利用链上形成连贯计划。
CyberGym(测试白盒源码发现和验证)从 77.2% 升至 84.5%,超越了 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。ExploitBench(需要根因推理和可工作的利用代码)从 24.4% 升至 54.4%。Mythos 5 为 78.0%。在 ExploitGym 上,GLM-5.3 在两小时内完成 105 个任务,六小时完成 130 个。GLM-5.2 完成 29 和 39。Mythos 5 完成 181 和 247。
模式是一致的。基准测试在利用链中越深入,相对 GLM-5.2 的提升就越大。与闭源前沿模型的差距也越大。
GLM-5.3 重用 GLM-5.2 基座模型;所有提升均来自后训练 scaling。
Terminal-Bench 3.0 从 4.6 升至 28.3;DeepSWE v1.1 从 46.2 升至 66.9。
CyberGym 达到 84.5%,领先 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
ExploitBench 翻倍以上至 54.4%,但仍落后 Mythos 5 的 78.0%。
权重约两周后发布,待安全评估和加固完成。