Z.ai发布GLM-5.3,与GLM-5.2基座相同但编程能力显著提升,文中分析了训练策略与后处理技术的贡献。
Z.ai 于周五发布了 GLM-5.3,这是一款编程与 Agent 模型,基于与 GLM-5.2 相同的基座模型构建。开发者已可通过 Z.ai 的 GLM Coding Plan 使用 GLM-5.3,支持 Claude Code、Cline、OpenCode 和 Codex。直接 API 访问仍标注为"即将上线",因为 Z.ai 计划在两周的强化与安全测试后再发布模型权重。
后训练承担了核心工作
Z.ai 大幅扩展了 GLM-5.3 的后训练规模,让模型接触了十倍数量的长周期任务环境,同时拓宽了其对开发者工具和工程工作流的访问权限。
部分训练任务模拟了完整的软件生命周期——从识别 bug、起草修复方案,到编写代码、运行测试并交付结果。Z.ai 表示,单个任务的工作量就相当于高级工程师数天的工作量。
Z.ai 将算力集中在模型实际工作的特定环境上。
这使 GLM-5.3 成为后训练算力扩展的一个有力案例研究。Z.ai 将算力集中在模型实际工作的特定环境上。他们并非孤例——DeepSeek 最近证明,一个更小的模型可以通过优化后训练而非扩大参数规模来超越其旗舰对手。
基准测试跃升,但需谨慎看待
Z.ai 声称 GLM-5.3 在其内部 Code Bench 上比 GLM-5.2 提升了 50% 的性能,不过供应商自报的数值在社区测试已发布权重前需要保持常规的谨慎。然而在公开评测中,该模型在 Agent 编程方面表现出了显著的提升。GLM-5.3 在 Terminal-Bench 3.0 上从 4.6 跃升至 28.3,在 DeepSWE v1.1 上从 46.2 提升至 66.9,并在 Agents' Last Exam 上从 23.8 微升至 28.5。66.9 的 DeepSWE 得分与 Google 的 Gemini 3.7 Flash(65%)并驾齐驱,不过测试框架的差异意味着直接对比仍需持保留态度。
长上下文有多个努力层级
GLM-5.3 拥有 100 万 token 的上下文窗口和 12.8 万 token 的输出上限,足以容纳超大型代码库。开发者可在 Claude Code 中通过 glm-5.3[1m] 模型标签和匹配的 100 万 token 压缩窗口来配置更大的上下文。
推理努力程度可在 low、high 和 max 三档之间配置(max 为默认启用)。虽然推荐用于非平凡的工程任务,但 max 推理会引入明显的延迟和 token 开销。团队需要评估下游的准确性提升是否值得额外的算力成本。Z.ai 声称模型优化了延迟、token 效率和正确性之间的权衡,但官方按 token 计费的 API 价格尚未公布。
虽然这对方便那些只想用上最新模型的开发者来说是好事,但也为团队试图在相同计划下对先前版本进行干净的 A/B 对比制造了一个盲点。
这一空白反映了围绕 Agent 经济学的持续市场再平衡。在 OpenAI 激进降价和 Microsoft 引入 token 上限以防止失控的自主 Agent 之间,长期 Agent 计算的定价仍然是一个动态目标。在 Z.ai 的 Coding Plan 中,使用量按积分计量:GLM-5.3 的输入、缓存输入和输出 token 的基础乘数比 GLM-4.7 更高,但有 50% 的非高峰期折扣来抵消。
有一个迁移问题值得留意。根据 Z.ai 的文档,Coding Plan 对 GLM-5.2 或 GLM-5.1 的调用会自动重定向到 GLM-5.3。虽然这对方便那些只想用上最新模型的开发者来说是好事,但也为团队试图在相同计划下对先前版本进行干净的 A/B 对比制造了一个盲点。请务必仔细核对实际返回的模型 ID。
安全能力在利用阶段见顶
Z.ai 正在将网络安全定位为 GLM-5.3 的一项新兴优势。该模型在 CyberGym 上得分 84.5%,高于 GLM-5.2 的 77.2%。Z.ai 报告称这勉强超越了 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。
GLM-5.3 在需要利用它发现的漏洞时表现就不那么出色了。其 ExploitBench 得分从 24.4% 翻倍以上至 54.4%,但仍落后于 Mythos 5 的 78% 和 GPT-5.6 Sol 的 76.5%。这些结果遵循了前沿 AI 实验室中观察到的一种模式:OpenAI 最近专门为网络安全工作构建了一个模型,并推迟了另一个模型的发布,原因是担心其攻击能力在现实世界中的影响。
Z.ai 承认,该模型目前在利用链的早期阶段表现更强,包括审查源代码和验证漏洞,而非完成更深入的进攻性安全任务。但请对这些高的白盒审查分数保持谨慎。众所周知,可靠地构造漏洞利用、证明生产环境的真实可达性,或在不引发下游回归的情况下修复漏洞,是一项完全不同的挑战。
可靠地构造漏洞利用、证明生产环境的真实可达性,或在不引发下游回归的情况下修复漏洞,是一项完全不同的挑战。
权重两周后发布
GLM-5.3 已可在 GLM Coding Plan 中通过 Anthropic 兼容和 OpenAI 兼容端点进行选择。用户可将其连接到 Claude Code、Codex 或其他支持自定义模型配置的 Agent。Z.ai 的模型切换指南提供了所需的端点和设置。
更具影响力的发布计划在两周后进行。一旦权重可用,开发者将能够测试基准测试的改进是否能迁移到本地部署、不同的推理栈以及 Z.ai 未选择的代码仓库。这种等待并不陌生——Moonshot 在类似条件下发布了 Kimi K3 的权重,"宣布开放权重"与"能实际运行的权重"之间的gap已成为开源模型领域的常见模式。