GLM 5.3于2026年8月14日发布,复用GLM 5.2基座,所有提升来自后训练;上下文128K输出、1M token窗口,Terminal Bench 3.0从4.6跃升至28.3;权重约两周后开源。
GLM 5.3 于 2026-08-14 发布,仅过了一天,独立 API 仍标注为"即将上线",所以目前所有第一方调用通道都经由 GLM Coding Plan。该模型复用了 GLM 5.2 的基座,性能提升完全来自后训练。权重文件承诺约两周后放出。
发布时间:2026-08-14(Z.ai 发布说明)
基座模型:与 GLM 5.2 相同,所有增益来自后训练
上下文:1M tokens,最大输出 128K(Z.ai 模型页面)
开放权重:尚未,Z.ai 预计约两周
编程能力:Terminal Bench 3.0 从 4.6 提升至 28.3,开源 SOTA
Breaking API 变更:thinking.type "disabled" 已移除;reasoning_effort 支持 low/high/max
当前访问方式:GLM Coding Plan、ZCode、Claude Code / Cline / OpenCode
独立 API:标注"即将上线",无具体日期
尚未收录:OpenRouter、gateway 目录、HuggingFace
这是 GLM 5.2 的后训练刷新版,而非新模型家族。Z.ai 在发布说明中明确表示,该模型"与 GLM-5.2 使用相同的基座模型","所有增益均来自后训练。"
r/LocalLLaMA 发布帖在数小时内获得了 800+ upvotes,正评率 0.99,热评聚焦于一个细节:一款 743B 量级的模型与更大体量的模型正面交锋。该参数数字是社区推算,并非官方规格,因此不作为事实引用。
2026-08-14,当日即面向 GLM Coding Plan 订阅用户开放。
发布节奏不均衡,在搜索之前值得了解:
模型页面在公告后一天才上线,这是正常的发布形态:首日以发布说明为准,文档随后跟进。对于按 token 计费的用户来说,最关键的文档——即定价——至今尚未更新。
尚未开源。Z.ai 承诺在上线后约两周发布权重,"待安全评估与加固完成后"。
HuggingFace 仓库 zai-org/GLM-5.3 已存在,通过 API 访问返回 401,而 zai-org/GLM-5.2 返回 200。401 而非 404 表明仓库已创建但处于 gated 状态,并非不存在。这更符合有计划的发布节奏,而非模糊的意向,但附有两周期限的承诺终究还是承诺。
上一次等待的时长有先例可循。Simon Willison 在 2026-06-17 写道:"中国 AI 实验室 Z.ai 于 6 月 13 日向 Coding Plan 订阅用户发布 GLM-5.2,随后在 6 月 16 日以 MIT 许可证发布了完整的开放权重。"上一次等了三天,这一次声明两周。许可证也值得留意,因为 5.2 采用 MIT,Z.ai 尚未说明 5.3 将采用何种许可证。
如果本周就需要权重,GLM 5.2 仍是选项。GLM 5.2 本地部署指南涵盖了 GGUF 量化文件及各规格的需求,自托管硬件与成本分解有 vLLM 的数字。由于 5.3 与 5.2 基座相同,内存占用和服务形态应基本不变——这是纯后训练发布的唯一好处:容量规划不会重置。
Z.ai 尚未公布 GLM 5.3 的按 token 价格,配套的独立 API 也未开放。其开发者文档中的定价表截至本快照为止仍停留在 GLM 5.2。
目前有据可查的信息:
从该定价表可得出三个结论。所有通道均无免费层级,因此最低入门门槛是订阅 Coding Plan 而非试用 Key。高峰时段之外的费率覆盖了每周 20 小时窗口以外的时段,含周末,因此夜间运行的批处理任务默认按半价计费,而非需要谈判。在 5.3 的定价行出现之前,任何引用 GLM 5.3 按 token 价格的人都是在以 5.2 推算。
1M tokens,文档记录的最大输出为 128K。Z.ai 的 GLM-5.3 模型页面列明了这两项,智谱的中文文档也给出了相同数字。
Z.ai 自评并非全部跑在该上限上,这对了解模型实际在哪些场景下被验证过是一个有用的信号:
如果打算充分使用这 100 万 token 的上下文,这个差异就很重要。1M 是模型接受的输入上限;400K 是 Z.ai 为其核心编程评测套件选择的上限。最终服务 5.3 的端点也可能自行设定一个更低的上限,因此提供商的数字才是操作依据。
在新一代 Agent 基准上提升显著,在已饱和的基准上提升有限。以下所有数字均来自 Z.ai 官方。Terminal Bench、SWE-Marathon 和 Agents' Last Exam 使用 Claude Code 2.1.207 评测框架并以最大推理强度运行;DeepSWE 使用 mini-swe-agent。
Terminal Bench 3.0 这条线承担了主要论证:在 GLM 5.2 几乎无竞争力的评测套件上从 4.6 提升到 28.3。在 Terminal Bench 2.1 上(所有模型都在 85–89 之间),同样的升级带来 7 分提升但不影响排名。新基准有空间展现差距,旧的没有。
Z.ai 重点宣传的不是分数。在 High 推理强度下,GLM 5.3 在其内部 Code Bench 上以每任务约 50K 输出 tokens 达到 31.4%,而 Claude Opus 4.8 以 120K 输出 tokens 达到 29.5%。
这才是值得独立验证的声明,因为按量付费的正是 token 数量。Z.ai 还报告了约 75K tokens 在 Max 推理强度下达 34.5%,而 GLM 5.2 在 96K tokens 下为 23.4%。该私有基准上 Claude Fable 5 仍以 39.5% 领先,GPT-5.6 Sol 仍在 Terminal Bench 3.0 领先,因此"开源 SOTA"是准确的措辞,而非"SOTA"。
整张表的一个注意事项:这是一份私有基准加厂商运行的公共基准。Kimi K3 和 Claude Opus 4.8 的数字由 Z.ai 产出,而非其厂商。
需要,如果你曾经关闭过 thinking。thinking.type: "disabled" 已移除,Z.ai 表示请求将直接报错。
迁移顺序很重要:先设置 enabled 加 reasoning_effort: "low",再替换模型 ID
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
关闭 thinking 的代价容易被低估,因此在 2026-08-14 通过 OpenAI 兼容端点在 GLM 5.2 上做了测量。简单 prompt:"仅回复一个词:ok",每种配置跑三次:
在如此小的 prompt 上,thinking 模式之间的运行差异淹没了 low 与 max 之间的差异,因此不要从这三行中读出顺序关系。重要的是最后一行。关闭 thinking 每次都以 2 个输出 token 回答;最便宜的 thinking 开启设置也消耗了 69 到 122 个 token。在 GLM 5.3 上,最后这一行已不复存在。
如果使用 GLM 做分类、路由、提取或任何其他高流量短回答任务,这就是切换前需要核算成本的迁移,而 low 现在是最低档。GLM 5.2 与 GPT-5.5 的成本对比有这类流量负载的详细计算。
文本输入、文本输出,外加 thinking 模式、流式输出、函数调用、上下文缓存、结构化输出和 MCP。Z.ai 模型页面列出了全部六项;智谱的中文页面列出了除 MCP 外的相同集合。
相对于 GLM 5.2 没有任何新增能力,这与纯后训练发布的定位一致。视觉、图片和音频能力仍在独立的 GLM-5V 和 GLM-Image 产品线上。
目前通过 GLM Coding Plan、ZCode 或支持指向 Z.ai 的任意编程 Agent。按 token 计费的 API 尚未开放。
智谱已提前公布了 API 上线后的端点地址:https://open.bigmodel.cn/api/paas/v4 用于 OpenAI Chat Completions 协议,/api/v1 用于 OpenAI Responses 协议,/api/anthropic 用于 Anthropic Messages 协议。同一份说明中有一个容易被忽略的注意事项:凡曾经订阅过 GLM Coding Plan 的账户(含已过期的),目前只能使用 Chat Completions 协议。
任何 OpenAI 兼容的客户端只需两行改动即可接入(一旦你的供应商列出该模型):
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")
r = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
reasoning_effort="low", # "disabled" 在 5.3 上已不可用
)
print(r.usage)
在该 catalog 更新之前运行会得到预期的报错,这值得了解,以免去排查认证 Bug:
{"error":{"message":"Model 'z-ai/glm-5.3' not found","type":"model_not_found","code":404}}
z-ai/glm-5.2 目前在同一端点上可以响应,因此端点、Key 和请求结构在 5.3 出现时已全部就绪。GLM 5.2 API 访问指南涵盖了 Key 设置的完整流程。
改一个字符串即可——如果你的 Agent 支持自行设置端点。发布周总是呈现相同形态:订阅产品有模型,计量 API 没有,文档页迟到一天,每个工具都维护着一份硬编码的模型列表。2026-08-15 这一天,GLM 5.3 在两个方向上都存在这道gap:Coding Plan 订阅用户在跑它,而 OpenRouter、gateway 目录没有可售商品,HuggingFace 仓库也锁着。
你能控制的部分是:一个新模型需要多少重新配置的成本。支持设置 base_url 和 model 字符串的 Agent 将发布视为一行代码的改动。内置固定下拉菜单的 Agent 则需要等待其发布周期,这也是 r/opencodeCLI 帖子在公告发布一小时内就出现的原因。
由于 Claude Code、OpenCode 和大多数其他 Agent 都使用 OpenAI 兼容 HTTP,一个 Key 配一个 base_url 让它们全部共享同一套计费和故障转移。通过 ofox 在 2026-08-31 前购买充值可享 85 折,该端点上托管了约 130 个模型,GLM 5.2 在列。本快照时点 GLM 5.3 尚未收录,上面代码块中的内容就是它上线时需要改动的地方。
后训练层面变了,以及三件你可以采取行动的事:thinking 关闭开关没了、权重尚未可下载、Terminal Bench 3.0 分数从 4.6 升至 28.3。
如果本周需要可下载的权重、已公布的定价、按 token 计费、或关闭 thinking 以降低短调用成本,选 GLM 5.2。如果工作属于长时序 Agent 编程且走 Coding Plan 订阅,选 GLM 5.3——差距只在这种情况下才是戏剧性的。
相关链接:
GLM 5.3 独立 API 现在可用吗?
尚不可用。Z.ai 模型页面顶部有横幅写着"GLM-5.3 API 即将上线",智谱的中文文档同样如此,两处均未给出上线日期。GLM 5.3 已面向所有 GLM Coding Plan 订阅用户开放,这是目前唯一的第一方调用通道。
GLM 5.3 最大输出长度是多少?
128K tokens,配套 1M token 上下文窗口,来源于 Z.ai 模型页面。Z.ai 自评跑分在此上限或以下:Terminal Bench 3.0 和 PostTrainBench 输出 128K,Agents' Last Exam 输出 64K。最终服务该模型的端点也可能自行设定一个更低的上限。
GLM 5.3 能配合 Claude Code 使用吗?
可以。Z.ai 列出 Claude Code、Cline 和 OpenCode 为 GLM Coding Plan 支持的编程工具,且其自评使用了 Claude Code 2.1.207 评测框架。请设置 reasoning_effort 而不是关闭 thinking,因为该模型不再接受关闭 thinking。
GLM 5.3 比 Kimi K3 更好吗?
在 Z.ai 官方表格上,GLM 5.3 在 Terminal Bench 3.0 以 28.3 对 17.4 取胜,在 AutomationBench 以 48.2 对 46.7 取胜;而 Kimi K3 在 Toolathlon 以 76.5 对 73.0 领先,在 SWE-Marathon 以 48.1 对 42.5 领先。这些数字全部由 Z.ai 自行发布,应视为待验证的声明而非独立结果。
GLM 5.3 使用新的基座模型了吗?
没有。Z.ai 明确表示 GLM 5.3 使用与 GLM 5.2 相同的基座模型,所有增益均来自后训练。发布说明开篇即写道:"扩展后训练是 GLM-5.3 的全部工作。"
GLM 5.3 有免费层级吗?
没有免费层级。第一天访问需通过点数制 GLM Coding Plan 或 ZCode。在工作日 14:00 至 18:00 UTC+8 高峰时段以外的呼叫消耗标准点数的一半,这是目前最接近折扣的选项。
在哪里可以下载 GLM 5.3 权重?
目前无处可下。HuggingFace 仓库 zai-org/GLM-5.3 已存在但尚未公开,通过 HuggingFace API 访问返回 401,而 GLM 5.2 返回 200。Z.ai 表示权重将在上线后约两周发布,待安全评估与加固完成。
原文首发于 ofox.ai/blog。