GLM-5.3 发布 756GB weights,支持 vLLM/SGLang 开箱即用,编程 benchmark 跳涨显著(Terminal-Bench 从 4.6 升至 28.3),但 license 限制需仔细审查。
Z.ai 刚刚发布了 GLM-5.3 的 weights:756 GB 模型文件分布在 141 个 Safetensors 分片中。这个数字几乎决定了越南开发者需要考虑的一切。
本文在你将 GLM-5.3 纳入技术栈之前,先剥开三层:真正的 release 包含什么、自host 的成本,以及 license 条款拦住谁。
发布包包含 756 GB 模型文件,分布在 141 个 Safetensors 分片中,原生支持 vLLM 和 SGLang。架构配置为 256 个 routed expert,每个 token 激活 8 个 expert,运行在 100 万 token 的上下文窗口上。
开箱即支持 vLLM 和 SGLang 是值得注意的细节:你无需等待社区移植 serving stack。
这是 release notes 中最重要的技术细节。Z.ai 保留了 GLM-5.2 的 base foundation——公司没有运行更大的预训练集群,也没有改变底层参数结构。
性能跃升来自 post-training:强化学习环境、任务验证 harness,以及软件工程和漏洞挖掘的专业数据。
Z.ai 公布的提升如下:Terminal-Bench 3.0 从 4.6 升至 28.3;DeepSWE 从 46.2 升至 66.9;ExploitBench 从 24.4 升至 54.4。
在相信这些数字之前,仔细看看页脚。根据 Dev.to 上的分析,这些是由 vendor 自己在特定 harness 配置下运行的评测——包括 40 万 token 上下文和每次 rollout 10 小时超时。作者直说,只有第三方在多种不同 serving stack 上复现后,才能看到实际运营中的波动。
对构建 agent 的开发者而言的实际意义:agent 能力越来越多地由 post-training 中的 scaffolding 和验证循环决定,而非原始预训练规模。一个模型能理解多轮 execution 并响应 sandbox 行为,与一个只擅长猜测下一个 code token 的模型表现截然不同。
756 GB weights 将未经量化的原生 self-host 推入了多 GPU 数据中心领域。即使进行 FP8 量化,根据分析,这仍然不是开发者的 workstation 或小型 homelab node 能跑得动的。
换言之:这里的 "open weights" 不意味着你下载下来就能跑。对于越南的大多数团队,主流路径仍然是 hosted endpoint。
Cloudflare 在发布当天就将 GLM-5.3 上了 Workers AI,公布的价格如下:
| Token 类型 | 每百万 token 价格 |
|---|---|
| Input | 1.40 美元 |
| Input(已缓存) | 0.26 美元 |
| Output | 4.40 美元 |
普通 input 和已缓存 input 之间的差距超过五倍。如果你的 workload 重复发送 system prompt 或同一段代码,设计让请求命中缓存是这里最大的成本杠杆。
Output 比 Input 贵三倍多也值得注意:生成大量 code 的 agent 会比只读和简短回答的 agent 更快烧钱。这个价格让你可以在不搭建自有 H100 集群的情况下尝试 coding 和漏洞分诊能力。
Z.ai 使用了一份自己起草的 open-weight license,授予广泛的运行、修改、分发和商业化权限。任何将模型功能嵌入产品的人都可以自由使用。
但 license 附带一个特定的商业条件:合并报表集团总收入超过 100 亿美元、以 Model-as-a-Service 平台运营的公司,在开放受控 API inference 或 fine-tuning 之前,必须通过 Z.ai 的安全审查。
这将开放分发分为两层。独立开发者、早期 startup,或运行内部自动化的企业均拥有完整访问权,无需申请。AWS、Microsoft Azure 或 Google Cloud 想直接向客户售卖 GLM-5.3 endpoint,则必须坐到审查席上。
对命名方式的影响:这不是 OSI 批准的 license,称其"无限制"是错误的。分析文章将此描述为针对云平台的防御机制——阻止他们从一个开源模型中榨取全部利润而不回馈计算资源或 license 收入。
对于越南的团队,这个门槛几乎不会影响你。只有当你打算以超大企业的名义转售 GLM-5.3 inference 时,它才重要。
Open weights 将运营责任推给部署方。当一个具备强大漏洞发现能力的模型运行在你的基础设施内部时,必须自行在宿主上验证网络分段、出口控制和工具权限。
分析文章用一句话总结,值得贴在技术部门墙上:vendor 提供 weights,而损害半径是你的。
如果你用 hosted endpoint 处理重活,其余部分仍需要有明确的规则。一篇 Dev.to 上的 local-first gateway 分析提出了三个路由标准:延迟容忍度、数据敏感度、并发量。
套用到 GLM-5.3 的场景:包含内部代码或客户数据的 prompt 适合留在本地用小模型跑,而需要 agent 长流程和并行多线程的任务则上推到 endpoint。那篇文章的作者指出,笔记本只能同时处理大约两条命令,而 hosted worker 能处理数十条。
如果你正在考虑将 GLM-5.3 用于 coding agent:从 hosted endpoint 开始,在自己的真实 workload 上测量实际成本,并设计 prompt 以利用 0.26 美元的缓存价格。
需要等待的是在不同 serving stack 上的独立复现结果。以上三个 benchmark 数字由 vendor 运行;等第三方数据出来时,先把它们当作上限,而非你在 production 中能达到的水平。
本文最初发表于 NextFuture。