前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8356
  • AI 自动化 SEO 实验:Claude Code 每日一更的 42 周数据
  • 数据漂移排查:先查滚动条再查数据库
  • Google 开源 DESIGN.md:让 AI 编码工具读懂视觉规范
  • 4美元/月 DigitalOcean + vLLM 部署 Claude 3.5 Haiku 推理服务
  • 强到弱脚手架:推理时提升弱模型性能的新方法
  • 我用OKF、CLAUDE.md和Skills大幅降低LLMToken消耗
  • Gemini 3.7 Flash 与 Qwen3.8-27B 发布:编程能力大幅提升
  • 4.8万星开源项目:在浏览器里跑完整AI Agent流水线
  • 给编程Agent一个可复现的失败,而非模糊需求
  • 多Agent系统规模化实战:Hermes与LobeHub架构复盘
  • 262k上下文模型在33k处崩溃的根因分析
  • AI基准测试平台Optima:用自有数据评估模型成本与性能
  • 用免费模型写一个最小复现服务器
  • CI不适合重复调用模型——改用免费服务器边车
  • MCP传输协议:stdio与HTTP如何选,及已废弃的旧版SSE方案
  • 用skilleval给Agent技能写自动化测试
  • 多租户Chatbot成本可视化的工程选型:OpenAI兼容API vs 原生API
  • 调查:五分之一美国工作者将任务委托给AI
  • 程序员视角:快速识别AI生成的网站
  • 认证聊天机器人流式后端的测试策略
  • GLM 5.3发布:基于5.2后训练刷新,编程评测开源SOTA
  • Code Agent运行机制详解:ReAct循环的工程实现
  • SharePoint 认证绕过漏洞 CVE-2026-55040 PoC 已公开
  • Node.js 长文本摘要:结构化输出校验与分块策略
  • 千问办公公测:GLM-5.3 与 DeepSeek V4 Pro 可直接选用
  • DeepSeek Harness 引发 Node.js 安装潮
  • GPT-5.6推理token按输出计费:成本估算可能偏差4倍
  • 开源模型评测工具:上线前用测试用例验证便宜模型
  • Anthropic缓存命中率低:实际节省分析
  • 多模态 LLM 生产级成本优化:视觉输入压缩与路由策略
  • SpaceX 60亿美元收购 Anysphere:Origin git平台才是真正的标的
  • DeepSeek 峰谷定价实战:Spring Boot 调度模式压榨成本
  • 昇腾 0 Day 适配小红书 dots3-note:全模态+投机解码
  • LabLLM:Mac 原生 App 从零训练小型语言模型
  • CLI-Anything:用标准接口让所有软件获得AI Agent原生支持
  • 长上下文没有杀死RAG:成本、延迟、可靠性三大陷阱
  • 一条YAML微调8B模型:4GB显存本地即可
  • 上下文已成平台能力:内部平台团队的新责任
  • 别信"完成了":强制AI Agent在报告前重新拉取真实状态
  • AI通过律师资格考试却不会比大小:理解AI的「参差不齐前沿」
  • Codex自动化研究:CUDA内核232倍加速实战
  • MCP令牌压缩91%:JSON Schema优化实践
  • Anthropic红队:多Agent冲突可升级为对抗行为
  • AI内容检测工具本质是玄学:连美国宪法都被误判为机器生成
  • Agent权限设计:批准前应展示被拒绝的替代方案
  • 新手用 Node.js 做内置聊天机器人:OpenAI 兼容接口是更优起点
  • 免费AI模型的危险命令如何通过许可证机制化险为夷
  • AI模型路由:为何单一LLM无法应对所有工作负载
  • 利用32k上下文窗口进行全仓库代码审查
  • MCP 协议 16 个月增长 970 倍:AI 应用的 USB-C 时刻来临
  • 2026 年开发者调研:Claude Code 登顶最受喜爱 AI 编程工具,Copilot 失势
  • 已加载 51 / 8356
8.0
热点
AI SCORE
模型发布2026-08-16 12:34

GLM 5.3发布:基于5.2后训练刷新,编程评测开源SOTA

dev.to · AI#GLM#大模型#编程评测
Editor brief · 编辑速览

GLM 5.3于2026年8月14日发布,复用GLM 5.2基座,所有提升来自后训练;上下文128K输出、1M token窗口,Terminal Bench 3.0从4.6跃升至28.3;权重约两周后开源。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

GLM 5.3 于 2026-08-14 发布,仅过了一天,独立 API 仍标注为"即将上线",所以目前所有第一方调用通道都经由 GLM Coding Plan。该模型复用了 GLM 5.2 的基座,性能提升完全来自后训练。权重文件承诺约两周后放出。

发布时间:2026-08-14(Z.ai 发布说明)

基座模型:与 GLM 5.2 相同,所有增益来自后训练

上下文:1M tokens,最大输出 128K(Z.ai 模型页面)

开放权重:尚未,Z.ai 预计约两周

编程能力:Terminal Bench 3.0 从 4.6 提升至 28.3,开源 SOTA

Breaking API 变更:thinking.type "disabled" 已移除;reasoning_effort 支持 low/high/max

当前访问方式:GLM Coding Plan、ZCode、Claude Code / Cline / OpenCode

独立 API:标注"即将上线",无具体日期

尚未收录:OpenRouter、gateway 目录、HuggingFace

这是 GLM 5.2 的后训练刷新版,而非新模型家族。Z.ai 在发布说明中明确表示,该模型"与 GLM-5.2 使用相同的基座模型","所有增益均来自后训练。"

  • 与 z-ai/glm-5.2 基座权重相同,在此基础上额外进行了一个月的强化学习训练
  • 在合成的长时序环境中训练,其中部分模拟了资深工程师数天的工作量
  • 目标明确指向 Agent 编程:终端任务、代码库级别工作、多步工具调用
  • 同时上线了一个大规模安全研究板块

r/LocalLLaMA 发布帖在数小时内获得了 800+ upvotes,正评率 0.99,热评聚焦于一个细节:一款 743B 量级的模型与更大体量的模型正面交锋。该参数数字是社区推算,并非官方规格,因此不作为事实引用。

GLM 5.3 何时发布?

2026-08-14,当日即面向 GLM Coding Plan 订阅用户开放。

发布节奏不均衡,在搜索之前值得了解:

模型页面在公告后一天才上线,这是正常的发布形态:首日以发布说明为准,文档随后跟进。对于按 token 计费的用户来说,最关键的文档——即定价——至今尚未更新。

GLM 5.3 是开源的吗?

尚未开源。Z.ai 承诺在上线后约两周发布权重,"待安全评估与加固完成后"。

HuggingFace 仓库 zai-org/GLM-5.3 已存在,通过 API 访问返回 401,而 zai-org/GLM-5.2 返回 200。401 而非 404 表明仓库已创建但处于 gated 状态,并非不存在。这更符合有计划的发布节奏,而非模糊的意向,但附有两周期限的承诺终究还是承诺。

上一次等待的时长有先例可循。Simon Willison 在 2026-06-17 写道:"中国 AI 实验室 Z.ai 于 6 月 13 日向 Coding Plan 订阅用户发布 GLM-5.2,随后在 6 月 16 日以 MIT 许可证发布了完整的开放权重。"上一次等了三天,这一次声明两周。许可证也值得留意,因为 5.2 采用 MIT,Z.ai 尚未说明 5.3 将采用何种许可证。

如果本周就需要权重,GLM 5.2 仍是选项。GLM 5.2 本地部署指南涵盖了 GGUF 量化文件及各规格的需求,自托管硬件与成本分解有 vLLM 的数字。由于 5.3 与 5.2 基座相同,内存占用和服务形态应基本不变——这是纯后训练发布的唯一好处:容量规划不会重置。

GLM 5.3 定价多少?

Z.ai 尚未公布 GLM 5.3 的按 token 价格,配套的独立 API 也未开放。其开发者文档中的定价表截至本快照为止仍停留在 GLM 5.2。

目前有据可查的信息:

从该定价表可得出三个结论。所有通道均无免费层级,因此最低入门门槛是订阅 Coding Plan 而非试用 Key。高峰时段之外的费率覆盖了每周 20 小时窗口以外的时段,含周末,因此夜间运行的批处理任务默认按半价计费,而非需要谈判。在 5.3 的定价行出现之前,任何引用 GLM 5.3 按 token 价格的人都是在以 5.2 推算。

GLM 5.3 的上下文窗口是多大?

1M tokens,文档记录的最大输出为 128K。Z.ai 的 GLM-5.3 模型页面列明了这两项,智谱的中文文档也给出了相同数字。

Z.ai 自评并非全部跑在该上限上,这对了解模型实际在哪些场景下被验证过是一个有用的信号:

如果打算充分使用这 100 万 token 的上下文,这个差异就很重要。1M 是模型接受的输入上限;400K 是 Z.ai 为其核心编程评测套件选择的上限。最终服务 5.3 的端点也可能自行设定一个更低的上限,因此提供商的数字才是操作依据。

GLM 5.3 的编程能力提升了多少?

在新一代 Agent 基准上提升显著,在已饱和的基准上提升有限。以下所有数字均来自 Z.ai 官方。Terminal Bench、SWE-Marathon 和 Agents' Last Exam 使用 Claude Code 2.1.207 评测框架并以最大推理强度运行;DeepSWE 使用 mini-swe-agent。

Terminal Bench 3.0 这条线承担了主要论证:在 GLM 5.2 几乎无竞争力的评测套件上从 4.6 提升到 28.3。在 Terminal Bench 2.1 上(所有模型都在 85–89 之间),同样的升级带来 7 分提升但不影响排名。新基准有空间展现差距,旧的没有。

Z.ai 重点宣传的不是分数。在 High 推理强度下,GLM 5.3 在其内部 Code Bench 上以每任务约 50K 输出 tokens 达到 31.4%,而 Claude Opus 4.8 以 120K 输出 tokens 达到 29.5%。

这才是值得独立验证的声明,因为按量付费的正是 token 数量。Z.ai 还报告了约 75K tokens 在 Max 推理强度下达 34.5%,而 GLM 5.2 在 96K tokens 下为 23.4%。该私有基准上 Claude Fable 5 仍以 39.5% 领先,GPT-5.6 Sol 仍在 Terminal Bench 3.0 领先,因此"开源 SOTA"是准确的措辞,而非"SOTA"。

整张表的一个注意事项:这是一份私有基准加厂商运行的公共基准。Kimi K3 和 Claude Opus 4.8 的数字由 Z.ai 产出,而非其厂商。

使用 GLM 5.3 需要修改代码吗?

需要,如果你曾经关闭过 thinking。thinking.type: "disabled" 已移除,Z.ai 表示请求将直接报错。

  • thinking.type 仅接受 enabled
  • reasoning_effort 接受 low、high、max,默认为 max
  • Z.ai 推荐编程场景使用 max

迁移顺序很重要:先设置 enabled 加 reasoning_effort: "low",再替换模型 ID

{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

关闭 thinking 的代价容易被低估,因此在 2026-08-14 通过 OpenAI 兼容端点在 GLM 5.2 上做了测量。简单 prompt:"仅回复一个词:ok",每种配置跑三次:

在如此小的 prompt 上,thinking 模式之间的运行差异淹没了 low 与 max 之间的差异,因此不要从这三行中读出顺序关系。重要的是最后一行。关闭 thinking 每次都以 2 个输出 token 回答;最便宜的 thinking 开启设置也消耗了 69 到 122 个 token。在 GLM 5.3 上,最后这一行已不复存在。

如果使用 GLM 做分类、路由、提取或任何其他高流量短回答任务,这就是切换前需要核算成本的迁移,而 low 现在是最低档。GLM 5.2 与 GPT-5.5 的成本对比有这类流量负载的详细计算。

GLM 5.3 支持哪些能力?

文本输入、文本输出,外加 thinking 模式、流式输出、函数调用、上下文缓存、结构化输出和 MCP。Z.ai 模型页面列出了全部六项;智谱的中文页面列出了除 MCP 外的相同集合。

相对于 GLM 5.2 没有任何新增能力,这与纯后训练发布的定位一致。视觉、图片和音频能力仍在独立的 GLM-5V 和 GLM-Image 产品线上。

如何访问 GLM 5.3?

目前通过 GLM Coding Plan、ZCode 或支持指向 Z.ai 的任意编程 Agent。按 token 计费的 API 尚未开放。

智谱已提前公布了 API 上线后的端点地址:https://open.bigmodel.cn/api/paas/v4 用于 OpenAI Chat Completions 协议,/api/v1 用于 OpenAI Responses 协议,/api/anthropic 用于 Anthropic Messages 协议。同一份说明中有一个容易被忽略的注意事项:凡曾经订阅过 GLM Coding Plan 的账户(含已过期的),目前只能使用 Chat Completions 协议。

任何 OpenAI 兼容的客户端只需两行改动即可接入(一旦你的供应商列出该模型):

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")

r = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
    reasoning_effort="low",   # "disabled" 在 5.3 上已不可用
)
print(r.usage)

在该 catalog 更新之前运行会得到预期的报错,这值得了解,以免去排查认证 Bug:

{"error":{"message":"Model 'z-ai/glm-5.3' not found","type":"model_not_found","code":404}}

z-ai/glm-5.2 目前在同一端点上可以响应,因此端点、Key 和请求结构在 5.3 出现时已全部就绪。GLM 5.2 API 访问指南涵盖了 Key 设置的完整流程。

如何将编程 Agent 指向一个昨天才发布的模型?

改一个字符串即可——如果你的 Agent 支持自行设置端点。发布周总是呈现相同形态:订阅产品有模型,计量 API 没有,文档页迟到一天,每个工具都维护着一份硬编码的模型列表。2026-08-15 这一天,GLM 5.3 在两个方向上都存在这道gap:Coding Plan 订阅用户在跑它,而 OpenRouter、gateway 目录没有可售商品,HuggingFace 仓库也锁着。

你能控制的部分是:一个新模型需要多少重新配置的成本。支持设置 base_url 和 model 字符串的 Agent 将发布视为一行代码的改动。内置固定下拉菜单的 Agent 则需要等待其发布周期,这也是 r/opencodeCLI 帖子在公告发布一小时内就出现的原因。

由于 Claude Code、OpenCode 和大多数其他 Agent 都使用 OpenAI 兼容 HTTP,一个 Key 配一个 base_url 让它们全部共享同一套计费和故障转移。通过 ofox 在 2026-08-31 前购买充值可享 85 折,该端点上托管了约 130 个模型,GLM 5.2 在列。本快照时点 GLM 5.3 尚未收录,上面代码块中的内容就是它上线时需要改动的地方。

GLM 5.3 vs GLM 5.2:实际变了什么?

后训练层面变了,以及三件你可以采取行动的事:thinking 关闭开关没了、权重尚未可下载、Terminal Bench 3.0 分数从 4.6 升至 28.3。

如果本周需要可下载的权重、已公布的定价、按 token 计费、或关闭 thinking 以降低短调用成本,选 GLM 5.2。如果工作属于长时序 Agent 编程且走 Coding Plan 订阅,选 GLM 5.3——差距只在这种情况下才是戏剧性的。

相关链接:

  • Z.ai 发布说明:GLM-5.3
  • Z.ai 开发者文档:GLM-5.3 模型页面
  • Z.ai 开发者文档:定价
  • Z.ai devpack 文档:GLM Coding Plan 概览
  • 智谱 AI 文档:GLM-5.3
  • OpenRouter 模型列表
  • r/LocalLLaMA:GLM 5.3 发布讨论
  • r/opencodeCLI:GLM 5.3 已有!
  • Simon Willison:GLM-5.2 可能是最强大的纯文本开放权重 LLM
  • ofox 模型页面:GLM 5.2

常见问题

GLM 5.3 独立 API 现在可用吗?

尚不可用。Z.ai 模型页面顶部有横幅写着"GLM-5.3 API 即将上线",智谱的中文文档同样如此,两处均未给出上线日期。GLM 5.3 已面向所有 GLM Coding Plan 订阅用户开放,这是目前唯一的第一方调用通道。

GLM 5.3 最大输出长度是多少?

128K tokens,配套 1M token 上下文窗口,来源于 Z.ai 模型页面。Z.ai 自评跑分在此上限或以下:Terminal Bench 3.0 和 PostTrainBench 输出 128K,Agents' Last Exam 输出 64K。最终服务该模型的端点也可能自行设定一个更低的上限。

GLM 5.3 能配合 Claude Code 使用吗?

可以。Z.ai 列出 Claude Code、Cline 和 OpenCode 为 GLM Coding Plan 支持的编程工具,且其自评使用了 Claude Code 2.1.207 评测框架。请设置 reasoning_effort 而不是关闭 thinking,因为该模型不再接受关闭 thinking。

GLM 5.3 比 Kimi K3 更好吗?

在 Z.ai 官方表格上,GLM 5.3 在 Terminal Bench 3.0 以 28.3 对 17.4 取胜,在 AutomationBench 以 48.2 对 46.7 取胜;而 Kimi K3 在 Toolathlon 以 76.5 对 73.0 领先,在 SWE-Marathon 以 48.1 对 42.5 领先。这些数字全部由 Z.ai 自行发布,应视为待验证的声明而非独立结果。

GLM 5.3 使用新的基座模型了吗?

没有。Z.ai 明确表示 GLM 5.3 使用与 GLM 5.2 相同的基座模型,所有增益均来自后训练。发布说明开篇即写道:"扩展后训练是 GLM-5.3 的全部工作。"

GLM 5.3 有免费层级吗?

没有免费层级。第一天访问需通过点数制 GLM Coding Plan 或 ZCode。在工作日 14:00 至 18:00 UTC+8 高峰时段以外的呼叫消耗标准点数的一半,这是目前最接近折扣的选项。

在哪里可以下载 GLM 5.3 权重?

目前无处可下。HuggingFace 仓库 zai-org/GLM-5.3 已存在但尚未公开,通过 HuggingFace API 访问返回 401,而 GLM 5.2 返回 200。Z.ai 表示权重将在上线后约两周发布,待安全评估与加固完成。

原文首发于 ofox.ai/blog。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
认证聊天机器人流式后端的测试策略
下一篇
Code Agent运行机制详解:ReAct循环的工程实现