智谱发布 GLM-5.3-Flash(3200 亿参数),在 Intelligence Index 仅落后 GLM-5.3 三分,费用为后者的七分之一,全程跑在中国芯(非 Nvidia)上。
Z.ai 发布了 GLM-5.3-Flash,这是一款拥有 3200 亿参数、100 万 token 上下文窗口的模型。
在 Intelligence Index 基准上,它几乎追平了更大的 GLM-5.3,但每任务仅需 0.09 美元,约为后者的七分之一。
模型完全运行在中国 AI 芯片上,Z.ai 自研软件达到了与 Nvidia GPU 相当的效率。
Z.ai 的新 GLM-5.3-Flash 模型性价比出色,存在明显短板,但在基础设施层面值得关注。
据 Z.ai 介绍,GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型。它拥有 3200 亿参数,其中仅 180 亿处于激活状态,采用 MIT 许可证发布,提供 100 万 token 的上下文窗口。模型权重已在 Hugging Face 上开放下载。
Artificial Analysis 的测试数据显示,在最大推理负载下,该模型在 Intelligence Index 上获得 57 分,仅以 3 分之差落后于 60 分的 GLM-5.3,与 GPT-5.6 Terra 和 Muse Spark 1.2 处于同一水平。
真正引人注目的是价格。基准测试中每任务成本为 0.09 美元,而 GLM-5.3 需 0.68 美元,约为后者的七分之一。Artificial Analysis 指出,这使得该模型处于智能与成本的帕累托前沿,同时它也加入了一份不断增长的中国模型清单——这些模型近期对西方提供商施加了巨大的价格压力。
在 Intelligence Index 上,GLM-5.3-Flash 获得 57 分,位于成本与智能最具吸引力的象限。| 图片来源:Artificial Analysis

在 Z.ai 的 API 上,GLM-5.3-Flash 每百万输入 token 收费 0.15 美元,每百万输出 token 收费 0.50 美元,约为 GLM-5.3 价格的十分之一。在 Agent 任务上,该模型与其更大版本保持同步。在 GDPval-AA v2 上,它达到约 1770 的 Elo 分数,与 GLM-5.3 和 Grok 4.6 持平,仅次于 Claude Opus 5。不过它仍然存在 token 效率问题。Artificial Analysis 发现,其消耗的输出 token 中约 90% 用于推理。
上线前,Z.ai 以"ox-alpha"为名在 OpenCode 和 OpenRouter 上进行了匿名测试,在这两个平台上它成为了当周最受欢迎的模型。有趣的是,据 Z.ai 介绍,所有这些流量都运行在中国 AI 芯片上。
SemiAnalysis 报告称其每天处理 100 万亿个 token,这一容量水平此前被认为是前沿实验室才能达到的。Z.ai 表示其硬件效率和每个 token 的成本与常规 Nvidia GPU 持平。SemiAnalysis 将此视为继 OpenAI 新芯片结果之后对"CUDA 护城河"的又一次检验。
CUDA 是 Nvidia 在 AI 软件和显卡之间的编程层。它发展了近 20 年,几乎每个 AI 框架都针对它进行了优化。切换到其他芯片意味着重做这些工作:重新编程计算操作、调整内存访问、寻找瓶颈。
因此,Z.ai 在 SGLang 之上构建了自己的服务软件,并将处理分成可独立扩展的阶段。该团队表示,与同一硬件上的首次尝试相比,这使吞吐量提升了三倍。一个基于 GLM-5.3 的 Agent 帮助进行了这项优化。