Z.ai发布GLM-5.3-Flash,首个GLM-5系列原生多模态MoE模型,总参320B激活18B,上下文达100万token,MIT协议开源,API价格极低,在SWE-bench类评测中表现优异。
Z.ai 发布了 GLM-5.3-Flash,这是 GLM-5 系列中首个原生多模态模型,也是该实验室迄今为止成本最低的编程模型。它是一个混合专家模型,总参数 320B、每次激活 18B,上下文窗口达 1,048,576 token,支持图像和视频输入,以 MIT 许可证发布,权重已上传至 Hugging Face。据 Z.ai 报告,该模型在各项基准测试和真实工作负载上均超越 GLM-5.2,价格约为后者的十分之一,同时在其内部编程基准测试中与 Claude Opus 4.8 的差距不到半分。该模型上线第一周以"Ox Alpha"的名义在 OpenCode 和 OpenRouter 上匿名运行,全部基于国产中国 AI 芯片提供服务。
是的,双轨并行。权重以 MIT 许可证在 Hugging Face 上开放,托管 API 已定价并开始提供服务。
哪些公司真正有能力自托管?并非所有人。默认 FP8 checkpoint 在 KV 缓存前大约需要 306 GiB 的权重,目前的 vLLM 方案仅支持 NVIDIA Hopper 及更新架构。这使得自托管的门槛落在拥有至少 8 卡节点(或 TP4 部署的 GB200 托盘)的中大型组织,以及租用 GPU 资源的 AI 原生初创公司。低于这条线的所有用户都通过 API 消费——这里的故事是经济账,而非硬件。
Immediate fit 的行业:软件与开发工具、IT/BPO 自动化、金融服务与保险文档操作、企业 BI 与后台知识工作、电商以及任何大量交付 UI 的团队。
应用场景:仓库级编程 Agent、终端与浏览器/计算机使用 Agent、百万 token 日志与合同分析、基于截图的 UI 回归检查,以及此前需要 OCR 转文本流水线的表格/PPT/仪表盘推理场景。
GLM-5.3-Flash 始于一个在 30T token 多模态语料上全新训练的基座模型。有三个值得了解的改动:
Hybrid attention:在 GLM 系列中首次,Z.ai 将线性和稀疏注意力相结合。按照 vLLM 配方,45 层语言模型将 KDA 线性注意力层与 NoPE 稀疏 MLA 层交错排列,每个 token 经由 288 个专家中的 8 个路由,并附带原生 FP8 权重和一个 MTP draft 层。线性注意力处理本地依赖关系;稀疏注意力检索全局相关上下文。
IndexPool:在百万 token 上下文场景下,检索本身成为瓶颈。IndexPool 通过加权池化压缩一组索引器 key 向量,以降低延迟和内存占用。Z.ai 报告称,相比 GLM-5.3,注意力计算量减少约 3 倍,KV 缓存缩小 4.4 倍。
mHC:该模型采用 Manifold-Constrained Hyper-Connections 来提升扩展效率。相比 GLM-4.5,在相近的总参数数量下,GLM-5.3-Flash 的激活参数和层数均减少约一半。
下表中大多数数字由 Z.ai 自行报告,且各测试的测试框架不同——模型卡片的脚注中注明了各基准测试的温度、上下文限制和 judge 模型,因此跨模型比较应视为取决于测试设置。
| Benchmark | GLM-5.3-Flash | Reference |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | Opus 4.8: 85.0 · GPT-5.6 Terra: 87.4 |
| DeepSWE v1.1 | 63.4 | GLM-5.2: 46.2 |
| AutomationBench | 48.8 | GLM-5.2: 26.2 |
| HLE | 55.3 | — |
| OfficeQA Pro | 62.4 | ahead of Opus 4.8 |
| Z.ai Code Bench v1.0 (max) | 29.0 | Opus 4.8: 29.5 |
独立机构 Artificial Analysis 给出该模型 Intelligence Index 57 分,在 Z.ai API 上输出速度 48.7 tokens/秒,首 token 时间(TTFT)1.52 秒——智能性价比出色,但速度偏慢且输出冗长。视觉是其薄弱环节:在 BabyVision 和 MVbench 上落后于 Gemini 3.7 Flash。
Z.ai 表示,整个 Ox Alpha 预览全程运行在国产中国 AI 芯片上,使用基于 SGLang 定制的引擎,将编码、prefill 和解码解耦,并报告在数万个加速器上实现了 3 倍的端到端服务提升。
标准 API 定价为 $0.15/M 输入、$0.03/M 缓存输入、$0.50/M 输出。Z.ai 报告该模型在 Artificial Analysis Intelligence Index v4.1.1 上得分为 57,折后层级每任务成本 $0.045。该模型已在所有 GLM Coding Plan 层级上线——Lite($18/月)、Pro($80)、Max($168)——可用配额为 GLM-5.3 的 3 倍,其多模态能力通过 ZCode 中的 Browser Use 和 Computer Use 呈现。本地服务支持 SGLang、vLLM、TokenSpeed 和 KTransformers。