Z.ai和Qwen独立推出的Flash模型均采用3:1线性混合、压缩索引器、门控残差和Muon训练,两种方案高度趋同,具有重要的架构信号意义。
本周,两款前沿开源权重模型在不到一天的时间内相继发布。Z.ai 发布了 GLM-5.3-Flash,这是一款 320B 参数的多模态 MoE 模型,活跃参数为 18B。阿里巴巴的 Qwen 团队发布了 Qwen3.8-Flash-Next,这是一款 125B 模型,活跃参数为 6B,预告了 Qwen4 架构。
两个团队独立设计了这套系统,然而它们的配置看起来几乎一模一样。两者都采用 3:1 的线性注意力与全注意力混合比例。都使用压缩索引器选择上下文,上限为 2048 token。都把残差流扩展为 4 个 gated 分支。都使用 Muon 优化器训练,并将融合的参数矩阵在正交化之前拆分开来。本文将深入解析这套共同配方、一个分歧点,以及一个持异议的实验室。
两次发布概览
GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,以 MIT 许可证发布在 Hugging Face 上。Z.ai 在 OpenRouter 上以 Ox Alpha 的匿名身份测试了该模型,一周内成为最受欢迎的模型。它在 30T token 的多模态语料上训练,上下文窗口为 1M token。Z.ai 表示,它在各项基准测试上优于 GLM-5.2,同时价格仅为后者的十分之一,在编程和 Agent 基准测试上接近 Claude Opus 4.8。定价为每百万输入 token 0.15 美元,每百万输出 token 0.50 美元。
Qwen3.8-Flash-Next 扮演的角色,正如 Qwen3-Next 当年扮演 Qwen3.5 的角色一样:是下一代架构家族的早期公开预览。模型卡列出了 125B 主模型,外加 51B 的 n-gram 嵌入表,每个 token 激活 6B 参数。原向上下文为 262,144 token,通过 YaRN 可扩展至 1M。Qwen 团队报告,训练所需的算力约为 Qwen3.7-Plus 的九分之一。随附的技术报告标题为"On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability"。
GLM-5.3-Flash 堆叠了 45 层:34 层线性注意力层和 11 层全注意力层(来自发布的配置)。Qwen3.8-Flash-Next 堆叠了 48 层,每 3 层 Gated DeltaNet 层加 1 层 Qwen Sparse Attention 层为一个重复块(来自 vLLM 配方)。两者都落在同一个 3:1 比例上。
线性层是廉价的层。它不像 KV cache 那样随文本增长,而是将所有历史压缩成一个固定大小的循环状态。每个 token 的计算量不随上下文长度而变化。GLM 使用 Kimi Delta Attention(KDA),这是 Moonshot AI 的 Kimi Linear 引入的线性注意力设计,应用了细粒度的 per-channel 衰减门。Qwen 使用自己的 Gated DeltaNet(GDN),在 per-head 级别做门控。不同的门控粒度,相同的 delta-rule 家族,干的是同一件事。
剩下四分之一的层做精确的长距离检索。GLM 在 DeepSeek 风格中使用 NoPE 多头潜在注意力(MLA)。Qwen 在 QSA 中使用分组查询注意力。这才是 KV cache 真正存在的地方,也是第二个共享技巧的所在。
两个模型都不让全注意力层在完整上下文中进行注意力计算。两者都附加了一个小型可学习索引器,对历史分块打分,只保留得分最高的。参数几乎完全一致。
GLM 的稀疏层使用 32 头 lightning 索引器,top-2048 选择,源自 DeepSeek 的 DSA。为了在 1M token 上下文时降低索引器成本,Z.ai 引入了 IndexPool,通过加权池化将四个索引器 key 向量压缩成一个,然后再打分。Qwen 的 QSA 在 micro-block 粒度上操作:压缩的轻量索引器对 4 token 的块打分,保留 top 512 个块,恰好是 2048 token。因此两个模型都在打分前将上下文压缩 4 倍,都将注意力预算上限设为 2048 token。Qwen 宣称 QSA 在 1M token 时相比全注意力实现最高 7.6 倍的 prefill 加速和 4.9 倍的解码加速。
对 GLM 一侧的综合影响是显著的。Z.ai 报告,相比完整的 GLM-5.3 模型,Flash 架构将注意力计算量削减约 3 倍,KV cache 大小削减 4.4 倍,同时几乎将活跃参数减半(18B vs 32B)、层数减半(45 vs 92)。
两个模型都抛弃了自 2017 年以来定义 transformer 的单残差流。都将它扩展为四个并行分支,通过门控控制每个块读取和写入的内容。
GLM 采用 Manifold-Constrained Hyper-Connections(mHC),这是一种源自 DeepSeek 的设计,在发布的权重中配置为 4 分支。Qwen 写了自己的变体 Gated Residual,通过 element-wise 数据依赖的读门和 per-branch 标量写门来调制流经 4 条扩展流的流量。据 Qwen 团队所述,Gated Residual 去掉了 Hyper-Connections 使用的额外分支混合步骤,减少了内存访问开销,而且门控足以抑制激活异常值,从而允许 FP8 残差存储。值得注意的是,Qwen 团队对两种方法都做了消融实验,发现质量上大致相等。两个实验室,两种实现方式,得出完全相同的结论:四条门控流优于一条。
两个模型都使用 Muon 优化器训练。而且两者都应用了同一个微妙的改进:在 Muon 对其进行正交化之前,将融合的投影矩阵拆分到各自的独立变换中。Qwen 记录了融合 QKV、SwiGLU 和 GDN 投影的拆分,将 Muon 分配给真正的 2-D 线性映射,将 AdamW 分配给 embedding、路由器和低秩参数。Qwen 还针对新架构重新拟合了 scaling laws,并在测量到 warmup 多耗费了 18.8% 的优化器步数而没有改善结果之后,完全放弃了 batch-size warmup。
唯一干净的分歧是全注意力层中的旋转位置嵌入。GLM-5.3-Flash 放弃了它们:配置中设置 qk_rope_head_dim = 0,使其稀疏 MLA 层完全 NoPE。位置信息通过循环线性层隐式流动。
Qwen 尝试了同样的做法但保留了 RoPE。根据 Qwen3.8-Next 技术报告,NoPE 在预训练期间没有产生可测量的差异。问题在后面才暴露:后训练之后,NoPE 变体经常无法停止生成。这是一个对整个领域有用的警示结果。预训练损失曲线可能隐藏了只有在 RLHF 阶段调优之后才会出现的 behavioral 缺陷。
这套配方并非只限于两个实验室。DeepSeek 通过 DeepSeek-V3.2-Exp 中的 DSA 开创了稀疏索引器加 2048 预算的模式,而 mHC 是现在 GLM 在用的 DeepSeek 设计。Moonshot 的 Kimi 贡献了 KDA,即 GLM 采用的精确线性注意力层。中国开源模型正在明显地交叉借鉴架构组件,在共享设置上收敛。
值得注意的是持异议者是 MiniMax。在 M2 开发期间,团队在大规模下广泛测试了线性和滑动窗口注意力,发现多跳推理存在严重缺陷,尤其是在 SFT 之后超过 32K 上下文时。M2 在每一层都使用全 softmax 注意力。在 M3 中,MiniMax 采用了 MiniMax Sparse Attention(MSA),通过块选择对 softmax 注意力进行稀疏化,但完全不包含任何线性注意力层。所以这个领域尚未定论。Z.ai、Qwen、DeepSeek 和 Kimi 押注于 3:1 的线性混合能够保留推理能力。MiniMax 的消融实验表明这做不到,至少对他们的技术栈做不到。
GLM-5.3-Flash(34:11)和 Qwen3.8-Flash-Next(36:12)独立地落在了同一个 3:1 线性与全注意力比例上。
两者都将上下文压缩 4 倍,并将稀疏注意力上限设为 2048 token,这一模式由 DeepSeek 的 DSA 开创。
两者都将单残差流替换为 4 条门控分支;Qwen 将 Gated Residual 与 mHC 做了消融对比,发现两者质量相当。
在位置编码上出现分歧:GLM 放弃 RoPE(NoPE),而 Qwen 在 NoPE 模型后训练后无法停止生成,于是保留了 RoPE。
MiniMax 是异议者:其大规模消融实验发现线性注意力损害多跳推理,因此 M3 只使用稀疏 softmax 注意力。
来源:Hugging Face 上的 GLM-5.3-Flash、Z.ai GLM-5.3-Flash 文档、GLM-5 技术报告(arXiv:2602.15763)、Hugging Face 上的 Qwen3.8-Flash-Next、Qwen3.8-Flash-Next GitHub、NVIDIA Technical Blog、MiniMax-M2 报告(arXiv:2605.26494)和 MiniMax Sparse Attention(arXiv:2606.13392)
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最新的项目是推出了一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而著称,内容既技术扎实又易于被广大受众所理解。该平台的月访问量超过 200 万,显示出其在受众中的受欢迎程度。