稀疏MoE架构每token仅激活6B参数,训练成本降至Qwen3.7的1/9,编程和办公基准测试超越更大规模竞品。
阿里巴巴 Qwen 团队发布了 Qwen3.8-Flash-Next,这是一款主打 token 成本的开源权重多模态混合专家模型。该 checkpoint 搭配 125B 主干网络、51B N-gram 嵌入表以及 4B 多 token 预测模块。每个 token 仅激活 6B 参数。团队将其定位为 Qwen4 架构的早期预览,角色与 Qwen3-Next 当年为 Qwen3.5 所扮演的角色相同。本次发布有四项核心变化:Gated DeltaNet 与 Qwen Sparse Attention 混合架构、Gated Residual、N-gram 嵌入以及 Muon 优化器。Qwen 团队报告训练成本约为 Qwen3.7-Plus 的九分之一。
但这不是单卡工作站能跑动的。FP8 checkpoint 为 172.78 GiB,BF16 checkpoint 为 335.28 GiB。按照 vLLM 官方配方,TP2 是 GB300 上经过验证的最小 FP8 配置,TP4 为推荐配置。在 8×H200 节点上应使用 TEP8;普通 TP8 与该 checkpoint 的 128 宽度量化块不兼容。稀疏激活削减的是计算量,不是存储。
https://qwen.ai/blog?id=qwen3.8-flash-next

Qwen3.8-Flash-Next 由 125B 主模型、51B N-gram 嵌入参数和 4B 多 token 预测模块组成,磁盘总大小 180B。每个 token 仅激活 6B 参数。驱动的四项核心变化如下:
混合注意力(GDN + QSA):每四层中有三层使用 Gated DeltaNet,这是一种线性注意力层,将历史压缩为固定大小的循环状态。第四层运行 Qwen Sparse Attention(QSA),使用轻量级索引器在微块粒度上选择上下文,而非逐 token 处理。层布局为 48 层中每 12 层为一组(3 × GDN → 1 × QSA),QSA 预算为 512 个块或 2048 个 token。
Gated Residual:残差流扩展为 4 条并行分支,带有逐元素读门和每分支标量写门,bottleneck rank 为 320。
N-gram 嵌入:第 2 层的 20,000,000 条二元组/三元组表通过确定性查找增加容量。可卸载到主机内存并异步预取——不过目前卸载仅在 NVIDIA 设备上运行。
训练配方:Muon 优化器与 AdamW 一起应用于特定权重类别,取消了 batch-size warmup 并重新拟合了 scaling laws。
MoE 层包含 512 个专家,激活 10 个路由专家加 1 个共享专家,专家中间维度为 640。
Qwen 报告的基准成绩为:DeepSWE 1.1 上 58.7、SWE-bench Pro 上 62.5、SWE-bench Multilingual 上 81.0、LiveCodeBench v6 上 91.9。Agent 任务成绩:CoWorkBench 上 73.9、JobBench 上 55.7、Toolathlon Verified 上 73.5。多模态成绩:AndroidWorld 上 84.5、LVBench 上 76.6、RealWorldQA 上 88.5、MathVision with code interpreter 上 95.7。
但该模型并非全面领先。Claude Opus 4.6(Max)在 HLE 上取得 40.0,而 Qwen 为 35.9;DeepSeek-V4-Flash-0731 在 NL2Repo-Bench 上以 54.2 领先 Qwen 的 48.1。前沿推理仍是差距所在。
Qwen 表示训练成本约为 Qwen3.7-Plus 的 1/9。在服务推理方面,公告称 QSA kernel 在 1M token 时预处理加速最高达 7.6 倍、解码加速最高达 4.9 倍;而 SGLang cookbook 和 vLLM 配方分别给出 10.2 倍和 6.6 倍。在独立测量之前,请将这个范围视为厂商报告。Qwen 还报告在 90% 前缀缓存命中率下,吞吐量是 Qwen3.7-Plus 的 8.6 倍。
上下文原生支持 262,144 token,通过 YaRN 可扩展至 1,000,000。
该模型通过 vLLM、SGLang、TokenSpeed、transformers serve 以及 llama.cpp(GGUF 量化)提供服务。支持通过 Unsloth、Swift 和 LLaMA-Factory 进行微调。它已驱动 QwenWork 的"Standard"模式,并与 Qwen Code 配合使用。
Thinking 模式默认开启,推理强度可选 xhigh、medium 或 low。Qwen 建议 Thinking 模式使用 temperature 1.0 和 top_p 0.95,instruct 模式使用 temperature 0.7 和 top_p 0.80。
查看 GitHub Page、HF Model Card 和 Technical Details。也欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等等,你在用 Telegram 吗?现在也可以加入我们了。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而著称,内容既有技术深度又通俗易懂。该平台月浏览量超过 200 万,显示出其在受众中的受欢迎程度。