6B激活参数的稀疏MoE模型,训练成本降至竞品1/9,编程与办公任务超越DeepSeek-V4-Flash和Claude Opus 4.6。
Alibaba 的 Qwen 团队发布了 Qwen3.8-Flash-Next,这是一款多模态混合专家模型,可视为 Qwen4 的架构预览版。它的目标是以极低的训练成本达到比它大得多的模型的性能水平。
该模型共有 1250 亿参数,但每次生成一个 token 仅激活 60 亿参数。此外还有一个包含 510 亿参数的全新 N-gram embedding 层,这是 Qwen4 架构规划中的创新之一。这个层将常用词组作为独立条目存储在一种"短语词典"中,可以运行在普通系统 RAM 上而非 GPU 上,"额外成本相当低"。
N-gram embedding 层(图中底部,紫色)在网络起始处注入短语级信息。它包含 510 亿参数,但运行在系统 RAM 而非 GPU 显存中。| 图片来源:Alibaba / Qwen

该模型原生支持 262,144 个 token 的上下文窗口,并可使用 YaRN 扩展至 100 万 token。技术报告已发布在 GitHub,权重文件可在 Hugging Face 和 ModelScope 下载。生产版本以 Qwen3.8-Flash 的名称通过 QwenCloud 提供 API,定价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元。据 Qwen 方面透露,API 将于近期上线。
九分之一的训练成本,更好的效果
据 Qwen 团队介绍,Qwen3.8-Flash-Next 在训练成本约为 Qwen3.7-Plus 九分之一的情况下,取得了更优的效果,尤其在编程和办公任务上提升最为显著。Qwen3.7-Plus 拥有 3970 亿参数,每次激活 170 亿参数,是 Flash-Next 激活量的近三倍。
Alibaba 公布的基准测试将该模型与 DeepSeek-V4-Flash(2840 亿参数,激活 130 亿)以及 Anthropic 的 Claude Opus 4.6(Max 版)进行对比。尽管这两个竞品体积更大或成本更高,Flash-Next 仍在大多测试任务中领先。
该模型在 agentic 编程基准测试中表现尤为突出——这类测试要求 AI 在真实软件项目中独立发现并修复 bug。Flash-Next 在 DeepSWE 上得分 58.7,在 SWE-bench Pro 上得分 62.5,均超越了 DeepSeek-V4-Flash 和 Claude Opus 4.6。
在办公和生产力任务上的差距更为悬殊。Flash-Next 在 CoWorkBench 上达到 73.9 分,而 DeepSeek-V4-Flash 仅获得 45.1 分。在 JobBench(专业工作流测试)中,Flash-Next 得分 55.7,几乎是 Qwen3.7-Plus(27.6 分)的两倍。在科学推理(GPQA Diamond:91.7)和竞赛编程(LiveCodeBench v6:91.9)上,两者成绩接近。
Claude Opus 4.6 仅在 Humanity's Last Exam(围绕极高难度跨学科问题的测试)上领先,但这也是 2026 年 2 月发布的"较老"的 Anthropic 模型。一如既往,基准分数与实际表现可能存在差异。
定价持续施压竞争对手
Alibaba 在今年 8 月初刚推出 Qwen3.8-Max 作为当前旗舰模型,与 Claude Opus 4.8、Gemini 3.1 Pro、GPT5.6 Sol 等展开竞争。Flash-Next 性能仅次于旗舰,但成本仅约其十二分之一,输入和输出 token 的价格差距均约为 12 倍。
这样的定价策略持续向 OpenAI 和 Anthropic 施压。Qwen3.8-27B 近来也很受欢迎,因为它可以在本地运行、几乎不花钱就能提供强大性能——前提是你有相应的硬件。OpenAI 近期通过大幅降价来回应新 GPT-5.6 模型系列。这对用户是好事,但对 AI 提供商维持投资叙事所需的快速增长收入而言却并非好消息。