阿里巴巴开源多模态MoE模型Qwen3.8-Flash,是Qwen3.8 Max之后的新变体,被官方描述为Qwen4架构的早期预览。
我们很高兴你在这里。你可以期待 The New Stack 最优质的内容在周一至周五送达,让你紧跟新闻动态、保持领先地位。
查收收件箱中的确认邮件,你可以调整偏好设置,甚至加入其他社群。
在你喜欢的社交网络上关注 The New Stack。
成为 LinkedIn 上的 The New Stack 关注者。
在等待第一封 The New Stack 邮件时,看看最新的精选和热门文章。
阿里巴巴本周发布了 Qwen3.8-Flash,这是一款开源的多模态混合专家(MoE)模型。
就在本月初 Qwen 3.8 Max 发布之后,这款拥有 1250 亿参数的 AI 模型被视为 Qwen 4 的前奏。它的定位兼具性能与性价比。因此,阿里巴巴宣称其在"编程和办公任务方面具有卓越能力",并在能力、延迟和成本之间取得了最佳平衡。
"在本次发布中,我们开源了 Qwen3.8-Flash-Next 的权重,这是一个多模态 MoE 模型,同时也是 Qwen4 所用架构的早期预览,"阿里巴巴在发布博客中确认。
通过早期发布 Qwen3.8-Flash 的架构变更,阿里巴巴希望社区能够审视其中的机制、构建和组件,并在完整的 Qwen4 模型家族基于这些构建之前开始对其进行路测。
阿里巴巴宣称 Qwen3.8-Flash 为 Qwen4 铺平了道路,这展示了(重要的是公开分享了)将延续到后续模型中的设计方案,以便开发者能够提前开始构建(或至少规划)他们的下一个代码库。
具体来说,阿里巴巴表示 Qwen3.8-Flash 扮演了与 Qwen3-Next 为 Qwen3.5 所扮演的"相同角色"——即 Qwen3.8-Flash 向开发者引入了该公司混合 Gated DeltaNet + Gated Attention 设计(使 AI 模型能够在推理和训练过程中平衡长上下文效率与上下文焦点和注意力的计算组件),该设计随后被应用于 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 系列。
"Qwen3.8-Flash-Next 从四个方面对模型进行了系统升级——注意力、残差、嵌入和优化——在提升模型能力的同时进一步优化计算效率、模型容量和训练稳定性,"阿里巴巴表示。
在代理编程、长时程代理任务和多模态智能方面进行基准测试时,Qwen3.8-Flash 在 SWE-bench Pro(代理编程)、CoWorkBench(长时程办公工作)、Toolathlon Verified(现实世界工具使用)、MathVision(视觉数学问题求解)、AndroidWorld(代理移动使用)和 ERQA(具身智能)上,与包括 DeepSeek-V4-Flash 和 Claude-Opus-4.6 在内的模型相比,表现相当可观。
"Qwen3.8-Flash-Next 从四个方面对模型进行了系统升级——注意力、残差、嵌入和优化——在提升模型能力的同时进一步优化计算效率、模型容量和训练稳定性。"
在 SWE-bench Pro 上进行代理编程测试时,Qwen3.8-Flash-Next 得分为 62.5,而 Qwen3.8-27B 为 61.7,Qwen3.7-Plus 为 55,DeepSeek-V4-Flash-0731 为 56.0,Claude-Opus-4.6(Max)为 53.4。
重要的是,Qwen3.8-Flash 仅需阿里巴巴所描述的"约九分之一的训练资源",同时提供更优的性能。该公司表示,这意味着 Qwen3.8-Flash"大幅降低了"与 Qwen3.7-Plus(一个体积是其三倍的模型)相比的训练和推理成本。
从命名上来说,Qwen3.8-Flash-Next 是在 Hugging Face AI 开发者平台和阿里巴巴的 ModelScope 社区门户上向开发者提供的开源研究前沿模型。Qwen3.8-Flash 则基于相同的底层架构,是该模型的生产版本,通过 QwenCloud API 提供,默认 100 万 token 并内置官方工具。
Qwen3.8-Flash-Next 主模型拥有 1250 亿参数,辅以额外的 510 亿 N-gram 嵌入,每 token 激活 60 亿参数。它原生支持 262,144 token 的上下文,并可通过 YaRN 扩展到 1,000,000 token。
如前所述,Qwen3.8-Flash 在注意力机制、残差连接、嵌入和优化方面引入了架构扩展。它的混合注意力架构结合了 Gated DeltaNet(GDN),用于压缩历史信息,以及 Qwen Sparse Attention(QSA),这是一种使用轻量级压缩索引器来选择相关上下文的新设计,可大幅降低长序列的注意力成本。
阿里巴巴解释道,Gated Residual(GR)机制在层之间扩展数据路径,同时增强层间信息流和训练稳定性。N-gram Embedding 技术以最小的额外计算量扩展模型容量,而 Muon Optimizer 则提升了大规模模型训练的效率。
"我多么希望本地 LLM 如今真的能取代远程 LLM,我也没有理由对自己的体验撒谎……只是(目前)还做不到(本地专业软件开发)。"
从开发者反应来看,目前喜忧参半。
机械电子工程师 Alok 在 X 上发帖称,他认为视频显存壁垒(即面对模型量化(旨在实现更好的长上下文推理)时,LLM 内存管理对物理性、高速基于 GPU 的内存的需求)已正式被打破。
"我刚在单张 24GB RTX 4090 上运行了 Qwen3.8-Flash-Next(MoE)125B A6B,上下文窗口 250,000——21 tokens/秒解码。364 t/s 预填充——无 mtp。无 dflash。无 KV 缓存量化!我们正在消费级硬件上运行数据中心级别的模型,"Alok 兴奋地表示。
多学科软件开发者 Embedding Shapes 则不那么高兴。
他们在 Hacker News 上发帖,用一些激烈的措辞描述模型如何不断[插入脏话]搞砸非常基础的事情,然后说:"我多么希望本地 LLM 如今真的能取代远程 LLM,我也没有理由对自己的体验撒谎。但我读着互联网上关于 Qwen 3.8 的乐观情绪也曾抱有希望,只是(目前)还做不到(本地专业软件开发)。"
Qwen3.8-Flash 可通过 API Model Studio 和 Qwen Cloud(阿里巴巴的 AI 原生云平台)访问。每 100 万 token 的价格为:输入 0.16 美元,输出 0.47 美元(中国境内开发者为 3 元人民币)。
该模型也可在阿里巴巴的工作场所 AI 代理平台 QwenWork 上使用,它运行着重新设计的"标准模式",与当前模式相比,每个任务的 token 消耗减少了 75%,生成速度"大约翻倍"。
阿里巴巴声称,这使得旗舰级能力触手可及,可用于日常工作负载,开发者可以在他们可能已经拥有的硬件上运行此模型。
阿里巴巴尚未确认 Qwen4 的正式发布日期。不过,在网上随便搜索一下这个话题,会发现一系列评论员和市场观察者普遍认为它将在今年年底前发布,也可能最早在 9 月。
此领域的推测探讨了下一个模型系列是否可能针对复杂 3D 编程和高级空间建模中的设计任务进行优化。其他人则认为混合专家(MoE)架构将得到扩展,并且可能具备更深的原生多模态处理能力。
阿里巴巴就本文寻求更广泛的评论,但拒绝参与。
Qwen 在汉语中写作"通义千问"(发音 Tōngyì qiān wèn),在英语中翻译为"a thousand questions on general meaning"(关于通用含义的千个问题)。本周末在你的本地酒吧竞猜中可以使用这个知识点。