阿里 2.44 万亿参数 MoE 模型,激活约 950 亿参数,100 万 token 上下文,PaperBench 达 93.0 分。明确标注开源权重但实际难以本地部署。
Qwen3.8-Max 是阿里巴巴于 2026 年 8 月 3 日发布的 2.44 万亿参数混合专家模型,每个 token 激活约 950 亿参数,附带 100 万 token 的上下文窗口。它在多项 agent 能力和研究基准测试中超越了 GPT-5.6 Sol 和 Claude Fable 5——尤其是在 PaperBench 上取得了 93.0 分——同时阿里巴巴承诺将在 Hugging Face 和 ModelScope 上公开权重。这种组合——前沿级分数加上开放权重——正是这个版本值得关注的原因。
大多数报道都跳过了一个关键问题:如此规模的开放权重并不等同于开放访问。2.4T 参数的模型既跑不动你的工作站,也跑不动你的 8×H100 节点,更跑不动大多数单 rack 推理部署。权重可以下载,但几乎没有人真的会去下载。
本文涵盖 Qwen3.8-Max 的真实得分、稀疏 MoE 架构的工作原理、"开放权重"在实践中意味着什么,以及它是否值得你现在就接入技术栈。
Qwen3.8-Max 是一个 2.44 万亿参数的稀疏 MoE 模型,每个 token 激活约 950 亿参数,于 2026 年 7 月 19 日预览后,于 8 月 3 日通过 QwenCloud 发布,开放权重承诺在发布后约一周内提供。
它在 Terminal-Bench 2.1 上得分 86.6,在 PaperBench 上得分 93.0,后者超越了 Claude Fable 5 的 88.8 和 GPT-5.6 Sol 的 90.5。
上下文窗口为 100 万 token,输出 token 上限为 128k——与前沿水平持平,而非追赶。
权重计划发布在 Hugging Face 和 ModelScope,同时还有一个体量小得多的 Qwen3.8-27B,大多数团队实际上能够运行的就是这个版本。
实际决策是 API 对 API:对绝大多数团队来说,2.4T 的"开放权重"改变的是授权和可审计性,而非部署方式。

Qwen3.8-Max 是阿里巴巴 Qwen 团队迄今发布的最大、能力最强的模型:2.44 万亿总参数,稀疏混合专家布局,每个 token 激活约 950 亿参数。阿里巴巴于 2026 年 7 月 19 日预览了该模型,8 月 3 日通过 QwenCloud 发布正式版本,并承诺约一周内开放权重。
架构故事才是有趣的部分。稠密模型在每个 token 上都要付出完整的参数代价。稀疏 MoE 模型将每个 token 路由到少数"专家"子网络中,因此一个 2.44T 的模型可以以约 950 亿稠密模型的计算成本提供推理服务。根据 MarkTechPost 的技术拆解,这个比例——每个 token 约 3.9% 的参数处于激活状态——正是使该模型在经济上可用的关键。
另一个头条特性是时长。阿里巴巴将 Qwen3.8-Max 定位为其所称的"长时程任务":多步骤 agent 工作,在这类工作中模型必须在数百次工具调用中维持一个计划,而非仅仅良好地回答单个问题。Decoder 的报道将其框架为模型的实际设计目标,而基准测试的分布也支持这一观点:胜出集中在 agent 能力和研究评估上,而非原始的单轮推理。
Qwen3.8-Max 在研究复现和多模态文档任务上领先于前沿水平,在 agent 终端工作上与之持平,在最难编码评估上则落后于 GPT-5.6 Sol。它并非全面碾压,阿里巴巴自己的材料也未声称如此。
以下是各方公布的数字并列:
PaperBench 是值得暂停思考的结果。它衡量模型能否端到端复现一篇研究论文的结果——阅读、实现、运行并匹配报告的数字。93.0 的成绩让 Qwen3.8-Max 超越了所有参与对比的模型,包括 90.5 的 GPT-5.6 Sol。这是一个真正困难、真正体现 agent 能力的任务,它是比大多数排行榜条目更好的"这玩意儿能否完成数小时工作"的代理指标。
Terminal-Bench 2.1 讲了一个相反的小故事:86.6 很强,超越了两款 Anthropic 产品(84.6),但 GPT-5.6 Sol 仍以 88.8 领先。如果你的工作负载是 shell 密集型的自主编码,这个差距是真实存在的——不过差距足够小,价格大概会成为决定因素。我们曾在《2026 年 LLM API 价格变动分析》中详细介绍了这些价格曲线是如何演变的。
多模态工作的数字始终很高:MMMU-Pro 82.3,OSWorld-Verified 86.1,OmniDocBench 1.5 的 92.1,以及带字幕的 VideoMME 90.4。OmniDocBench 对任何做批量文档提取的人来说都值得关注——92.1 使其进入发票、合同和表单解析的生产可用境地。
较弱的分数才是诚实的。HealthBench 60.2 和 PRBench-Finance 58.3 只能算中等。领域特定的高风险推理仍然是这些模型的短板,而阿里巴巴公布这些数字而非隐藏它们,是其加分项。
不是——Qwen3.8-Max 是开放权重,不是开源,而且以 2.44T 参数的规模,这个区别对个人开发者来说基本是学术层面的。你可以下载和检查权重,如果有硬件的话可以微调,且无需向阿里巴巴发送数据即可运行。你无法做到的是在你自己拥有的硬件上运行它。
算一笔账。以 8 位量化,2.44 万亿参数仅存储权重就需要约 2.4TB 内存,这还不算 KV cache、激活内存,以及 100 万 token 上下文所需的任何余量。这需要的是一个多节点、高带宽互联的部署——一个集群,而不是一台服务器。即使以激进的 4 位量化,你也需要约 1.2TB,并且会有明显的质量损失。
这就是为什么配套发布比标题发布更重要。阿里巴巴同时在开放 Qwen3.8-27B 的权重,这是一个可以在单张 48GB GPU 上以 8 位舒适运行、在消费级硬件上以 4 位运行的模型。对于阅读本文的大多数团队来说,27B 才是你真正会部署的版本;Max 是你会通过 API 调用的版本。如果你正在评估那条本地路径,我们关于使用 Ollama、LM Studio 和 llama.cpp 本地运行 LLM 的指南涵盖了相关工具。
那么 2.4T 的开放权重实际上能为任何人带来什么?三样东西,都是真实的:
可审计性。研究人员和监管机构可以检查模型,而非仅从 API 推断其行为。
无法单方面废弃。下载的 checkpoint 不可能被下线、被静默更新或被重新定价。
主权部署。拥有自有计算资源的大型企业和政府可以在自己的边界内提供服务——这正是阿里巴巴瞄准的市场。

Qwen3.8-Max 是中国实验室在 2026 年持续贯彻的一种策略的最清晰表达:开放西方实验室保持封闭的权重,在成本和可用性上竞争,而非在狭窄的基准测试领先上竞争。它正在奏效。我们在《中国 AI 模型现已在 46% 的企业 API 流量中提供动力》中记录了这场企业层面的转变。
这个模式在各个厂商间重复。DeepSeek 以 V4-Flash 大力下压价格底线——我们在《DeepSeek V4 Flash 0731》详细拆解了这个版本——Z.AI 建立了国内推理能力。阿里巴巴的贡献是规模:其他任何人都没有开放过接近 2.44T 参数的权重。
Bloomberg 的报道主要将其框架为与 Anthropic 的基准测试平价。这个框架低估了分发效应。领先 2 分的封闭模型靠质量竞争。开放权重且分数在噪声范围内的模型既靠质量竞争,又把厂商从方程中移除——对于任何有采购或数据驻留限制的组织来说,这是一个截然不同的命题。
有一个说法值得怀疑。多篇文章重复了 Qwen3.8-Max 具备"递归自我改进"的声称,描述为模型随时间优化自身过程。阿里巴巴的技术材料在运营层面语焉不详,而这个短语在 AI 讨论中承载的分量远超当前任何已发布功能所能支撑的。把它当作营销手法,直到有一篇论文为止。
如果你在做高容量文档提取、研究复现或长时程 agent 工作,且想要一个可信的非美国供应商,那就用。不要仅仅根据这些数字就将主力编码 agent 切换到它。
以下是实际决策路径:
先在自己的任务上做基准测试。Terminal-Bench 和 PaperBench 都是代理指标。在你的实际仓库或文档语料上做两天评估,胜过任何排行榜。
先检查数据驻留,再考虑成本。QwenCloud 的默认区域可能无法满足你的合规姿态。这通常才是阻碍因素,不是价格。
让 27B 和 Max 同时做试点。如果 27B 在你的工作负载上达到了 90% 的效果,部署故事就会简单得多。
假设权重会迟到。"约一周内"是一个承诺,不是发布日期。基于 API 构建你的评估,将自托管视为后续选项。
结论:Qwen3.8-Max 是现存最有能力的开放权重模型,PaperBench 93.0 是一个真正的前沿结果,而非精心挑选的胜利。但对于中等规模的工程团队来说,真正带来改变的版本是 Qwen3.8-27B——那个你真正能运行的版本。
Qwen3.8-Max 有多少参数? Qwen3.8-Max 有 2.44 万亿总参数,每个 token 激活约 950 亿。它使用稀疏混合专家架构,因此推理计算更接近 950 亿稠密模型而非 2.4T 稠密模型。这正是使其在经济上可行的原因。
Qwen3.8-Max 比 GPT-5.6 Sol 更好吗? 完全取决于任务。Qwen3.8-Max 在 PaperBench(93.0 vs 90.5)和多项多模态基准上领先,而 GPT-5.6 Sol 在 Terminal-Bench 2.1(88.8 vs 86.6)上领先。两款模型都不是全面领先,差距小到价格和延迟将决定大多数实际部署。
我能本地运行 Qwen3.8-Max 吗? 现实来说,不行。以 8 位量化,仅权重就需要约 2.4TB 内存,这意味着需要多节点 GPU 集群,而非工作站。阿里巴巴的配套版本 Qwen3.8-27B 才是设计为在单 GPU 上运行的版本。
Qwen3.8-Max 的上下文窗口是多少? Qwen3.8-Max 支持 100 万 token 的上下文窗口,输出 token 上限为 128,000。这使其与 Claude 和 Gemini 的长上下文层级持平,而非落后于它们,这是处理整个仓库和长文档工作的前提条件。
Qwen3.8-Max 权重何时发布? 阿里巴巴在发布时承诺将在 2026 年 8 月 3 日发布后约一周内,将权重发布在 Hugging Face 和 ModelScope,同时还有较小的 Qwen3.8-27B。与任何权重发布一样,在 checkpoint 实际出现之前,将时间线视为声明意图。
Qwen3.8-Max 可以免费使用吗? 该模型通过 QwenCloud 的付费 API 定价提供,并非免费。开放权重一旦发布,可以免费下载和自托管——但运行 2.44 万亿参数模型所需的硬件,使自托管成为除了最大规模部署之外所有人的昂贵选项。
Qwen3.8-Max 是一个真正的前沿模型,PaperBench 结果并非侥幸——端到端复现研究正是区分一个好聊天机器人和一个有用 agent 的长时程任务。阿里巴巴赢了这个分数。
但要把"开放权重"视为一种治理特性,而非部署计划。几乎没有人会在自托管 2.44 万亿参数。如果这个说法是吸引你进来的原因,认真看看 Qwen3.8-27B,并阅读我们对开源 AI 开发者工具的比较,了解周围的技术栈。
前沿阵营现在有了一个权重可以下载的成员。这就是故事的核心——尽管这个下载是几乎没有人会完成的。