阿里发布Qwen3.8-Max,2.4T稀疏MoE架构,1M token上下文,OpenAI兼容API,入价$2/M tokens。开权重版本即将推出。
阿里巴巴于 2026 年 8 月 3 日正式发布 Qwen3.8-Max。本文为开发者提供一份实用指南:这个模型是什么、价格如何、怎样调用,以及哪些说法仍需谨慎看待。
Qwen3.8-Max 是一个拥有 2.4 万亿参数的 Mixture-of-Experts 模型,具备 100 万 token 上下文窗口,原生支持文本、图像和视频输入,提供兼容 OpenAI 的 API,定价为每百万 token 输入 2 美元、输出 6 美元。阿里巴巴承诺将在下周开放模型权重。
这个版本号很容易让人误解,所以先解释清楚:
Qwen3 是你可能已经使用过的开放权重模型家族,例如 Qwen3-32B、Qwen3-235B-A22B 等。
Qwen3.5、3.6、3.7、3.8 是连续推出的旗舰代际,并不是 Qwen3 的小版本更新。
“Max”代表每一代产品中的最高档位。
因此,Qwen3.8-Max 并不是“Qwen 3 的第 8 个版本”。它是最新一代旗舰模型,接替了 2026 年 5 月推出的 Qwen3.7-Max。Qwen 称其为迄今能力最强的模型,也是首个达到 Max 规模的开放权重模型。
另外请注意,之前还有一个 Qwen3.8-Max-Preview,于 7 月 19 日发布;现在发布的是 8 月 3 日正式 GA 的 Qwen3.8-Max。如果你正在阅读一篇 7 月份的博客文章,它讲的是预览版,其中列出的“尚未披露”事项,如今已有一半得到了解答。
这一部分值得认真理解,因为“2.4 万亿参数”这个数字本身几乎没有实际意义。
稀疏 Mixture-of-Experts 模型并不是一个单体的超大网络。它的每一层都包含许多专门化的子网络,也就是“专家”;路由器会针对每个 token 选择其中少数几个专家,其余专家在处理该 token 时保持闲置。
从 Qwen 自家的小型模型命名中,就能清楚看出这种模式:Qwen3-235B-A22B 总共有 235B 参数,但每个 token 只激活 22B;Qwen3-30B-A3B 则大约激活 3B。
总参数量 ≈ 模型掌握了多少知识,以及托管模型需要多少内存。
激活参数量 ≈ 处理每个 token 实际需要多少计算资源。
在总参数量 2.4T、激活参数量约 95B 的情况下,每个 token 大约只会调用整个网络的 4%。正因如此,阿里巴巴才能把输入价格定在每百万 token 2 美元,而不是一个令人望而却步的数字。
不过,为了严谨,这个数字需要加一个小小的星号。MarkTechPost 的发布报道指出,阿里巴巴并未披露激活参数量;但一些 benchmark 追踪网站则称,Qwen 自己在 8 月 3 日发布的文章中列出了 2.4T 总参数量和 95B 激活参数量。其他报道建议,在阿里巴巴发布 model card 之前,应将这个数字视为媒体报告的数据,而不是已经确认的官方规格。你可以用它粗略理解成本,但不要拿它做容量规划。
还需要明确一点:95B 激活参数并不意味着你能在一台只够运行 95B 模型的机器上部署它。服务系统仍然需要快速访问完整的专家池,还要容纳 attention state、路由机制、多模态组件和运行时缓冲区。整个 2.4T checkpoint 仍然必须常驻在某个地方。
你需要真正记住的是:缓存输入的成本比新输入低八倍。这意味着,相比 prompt 的长度,前缀是否稳定对成本的影响更大。
仅这一点就足以改变你围绕这个模型设计系统架构的方式。具体来说,假设一个 Agent 循环拥有 200K token 的稳定前缀,包括 system prompt、工具 schema 和代码库上下文,并连续运行 50 轮:
No caching: 50 × 0.2M × $2.00 = $20.00
Explicit cache: (0.2M × $2.50) + (50 × 0.2M × $0.17) = $2.20
仅仅通过保证前缀在字节层面保持稳定,成本就相差约 9 倍。实际使用时需要注意:
把所有静态内容放在 prompt 的最前面,把所有动态内容放在末尾。
不要把时间戳、request ID 或随机打乱的上下文注入 system prompt。
如果你在每次请求时重新构建前缀,那就是毫无必要地多付 8 倍费用。
再与同类模型对比一下:Kimi K3 的价格是每百万 token 输入 3 美元、输出 15 美元,因此 Qwen3.8-Max 的价格低了不少,尤其是输出价格。
它的集成过程刻意设计得平淡无奇,而这恰恰是优点。托管 API 同时兼容 OpenAI 和 DashScope,因此集成时只需修改 base URL 和 model ID。它还支持 Anthropic protocol,因此 Cursor、Cline、Codex 和 Claude Code 等工具都可以通过现有集成接入。
下面是模型页面提供的多模态示例,使用 DashScope SDK:
import os
import dashscope
dashscope.base_http_api_url = "https://dashscope-intl.aliyuncs.com/api/v1"
messages = [
{
"role": "user",
"content": [
{"image": "https://example.com/your-image.jpeg"},
{"text": "What is depicted in the image?"}
]
}
]
response = dashscope.MultiModalConversation.call(
api_key=os.getenv('DASHSCOPE_API_KEY'),
model='qwen3.8-max',
messages=messages
)
print(response.output.choices[0].message.content[0]["text"])
如果你已经在使用 OpenAI SDK,只需将 base_url 指向阿里巴巴的兼容模式 endpoint,并将模型名称改为 qwen3.8-max。准确的 base URL 请从 docs.qwencloud.com 获取,不要自行猜测,因为国际部署和中国大陆部署使用的地址不同。
需要注意两个区域 endpoint。服务分为国际部署(qwencloud.com)和中国大陆部署(platform.qianwenai.com),两者需要分别注册和计费,API key 不能互换。
它也已经上线第三方 gateway。Vercel 的 AI Gateway 于 8 月 2 日添加了 alibaba/qwen3.8-max,采用服务提供商原价,不额外加价。
Function calling、structured outputs、batch、prefix completion 和 fine-tuning 均已支持。Responses API 还内置了五种工具:code_interpreter、web_search、web_extractor、t2i_search 和 i2i_search。
在自己手写工具之前,值得先看看这些内置工具。如果你目前还在维护自定义的 web-search 工具封装,现在只需启用一个服务端 flag 即可。
与 7 月的预览版不同,GA 版本发布时给出了实际数字。阿里巴巴随正式发布公布了一张 benchmark 表:Terminal-Bench 2.1 得分为 86.6,SWE-bench Pro 为 67.7,GPQA Diamond 为 92.6。提升最明显的是多模态和 Agent 能力类别,而不是通用推理能力。
补充完整的竞争力表现:
它在大多数视觉 benchmark 项目中也排名领先,其中 OSWorld-Verified 得分为 86.1,Parametric CAD Bench 为 91.5,OmniDocBench 1.5 为 92.1。与上一代模型相比,提升幅度很大:DeepSWE 1.1 从 21.6 提升至 56.6,FrontierSWE 从 40.7 提升至 73.5,JobBench 从 31.3 提升至 53.4。
任何公平的解读都应该提到两个问题,MarkTechPost 也指出了这两点:第一,多模态对比表选择 Qwen3.7-Plus 而不是 Qwen3.7-Max 作为基准,这会让代际提升显得更加亮眼;第二,阿里巴巴自己的 RL scaling curve 在接近 4,000 个训练环境时达到 0.725 的峰值,之后却下降至 0.719 和 0.689。
阿里巴巴确认将在下周开放模型权重,同时发布第二个 checkpoint:Qwen3.8-27B。预计这些模型会在 8 月 10 日当周通过 Alibaba Cloud Model Studio 发布。此前,阿里巴巴在今年早些时候将几款旗舰模型保持为专有模型;这次发布标志着它重新开始开放顶级模型的权重。
坦率地说,目前仍存在以下空白:
没有 model card。GA 发布时依然没有提供正式的训练与安全 model card,没有披露训练数据,也没有公布安全评估方法。
没有公布 license。在权重正式发布之前,还无法审查商业使用条款。
激活参数量来自报道,尚未在官方规格表中得到确认。
目前还没有独立的 Artificial Analysis 评分。
如果你正在从事多模态工作,例如文档处理、视频索引、截图理解或 UI 自动化;希望以远低于西方前沿模型的价格运行长上下文 Agent;或者已经拥有兼容 OpenAI/Anthropic protocol 的系统,只需修改 base URL 并花一个下午进行测试,那么现在就值得试用。
Qwen3.8-Max 模型页面(QwenCloud)——提供权威规格、定价和 rate limit 信息。
已经有人把它用于生产环境了吗?我很想了解真实的延迟和每秒 token 数,因为阿里巴巴尚未公布吞吐量数据。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。