Qwen3.8-Max是2.4万亿参数MoE模型,活跃参数仅约95B,支持100万token上下文。下周将开源全量权重,同时兼容OpenAI和Anthropic协议,可直接用Claude Code驱动。
Intro:首次开源 Max 级模型——但更大的信号藏在 Endpoint 里
8月3日,阿里正式发布 Qwen3.8-Max:一款 2.4 万亿参数的 MoE 模型,每个 Token 仅激活约 95B(~4%),拥有 100 万 Token 的上下文窗口,支持文本+图像输入。QwenCloud 定价为每百万 Token 2 美元输入 / 6 美元输出,采用单一扁平计价层级,从第 0 个 Token 一直覆盖到 100 万 Token 上限——这与大多数长上下文模型随着提示增长而阶梯式加价的做法不同。阿里还承诺下周(约8月10日)将在 Hugging Face 和 ModelScope 上发布完整权重——这是 Qwen 首次开源 Max 级旗舰模型。但对于工程师而言,这次发布最值得关注的不是参数规模——而是一个不起眼的 URL:https://dashscope-intl.aliyuncs.com/apps/anthropic。Qwen 同时提供 OpenAI 兼容(chat completions / responses)和 Anthropic Messages 协议兼容的端点——因此,原本为 Claude 生态编写的工具只需修改两个环境变量就能直接跑在 Qwen 上:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_MODEL="qwen3.8-max"
claude # Claude Code 直接驱动 Qwen3.8-Max
阿里甚至官方发布了五款编码 Agent 的集成配置——Claude Code、Codex、Qoder、Qwen Code 和 OpenClaw——而且其大部分自有编码基准测试都在 Claude Code 测试框架内运行。协议层的收敛正在将"切换模型"从一个重构项目变成一次配置变更。
I. 规格与定价:稀疏激活如何支撑 $2/$6 的价格
Qwen3.8-Max 基于 Qwen3.5 架构构建,总参数 2.4T,激活参数 95B,激活比约 4%。作为对比:上周备受关注的 Kimi K3 总参数 2.8T、激活参数 104B——Qwen3.8-Max 在两个维度上都是"更小的那个",而这恰恰是它能将价格维持在 $2/$6 的结构性原因:MoE 稀疏激活意味着推理成本主要取决于激活参数而非总参数。推理深度通过三个层级的 reasoning_effort 来控制:xhigh(默认,深度分析)、medium(平衡)、low(节省成本、更快)。注意默认层级是 xhigh,而且思维 Token 是按输出计费的,所以预算需要设置在报价之上。缓存定价值得单独提及,因为它是多模型编排中最容易被忽视的成本差异:

同一段被反复引用的系统提示词,在两家厂商的账单上跑出了完全不同的曲线。
II. 背景:降价潮 + 协议收敛——模型正在变成"即插即用零件"
这次发布出现在一个竞争激烈的窗口期:7月30日,OpenAI 将 GPT-5.6 Luna 降价 80%($0.20/$1.20),Terra 降价 20%($2/$12);7月31日,DeepSeek 发布 V4-Flash 作为完整版本(284B 总参数 / 13B 激活参数,100万上下文),Artificial Analysis 估计其成本比顶级旗舰低两个数量级;Tom's Hardware 甚至将这轮价格战描述为"逐底竞争"。价格战的另一面是协议战的"停火":与其说服开发者迁移 SDK,不如直接兼容对方的协议。OpenAI 的 chat completions 已经是事实标准;现在 Anthropic Messages 协议成为了第二个——Qwen,以及越来越多的中国模型,选择同时暴露两个接口。结果就是:模型选择的切换成本从"重写调用层"降到了"改 base_url 和 model 字符串"。
III. 但"协议兼容"≠"无缝切换":四个实践陷阱
真正做过跨模型故障切换的团队都知道,兼容的端点解决的是请求格式问题——而非语义差异:
推理参数说的是不同的语言。 控制思维深度,Qwen 用 reasoning_effort + enable_thinking,OpenAI 用 effort 层,Anthropic 原生协议用 thinking blocks。当通过兼容层转发时,这些参数要么被静默丢弃,要么行为不一致,必须逐模型验证。
流式事件结构不同。 在 Qwen 的 OpenAI 兼容流中,reasoning_content delta 先于 body 到达;原生 Anthropic SSE 按 block 分块内容。如果中间件只解析一种格式,切换模型就会丢失字段。
切换瞬间缓存归零。 上表中所有缓存折扣都绑定在单一厂商。一旦跨厂商故障切换,长的系统提示词就要全部以 miss 价格重新计算——在高频率场景下,这种"切换税"可能超过降价省下的钱。
限速和区域路由。 Qwen3.8-Max 有三个区域端点——北京、新加坡、美东——各自有独立的限速;写在业务代码里的跨区域重试逻辑很快就会变成无人敢碰的意大利面条。
IV. 实践:将这些差异折叠到统一访问层
解决上述四个陷阱的通用方案是将协议适配、重试和路由从业务代码中抽离,放到统一的模型中继层。这也是我们在生产环境中使用 wrouter.ai 这类中继服务的原因:
稳定性: 当单一厂商被限速或某个区域故障时,重试和切换发生在网关层,业务代码无感知;
模型完备性: GPT-5.6 系列、Claude、Gemini、Qwen3.8-Max、DeepSeek V4 等新模型一上线即可使用,无需逐厂商开户和集成协议;访问只需标准 OpenAI 协议——把 base_url 指向中继即可:
from openai import OpenAI
client = OpenAI(base_url="https://wrouter.ai/v1", api_key=***
for model in ["qwen3.8-max", "gpt-5.6-terra", "claude-opus-5"]:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": "Summarize the root cause of this failed build log"}],
)
print(model, r.choices[0].message.content[:80])
使用同一个密钥和同一套调用代码,你就可以把8月3日发布的模型和你现有的主力模型放进同一个 A/B 评估循环——这就是"模型即插即用"的完整工程形态。
凭借 100 万上下文窗口上 $2/$6 的扁平定价,以及下周开源的承诺,Qwen3.8-Max 将 Max 级旗舰拉上了一条商品化轨道;其双协议端点宣告了调用协议不再是护城河。接下来一周有两件事值得观察——权重是否会按计划在8月10日左右登陆 Hugging Face,以及第三方推理提供商接入后的价格分布。模型层正在加速变革;将切换成本压缩到一次配置变更,是你从现在就可以做的准备。
Qwen 官方发布:https://www.alibabacloud.com/blog/qwen3-8-max-a-new-bar-for-coding-and-cowork_603421
Developers Digest 规格与定价验证:https://www.developersdigest.tech/blog/qwen-3-8-max-release-2026
Apidog 双协议集成深度解读:https://apidog.com/blog/what-is-qwen-3-8/
OpenAI GPT-5.6 降价公告:https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/
Tom's Hardware 价格战分析:https://www.tomshardware.com/tech-industry/artificial-intelligence/ai-companies-are-now-racing-to-the-bottom-crashing-token-prices-and-competitive-models-push-companies-to-cut-costs