阿里Qwen3.8-Max采用MoE架构达2.4T参数,性能媲美Fable5和GPT-4。深度分析稀疏模型参数规模的实际意义与应用成本影响。
披露:我运营着 NovAI,这是一个 API 网关,提供 Qwen3.8-Max 及其他 40 多个模型。本文是一篇分析文章,并非产品推广——下文中的技术观察来自阿里巴巴的公告和独立评测者。
还记得 2024 年吗?当时所有人都在争相推出 400B 模型,大家普遍认为“参数已经不再重要,一切取决于数据质量”。这话没错——但仅适用于稠密模型。随后,DeepSeek 证明了 MoE(mixture-of-experts,混合专家)改变了计算方式:模型可以拥有 671B 的总参数量,但每个 token 只激活 37B 参数,从而以一小部分计算成本获得稠密模型级别的质量。
现在,阿里巴巴把这条路线推向了逻辑上的极致。Qwen3.8-Max-Preview 于 7 月 19 日在上海世界人工智能大会(WAIC)发布,采用稀疏 MoE 架构,总参数量达到 2.4 万亿。这接近 DeepSeek V3 总参数量的 4 倍,也让 Qwen 与拥有 2.8T 参数的 Kimi K3 处于同一梯队——它们是目前可通过 API 使用的两个最大模型。
但真正有意思的是:它不只是更大。这是首个在如此规模下原生支持多模态的 Qwen 模型,也是首个被独立评测者认为确实能够与 Fable 5 和 GPT-5 竞争的中国实验室万亿参数模型。
此前的 Qwen 旗舰模型(Qwen3-Max、Qwen3.7-Max)都只支持文本。Qwen3.8-Max 可以原生处理文本、图像、视频和文档——不需要单独的视觉适配器,也不是在模型上硬接一个“视觉模型”。这很重要,因为:
你不需要把不同类型的输入路由到不同模型。
模型可以跨模态推理(例如:“阅读这份 PDF,查看这张截图,然后告诉我 UI 是否符合规格说明”)。
无需预先转换为纯文本,即可处理 PDF、HTML、Markdown 等文档。
这正是它与仅支持文本和图像的 Kimi K3 相比,真正具有差异化的地方。
独立评测者 Thomas Wiegold 使用 4 项编程 benchmark 测试了 Qwen3.8-Max。他最有意思的观察与质量无关,而是模型的工作过程:
“它使用 Playwright 检查按钮、菜单、动画和宽高比,仿佛每运行一次测试都能拿到报酬。”
这个模型不会只生成代码,然后就此停下。它会先生成代码,再通过浏览器自动化测试自己的输出,随后反复迭代。这种 Agent 式行为已经内化在模型的默认响应模式中。它很慢——构建一个网站花了 30 多分钟——但其输出质量被形容为“我用这个 prompt 得到过的最佳结果”。
这是一次意义重大的转变。我们正在从“生成代码的模型”,迈向“能够生成、测试、调试并迭代的模型”。实现这一点的并不是参数量,而是训练方法。但 2.4T 参数为模型提供了足够的容量,使其可以同时具备生成和评估能力。
这听起来很无聊,但实际上意义重大。Qwen3.8-Max 的 API 原生兼容 OpenAI 和 Anthropic 两种协议。这意味着:
Cursor 用户只需修改一行配置,就能切换到 Qwen3.8-Max(OpenAI 协议)。
Claude Code 用户也可以用同样的方式切换(Anthropic 协议)。
不需要 wrapper、adapter 或 translation layer。
大多数中国模型只支持 OpenAI 格式。原生支持 Anthropic 协议,意味着在那些仅支持 Anthropic API 的工具中,Qwen3.8-Max 可以作为 Claude 的直接替代品使用。
这是阿里巴巴的说法。目前没有发布任何 benchmark 表格,也没有 model card。能找到的唯一一项独立评测(Trilogy AI 的 StackPerf)中,Qwen3.8-Max 得分为 80,Kimi K3 得分为 83——而且只测试了一个任务,仅运行了一次。请把它视为一个数据点,而不是最终结论。
总参数量 ≠ 激活参数量。在稀疏 MoE 模型中,每个 token 只会激活一部分参数。阿里巴巴尚未披露激活参数量。该模型每个 token 可能激活 50B、100B,也可能是 200B 参数——真正决定推理成本和延迟的是这个数字,而不是总参数量。
官方作出了承诺,但没有公布日期和许可证。上一代 Qwen3-Max 开放了权重,Qwen3.7-Max 则没有。可以认为这件事很可能发生,但仍存在不确定性。如果开放权重最终落地,那么真正值得关注的将是从旗舰模型蒸馏而来的小型 Qwen3.8 模型,它们会成为本地 AI 领域的主角。
Qwen3.8-Max 已可通过兼容 OpenAI 的网关使用。如果你已经在使用 OpenAI SDK:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_KEY",
base_url="https://aiapi-pro.com/v1", # any OpenAI-compatible gateway
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Your prompt here"}],
)
就这么简单。流式输出、function calling 和多模态输入都可以使用标准的 OpenAI SDK 模式。
如今,前沿模型赛道确实已经非常拥挤。以下是截至 2026 年 7 月的真实局面:
2026 年真正拉开差距的已经不是质量——排名前五的模型都“非常优秀”,彼此也“十分接近”。真正的差异在于价格、速度、可用性和 guardrails。Qwen3.8-Max 在价格上占优(预览期价格为标准费率的十分之一),但在速度上落后。
Qwen 是一个开放权重模型家族,为大量本地 Agent 配置提供了基础能力。如果承诺中的开放权重如期发布,并且 Qwen3.8 的改进能够下放到 7B~72B 规模,那么这才是真正值得关注的故事。一个拥有蒸馏多模态能力、可以在消费级 GPU 上运行的 72B Qwen3.8 模型,将彻底改变医疗、法律和企业等对隐私敏感的使用场景。
Qwen3.8-Max 确实是一款令人印象深刻的模型,但它仍以预览版形式发布,并留下了许多尚未解答的问题。2.4T 参数量只是一个吸引眼球的标题,而不是完整的技术规格——真正重要的是原生多模态、自我验证行为以及协议兼容性。
如果你要为快速迭代选择模型,可以选择速度更快的方案,例如 Grok 4.5、DeepSeek V4 Flash 或 Qwen-Plus。如果你要处理需要一次性深入完成的任务——例如构建完整网站、审计复杂代码库或开展深度研究分析——Qwen3.8-Max 足以跻身第一梯队;按照预览期定价计算,它还是该梯队中最便宜的选择。
你可以在 NovAI 使用 2 美元免费额度进行尝试(无需信用卡),也可以通过阿里巴巴自己的 Token Plan 使用。用你自己的 prompt 测试并自行判断——这正是推出预览版的意义所在。
包含 Python、Node 和 curl 示例的完整 API 指南:Qwen3.8-Max API Guide。NovAI 是独立 API 网关,与 Alibaba Cloud 没有关联。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。