阿里8月3日发布Qwen旗舰,131K最大输出、百万上下文窗口,API定价$2/$6比上代更低;下周开源Max级模型。
发布日期:2026年8月3日(预览版于2026年7月19日公布)
价格:QwenCloud 上 $2.00 / 100万输入 token,$6.00 / 100万输出 token
上下文窗口:100万(最大输入 991K,最大输出 131K)
参数规模:2.4万亿参数,950亿活跃参数
开源权重:预告下周发布,许可证和日期尚未公布
当前访问方式:QwenCloud API、Qwen Studio、QwenWork
ofox 上架:是的,bailian/qwen3.8-max,支持 OpenAI 和 Anthropic 协议
新版旗舰比旧版便宜:$2/$6 对比 Qwen 3.7 Max 的 $2.50/$7.50。
最大输出翻倍至 131K token;100万上下文窗口保持不变。
阿里将首次开源 Max 级模型,同时还有 Qwen 3.8-27B,"下周"发布(已宣布,未定日期)。
官方基准表显示,在大多数 agentic 基准上领先 Claude Opus 4.8,SWE-bench Pro 和 HLE 落后于 Fable 5。这是厂商自己出的表。
表中没有 Kimi K3 列,而这才是大多数人心中的对比项。
它已经在 ofox 上线,名称为 bailian/qwen3.8-max,同时支持 OpenAI 和 Anthropic 协议,所以无需等待阿里开通 Claude 风格的端点,就能直接接入 Claude Code。
Qwen 3.8 Max 是阿里旗下最高端的专业模型,一个2.4万亿参数的多模态系统,每个 token 激活950亿参数。它基于 Qwen 3.5 架构而非全新架构,阿里将其定位在长时程自主工作,而非单轮对话。
发布文章极力强调多日自主能力。其核心演示是在一个公开仓库中,16天左右产生了265次 commit、127个 PR 和151个 issue 的无人值守编码运行。这个数字能否泛化到你的代码库,这是发布文章无法告诉你的。
2026年8月3日。预览版先出,两个日期容易在报道中混淆:
2026年7月19日。在上海世界人工智能大会上宣布 Qwen3.8-Max-Preview。仅通过阿里的 Token Plan 订阅、Qoder 和 QoderWork 访问。无按量付费 API,无模型卡片,无基准表。
2026年8月3日。全面开放。QwenCloud API 开放,定价公布,完整基准表公布,开源权重时间表公布。
任何介于这两个日期之间的报道都包含了过时的"无公开定价"和"无基准"说法,包括引用预览版10%标准价折扣的文章——该折扣仅适用于 Token Plan 窗口期。
目前不是。阿里称权重将于下周——2026年8月10日那周——发布。
实际公布的内容:
未公布:许可证名称、确切日期、开源版本参数量拆分。
三件事要持保留态度直到正式发布。厂商的"下周"是计划,不是交付日期。许可证对商业使用比时间更重要。Qwen 的开源版本历来以 Apache 2.0 许可发布(Qwen3-235B-A22B 在 Hugging Face 上仍带有 apache-2.0),但那是先例,不是 Max 级发布的承诺。而且2.4T参数950亿活跃的模型不是工作站自托管的菜;27B 才是有现实硬件故事的模型。
2026年8月3日快照,QwenCloud 上每100万输入 token 2.00美元,每100万输出 token 6.00美元。新旗舰比替换的型号便宜20%。
这张表两个注脚。cache 行来自不同的价格表,不能直接比较。ofox 的 Qwen 3.7 Max 页面列出 cache 读取 $0.50/M、cache 写入 $3.125/M,这是网关的挂牌而非阿里的。而且检查时 Model Studio 的新加坡价目表正显示3.7 Max 限时5折,所以实际差距可能比表面对比更小。
两边的价格都会变动。在以此构建成本模型前,先拉取当前数字。
总共100万 token,分割为最大输入991K、最大输出131K,另有独立的262K推理上限。
输出上限才是真正的变化。ofox 列出 Qwen 3.7 Max 在同样的100万窗口下最大输出为64K,所以3.8 Max 将每次响应可输出的量翻倍了。这对阿里定位的工作负载很重要:一个在262K推理 token 上规划、然后只有64K来写产出物的模型,是一个会被截断的模型。
阿里在发布时公布了一张完整对比表,整体情况是有好有坏,而非全面碾压。以下所有数字均来自厂商报告。
精选行,Qwen 3.8 Max 对比前沿模型集:
带着常规的折扣来看。竞品的 Terminal Bench 数字是从 Artificial Analysis 和 OpenAI 自己的帖子中引用的,而非 Qwen 重新跑分;SWE-bench Pro 行使用了 Claude Code harness,temp 1.0,top_p 0.95,256K 上下文,这是 Qwen 选择的配置。有几行是 Qwen 自研基准(QwenSWEBench、QwenQoderBench、QwenReactBench),其中与 Qwen 同名的模型正是被测量的对象。
表中最大的Gap比任何具体数字都更响亮:没有 Kimi K3 列。Moonshot 的开源权重旗舰在 Qwen 3.8 预览版前几天发布,是 Qwen 3.8 Max 被问得最多的对比项。阿里选择对比了三个闭源西方模型及其自家前代产品。
目前通过 QwenCloud。三条第一方路径存在,一条被广泛报道的第四条需要核实:
QwenCloud API。模型 ID qwen3.8-max,开发者路径。密钥从 home.qwencloud.com/api-keys 获取。
Qwen Studio。chat.qwen.ai,聊天界面。
QwenWork。工作场所 agent 平台,面向非开发者。
阿里云 Model Studio。南华早报在8月3日报道了全球 API 访问。检查当天,Model Studio 的英文模型列表和价目表最高只有 qwen3.7-max,所以目录页面滞后于公告,尽管端点是共用的。
最后一点值得拆开说,因为品牌掩盖了它。QwenCloud 自己的开发者指南把 OpenAI 兼容端点称为 https://dashscope-intl.aliyuncs.com/compatible-mode/v1,密钥从 DASHSCOPE_API_KEY 读取,这与 Model Studio 使用的 DashScope 国际主机是同一个。QwenCloud 是该基础设施的前端,不是独立的 API。
调用是 OpenAI 风格的:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Summarize this repo's test strategy."}],
max_tokens=4096,
)
print(resp.choices[0].message.content)
Qwen 只提供 OpenAI 风格的 API,所以 Claude Code 无法直接调用 qwen3.8-max。Claude Code 使用 Anthropic Messages 协议,不会协商。网关在第一天就填补了这个空白。
bailian/qwen3.8-max 在发布当天就在 ofox 上线了。2026年8月3日的一次目录调用返回了123个模型,新 ID 已存在,模型页面列出价格为输入 $2/M、输出 $6/M、cache 读取 $0.25/M、cache 写入 $2.50/M,上下文长度1,131,072 token,完成上限131,072 token。四行价格与 QwenCloud 挂牌一致。
值得标记一下,因为它差点坑了我们。目录的 supported_endpoints 字段只列出了 /v1/chat/completions 和 /v1/responses,看起来像是 Anthropic 路径关闭了。实际上不是:2026年8月3日的一次实时 Messages 调用返回了格式良好的结果,stop_reason: end_turn。在围绕该字段做规划之前,先发一个真实请求试试。
两行 shell 就能把它接入 Claude Code:
export ANTHROPIC_BASE_URL=https://api.ofox.ai/anthropic
export ANTHROPIC_MODEL=bailian/qwen3.8-max
或者保留上面的 Python,改两个参数:
client = OpenAI(
api_key=os.getenv("OFOX_API_KEY"),
base_url="https://api.ofox.ai/v1",
)
resp = client.chat.completions.create(model="bailian/qwen3.8-max", ...)
诚实的警告:网关增加了一个不受你控制的跳转,且它的价目表可能滞后于厂商的中期调整。看模型页面,不要看营销页面——这句忠告对自己和别家都适用。
更便宜、输出上限翻倍、agentic 基准大幅跃升。
除非有理由不选,否则选3.8 Max。它更便宜,每次响应输出量翻倍,两款模型用同一套密钥访问,所以迁移只是换一个模型 ID 而不是重新集成。只有在你为可重现性锁定了版本、或你的评估是基于3.7 Max 校准时,才继续用3.7 Max。价格差距是20%,不是数量级,所以单是成本不会迫使你迁移。如果成本是决定因素,3.7 Plus 与3.7 Max 的基准对比涵盖了更便宜的同门兄弟。
对于这次发布重新打开的跨厂商问题,Kimi K3 对比 GPT-5.5 和 Opus 4.8 的文章有开源权重那侧的对比,Kimi K3 使用指南涵盖了访问方式。两款目前在 ofox 上都能找到,K3 是 moonshotai/kimi-k3,这款是 bailian/qwen3.8-max,所以对比它们只是换个模型 ID,而不是采购决策。
Qwen 3.8 Max 什么时候发布? 2026年8月3日,作为全面开放版本,定价和基准均已公布。预览版于2026年7月19日宣布,仅限于阿里的 Token Plan、Qoder 和 QoderWork。
Qwen 3.8 Max 免费吗? 不免费。在 QwenCloud 上按 token 计价,$2/$6 每100万。7月预览版据报道对 Token Plan 订阅者执行标准价的10%;该窗口期已结束。
可以下载 Qwen 3.8 Max 权重吗? 还不行。阿里宣布了2026年8月10日那周的开源权重发布,未定许可证和确切日期。Qwen 3.8-27B 在同一次公布的发版中,是现实的自托管目标。
Qwen 3.8 Max 支持视觉吗? 图片支持,视频支持有保留。QwenCloud 模型页面列出文本、图片和视频作为输入模态,阿里的多模态表报告 MMMU-Pro 82.3、OSWorld-Verified 86.1。通过 ofox,2026年8月3日发送的一张图片被正确描述,prompt token 从60增加到90,所以图片输入在那里是可用的。视频不在 ofox 的目录条目中,不要假设它可用。
可以在 Claude Code 中使用 Qwen 3.8 Max 吗? 不能直接对 QwenCloud,因为 Claude Code 使用 Anthropic Messages 协议,而 QwenCloud 是 OpenAI 风格的。通过一个同时支持两者的网关,第一天就能用,2026年8月3日已测试:将 ANTHROPIC_BASE_URL 指向 https://api.ofox.ai/anthropic 并设置 ANTHROPIC_MODEL=bailian/qwen3.8-max。
Qwen 3.8 Max 和 Qwen 3.8-27B 有什么区别? Max 是2.4T 的专有旗舰,现在通过 API 访问。27B 是一个小得多的模型,宣布在下周的开源权重发布中。两者同代,但不是同一个量级。
Qwen 3.8 Max 比 Kimi K3 好吗? 阿里没有发布那个对比。基准表中没有 K3 列。两者在可用性上也不可比较:K3 现在有开源权重和广泛的网关支持,3.8 Max 没有。
https://qwen.ai/blog?id=qwen3.8 https://x.com/Alibaba_Qwen/status/2084100707423289643 https://www.qwencloud.com/models/qwen3.8-max https://docs.qwencloud.com/developer-guides/text-generation/function-calling https://www.alibabacloud.com/help/en/model-studio/model-pricing https://www.alibabacloud.com/help/en/model-studio/models https://www.scmp.com/tech/article/3362738/alibabas-ai-model-qwen38-max-made-widely-accessible-ahead-open-weights-release https://huggingface.co/Qwen/Qwen3-235B-A22B https://ofox.ai/models/bailian/qwen3.8-max https://ofox.ai/models/bailian/qwen3.7-max https://ofox.ai/llms-full.txt
GET https://api.ofox.ai/v1/models(实时调用,2026-08-03:07:30 122个模型,08:20 有 bailian/qwen3.8-max 共123个)
对 bailian/qwen3.8-max 的实时请求测试,2026-08-03:POST /anthropic/v1/messages(200,Anthropic 风格 body)、POST /v1/chat/completions(200)、一次图片输入调用(200,正确描述,prompt token 90 vs 同 prompt 无图时60)
最初发表于 ofox.ai/blog。