Qwen3.8-Max作为Qwen系列最强多模态模型发布,业界评价其开源姿态与商业变现之间的矛盾;腾讯混元已集成该模型,API商业模式成为关注焦点。
本周,阿里巴巴发布了 Qwen3.8-Max。作为 Qwen 系列迄今为止最强大的模型,这款多模态模型参数量达 2.4 万亿,包含了模型在训练过程中用于调整推理的内部变量。
Qwen3.8-Max 建立在 Qwen 3.5 的架构基础之上,支持最高 100 万 token 的上下文窗口,能够处理海量代码库或数百页文档,以执行所谓的长时任务。
该模型采用稀疏混合专家设计以提高运营效率,并使用混合注意力机制来提升内存效率和长上下文场景下的建模与扩展能力。
"我们正式发布 Qwen3.8-Max,这是 Qwen 家族迄今为止能力最强的模型。这也标志着我们首次开源 Qwen-Max 级模型的权重——开源权重将于下周发布。"阿里巴巴表示。
朋友之间差个 4000 亿参数算什么?
对于这则公告,外界的反应主要围绕参数量展开,尽管参数量并不一定能保证模型能力。此外,阿里巴巴的 Qwen 与其他中国 AI 前沿模型竞争对手——包括 DeepSeek 和 Moonshot AI——的差距也是关注点之一。Moonshot AI 的 Kimi K3 于上月发布,拥有 2.8 万亿参数——但朋友之间差个 0.4 万亿(即 4000 亿)参数又算什么呢?
其他亮点还包括模型在核心文本和视觉智能任务上的表现,以及新模型在 Arena 排名榜上的位置。
这些都是评估任何新模型发布时值得关注的方式,但这场讨论中真正重要的,或许是开发者的看法。
独立软件工程和 AI 顾问、自称同名运营机构的首席 AI 官的 Jeff Brokaw 告诉 The New Stack,他自 2016 年起就一直在构建这类东西,而且有一个老习惯:先看发布说明,再看排行榜。
"真正让我感兴趣的细节被埋藏在深处……阿里巴巴声称权重是开放的,但实际上还没有放出权重。"Brokaw 说道。"发布说明写的是开源权重'承诺后续发布',而 Moonshot 几个月前用 Kimi K3 也用了完全相同的策略。这不是一个技术脚注;这是 API 商业模型穿上了开源的外衣,就为了发布会上的那张照片。"
"阿里巴巴的排名基于其自身评估……同一天发布的基准测试就是实验室给自己出题自己打分。值得作为野心来读,而不是一个定论的排名——直到有外部机构运行同样的测试。"
"Qwen3.8-Max 在文本 arena 中排名第五,在视觉 arena 中排名第二,但这两个数字都来自阿里巴巴自己的评估,与发布同日发布,对比组也是阿里巴巴自己挑选的。"Brokaw 提醒道。"同一天发布的基准测试就是实验室给自己出题自己打分。值得作为野心来读,而不是一个定论的排名——直到有外部机构运行同样的测试。"
使用量份额不是值得庆祝的数字
Brokaw 解释称,他的软件工程方法是让 AI 在生产环境中运行,而不是幻灯片式的(就像在 PPT 上做出宏大承诺之类),这意味着"使用量份额还不是值得庆祝的数字",我们应该关注的是采用数量。在他看来,这次发布没有说明 2.4 万亿参数和 100 万 token 上下文在毛利率层面是什么样子。他说,这才是决定这究竟是一门生意还是一场极其昂贵的肌肉秀的关键数字。
开源 CMS 公司 Umbraco 的 Staff Engineer Phil Whittaker 告诉 The New Stack,他总体上同意关于排名的观点。
"随着模型走向商品化,这类 Qwen3.8-Max 所展示的基准测试将变得不那么重要。"Whittaker 说道。"速度和 token 效率将成为更重要的指标,但归根结底一切都取决于评估框架(harness)的质量。"
至于 Qwen3.8-Max 在代码生成、测试和日志分析中独立迭代时究竟需要多少真正的开发者监督,Whittaker 的看法同样平衡。
"如果与 Qwen3.8-Max 配套的验证循环、指令和评估框架足够好,那么确实不需要多少开发者监督。但我也会使用来自不同模型提供商的对抗性审查智能体作为进一步验证。"Whittaker 补充道。"这些模型排名确实值得一读,但不会说服我切换到 Qwen3.8-Max。评估框架的质量、与模型的集成以及 Claude 和 OpenAI 的 CoWork 等竞争产品——这些因素仍然让这些平台处于市场领导地位。"
在 Hacker News 上关于 Qwen3.8-Max 话题的大量评论中,对于基准测试的怀疑态度形成了巨大共识,也有一些对中国的不信任言论……而最重要的是,在生产环境中使用这类开源权重模型之前,必须建立一个强大的评估框架。
是啊,你建了座城堡,是不是忘了护城河?
Ajit Dhiwal(又名 me551ah)的观点呼应了 several comments 中关于 AI 公司(如阿里巴巴)是否有"护城河"的讨论,即是否拥有难以复制的持久竞争优势——比如专利算法、Facebook 的社交图谱、AWS 的规模和广度,或者一旦部署后切换平台的成本高昂(如 SAP、Oracle、Salesforce、Snowflake 等)。
"LLM 不会学习或记忆任何东西,这使得用户可以非常容易地随时切换 LLM。"Dhiwal 写道。如今大多数流行的 AI 框架只需一行代码就能完成切换。这让我不禁思考,下一代 LLM 是否会基于微调,让 LLM 真正从用户过去的行为中学习,从而为产品赋予一定程度的粘性。OpenAI 曾为 GPT-3.5 提供微调服务,但似乎已经不再提供这项服务了。"
John Deere 企业架构与 AI 高级软件工程师 Anwar Khan 告诉 The New Stack,目前还没有人将 Qwen3.8-Max 投入生产,包括他在内,但他认为这篇发布文章值得仔细阅读,而最有用的内容在脚注里。
阿里巴巴指出,Qwen3.8-Max 在自主编程和长时执行方面展现了"卓越的熟练度",能够在无需人工干预的情况下长时间独立运行。在内部测试中,该模型在 16 天内自主完成了一个真实的软件工程项目。
天哪,是阿里巴巴 oh-my-cli
"关于这里真正需要多少人工监督,最好的分析就在阿里巴巴自己的文章里,我是真心这么说的。"Khan 说道。"仔细读读该公司对 oh-my-cli 运行的描述(这是一个已在 GitHub 上完全开源的自进化智能体框架):一个 issue 状态机、一个调度器、一个监控器、一个看门狗,以及端到端测试加上每一次合并都需要通过的持续集成检查。"
他提醒我们,这个测试案例在 16 天内产生了 265 次提交和 127 个 pull request,每一个都是通过测试才被接受的,没有一个是凭感觉的。
"供应商在这 16 天里也不是完全信任这个模型的。他们信任的是自己构建的这个笼子。这才是正确的思路,而这个笼子才是值得复制的东西。"Khan 强调道。
"就 Qwen3.8-Max 的 100 万 token 上下文窗口而言,检索质量并不会随着窗口增大而提升。"Khan 澄清道。"把 100 万 token 塞到一个模型面前,你需要的那段内容要与一大波看起来相似的材料竞争,而失败模式不是你能够捕捉到的拒绝响应——而是一个自信满满的答案,但却是从错误的段落中拼凑出来的。我参与过的所有生产系统中,更小但经过更好筛选的上下文始终优于更大的上下文。"
他确实承认,这个窗口真正带来的是原型开发速度——开发者第一天不用构建检索系统就能得到一个可用的 demo,这是真实的价值。
"一旦你的语料库超过了 demo 的规模,这就就不再是一个架构了,而这种退化是静悄悄的,这是最糟糕的一种。"他补充道。
"Qwen3.8-Max 不仅仅是一个基准测试的故事。它是试图为企业提供一个完整的替代技术栈来构建和运行智能体。Qwen 的长时编程演示令人印象深刻,但 16 天的智能体运行改变了风险单元。"
Qwen3.8-Max 很重要,但容量不等于判断力
综合审视 Qwen3.8-Max,感觉似乎必然会有粉丝、谨慎的支持者和怀疑者的混合。AI 原生系统和产品构建公司 Evkii 的创始人兼首席 AI 官 Heath Squier 告诉 The New Stack,"Qwen3.8-Max 很重要",因为阿里巴巴将一个前沿规模的 2.4 万亿参数模型与承诺的开源权重发布及其自有的 Qoder 部署工具结合在一起。
"这使得 Qwen 不仅仅是一个基准测试的故事。它是试图为企业提供一个完整的替代技术栈来构建和运行智能体。"Heath 说道。"Qwen 的长时编程演示令人印象深刻,但 16 天的智能体运行改变了风险单元。一个小错误可以在数千个操作中不断累积。企业对 Qwen 的价值将取决于团队是否能够检查其检查点、追踪其决策、限制其权限,并在错误进入生产环境之前回滚工作。"
Heath 建议,如果阿里巴巴按承诺发布 Qwen3.8-Max 开源权重,企业将"获得更多控制权",包括部署、数据边界和模型评估。但他警告,代价是安全性、监控、打补丁和回归测试都将转移到运营商身上——所以 Qwen 给了企业更多控制权,但也给了他们更多责任。
"一个非常大的上下文窗口可以帮助 Qwen 在大量代码库中工作,而无需不断重建上下文,但容量不等于判断力。真正的考验是 Qwen 能否在长时间运行中保持原有的业务目标,而不是悄悄地优化了错误的代理指标。"Heath 补充道。
对于 Qwen3.8-Max 的出现是否应该促使开发者取消 Claude 或 GPT 订阅这个问题的最终平衡,John Deere 的 Khan 指出,阿里巴巴自己的发布页面已经给出了更好的答案。其快速入门告诉用户保留 Claude Code 或 Codex,只需将 base URL 指向 QwenCloud。
"即使是这个挑战者,也默认你的工具链保持不变。"Khan 总结道。
Qwen3.8-Max 可用性
Qwen3.8-Max 通过阿里巴巴云 Model Studio 的 API 提供服务。也可以通过 QwenWork(阿里巴巴的工作场所 AI 智能体平台)使用。阿里巴巴位于杭州的中央公关部门受邀对此报道进一步置评;我们收到的回复是邀请阅读该公司博客。