阿里巴巴发布新一代开源基础模型,2.4 万亿参数,支持长链条自主任务(复现论文、设计芯片)。权重即将开源,为程序员提供本地部署和定制开发机会。
阿里巴巴发布了 Qwen3.8-Max,这是一款拥有 2.4 万亿参数的语言模型,旨在独立完成持续数天的复杂任务。
在测试中,该模型自主构建了软件,复现并改进了一篇研究论文的结果,还成功运营了一家模拟的电商企业。
内部 benchmark 显示,其性能与西方顶尖模型处于同一水平。Qwen3.8-Max 现已上线,模型权重预计将于下周发布。
阿里巴巴的新旗舰模型 Qwen3.8-Max 专为自主处理持续数天的复杂任务而打造,涵盖复现研究论文、自动设计芯片等场景。团队计划于下周发布模型权重。
阿里巴巴 Qwen 团队发布了迄今能力最强的语言模型 Qwen3.8-Max。该模型共有 2.4 万亿参数,每次查询激活 950 亿参数。Qwen3.8-Max 基于 Qwen3.5 架构打造,团队表示,它的重点并非仅仅回答一次性的 prompt,而是能够在较长时间内独立完成复杂任务。
阿里巴巴最早于 7 月中旬公布了该模型的预览版,用户可以通过阿里巴巴的 Token Plan、Qoder 和 QoderWork 使用,价格为标准价格的 10%。当时,团队已经提到它拥有 2.4 万亿参数,并将其排名置于 Fable 5 之后,但没有公布 benchmark。Qwen3.8-Max 是 Qwen-Max 系列中首个将公开提供权重的模型。
为了展示 Qwen3.8-Max 的编程实力,团队公布了三个案例。在这些案例中,模型全程没有获得任何人工协助。
在第一个案例中,Qwen3.8-Max 花费 16 天构建了命令行工具 oh-my-cli。模型接收用户提交的需求,将其转化为 GitHub issue,分配给自己,编写代码、运行测试,并通过迭代不断改进结果。截至 2026 年 7 月 30 日,它已经完成 265 次 commit、127 个 pull request 和 151 个 issue,全程没有任何人工介入。
在第二个案例中,模型收到了研究论文《Unified Data Selection for LLM Reasoning》,但没有获得任何初始代码。它的任务是复现论文结果,然后进一步改进这些结果。据团队介绍,在大约 5 天、约 125 小时的计算时间里,Qwen3.8-Max 编写了 7,600 行代码,并运行了 33 个 GPU 训练任务。它首先复现了论文中的全部六项主要结果,随后分四轮测试了自己提出的 18 个想法,最终在 AIME24 数学 benchmark 上比论文中的方法高出 2.7 分。
第三个案例是阿里巴巴天池平台上的 WWW2025 多模态对话意图识别挑战赛,共有 526 支人类团队参赛。在 24 小时内,模型微调了多个中文语言模型,同时针对商品截图微调了 Qwen2.5-VL-7B,并将这些模型组合成一个投票系统。经过 45 次提交,准确率从 0.60 提升至 0.853。这一成绩超过了 526 支人类团队中的 458 支。
另外两个案例面向需要经历数百轮交互的任务。在第一个案例中,Qwen3.8-Max 需要设计一种用于加密方案的密码学基础模块。此类电路的关键效率指标是所需逻辑门的数量——逻辑门是芯片上的基本组成单元。逻辑门越少,芯片就越小、效率也越高。模型最初得到的是一个能够运行但十分臃肿的设计,需要使用 8,298 个逻辑门;经过大约 500 次迭代后,它将这一数字压缩到了 678 个。
使用开源工具 OpenROAD 自动完成布局后,芯片的物理面积从 106×106 微米缩小到 46×46 微米,降幅达到 81%。Qwen 团队表示,即使经历了数百次迭代,模型仍在持续进行深层次的结构调整,而没有满足于停留在表面层面的微调。
第二个案例是 E-Commerce-Bench,这是一个基于淘宝和天猫匿名数据构建的线上零售全年财年模拟环境。模型初始拥有 10 万元资金,需要同时经营多家网店,持续一整年。这意味着它要负责采购商品、使用自然语言与供应商谈判、调整价格、处理退货,还要应对台风或供应链中断等危机。
供应商池中隐藏着 152 名骗子,模型需要将他们识别出来。Qwen3.8-Max 最终获得了 416,252 元余额,将初始资金翻了两番。这一成绩比排名第二的 GLM 5.2 高出 38%,也是前代模型 Qwen3.7-Max 成绩的 2.5 倍以上。模型在年初采取了激进的投资策略,并在节假日旺季实现了超过 10 万元的净利润。
Qwen3.8-Max 可以处理超过 200 页的文档,以及时长超过 100 小时的视频,这是团队对其多模态任务能力的描述。团队还推出了一个名为 RecreationBench 的新 benchmark,要求模型在无法访问源代码的情况下,重建能够运行的应用程序。
模型只能通过交互观察目标应用,也就是使用鼠标点击和键盘输入。测试覆盖 Ubuntu、macOS、Windows、Android 和 Web。与此同时,团队还发布了扩展库 Qwen-MM-Plugins,为现有 Agent 系统增加图像与视频处理、视觉工具调用以及多模态记忆能力。
阿里巴巴公布的 Qwen3.8-Max benchmark 结果,将其在编程、Agent 任务、推理和多模态任务方面的表现与其他前沿模型进行了比较。|图片:阿里巴巴

在 Qwen 团队公布的 benchmark 表格中,Qwen3.8-Max 在多个类别中的表现接近或超过 Claude Opus 4.8、Claude Fable 5 和 GPT-5.6 Sol。在 PaperBench 上,Qwen3.8-Max 得分为 93,是参与对比的模型中最高的。在 TerminalBench 2.1 上,它获得了 86.6 分,落后于 GPT-5.6 Sol 的 88.8 分。与模型厂商自行公布的数据一样,这些结果来自内部测试,目前仍有待独立验证。
Qwen 团队认为,模型之所以能够持续执行如此长时间的任务,得益于强化学习期间训练环境的大幅扩展。训练不再只关注单一任务,还覆盖了持续数天的工作流、由单个文件扩展至多层嵌套目录结构的操作,以及多种 Agent harness。
团队在十多个 benchmark 上的内部综合得分指数从 0.474 上升到 0.725。当训练环境数量达到约 4,000 个时,模型表现最佳;此后得分略有下降。
据 Qwen 团队介绍,随着 RL 训练环境数量和计算时间的增加,Qwen3.8-Max 在数十项内部及公开 benchmark 上的得分稳步提升。

Qwen3.8-Max 最直接的竞争对手同样来自中国。Moonshot AI 于 7 月 27 日在 Hugging Face 上发布了采用开放权重的 Kimi K3。这是一款多模态混合专家模型,拥有 2.8 万亿参数和 100 万 token 的上下文窗口。除模型权重外,Moonshot 还公开了其部分基础设施,包括 attention kernel、MoE 通信库,以及用于大规模运行 Agent 的工具。不过,独立测试为该公司的宣传降了温:无论是网络安全能力还是复杂数学能力,K3 都明显落后于西方顶尖模型。
Qwen3.8-Max 现已通过 QwenCloud 提供。模型权重预计将于下周在 Hugging Face 和 ModelScope 上线。该模型同时支持 OpenAI 的 Chat Completions 格式和 Anthropic 的 API 协议,因此可以直接接入 Claude Code、Codex、Qoder CLI、Qwen Code 和 OpenClaw。用户可以通过名为 reasoning_effort 的参数在三个级别之间进行选择,以速度换取更充分的推理。
Qwen 表示,该模型在不同 Agent harness 中的表现相近,并未针对自家环境进行专门调优。|图片:阿里巴巴

Qwen3.8-Max 并不是阿里巴巴近期推出的唯一产品。几周前,团队发布了 Qwen-Image-3.0,这是一款面向信息密集型布局的图像生成器,能够处理最长 4,500 token 的输入,并可渲染小至 10 像素且清晰可读的文字。在模型规模的另一端,阿里巴巴也在继续推进 Qwen3.6-35B-A3B 等小型开放模型。该模型共有 350 亿参数,但每次只激活其中的 30 亿参数。
订阅 THE DECODER,即可享受无广告阅读、每周一期的 AI newsletter、每年六期独家前沿报告「AI Radar」、完整历史文章访问权限,以及评论区访问权限。