阿里发布2.4万亿参数多模态模型,展示超长上下文持续代码生成能力,可在实际工程场景验证AI编程工具可靠性。
很高兴你能来到这里。周一至周五,我们都会为你送上 TNS 的优质内容,帮助你及时掌握新闻动态,始终保持最佳状态。
请查看收件箱中的确认邮件,你可以在邮件中调整偏好设置,甚至加入更多群组。
在你喜欢的社交媒体平台上关注 TNS。
在 LinkedIn 上关注 TNS。
等待第一封 TNS newsletter 期间,不妨看看最新的精选和热门文章。
Alibaba 发布了 Qwen3.8-Max。这是一款拥有 2.4 万亿参数的多模态模型,专为可能需要数天才能完成的复杂任务而打造。目前,该模型已通过 QwenCloud 和 Alibaba Cloud Model Studio 提供,定价为每百万输入 token 2 美元、每百万输出 token 6 美元。
Qwen3.8-Max 基于 Qwen3.5 架构构建,采用带有混合注意力机制的稀疏 mixture-of-experts 设计。尽管模型总计包含 2.4 万亿个参数,但处理每个 token 时,大约只会激活 950 亿个参数。
mixture-of-experts 架构会针对每项任务调用模型中所需的部分,而不是每次都运行全部 2.4 万亿个参数。据 Alibaba 称,模型权重将于下周发布到 Hugging Face 和 ModelScope,这将是首个提供可下载权重的 Qwen-Max 模型。
该模型的 mixture-of-experts 架构会针对每项任务调用所需的模型部分,但对开发者来说,需要托管的仍然是一个规模极其庞大的模型。
即使同时激活的参数只有 950 亿,完整权重仍然必须存储并分布在多个配备大显存 GPU 的节点上。实际而言,这使得自行托管超出了绝大多数开发者的能力范围,也意味着 Qwen3.8-Max 更适合拥有相应运行基础设施的大型组织和推理服务提供商。
对于拥有相应运行基础设施的大型组织和推理服务提供商来说,Qwen3.8-Max 是一个更现实的选择。
这使 Alibaba 进一步逼近 Moonshot AI 新推出的 Kimi K3,后者拥有 2.8 万亿个参数。Alibaba 持有 Moonshot AI 36% 的股份,因此二者并非完全独立的竞争对手。Kimi K3 发布后数小时内便登上 Arena 前端编程排行榜榜首,需求增长之快迅速压垮了 Moonshot 的 GPU 容量,迫使该公司暂停接受新订阅。Kimi K3 的开放权重版本也遇到了完全相同的问题:需求在 48 小时内便远远超过 GPU 容量,而模型高达 2.8 万亿的参数量,使得除最大型团队以外的其他组织几乎无法自行托管。如今,Qwen3.8-Max 也加入了这场竞赛。
根据 Alibaba 的测试,Qwen3.8-Max 花费 16 天构建了一款命令行应用,用 5 天复现了一篇研究论文的结果,并经过约 500 次迭代改进了一项芯片设计。Alibaba 尚未公布足够的信息,因此外部研究人员目前无法验证这些结果。
在 Alibaba 最具雄心的软件演示中,Qwen3.8-Max 独立花费 16 天构建了“oh-my-cli”。在此期间,它提交了 265 次 commit,创建了 127 个 pull request,并处理了 151 个 GitHub issue。该 repository 及其审计记录已通过 qwen-code-dev-bot/oh-my-cli 公开,因此开发者不必仅仅依赖 Alibaba 对整个过程的描述。
对于长时间运行的任务,模型与其 harness 之间的差异至关重要。
对于长时间运行的任务,模型与其 harness 之间的差异至关重要。模型负责决定下一步做什么,而围绕模型构建的系统则负责处理其他所有事情。正是这些组成部分,决定了一个 Agent 能够连续运行 16 天,还是仅仅 16 分钟后就宣告失败。
Anthropic 收购 CI/CD 初创公司 Mendral,正是为了完善这一基础设施层;GoDaddy 在向 AI Agent 开放其域名注册服务时也吸取了同样的教训:必须先建立 guardrail。
Alibaba 表示,它使用 Agent 在实际工作中可能遇到的复杂项目训练了 Qwen3.8-Max。在使用 QwenWork、Claude Code、Codex、OpenClaw 和 Hermes 进行测试时,该模型的表现相近。
该公司已经发布了相关指南,向开发者展示如何将模型接入这些工具。开发者应该很快就能亲自检验这一说法。Model Studio 兼容 OpenAI 和 Anthropic 的 API 格式,因此团队可以将 Qwen3.8-Max 接入现有的编程工具,无需从头重建整套配置。
在一项实验中,模型只拿到了论文《Unified Data Selection for LLM Reasoning》,没有获得任何代码。Alibaba 表示,Agent 编写了约 7,600 行代码,启动了 33 个 GPU 训练任务,并复现了论文中的六项主要结果。它还测试了另外 18 个想法,并将论文所报告的 AIME24 结果提升了 2.7 分。
在另一项测试中,Qwen3.8-Max 经过约 500 次迭代,对一个密码学电路进行了优化。Alibaba 表示,该模型将设计规模从 8,298 个逻辑门缩减至 678 个。使用开源芯片设计工具 OpenROAD 处理后,其物理面积减少了 81%。
这并不是一次性的编程测试。Agent 必须检查每一次结果,并据此决定下一步要尝试什么。但即使拥有百万 token 的 context window,Agent 能走的距离仍然有限。随着项目规模不断扩大,开发者会希望了解 Qwen3.8-Max 能否记住早期的决策和指令。
每一步都发送接近 100 万个 token 还会引发其他问题。Agentic AI 的经济账已经表明,当自主 Agent 消耗 token 的速度远远超过有人监督的会话时,更低的单 token 价格并不会自动带来更低的项目成本。
但即使拥有百万 token 的 context window,Agent 能走的距离仍然有限。随着项目规模不断扩大,开发者会希望了解 Qwen3.8-Max 能否记住早期的决策和指令。
Alibaba 的内部 benchmark 显示,Qwen3.8-Max 的表现接近 Anthropic 和 OpenAI 的模型。据 Alibaba 称,它在 Terminal-Bench 2.1 中获得了 86.6 分,而 OpenAI 的 GPT-5.6 Sol(max)为 88.8 分。针对同一 benchmark 的独立测试为这两个模型得出了略有不同的分数,因此,外部实验室复测后,这些数字可能还会发生变化。该模型还在 Text Arena 中排名第五,在 Vision Arena 中排名第二。在 Alibaba 自己涵盖 31 项测试的对比表中,Qwen3.8-Max 在 6 项测试中领先;其余大多数测试则由 Claude Fable 5 或 GPT-5.6 Sol 领先。
这些结果使 Qwen3.8-Max 成为一个强有力的竞争者,但尚不足以证明它能够连续数周独立维护生产软件。Alibaba 发布模型权重后,开发者便可以了解 Qwen3.8-Max 脱离该公司自有环境后的实际表现。如果模型迁移到不同基础设施或接入其他编程工具后性能下降,那么这将比它在排行榜上的名次更能说明问题。