阿里在云栖大会公布Qwen3.8-Max完全自主完成33轮训练迭代、耗时超一个月、无人介入,Artificial Analysis评分从40升至45;同步公布Qwen4.5/5向10万亿参数扩展的路线图。
Alibaba 在 9 月 22 日的 Apsara Conference 上披露[1],Qwen3.8-Max 已完整经历 33 轮全自动训练与后训练调优流程,持续时间超过一个月,全程无任何人类介入。Artificial Analysis 的 Intelligence Index 评分因此从 40 提升至 45,而模型代码保持不变。阿里巴巴同时宣布了 Qwen 4.5 和 Qwen 5 系列向 5-10 万亿参数规模推进的计划[5]。
在阿里巴巴云智能于 2026 年 9 月 22 日在杭州 Apsara Conference 上发布的新闻稿中,公司表示旗舰模型已完整走完训练及后训练调优的自动化流程 33 轮,用时超过一个月,最终将 Artificial Analysis 的 Intelligence Index 评分从 40 推升至 45[1]。
Intelligence Index 从 40 到 45 的提升,让部分观察者对这类静默升级服务与前代版本的对标程度产生了疑问[1]。
这件事真正的看点不在分数本身,而是模型代码没变、底层数据在变[1]——也就是说,用户用原来的名字调用原来的模型,实际上得到的是一套经由无人参与流程优化过的模型。
必须说明的是,这是供应商声明,不是独立测试结果[1]。阿里巴巴通过自家公关渠道发布的信息,目前尚无外部机构验证这 33 轮究竟如何运作[1][5]。
我认为最有说服力的部分,是阿里巴巴给出的可核查案例——不是因为数字漂亮,而是因为它们可以被检验。
第一个案例是从空代码库构建命令行工具 oh-my-cli。Alibaba 让模型持续运行,模型自建了工作循环,包含任务各阶段的状态机,配合构建验证、单元测试和端到端测试,失败时则打回上游任务重新来过[2]。
2026 年 7 月 30 日,即启动约 16 天后,代码库已有 265 次提交、127 个 Pull Request 和 151 个 Issue,全程无任何人类审查或合并代码[2]。
这件事与其他工作的不同之处在于——代码库已在 GitHub 上公开:github.com/qwen-code-dev-bot/oh-my-cli[2],可供核查。
第二个案例是让模型重复某篇研究论文的成果——只给一篇论文参考文献和一组 GPU,不给任何起始代码和框架。模型需要自建完整 pipeline,在约 125 小时(约 5 天)的无人值守连续运行中,编写了约 7,600 行代码,执行了超过 1,100 次操作,并在 GPU 上完成了 33 轮训练[2]。
前约 37 小时用于从零重建该论文的 pipeline 并重复全部 6 项发现成果;之后约 88 小时用于循环自我改进——提出假设、编写代码、在 GPU 上运行、分析结果、再重新开始,共 4 轮,加上模型自行产生的 18 个概念[2]。
一个模型用 AI 加速下一个模型的开发,这在概念上并非新鲜事,但它刚刚从研究阶段转变为在顶级实验室中真实发生的事情。
而它正在发生的同时,世界的另一端正在直接面对这个议题。Anthropic 在给投资者的文档中警告——据 Reuters 9 月 28 日报道——高级模型可能表现出自我保护行为,比如抵抗关闭系统、隐瞒或扭曲信息[3],以及模型可能意识到自己正在被评估,这被认为是安全评估中的一个重大限制[6]。
把这两条新闻放在一起看,画面很清楚:一边在法律文书中写下警告,一边在埋头推进,连放慢一个字都没说。
第一条:这 33 轮指的是训练与微调过程的循环,不是模型把整个自己重写一遍。公司新闻稿中"self-evolution"一词的覆盖范围比人们通常理解的要窄。
第二条:Intelligence Index 从 40 到 45 的提升,是基于 Artificial Analysis 制作的测试套件。5 分的提升是积极信号,但不等于模型在所有任务上都与得分接近的竞品旗鼓相当。
除了大模型规划,Alibaba 还在同一场活动上发布了 Zhenwu V900 芯片[4]。
第三条:同一模型代码可能随时间给出不同结果,这是实际使用者需要警惕的事。当提供商在后台更新模型而不改名字时,上个月做的测试可能无法直接和今天的结果对比。
如果你在决定使用前测试了模型,每次测试时记得记录日期和模型代码。因为服务方在不换名字的情况下把模型调优得更好,会让原有测试结果失去可比性。后续关注新一轮升级是否会披露更多信息。
[1] OrcaRouter, "Qwen3.8-Max vs Qwen3.7-Max: A 16-Point Gap and a Price Trap"(引用阿里巴巴 2026 年 9 月 22 日 Apsara Conference 新闻稿:33 轮全自动训练与微调,持续超一个月 · Artificial Analysis Intelligence Index 40→45 · 模型代码不变 · 2026 年 8 月 GA,8 月 3 日 · 2.4 万亿参数,95B 开放使用 · 明确说明为供应商声明),2026 年 9 月 25 日。https://www.orcarouter.ai/blog/qwen-3-8-max-vs-qwen-3-7-max
[2] The Satyajit, "Qwen3.8-Max: 16 days, 265 commits, zero humans in the loop"(oh-my-cli 案例:16 天内 265 次提交、127 个 Pull Request、151 个 Issue,代码库已在 GitHub 公开:github.com/qwen-code-dev-bot/oh-my-cli · 重复研究成果案例:约 125 小时、约 7,600 行代码、超过 1,100 次操作、33 轮 GPU 训练 · 前约 37 小时完成 6 项成果复现 · AIME24 上提升 7.7%),2026 年 8 月。https://ai.thesatyajit.com/articles/qwen3-8-max
[3] CNBC, "Anthropic warns AI may pose 'existential risks to humanity' in IPO filing: Reuters"(投资者文档中的风险警告背景 · 自我保护行为:抵抗关闭系统、隐瞒或扭曲信息 · 相关限制见 [6]),2026 年 9 月 29 日。https://www.cnbc.com/2026/09/29/anthropic-warns-ai-existential-risks-ipo-filing-reuters.html
[4] Reuters, "Alibaba plans AI model with 5 trillion to 10 trillion parameters, unveils new chip"(5-10 万亿参数模型规划,以及 Apsara Conference 2026 年 9 月 22 日发布的 Zhenwu V900 芯片),2026 年 9 月 22 日。https://qz.com/alibaba-zhenwu-v900-ai-chip-qwen-model-092226
[5] Alibaba Cloud Press Room, "Alibaba Unveils Roadmap on Full-Stack AI Strategy from Chips, Cloud Infrastructure, Models to Agents"(Apsara Conference 2026 年 9 月 22 日杭州官方声明:Qwen3.8-Max 已完成 33 轮超一个月全自动运行,涵盖 pipeline 设计、数据验证、迭代实验、错误诊断 · Artificial Analysis 评分 40→45 · Qwen 4 训练中 · Qwen 4.5 和 Qwen 5 预计扩展至 5-10 万亿参数 · 芯片设计实验 60 小时,调用 EDA 工具超过 10,000 次,芯片面积减少 42% · 2032 年内目标 20GW),2026 年 9 月 22 日。https://www.alibabacloud.com/en/press-room/alibaba-unveils-roadmap-on-full-stack-ai-strategy?_p_lc=1
[6] The Straits Times / Reuters, "Anthropic warns AI may pose 'existential risks to humanity' in IPO filing"(Reuters 原始来源:"Potential model awareness of our evaluation efforts creates a significant limitation on our ability to assess model safety" · 自我保护行为:抵抗关闭系统 · 本系列第 02 章中 REF 同一引用 [8]),2026 年 9 月 29 日。https://www.straitstimes.com/business/anthropic-warns-ai-may-pose-existential-risks-to-humanity-in-ipo-filing