阿里发布 2.4T MoE、100 万上下文模型,OSWorld-Verified 86.1 分超越 GPT-5.6 和 Claude Fable 5;作者给出评估开放权重可信度的实用检查清单。
Alibaba 于 8 月 3 日发布了 Qwen3.8-Max:一款 2.4 万亿参数的 MoE 模型,支持 100 万 token 的上下文窗口,定价为每百万 token 2 美元 / 6 美元。引发所有人关注的核心主张:在 OSWorld-Verified 上达到 86.1 分,领先于 GPT-5.6 Sol Max(83.2)和 Claude Fable 5(85.0)的代理式计算机使用能力。开源权重承诺"下周"发布,同时还有一个 27B 的兄弟模型。
我希望这是真的。 frontier 级别的开源权重将是继 Llama 以来对独立开发者最有利的事情。但我之前被发布日的基准测试兴奋冲昏过头,所以这是我实际运行检查表——用 Qwen3.8-Max 作为具体案例。
"开源权重"在这个标题里做了大量修饰,因为在我写这篇文章时,许可证还没有披露。Apache 2.0 和"带有商业使用条款的自定义许可证(会标明你的收入门槛)"都被 routinely 称为开源。在没有许可证文件之前,就没有真正的发布——只有一篇新闻稿。
如果权重以限制性条款发布,那么 2.4T 标题模型就不那么重要了——更重要的是那个 27B 兄弟模型是否获得宽松许可证。说到这里:
2.4T MoE 不是你能自托管的东西。即使有 MoE 稀疏性, serving 它也意味着需要 GPU 集群和严肃的推理工程——现实情况下你只能通过 Alibaba 的 API 来使用它,这对独立开发者来说,"开源权重"在很大程度上只是一个仪式性的意义。
真正改变我生活的发布是 Qwen3.8-27B。一个 27B 模型如果能继承旗舰代理训练的大部分能力,就能跑在正常人能租到的硬件上。权重放出时,我要下载的第一个文件就是这个。
上面的每一个数字都来自 Qwen 自己的发布材料。这不是指控——每个人都是这样发布的——但自报基准测试有一个特定的失败模式:供应商挑选基准测试、挑选 effort 设置,以及对比模型的配置。
我等待的东西:Terminal-Bench 和 OSWorld 排行榜上的独立运行、第一批"我复现了 X,得到了 X 减去一些" 的帖子,以及——最诚实的信号——模型在没有人优化过的任务上的表现。Qwen 自己报告的 Terminal-Bench 2.1 分数(86.6)已经低于 GPT-5.6 Sol 的 88.8,这一点我实际上觉得令人安心: uniformly-winning 的发布材料才是值得怀疑的。
$2/$6 有竞争力但不颠覆——Sonnet 5 这个月的输入价格相同。颠覆性的数字是每百万缓存输入 token 0.25 美元。代理工作负载会 obsessively 重新读取上下文;如果你的缓存命中率还不错,这个价格就把旗舰模型拉到了预算级别。在为代理使用场景比较模型时,缓存输入价格是我第一个放进电子表格的数字。
发布周的模型有一种会被悄悄修补、重新量化或限流的倾向,一旦真实流量到来。除非这个模型解决你今天就有的问题,否则等待七天的成本几乎为零,而你获得的信息是巨大的。
真心激动,暂持怀疑。如果许可证干净、27B 站得住,这对像我这样的人来说是今年最重要的开源发布。如果许可证很取巧,那不过是一个带额外营销的 API。
这个检查表不是冷嘲热讽——它是把赌注压在模型上和压在一下午上的区别。押注一下午。
你们的开源模型检查表上有什么是我遗漏的?