阿里发布 Qwen 3.8-Max,2.4 万亿总参数、95B 激活参数、百万 token 上下文,在 Frontend Code Arena 得分 1668 仅落后 Opus 5 的 37 分,API 价格每百万输入 2 美元。
如果你今年一直在关注 AI 领域,应该已经熟悉了这个套路。美国实验室在 API 背后宣布了什么惊艳的东西,中国实验室就以开源权重的方式放出一个具有竞争力的版本。美国那边大谈安全,我们其他人则直接下载中国模型、该干嘛干嘛。
但这周感觉不太一样。不是因为套路变了,而是因为规模变了。
让我来梳理一下过去 48 小时发生的事。
Alibaba 周一放出了 Qwen 3.8-Max,数据很难忽视。总共 2.4 万亿参数,每次查询激活 950 亿参数(MoE 架构),百万 token 的上下文窗口。他们声称在大多数基准测试中与 Claude Sonnet 5 持平,在编程任务上超越了 GPT-5.6 Luna。
我花时间仔细看了这些基准测试。Artificial Analysis 的独立评测比 Alibaba 自己放出的图表略低——与 Sonnet 5 持平而非 Opus 5——但这依然是相当强的段位。在 Frontend Code Arena 上拿到了 1668 分,仅比 Claude Opus 5 低 37 分。对于一个可以下载到本地硬件运行的模型来说?这相当疯狂。
定价才是真正讲述故事的那个。Qwen 3.8-Max 在 Alibaba API 上的价格是每百万输入 token 2 美元、每百万输出 token 6 美元。Claude Sonnet 5 输入价格相同,但输出每百万要 10 美元——而且 9 月 1 日还要涨价 50%。OpenAI 的 GPT-5.6 Luna 输入更便宜只要 0.20 美元,但实际效果明显更差。
Alibaba 表示权重将于下周登陆 Hugging Face,同时还有一个 270 亿参数版本供没有成堆 B200 的同学使用。因为没错——2.4T 参数不是闹着玩的。生产环境服务需要 48-64 块 Nvidia B200,或者内部工作负载 8-16 块 B300。这可不是树莓派项目。
尽管如此,这个模型以开源权重形式存在这件事本身就改变了一切。
Alibaba 不是唯一一家搞出动静的中国实验室。DeepSeek 放出了 V4 Flash 0731,一个 2840 亿参数的模型,在独立基准测试上与 GPT-5.6 Luna 相差不到 1 分,同时每次任务成本还低了 40%。
有趣的是?它足够小,可以在普通企业服务器上运行。2840 亿参数约需 142GB 内存。你不需要租用超算集群来折腾这个。
DeepSeek 的策略一直是效率优先——用尽可能少的参数榨取每一滴性能。V4 Flash 是这种理念的集大成者。它在原始能力上打不过 Qwen 3.8-Max,但对很多现实场景更实用。推理更快、成本更低、部署更容易。
我一直在本地跑一些较小的 DeepSeek 变体来做代码辅助,老实说,"开源但小"与"闭源但大"之间的差距每个月都在缩小。V4 Flash 只是加速了这个趋势。
在太平洋彼岸,Anthropic 显然感受到了压力。本周 Bloomberg 报道,他们与云计算初创公司 Volta 签署了一项 100 亿美元的算力合同——而这家公司年初甚至还不存在。
合同期限六年。Volta 正在挪威建设一座 133 兆瓦的数据中心,采用 Nvidia 的 Vera Rubin 系统,并获得了加密矿企 Bitdeer 的协助。Anthropic 最近还与 SpaceX 和 Amazon 签署了算力协议。
这对算力来说是一笔巨款。这也告诉你一些关于 Anthropic 想法的信息——他们不指望靠效率提升来缩小差距,而是押注于暴力堆算力。
公平地说,Claude Opus 5 在某些基准测试上仍然是金钱能买到的最强模型。但差距正在快速缩小,Anthropic 的成本在上升,而中国开源模型则越来越便宜、越来越强。总有一方要做出改变。
总部位于伦敦的初创公司 Olix Computing,由一名 25 岁的辍学生创立,本周从 Netflix 联合创始人 Reed Hastings 和 Arm Holdings 获得了 3.12 亿美元融资。他们的方案与众不同:一款名为 DX-1 的芯片,零 HBM 内存,完全依赖片上 SRAM,通过使用光而非铜的光学互连连接。
他们声称在 1000 亿参数模型上达到每秒 10,000 token。这很快。没有 HBM 意味着没有先进封装成本,光学互连使用较慢但更可靠的编码方式,不需要昂贵的数字信号处理器。
Olix 目前估值 33 亿美元。首批出货预计 2027 年上半年。还很早期,但方向是对的——业界迫切需要 Nvidia GPU 垄断之外的推理替代方案。
SpaceX 的 AI 云业务创造了 26 亿美元营收(同比增长 3 倍),主要来自与 Anthropic 和 Google 的算力合作。他们正在将自己定位为 CoreWeave 的竞争对手。
Obsidian 作为共享 AI 记忆——有人找到了如何通过 MCP 让自己的 Obsidian 保险库成为 Claude Code、Codex 和本地 LLM 的共享上下文。我自己也做了类似的尝试,这确实改变了你与这些工具的协作方式。你的知识库成为了模型的记忆。
Hank Green 因为在创意工作流中大量使用 LLM 被自己的粉丝群围攻。争议是真实的,但背后的核心问题不会消失:工具和拐杖之间的界限在哪里?
泰国发布了 ThaiLLM——一个用于 AI 主权保护的本土模型项目。更多国家开始意识到他们不想把语言模型外包给美国或中国公司。
这就是本周要闻。开源模型在价格和可获取性上正在领先。闭源实验室在算力上疯狂投入。硬件初创公司正在试图突破推理瓶颈。
我不知道谁会赢得这场竞赛。但我知道谁会受益——任何能下载模型并自己运行的人。
如果你觉得这篇文章有用,可以看看 7x24planning——我一直在用这个工具来追踪所有这些动态。