Alibaba Qwen 3.8 Max 发布(2.4T 参数),文章详细分析本地运行的硬件成本和量化方案选择。FP8 需要 2.4TB、Q4 需要 1.2TB、极限 2-bit 量化需要 600GB。
阿里巴巴今天(8 月 3 日)正式发布了 Qwen 3.8 Max:它采用 Mixture of Experts(MoE)架构,参数规模约为 2.4 万亿,支持 100 万 token 上下文窗口以及图像和视频输入;首发成绩包括 GPQA Diamond 92.6 分、Terminal-Bench 2.1 86.6 分。与本文最相关的是:官方承诺将在未来一周内开放模型权重,并同时带来适合消费级硬件运行的 Qwen 3.8 27B。下面就来看看,想在自己的硬件上运行 Qwen 3.8,实际情况究竟如何。
MoE 模型会把硬件问题拆成两个部分。总参数量(2.4T)决定内存开销:每一个专家都必须存放在某处。活跃参数量(根据发布信息,每次推理约为 95B)决定运行速度。这就是为什么 Max 可以在数据中心里以较低成本提供服务,也解释了为什么它永远塞不进你的台式主机:全部 2.4T 参数都必须驻留在内存中,因为你无法预知下一个 token 会激活哪些专家。
FP8,也就是原生服务精度:权重约占 2.4 TB。
Q4,也就是本地运行的常用标准:约占 1.2 TB。
极端的 2 bit 量化:约占 600 GB,但会带来明显的质量损失。
到 2026 年,消费者可以买到的最大单机拥有 512 GB 统一内存,还不到 Q4 权重所需容量的一半——这甚至尚未给 100 万 token 上下文所需的 KV cache 分配任何空间。权重发布后的几周内,肯定会有人把多台 Mac Studio 串联起来,做出一个每秒只能生成个位数 token 的演示。它会是一段很棒的视频,却不会是一套好用的日常配置。
这正是本次发布与 Kimi K3 或 DeepSeek V4 Pro 的不同之处:同一批发布内容中还包括一个开放权重的 27B 模型。参考此前 Qwen 3.6 27B 的情况,可以作出如下推测:
开放版 Qwen 发布权重后,社区制作的 GGUF 通常会在几天内出现。如果 27B 能继承哪怕一部分 Max 的 Agent 能力提升——这一代在 FrontierSWE 上的成绩从 40.7 跃升至 73.5——它几乎会立刻成为同级别本地模型中的默认选择。而开放权重也意味着会出现各种衍生版本:每一代开放版 Qwen 都会在几周内迎来 abliterated 和 heretic 构建。
在新权重发布之前,你目前真正能运行的最新版本是 Qwen 3.6,而且它的实力确实很强:27B dense 模型最低可在 8 GB VRAM 上运行;对于 24 GB VRAM,35B MoE(活跃参数 3B)则是编程任务的首选。使用当前 llama.cpp 时代的技术栈,只需一行命令:
ollama pull qwen3.6:27b
如果你更愿意点击操作,而不是输入命令,可以使用免费且开源的本地 AI 工作室 Locally Uncensored。它的一键模型目录中提供了 Qwen 系列,会在下载前检查你的内存,并支持与 12 种本地 backend 通信。包含量化配置表的完整安装教程可参阅《How to Run Qwen 3.6 Locally》,Qwen 3.8 完整的硬件需求计算则可参阅《Can You Run Qwen 3.8 Locally?》。
隐私:你的 prompt 永远不会离开本机。成本:开放权重将按量计费的账单,变成一次性的硬件投入。控制权:你今天评测的模型,就是明年仍在运行的那个模型,不会遭遇上游悄无声息的替换。这是第一次,所有人都在热议的前沿模型发布,会在同一周带来一个你真正能够拥有的版本。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。