124B MoE模型本地运行指南:96GB机器跑Ling 3.0 Flash
Ling 3.0 Flash是124B MoE稀疏模型,每token仅激活5.1B参数,混合线性注意力支持长上下文温和增长,可本地交互运行。
Ling 3.0 Flash是124B MoE稀疏模型,每token仅激活5.1B参数,混合线性注意力支持长上下文温和增长,可本地交互运行。
现在大家信息流里最火的两个开源发布是 Kimi K3(2.8 万亿参数,首个开源 3T 级模型)和蚂蚁集团 inclusionAI 的 Ling 3.0 Flash。只有其中一个能装进个人拥有的硬件里,而且恰恰不是那个更抢眼的标题里的那个。下面是本地运行 Ling 3.0 Flash 的真实情况,包含实测的文件大小而非预测,外加诚实算一算为什么 K3 只能留在云端。
Ling 3.0 Flash 是一个 124B 参数的混合专家模型,每次生成 token 仅激活 5.1B 参数(512 个路由专家中激活 8 个,外加 1 个共享专家)。和所有 MoE 一样,总参数决定你的内存账单,激活参数决定你的速度。内存计数器上是 124B 的知识储备,速度计数器上是 5.1B 的计算量——这种组合正是为什么这个模型能在那些跑不动稠密 70B 模型的机器上实现交互式运行的原因。
另外两个在实践中很重要的架构细节。它使用了混合线性注意力(35 层 Kimi Delta Attention 与 7 层门控 MLA 层交替),因此长上下文对内存的增长是温和的而非二次方的。并且它是一个原生混合推理器:默认会先思考再回答,而且推理过程可以按请求关闭,所以你可以自行决定何时为推理付出代价。
许可证是标准的 MIT。权重在 Hugging Face 上,路径为 inclusionAI/Ling-3.0-flash,包含官方的 fp8、fp4 和 int4 变体。
社区的 GGUF 转换版本已经上线,以下是实测的文件大小(非估算):
| 量化方式 | 文件大小 |
|---|---|
| Q4_K_M | 约 73 GB |
| Q2_K | 约 43 GB |
| Q3_K_M | 约 55 GB |
| IQ1_M | 约 21 GB |
llama-server -m Ling-3.0-flash-Q4_K_M.gguf \
--ctx-size 32768 \
--n-gpu-layers 99 \
--n-cpu-moe 40
先从一个适中的上下文窗口起步;模型训练时支持到 256K,但窗口每多一个 token 就是本可以花在更好量化上的内存。
如果你更想点点鼠标而不是敲命令,Locally Uncensored(开源,AGPL)把这一切都封装好了:安装好,打开 Model Manager,粘贴一个 Ling 3.0 Flash 的 GGUF 仓库地址,选一个适合你内存的量化级别,开聊。它处理 llama.cpp 引擎、卸载分配,一切留在本地,不需要账号,也没有遥测。
K3 值得它的头条:首个开源 3T 级发布、100 万 token 上下文、原生图像输入,以及与 Ling 同源的 Kimi Delta Attention 系列。但最小的可用 GGUF 转换版——1-bit 量化——磁盘占用就是 466 GB。2-bit 是 861 GB。Q4 是 1.5 TB。社区经过专家裁剪的构建向 512 GB 服务器级别靠拢,非常厉害但依然不是游戏 PC 的菜。
所以对于一次搜索的代价,诚实的划分是:在家跑 Ling 3.0 Flash,遇到真正需要 100 万上下文或视觉的任务时,通过托管 API 去够 K3。DeepInfra 两个都提供(Ling 每百万 token 0.03 美元入 / 0.07 美元出,基本等于免费;K3 每百万 token 2.85 美元 / 14.25 美元),OpenRouter 列出了一个免费 Ling 层级,两家本周都已上线 LU Labs Cloud 所有计划,推理在两家都是可开关的选项。
inclusionAI 的基准测试显示,它在 SWE-Bench Pro、代理工具套件和长上下文任务上与他们之前的 1T 级旗舰模型持平。厂商数字一向如此,但架构层面的数学是实的,自己验证这个说法的代价就是一个周末的下载。
本地速度如何?速度追踪的是 5.1B 的激活参数,而非 124B 的总数。在 Apple Silicon 的 Q4 量化下,以及 GPU 加内存的混合方案上,预期是两位数 token 每秒。
无审查版本有了吗?还没有。MIT 许可证使微调和 abliteration 完全合法,而且 5.1B 激活的模型调起来很便宜,所以社区变体可期。原生模型携带标准的安全对齐。