Meta推出Muse Glimmer,30B参数Apache 2.0开源,24GB显存即可运行,DFlash推测解码提速3.1倍。填补了小显存本地跑大模型的能力空白。
Meta 发布了 Muse Glimmer,这是一款从 Muse Spark 蒸馏而来的 300 亿参数多模态模型。它专为始终在线的本地 Agent 工作流而调优,以 Apache 2.0 协议开源。300 亿参数模型在全精度下通常需要超过 55 GB 内存。Meta 将其压缩至约 4-bit,然后加入块级投机解码,使其响应速度足以嵌入真实的 Agent 循环。最终模型可以在单张消费级 GPU 或 Mac 上运行,无需网络调用。
是的,权重以 Apache 2.0 协议开源。Hugging Face 集合中包含 BF16 权重、GGUF k-quants、ExecuTorch 构建版本以及 DFlash drafter。自托管是第一天的路径。
适用公司:独立开发者和初创企业可以在单张 24 GB GPU 或 M4/M5 Max Mac 上运行它。中型团队可以获得无需按 token 计费的自托管推理。受监管企业可以获得一个可物理隔离的 Agent。Meta 建议添加系统级 guardrails,而不是将模型作为裸端点发货。
行业:医疗、法律、金融服务、国防与公共部门、制造业以及现场服务。这些场景的数据驻留、离线操作或延迟要求排除了云端调用。
应用:读取截图的桌面 Agent、编码 Agent,以及基于 schema 的函数调用。还包括文档与图表理解、合成数据生成,以及 LLM-as-a-judge 评估。
Muse Glimmer 是一个带有专用感知编码器的密集因果 Transformer。总参数约 300 亿(含视觉塔)。分组查询注意力使用 32 个查询头和 2 个 KV 头。注意力重复 [Local, Local, Local, Global] 模式,滑动窗口为 2,048。RoPE 仅应用于局部层,theta 为 500,000。视觉侧是约 18 亿参数的 ViT-G/14 感知编码器,每张图片最多接受 4,096 个视觉 token。上下文长度为 131,072+,词表为 202,048 个 token,知识截止日期为 2026 年 1 月 4 日。输入为文本和图像;输出为文本。不支持音频,视频按单帧处理。
训练分三个阶段进行:
预训练使用 Muse Spark 输出的 logit 蒸馏。
中期训练添加更长上下文、Agent 密集型数据以及更丰富的推理轨迹。
后训练结合了监督微调与同策略蒸馏,以及跨通用、推理、编码和 Agent 领域的强化学习。
全精度下模型需要超过 55 GB 内存。Meta 将权重压缩至约 4-bit 精度,使语言模型降至 20 GB 以下。这在 24 GB 或 32 GB envelope 内留出了余量。KV 缓存、感知编码器和 drafter 共享这部分空间。两个量化构建版本同步发布。K-Quant-Dynamic 目标为 32 GB VRAM,平均性能下降 0.2%。K-Quant-17GB 目标为 24 GB VRAM,平均性能下降 1.0%。性能下降是取自 15 个常见基准测试的准确率指标的平均值。
生成速度来自 DFlash,这是一种块扩散 drafter,在一个前向传播中预测 16 个 token。主模型并行验证这个块。drafter 使用 5 层、滑动窗口注意力 2,048,以及 32 个查询头 / 8 个 KV 头。Meta 在 batch size 1、greedy 解码下测量了 K-Quant-17GB。在 RTX 5090 上,吞吐量从 74.9 提升到 233.4 tok/s,提升 3.1 倍。Apple M5 Max 从 26.6 提升到 50.2 tok/s,M4 Max 从 23.7 提升到 37.8 tok/s。
Meta 将 Muse Glimmer 与 Gemma4-31B 和 Qwen3.6-27B 在思考模式下进行比较。在 MCP Atlas 上以 75.5 领先,对手为 54.2 和 62.5。在 DeepSearch QA 上也以 74.6 领先,Gaia2 为 43.3,SWE-Bench Pro 为 51.2。推理分数如下:AIME 2026 为 94.7,IFBench 为 77.0,AA-LCR 为 80.0。Qwen3.6-27B 在 OSWorld-Verified 上保持领先,75.6 对比 65.9。还在 TerminalBench 2.1 上以 60.7 领先,SWE-Bench Verified 为 77.2。模式是稳定的。Muse Glimmer 在 Agent 编排和推理上胜出。在计算机使用和终端工作上则落后。
安全性方面,Siren AgentDojo 攻击成功率为 28.4,效用为 94.2。Meta 表示该模型不符合其高级 AI 扩展框架中的前沿 AI 定义。它将化学/生物、网络和失控风险评级为中等或更低。