Meta 发布 300 亿参数开源权重模型,专为本地硬件上的 Agent 工作流设计,可在消费级笔记本运行,标志着端侧 AI Agent 能力进一步普及。
We’re so glad you’re here. You can expect all the best TNS content to arrive Monday through Friday to keep you on top of the news and at the top of your game.
Check your inbox for a confirmation email where you can adjust your preferences and even join additional groups.
Follow TNS on your favorite social media networks.
Become a TNS follower on LinkedIn.
Check out the latest featured and trending stories while you wait for your first TNS newsletter.
Meta 于周一发布了 Muse Glimmer,这是一款 300 亿参数的开源权重模型,专为在本地硬件上运行 agent 工作流而设计。它已在 Hugging Face 上开放下载,但更值得关注的是 Meta 如何将其更大的 Muse Spark 模型压缩成足以作为本地 agent 运行的轻量级模型。
该模型使用 Spark 进行训练,使其能够学习大模型如何处理复杂任务。随后 Glimmer 被压缩,并加入了一个轻量的辅助模型来加速长任务处理。这种方法展示了企业如何将有效的云端模型转换为适用于本地部署的小型 agent——Sam Altman 最近曾对这一方向不屑一顾,但 Meta 如今已将其构建为端到端流水线。
本地 agent 可以在设备上管理日常任务,而更大的云端模型则提供训练并处理更复杂的任务。但这也会为开发者增加一条额外的部署链条需要管理。
根据 Meta 的技术公告,Glimmer 使用 logit 蒸馏在 Muse Spark 的输出上进行预训练。Meta 在该阶段之后进行了更长上下文的训练,更加侧重 agent 和更丰富的推理轨迹。后训练阶段则结合了监督微调、强化学习,以及在编码、推理和 agent 任务上的 on-policy 蒸馏。
蒸馏通常用于降低推理成本或使模型适配更小的设备,但 Muse Glimmer 展示了它还能将中心训练的模型与运行在更靠近用户及其数据位置的本地 agent 连接起来。
DeepSeek 最近展示了一个相关的动态——其更小的模型超越了自己的旗舰模型,表明一个经过良好蒸馏的学生模型有时可以在目标任务上匹配或超越更大的模型。
例如,一家公司可以使用更大的模型来训练一个本地编码 agent,使其能够检查代码库并使用开发工具,而无需将源代码发送到云端。Meta 已在这一方向上大力投入——其内部训练计划让工程师接触了大约 800 个真实的编码失败案例,以塑造其模型处理 agent 开发工作的方式。
Meta 将 Glimmer 描述为一个“始终在线”的本地 agent,支持超过 131,000 个 token 的上下文窗口,接受文本和图像输入,支持函数调用、支持故障恢复,并提供多种推理设置。
Meta 表示 Glimmer 可以在配备单块消费级 GPU 的 Mac 或 PC 上运行。虽然这是事实,但并不能保证在典型笔记本上获得最佳性能。在全精度下,该模型需要超过 55GB 的内存。Meta 开发了 4-bit 版本,将模型大小压缩到 20GB 以下,为上下文缓存、视觉编码器和投机解码模型留出空间。
最小的官方配置 K-Quant-17GB 面向拥有 24GB 内存的系统设计。Meta 在苹果的 M4 Max 和 M5 Max 芯片以及英伟达的 RTX 5090 上进行了测试。17GB 量化在 15 个基准测试中平均准确率下降了 1%。更大的动态量化(目标 32GB)据报告仅下降了 0.2%。
Glimmer 包含一个基于 DFlash 投机解码能力的小型“草稿模型”(drafter)。草稿模型预测 16 个 token 的区块,然后由主模型并行验证。在 Meta 的测试中,这使 RTX 5090 上的生成速度从 74.9 提升到 233.4 tokens/秒,M4 Max 上从 23.7 提升到 37.8 tokens/秒,M5 Max 上从 26.6 提升到 50.2 tokens/秒。
AMD 单独报告了在 Ryzen AI Max+ 395 上最高 24 tokens/秒,以及在 Radeon AI Pro R9700 上 53 tokens/秒的速度。
一旦模型经过蒸馏、压缩并连接到 agent 脚手架,其名称就不再能准确告诉开发者最终系统的行为。用 Muse Spark 1.1 构建的 agent 不会自动获得 Spark 1.2 中所做的改进,因此开发者必须在推出更新版本之前重新构建和测试。
模型压缩引入了额外的可变性。虽然 Meta 的测试显示整体性能下降很小,但 Glimmer 在不同的工具和数据上可能表现不一致,特别是如果开发者修改了其推理级别、系统提示词或 agent 脚手架。
如果生产环境使用通过 llama.cpp 在员工硬件上运行的 17GB 量化模型,仅测试全精度版本是不够的。
使用这种方法的工程团队需要跟踪的不仅仅是模型权重,还要测试与计划在生产环境中使用的相同配置。全精度模型的结果可能无法反映 17GB 量化版本通过 llama.cpp 在员工硬件上的实际表现。
Meta 的基准测试反映了这些差异。Glimmer 在 MCP Atlas 上得分为 75.5,而 Gemma4-31B 为 54.2,Qwen3.6-27B 为 62.5。它在 SWE-Bench Pro 上也以 51.2 对 50.2 险胜 Qwen,不过 Qwen 在 OSWorld-Verified、TerminalBench 2.1 和 SWE-Bench Verified 上表现更好。

将推理保留在设备上可以防止源代码离开机器,但无法防止 agent 误处理这些信息。
在 Meta 的模型卡上,Glimmer 在 Siren AgentDojo 上的攻击成功率为 28.4%。Gemma4-31B 得分为 25.6%,而 Qwen3.6-27B 得分为 40.3%。
Glimmer 在 Meta 的上下文完整性评估 CI Memories 上的违规率为 26.4%。Meta 建议将模型部署在一个包含额外安全防护的更大系统中,而不是将其视为一个安全的独立端点。
当模型在本地运行时,安全责任主要落在开发者身上。没有云提供商来强制执行工具权限、记录请求或阻止可疑行为,应用必须实现自己的沙箱化、确认步骤、凭证边界和审计记录。
正如最近现实世界的隔离失败所表明的,即使经过大量测试的模型在获得对真实系统的访问权限时也可能表现出不可预测的行为——安全社区仍在努力界定这个问题的范围。
一个能够读取恶意文档并访问本地文件的 agent 不应该继承启动它的用户的全部权限。
Meta 计划在未来几周内发布 Muse Spark 1.2 的开源权重版本,让开发者可以选择使用更大的模型处理挑战性任务,而 Glimmer 在本地处理更常规的工作。Glimmer 不会取代云端模型,其硬件要求也意味着它无法在任何地方运行,但它展示了如何利用一个更大、更强大的模型来创建一个运行在更靠近用户位置的更小 agent。