SGLang在发布首日即支持Meta Superintendent开发的Muse Glimmer,该模型专为本地Agent工作流优化,适合需要本地运行多模态Agent的开发者。
Muse Glimmer 是一个 30B 参数的模型,由 27.9B 纯文本解码器、1.9B ViT 和一个基于 GELU 的多模态投影器组成。文本解码器包含 52 层 Transformer。每层采用分组查询注意力机制,配备 32 个 query 头和 2 个 key-value 头,后接 SwiGLU 前馈网络。
解码器采用混合注意力模式,每隔四步插入一个全序列层,中间交织三个 2,048 token 的滑动窗口层以提升效率。全注意力层使用 NoPE,而局部窗口使用 RoPE,使模型能够将上下文长度扩展至超出训练限制的范围。
Muse Glimmer 可通过 SGLang 部署在开发者构建和运行本地 AI 智能体时常用的多种硬件上,包括 Apple Silicon 设备(Mac mini 和 M 系列 MacBook Pro)、NVIDIA GeForce RTX 5090 GPU 以及 NVIDIA DGX Spark。在 NVIDIA SM120 平台上,SGLang 利用优化的 GEMM 和 FlashInfer 后端实现高吞吐量推理,而 Apple Silicon 设备则使用原生 MLX 后端来提供高性能的本地服务。
为实现低延迟推理,请使用 SGLang 的 DFlash 实现:
--speculative-algorithm DFLASH
Muse Glimmer 与 SGLang 的众多原生优化兼容,包括低开销调度器、RadixAttention 前缀缓存和可中断的 CUDA 图。我们还将前缀缓存等多项优化带到了 SGLang 的 MLX 后端,使 Apple Silicon 上的智能体工作负载也能拥有竞争力强劲的性能表现。
我们提供多种格式的 Muse Glimmer 检查点,以满足不同硬件、保真度和系统性能需求的用户。
需要最高模型保真度的开发者可以在单张 H100 GPU 上运行原生 BF16 检查点。SM120 路径包含一个约 19.5 GB 的混合 NVFP4+MXFP8 量化方案。18 GB 的 NVFP4 检查点配合 5 GB 的 BF16 DFlash 投机解码器,可以轻松装入单张 RTX 5090,在 NVIDIA GeForce RTX 5090 加速器和 DGX Spark 上实现高性能部署。
我们还提供两个 GGUF 检查点。较小的一个采用 Q4KM 格式,组大小为 128。该检查点支持更快的推理速度和在内存限制更严格的硬件上部署。Q4K-Dynamic 提供更好的模型质量。对于在 Apple Silicon 设备上工作的开发者,我们提供上述 MLX 格式的 GGUF 检查点。
我们横跨七个平台对 Muse Glimmer 进行了 SGLang 测试,批大小从 1 到 8 不等。以下报告的是批大小为 1 时的交互性(tok/s/user)和批大小为 8 时的聚合输出吞吐量(tok/s)。
DFlash 将批大小为 1 时的交互性提升了 1.9 到 4.3 倍,具体取决于平台和精度:除 RTX 5090 上 GGUF 路径的 1.9 倍外,所有配置的提升均达到 3.0 倍或以上。批大小为 8 时的提升较小且变化更大,范围从 1.4 倍到 4.2 倍。MLX 后端不支持推测解码。
我们感谢 Meta Superintelligence Labs 团队和 SGLang 社区在将 Muse Glimmer 的 Day-0 支持引入 SGLang 方面的合作。