AMD 发布完全开源的 Instella-MoE-16B-A3B,16B 参数、2.8B 活跃参数,附带完整权重、数据混合、配置和推理代码,可直接用于本地推理或微调。
人工智能
AMD 发布了 Instella-MoE-16B-A3B,这是一款从零开始在 Instinct MI300X 和 MI325X GPU 上训练的完全开放 Mixture-of-Experts 语言模型。该模型共有 16B 参数,但处理每个 token 时仅激活 2.8B 参数。AMD 公布了各个训练阶段的权重,以及数据混合方案、训练配置和推理代码。这次发布有两项系统级设计值得关注:Gated Multi-head Latent Attention 和 FarSkip-Collective 连接机制。
部分开放。模型权重采用 ResearchRAIL 许可证,仅限学术和研究用途,因此它并不是一款可以直接投入商业应用的模型。训练代码库采用 MIT 许可证,而这才是此次发布中更具复用价值的资产。
公司层面:适合拥有数据中心级 GPU 计算能力的 AI 研究实验室、高校团队和企业研发团队。不适合希望直接使用托管式商业端点的精益创业公司。
行业:半导体与云基础设施、AI 工具供应商以及学术研究机构。
应用场景:复现完整的端到端 MoE 训练方案、研究 expert-parallel 服务、评估 64K 长上下文表现,以及开展 RL 后训练实验。
服务成本:16B 参数以 BF16 格式存储大约需要 32 GB 权重显存,因此一块大显存加速卡即可承载。AMD 同时提供了 SGLang 推理代码。
https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html

Instella-MoE 是一款仅使用 decoder 的 MoE 模型,共有 27 层,hidden size 为 2048,包含 16 个 attention head,词表大小为 128,896 个 token。每个 MoE 层包含 2 个共享 expert,以及从 64 个 expert 中选出的 6 个路由 expert。由此,模型总参数量为 16B,而实际激活参数量为 2.8B。预训练和中期训练阶段均采用 Multi-Token Prediction 目标。
其中有两项重要的结构设计值得了解。Gated MLA 为 Multi-head Latent Attention 增加了一个轻量级、可学习的输出 gate。它通过专用的线性投影生成一个由输入决定的 gate,并在输出投影之前以乘法方式应用。FarSkip-Collective 会将过时和不完整的 activation 传入 MoE 层与 attention 层,使 expert-parallel 通信能够与计算过程重叠执行。AMD 报告称,这项设计将预训练速度提升了 12.7%;在使用 expert parallelism 提供推理服务时,首个 token 的生成时间最多可缩短 39.2%。
预训练覆盖了来自开放语料库的 7.1T token,所用数据集包括 Nemotron-CC-v2、MegaMath、FineMath、RefineCode 和 TxT360。中期训练使用 Dolma3 Dolmino 100B 的三种数据变体,并通过权重平均将它们合并。长上下文训练阶段使用 YaRN、增大的 RoPE theta 以及 document masking,将上下文窗口从 4K 扩展至 64K。
后训练首先使用 Dolci-Think-SFT-7B 与 Nemotron 混合数据进行 SFT,最后再使用一个由反馈驱动、包含 512K 个样本的数据集,针对评测中发现的薄弱环节进行训练。随后进行 DPO,并关闭 router bias 更新和辅助 load-balancing loss,以防止模型性能退化。RL 阶段在 Miles 框架中完成:先执行 1,400 个 step 的指令遵循 RLVR,再通过 Multi-Teacher On-Policy Distillation 将这部分能力增益重新融入模型,同时避免数学和代码能力下降。
基础 checkpoint 的平均得分为 76.7,在完全开放模型中表现最强,领先 Moonlight-16B-A3B(76.2)、SmolLM3-3B-Base(70.5)、OLMo-3-7B(70.1)和 OLMoE-1B-7B(61.9),但落后于 Qwen3.5-4B-Base(79.5)。它在 WinoGrande 上以 86.5 分领先,并在 HumanEval+ 上取得 65.7 分。长上下文评测方面,它在 HELMET 上的平均得分为 41.5,在 RULER 上为 79.4。
后训练模型的得分从 SFT 阶段的 71.58,提高到 DPO 阶段的 72.67,最终在 Think 阶段达到 73.22,超过 Olmo3-7B-Think(71.97)、Gemma-4-E4B think(70.47)和 Qwen3.5-4B(69.73)。IFEval 得分也从 77.08 提升至 83.70。
交互式讲解
模型总参数量为 16B,每个 token 激活 2.8B 参数:包括 2 个共享 expert,以及从 64 个路由 expert 中选出的 6 个 expert。
Gated MLA 和 FarSkip-Collective 将训练速度提升了 12.7%,并将 TTFT 降低了 39.2%。
模型使用 ROCm、Primus 和 Miles,在 AMD Instinct MI300X 与 MI325X 上完成了端到端训练。
Base 模型平均得分为 76.7,Think 模型平均得分为 73.22,两者均领先其他完全开放的同类模型。
采用 ResearchRAIL 许可证的模型权重限制了商业用途,但采用 MIT 许可证的训练代码不受此限制。
欢迎查看 ROCm 博客、Hugging Face collection 和 GitHub。你也可以在 Twitter 上关注我们,别忘了加入我们拥有超过 15 万名成员的 ML SubReddit,并订阅 Newsletter。等等!你也使用 Telegram 吗?现在同样可以加入我们的 Telegram。
需要与我们合作,推广你的 GitHub Repo、Hugging Face Page、Product Release 或 Webinar 等内容吗?欢迎联系我们。
来源:ROCm 博客 · Hugging Face collection · GitHub
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位富有远见的企业家和工程师,Asif 致力于挖掘 Artificial Intelligence 造福社会的潜力。他最近创办了 Artificial Intelligence 媒体平台 Marktechpost。该平台凭借对 machine learning 和 deep learning 新闻深入、技术严谨,同时又能让广大读者轻松理解的报道而脱颖而出。平台每月浏览量超过 200 万,足见其在读者群体中的受欢迎程度。