整合 LLM 各类架构的可视化展示,帮助开发者直观理解不同模型的设计原理和创新点。
一份精心筛选的现代语言模型架构参考资料
对比架构图、实现链接、发布日期、注意力机制、解码器类型和简明参考表,无需深入阅读各篇文章。
这个库专注于仅文本的 LLM 和语言模型骨干。对于多模态发布版本,卡片通常描述的是文本解码器/骨干,而不是每个视觉、音频或图像生成组件。
欢迎在 issue 跟踪器中提出改正。如果缺少最新更新,请尝试强制刷新(macOS:Command + Shift + R;Windows:Ctrl + F5)。
有不少读者询问支持这个项目的方式,所以这个库现已作为实体海报在 Redbubble 上销售,并可应要求在 Gumroad 上获得打印就绪的数字版本。我订购了 Redbubble 的印刷品来检查质量;照片显示的是中号尺寸(26.9 x 23.4 英寸)。
选择两个模型来并排对比它们的架构
如果想并排对比两个架构而不是浏览库,可以使用这个对比工具。可以使用这里的选择器或每张卡片上的模型 A / 模型 B 操作。
没有匹配此搜索的模型。
作为参考点,包含了 2019 年末的密集基线,用来对比 GPT-2 以来解码器堆栈的变化程度。
参考密集 Llama 堆栈,用于对比 OLMo 2 的规范化和注意力选择。
Qwen 对比中的小密集 Llama 基线,层数较少但宽度更大。
透明密集模型,保留经典 MHA 并推进规范化变化以提升训练稳定性。
DeepSeek 的旗舰模板启动了最近大规模开源 MoE 模型的浪潮。
推理微调的 DeepSeek 模型,基于 V3 架构而非全新基础设计构建。
Gemma 的旗舰文本堆栈比 Gemma 2 更积极地采用本地注意力。
快速密集 24B 模型,去除了旧版 Mistral 发布版本中使用的滑动窗口设置。
Meta 的大型 MoE 遵循 DeepSeek V3 的方法论,但采用更常规的注意力堆栈。
微型当代代系 Qwen 模型,用深度换宽度并降低内存占用。
大型稀疏 Qwen 变体,与 DeepSeek V3 非常接近,但移除了共享专家。
小型稀疏 Qwen3 模型,在活跃参数规模上接近 GPT-OSS,但使用更深的堆栈。
大型密集 Qwen3 模型,是与 OLMo 3 32B 最清晰的逐一对比。
中等规模密集 Qwen3 模型,用作 SmolLM3 和 Tiny Aya 的干净基线。
密集 Qwen3 基线,用于展示 OLMo 3 对整体解码器公式的改动有多小。
紧凑密集模型,试验在特定层中省略位置编码。
万亿参数 Moonshot 模型,本质上是将 DeepSeek V3 公式向上扩展。
面向 Agent 的指令/推理混合模型,借用 DeepSeek 的密集前缀 MoE 布局。
更大的 gpt-oss 变体保持与 20B 模型相同的交替注意力公式。
OpenAI 较小的开源权重 MoE 模型倾向于宽度和交替本地/全局注意力。
微型 Gemma 3 变体,在玩具规模上保留了该系列的本地-全局注意力公式。
罕见的生产模型发布,展示了采用较少更大专家的旧版 MoE 风格。
效率专注的 Qwen 刷新,将标准注意力交换为 DeltaNet 注意力混合。
MiniMax 的旗舰版回到完整注意力,看起来像是 Qwen3 的更精简稀疏表亲。
线性注意力混合,保留了 Transformer 骨干但替换了大多数完整注意力层。
扩展的 OLMo 3 保留相同块设计但转移到分组查询注意力。
新的透明 Allen AI 模型,保留 OLMo 的 post-norm 风格同时现代化上下文处理。
DeepSeek 的后继者保留了 V3 模板但增加了稀疏注意力以降低长上下文成本。
Mistral 的新旗舰版有效地采用了 DeepSeek 架构并重新调整了专家规模。
NVIDIA 的 Nano 模型是库中最极端的 Transformer 状态空间混合。
大型 MoE 模型,比大多数同代产品更激进地推进滑动窗口注意力。
GLM 的直接前驱,在 MLA 转变之前更接近较老的 GLM-4.5 风格。
Arcee 的旗舰版将多项效率技巧融入类似 DeepSeek 的粗 MoE 设计;此处显示的 AA 分数指的是 Trinity Large Thinking 检查点。
巨大的 GLM 刷新,同时采用 MLA 和 DeepSeek 稀疏注意力以实现旗舰规模推理。
Super 变体扩展了 Nano 并添加了潜在专家和本地推测解码支持。
密集 Gemma 4 将该系列扩展到 256K 上下文多模态检查点,而不会大幅改变核心本地-全局公式。
稀疏 Gemma 4 变体,保留本地:全局注意力骨干同时将密集 FFN 交换为 MoE 层。
密集 Gemma 4 12B Unified 使用无编码器多模态输入路径,而其文本解码器保留 31B 风格的本地-全局注意力公式。
小型 Llama 基线,用于展示 Nanbeige 与主流紧凑解码器公式的紧密程度。
编码优化的 Qwen 模型,保留直接的分组查询 MoE 堆栈而非更新的混合注意力变体。
本地多模态 Moonshot 旗舰版,保留 K2/DeepSeek 风格的 MoE 布局并将本地上下文推进到 256k。
吞吐量专向 MoE 模型,与规模大得多的 DeepSeek 风格系统保持竞争力。
小型设备端定向模型,与 Llama 3.2 保持接近同时调整扩展选择。
流行的 230B 编码器选择了经典架构而非更新的混合注意力思想。
Cohere 的紧凑多语言模型,采用罕见的并行 Transformer 块。
万亿参数长上下文模型,用 Lightning Attention 替换 DeltaNet。
主线 Qwen 刷新,将 Next 风格的混合注意力引入旗舰系列。
推理导向的印度语言稀疏 MoE,在较小规模保留 GQA。
更大的 Sarvam 变体保留稀疏 MoE 布局但从 GQA 转换为 MLA。
微软的 14B 密集 Phi 刷新与 Phi-3-medium 保持接近但将其滑动窗口注意力替换为全上下文 GQA 和更大的分词器。
循环式 7B 语言模型,用基于矩阵记忆的 xLSTM 块替换自注意力。
紧凑 GLM-4.5 伴随版,在较小的服务占用空间上保留相同的面向 Agent 稀疏 MoE 公式。
GLM-4.5-Air 的大规模强化学习后训练,保留紧凑的 106B 稀疏 MoE 骨干。
美团的 LongCat-Next 文本骨干是轻量级 MoE,将大量参数转移到 N-gram 嵌入同时保持稀疏推理约 3B 活跃参数。
Mistral Small 的多模态刷新,从较老的密集 24B 堆栈跳跃到基于 MLA 的稀疏 MoE 设计。
紧凑设备端混合,将 Nemotron Nano 9B v2 压缩为主要由 Mamba-2 堆栈组成,仅有四个注意力层。
面向 Agent 的 230B 后继,为自演化、Agent 框架和生产力工作流构建。
最小的 Gemma 4 边缘模型保留了该系列的混合注意力堆栈并在手机规模多模态占用空间上添加了本地音频。使用按层嵌入,它添加了小的层特定令牌向量而无需扩展全计算路径,因此其计算占用空间更接近 2.3B 而非完整 5.1B 密集模型。
较大的 Gemma 4 边缘变体保留相同的多模态混合公式但加倍宽度和 KV 头以获得更强的 128K 移动检查点。使用按层嵌入,它添加了小的层特定令牌向量而无需扩展全计算路径,因此其计算占用空间更接近 4.5B 而非完整 8B 密集模型。
DeepSeek 的高效 V4 预览保留百万令牌架构同时将 MoE 规模减少到 284B 参数和 13B 活跃参数。
DeepSeek 的旗舰 V4 预览扩展到 1.6T 参数并为百万令牌上下文引入了压缩稀疏注意力加流形约束超连接。
Poolside 的开源权重代理编码 MoE 采用混合滑动窗口/全局注意力,每令牌仅激活 33B 中的 3B 参数。
Zyphra 的紧凑推理 MoE 将 CCA/GQA 注意力更新与 top-1 路由专家 FFN 更新配对以保持每令牌少于 1B 的活跃参数。
后训练 GLM 刷新,保留 GLM-5 骨干完整但针对更强的长视野代理编码。
紧凑 Qwen3.6 开源权重 MoE,保留 Qwen3.5 混合门控 DeltaNet/门控注意力公式同时仅激活约 3B 参数。
本地多模态 K2.5 后继,保留相同的 1T 稀疏 MoE 骨干同时针对更强的长视野编码、设计和 Agent 编排。
密集 Qwen3.6 模型,保留 Qwen3.5 风格的门控 DeltaNet/门控注意力混合堆栈同时用密集 FFN 替换 MoE 块。
全模态稀疏 MoE 模型,使用视觉和音频编码器扩展 MiMo-V2-Flash 骨干。
万亿参数稀疏 MoE 模型用于长视野代理和软件工程任务。
Ling 2.5 后继,保留 Lightning Attention 和 MLA 混合堆栈同时添加多令牌预测的 MTP 层。
腾讯混元的 295B 稀疏 MoE 预览结合密集第一 FFN 层、具有 QK-Norm 的 GQA 和一个额外的 MTP 层以加速生成。
IBM 的密集 30B Granite 4.1 模型保留了直接的长上下文 GQA Transformer 堆栈并通过后训练改进了工具调用、指令跟随和聊天行为。
Cohere 的开源稀疏 MoE 模型将 Command A 并行 Transformer 块扩展到 218B 总参数同时保持 25B 每令牌活跃参数。
Liquid AI 的 1.2B LFM2.5 模型在更广的隐藏规模上保留了 16 层混合 LIV 卷积和 GQA 堆栈。
Liquid AI 的紧凑 LFM2.5 模型结合了双门控 LIV 卷积块和周期性 GQA 层。
Liquid AI 的稀疏 LFM2.5 模型结合了 LIV 卷积、GQA 和 MoE 路由,每令牌激活 32 个中的 4 个专家。
JetBrains 的 Mellum2 Thinking 是用于代码和代理工作流的紧凑推理微调稀疏 MoE。
NVIDIA 的 Ultra 模型将 Nemotron 3 混合堆栈扩展到 550B 总参数同时保持 55B 活跃每令牌参数。
Cohere 的紧凑代理编码 MoE 将并行 Cohere2-MoE 块改编为 30B 总参数、3B 活跃模型。
编码专注的 K2.6 后继,保留相同的 1T 稀疏 MoE 文本骨干并强调长视野软件工程代理。
本地多模态 MiniMax 模型,为 M2 风格的 MoE 骨干添加稀疏注意力以实现 1M 令牌上下文。
基于 Qwen2.5-Coder 的密集推理器,其增益主要来自验证器驱动的后训练而非新块设计。
长上下文 GLM 刷新,保留 744B 稀疏 MoE 骨干并为 1M 令牌 DSA 推理添加 IndexShare。
Poolside 的 33B Laguna 刷新将稀疏 MoE 架构扩展到 262k 上下文同时保持约 3B 参数活跃。
德英双语基础模型,以 26.68T 令牌完全记录的数据混合重新训练 Nemotron 3 Nano 架构。
Thinking Machines Lab 的本地多模态模型结合了 66 层稀疏 MoE 解码器和 5:1 的本地和全局 GQA 混合。
面向 Agent 的 Qwen3.6-27B 衍生模型,添加了 rank-32 LoRA 适配器用于编码、结构化工具使用和长多轮执行。
Cisco Foundation AI 的紧凑终端代理使用密集 Granite 4.0 骨干并通过 SFT 和 GRPO 后训练用于漏洞定位。
Poolside 的 118B 稀疏 MoE 将 Laguna XS 公式扩展到 48 层和 1M 上下文同时激活约 8B 参数。
大型稀疏 MoE 结合了分组微分潜在注意力、按专家 PolyNorm 和修改的 mHC 在 53 层解码器中。
紧凑代理模型,运行相同的 22 层密集 Transformer 堆栈两次,产生 44 个 Transformer 块(层)而无需重复层权重。
Upstage 的稀疏混合交替一个门控 GQA 层和三个 Kimi Delta Attention 层并达到 1M 令牌上下文而无需位置嵌入。
2.8T 稀疏混合结合了 3:1 KDA 和门控 MLA 堆栈与块注意力残差和稳定 LatentMoE。它也是本地多模态,但图表关注文本部分。
库卡片用于一次检查一个模型很有用。元分析视图聚合整个库中的选定字段,使比较稀疏和混合架构系列中的设计权衡变得更容易。
原始对比文章,逐步讲解架构图及其上下文,解释密集、MoE、MLA 和混合解码器系列中的关键设计选择。
一篇专注的后续文章,涵盖 GPT-2 到 gpt-oss 转变中的架构变化,包括 RoPE、SwiGLU、MoE、GQA、滑动窗口注意力和 RMSNorm。
一篇以 DeepSeek 为中心的后续文章,涵盖 V3.2 架构更新、稀疏注意力变化以及发布周围更广泛的强化学习相关开发。
后续文章,涵盖 2026 年初期来自的额外开源权重架构发布,包括较新的 MiniMax、Qwen、Ling 和 Sarvam 系列。
https://sebastianraschka.com/llm-architecture-gallery/
LLM 架构库包含模型架构图、简明参考表、源链接、实现链接以及现代语言模型的对比工具。
@misc{raschka2026llmarchitecturegallery,
author = {Raschka, Sebastian},
title = {LLM Architecture Gallery},
year = {2026},
month = {March},
url = {https://sebastianraschka.com/llm-architecture-gallery/},
note = {Accessed: 2026-07-29}
}
Sebastian Raschka 的 LLM 架构库:https://sebastianraschka.com/llm-architecture-gallery/
购买实体海报或申请打印就绪的数字版本以支持此库。