数据并行复制模型提升吞吐;张量并行拆分层内计算需高速互联;流水线并行拆分层组如流水线组装。三种策略分别解决高并发和超大模型部署问题。
当人们第一次听到多 GPU 时,很容易想到:
GPU 越多 = LLM 推理越快。
但事实并非总是如此。
真正的问题是:
我们为什么需要多个 GPU?
主要有两类问题:
📌 模型可以装进一块 GPU,但我们需要服务更多用户。
📌 模型太大,一块 GPU 装不下。
这就引出了三种重要的技术:
1️⃣ Data Parallelism(数据并行)→ 复制模型
在多块 GPU 上运行同一个模型的完整副本,并将传入的请求分配到它们上面。
目标:更高的吞吐量
2️⃣ Tensor Parallelism(张量并行)→ 切分层内计算
把模型层内的计算拆分到多块 GPU 上。
由于 GPU 之间需要频繁通信,NVLink 和 NVSwitch 等高速 GPU 互联变得非常重要。
目标:运行更大的模型,并行化计算
3️⃣ Pipeline Parallelism(流水线并行)→ 切分各层
不同组的模型层运行在不同的 GPU 上。
一个阶段的输出传递给下一个阶段,就像一条装配线。
目标:在 GPU 和节点间扩展超大规模模型
记住这三种技术最简单的方法:
Data Parallelism → 复制模型
Tensor Parallelism → 切分层内计算
Pipeline Parallelism → 切分各层
对于超大规模部署,这些技术还可以通过混合并行(Hybrid Parallelism)组合使用。
📌 想从面试角度学习这些概念吗?
我即将推出一个 90 天强化计划:
Cracking the GenAI Interview for DevOps, SRE, Platform & Forward-Deployed Engineers
我们将传统的基础设施工程与现代 AI 基础设施岗位越来越重要的技能连接起来:
✔️ 生成式 AI 与 LLM 工程
✔️ GPU 与 AI 基础设施
✔️ AI 工作负载的 Kubernetes
✔️ 面试风格的故障排查场景
目标不只是学习 AI 术语,而是理解这些系统实际如何工作,以及如何在面试中解释和排查问题。