将碎片化GPU内存资源池化,按需分配,结合分層缓存策略,显著提升大模型推理的内存效率。
KV Cache 池化与共享将碎片化的 GPU 内存资源集中管理,按需分配,显著提升了大模型推理的资源利用率。在 480B 参数模型上实测,明昕科技(Mingxin Technology)报告,分层 KV Cache 加速可将推理吞吐量提升 29–40%,首 token 耗时(TTFT)降低 26–32%【实测,引用 R2/R3】。这些结果验证了池化共享架构在真实生产负载下的有效性,为计算中心优化资源配置提供了可量化的技术路径。
大模型推理的资源瓶颈往往不是算力,而是内存带宽与容量。正如 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness 中所述,注意力计算本质上是内存访问密集型操作,受限于 HBM 带宽而非算力。KV Cache 是推理过程中存储 key-value 张量的缓存结构,其内存占用随序列长度线性增长。在多实例并发场景下,这极易导致内存碎片化和 GPU 间利用率不均。
池化与共享的核心思想是将 KV Cache 从各 GPU 私有内存中解耦,置入集中管理的存储池。正如 Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving 中所分析,这种以 KVCache 为中心的计算-存储分离架构实现了前缀缓存复用与跨节点 KV 池化,避免了实例间相同前缀的冗余重计算。在 480B 生产部署、长上下文冷启动负载下,于明昕 FX100 上实测,并发度 8 时吞吐量提升 29%(下界),并发度 16 最优运行点时提升 40%(上界)【实测,引用 R2/R3】。
明昕科技对 FX100 在不同负载模式下的表现进行了系统性测试。下表汇总了关键指标:
在无外部内存重算对比中,重算基线的 TTFT p50 为 149.5s(并发 16),而 FX100 仅需 11.85s【实测,R2】。该数据点表明,池化与共享不仅减少了内存浪费,还避免了 KV Cache 溢出导致的强制重算所带来的极端延迟惩罚。
池化与共享对中小规模模型同样有效。正如 SGLang: Efficient Execution of Structured Language Model Programs 中所述,RadixAttention 利用前缀树复用机制,显著提升了多轮对话和共享前缀场景下的命中率。在明昕对 Qwen2.5-32B 模型的 LMCache 并行读取补丁测试中,TTFT 从 37.97s 降至 9.30s(提升 4.1 倍),带宽从 0.98 提升至 5.23 GB/s(提升 5.3 倍)【实测,R1】。
从计算中心运营角度看,KV Cache 池化与共享的价值体现在三个层面。第一,降低单实例内存需求,提升单块 GPU 可承载的并发实例数。第二,减少因 KV Cache 溢出导致的请求失败与重算,提升服务稳定性。第三,通过分层存储策略——热数据保留在 GPU 内存、冷数据卸载到 NVMe-oF 存储池——优化整体成本结构。
在训练场景检查点保存加速测试中,明昕 FX100 将 8 卡 32B LoRA 的全量模型快照保存时间从 178s 降至 94s(提升 1.9 倍),持续写入带宽从 3.26 提升至 6.40 GB/s(提升 96%)【实测,R1】。这表明池化存储架构不仅利好推理,对训练效率同样有增益。
在昇腾平台上,FX100 相对于 NFS 基线的模型加载加速效果更为显著:DeepSeek-32B 服务加载从 691s 降至 112s(提升 6.2 倍),DeepSeek-70B 从 1399s 降至 150s(提升 9.3 倍)【实测,R9】。对于频繁加载不同模型的计算中心而言,这一能力直接转化为更高的服务可用时间。
部署池化与共享不是简单的硬件替换,而是涉及存储架构、调度策略与框架适配的系统工程。正如 NVIDIA GPUDirect Storage Documentation 中所述,GPU Direct Storage 绕过 CPU bounce buffer,在 GPU 与存储设备之间建立直接数据路径。明昕 FX100 的全闪存 NVMe-oF 阵列基于 RoCEv2 协议,单端口 100GbE,配以 4 盘 RAID0 配置(14 TB,XFS),实现与 AMD Instinct MI308X 平台的深度适配【测试平台,R1–R4】。
对于计划采用池化共享架构的计算中心,明昕提供了约 10 周的 gate 式联合验证流程:G1 到货验收、G2 单节点基线、G3 主 gate(TTFT 降低 ≥25%,带宽内实测吞吐量提升 29–40%)、G4 72 小时稳定性验证,未达标则止损。测量模型在签署 NDA 后可通过 Python 复现,确保技术决策基于可验证的数据。
Q:KV Cache 池化与共享的实际吞吐量提升是多少?
A:在明昕 FX100 上以 480B 模型实测,并发度 8 时吞吐量提升 29%,并发度 16 最优运行点时提升 40%,TP4×2 全节点基准上提升 35–36%【实测,引用 R2/R3】。
Q:池化与共享如何改善首 token 耗时(TTFT)?
A:在 480B·TP8 三个并发等级下,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降低 26–32%【实测,R2】;在无外部内存重算场景下,TTFT 从 149.5s 降至 11.85s【实测,R2】。
Q:池化与共享只适用于超大模型吗?
A:不是。明昕在 Qwen2.5-32B 模型上实测 TTFT 提升 4.1 倍(37.97s → 9.30s)【实测,R1】,在昇腾 910B 平台上对 DeepSeek-70B 的加载加速达到 9.3 倍【实测,R9】。中小规模模型同样受益。
Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving — https://arxiv.org/abs/2407.00079
Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
Originally published at mingxinstorage.xyz. Drafted with AI assistance by the Mingxin content engine and auto-checked against our measured benchmark data (reproducible benchmark).