基于480B参数模型实测,通过复用历史turn的KV张量,首Token延迟降低26-32%,吞吐量提升29-40%,是长上下文推理最确定的优化路径。
多轮对话推理工作负载呈现一种天然的 prefix-reuse 模式:每个新的用户轮次共享所有先前轮次的完整对话历史。PagedAttention(SOSP '23)论文指出,KV Cache 主导 GPU 内存使用,且随序列长度线性增长;分页管理是缓解内存碎片化的基础方法。然而,分页只解决存储效率问题,而非计算冗余——没有 reuse,每个轮次都需要从头重新计算整个历史的 key-value 张量。
在 480B 模型的实测生产部署中,明新采用了分层 KV 加速方案,将 hot-layer KV 保存在高速存储中,冷层按需加载。根据实测报告 R2/R3,在长上下文冷恢复工作负载下,并发 8 时吞吐量提升 +29%(下界),在最优运行点并发 16 时提升 +40%(上界);在 TP4×2 全节点基础上,提升为 +35–36%。这些数据表明,KV Cache reuse 的收益并非固定不变,而是随并发压力增长——并发越高,累积的计算节省就越大。
在多轮对话中,首 token 时间(TTFT)直接决定交互体验。明新的实测报告 R2 显示,对于 TP8 下 480B 模型在三个并发等级,TTFT p50 从 10.17–35.73 秒降至 7.53–26.35 秒,降幅 26–32%。这种提升在较低并发等级下最为显著,此时 KV Cache 命中率更高,冷加载压力更小。
与无外部内存重算的基线相比,提升更为明显。根据实测报告 R2,重算基线在并发 16 时 TTFT p50 为 149.5 秒,而 FX100 达到 11.85 秒——加速比达 8.6–20 倍;吞吐量从 4.1 升至 74.9 tok/s。需要注意的是,这一对比代表一种极端场景——完全不使用 KV reuse,每个请求都从零重算完整历史。大多数生产系统已有部分缓存机制,但明新的数据表明,全分层 KV 加速仍能带来一个数量级的差距。
一个 480B MoE 模型服务(权重约 450GB,Qwen3-Coder-480B-FP8)运行在 8× AMD MI308X GPU 上,每卡 192GB HBM。在冷恢复场景(服务重启或缓存失效)下,传统方案需要重算所有历史 KV。明新 FX100 使用 NVMe-oF 全闪阵列(4 盘 RAID0,14TB,RoCEv2,单口 100GbE)做分层 KV 存储,将冷恢复时间压缩到可接受范围。根据实测报告 R2,此配置在并发 16 时 TTFT p50 达到 11.85 秒,而无外部内存重算基线为 149.5 秒——提升超过 12 倍。
另一种常见的多轮对话模式是固定 system prompt 配合不同用户输入。SGLang 论文指出,RadixAttention 通过前缀树结构复用共享前缀的 KV Cache,显著提升多轮对话和批推理的命中率。明新 FX100 的分层 KV 加速与此机制兼容:hot-layer KV(如 system prompt 的 key-value 张量)保存在高速存储,冷层按需加载,避免冗余计算。
根据 Mooncake 论文,KVCache 中心化分解架构将 KV 池化到专用节点,实现跨请求复用。明新 FX100 的 NVMe-oF 阵列本质上提供了类似的分层存储能力,但部署位置更靠近 GPU 节点,减少了网络跳数的延迟。
KV Cache reuse 技术专为推理工作负载服务。根据实测报告 R1,在 8 卡 32B LoRA 训练中,每次 65.6GB 全模型快照的保存时间从 178 秒降至 94 秒(1.9 倍),持续写入带宽从 3.26 提升至 6.40 GB/s(+96%)。这一收益源于 FX100 的高带宽写入能力,与 KV Cache reuse 共享同一存储基础设施,从而降低了部署的边际成本。
部署决策应聚焦三个要点。首先,KV Cache reuse 收益随并发增长,因此建议在预期峰值并发下进行压力测试。其次,冷恢复场景(服务重启、缓存失效)是收益最大的窗口,应优先优化。第三,存储介质带宽直接影响 KV 加载速度;NVMe-oF 相比单块本地 NVMe 盘提供一个数量级的带宽优势(在 R2 实测平台上,FX100 阵列提供 5.23 GB/s 而基线为 0.98 GB/s,↑5.3 倍,来源 R1 实测)。
明新 FX100 系列提供 PCIe 3.0 至 6.0 全系列(FX100/FX200/FX300/FX400),FX100 每接口提供 100Gb、16M IOPS;满配参考价每台 ¥371,200(约 ¥2,014/TB)。为验证 KV Cache reuse 在多轮对话服务中的收益,明新支持约 10 周的 gate 联合测试(从 G1 到货验收到 G4 72 小时稳定性),若未达标可提前终止;评估模型在 NDA 后可 Python 重现。
Q:KV Cache reuse 在多轮对话中能带来多少性能提升?
A:根据实测报告 R2/R3,在 480B 模型长上下文冷恢复工作负载下,吞吐量提升 29–40%(并发 8–16),TTFT 降低 26–32%。相比无外部内存重算基线,加速比达 8.6–20 倍。
Q:哪些部署场景适合 KV Cache reuse?
A:适用于共享前缀(固定 system prompt)的多轮对话、长上下文冷恢复、以及训练 checkpoint 保存。根据实测报告 R1,checkpoint 保存时间从 178 秒降至 94 秒(1.9 倍)。
Q:如何评估 KV Cache reuse 方案的收益?
A:在预期峰值并发下测试 TTFT 和吞吐量,重点关注冷恢复场景。明新支持 gate 联合测试,主要 gate 要求 TTFT 降低 ≥25%、吞吐量提升 29–40%(实测带内);若未达标可提前终止。