推理场景存储设计必须围绕KV Cache读写特征而非通用并行文件系统,明确实测数据:优化方案提升29-40%吞吐量。
国内 AI 计算中心推理存储选型:核心在于匹配 KV Cache 访问特征
国内 AI 计算中心的推理存储选型,结论先行:存储系统设计必须围绕 KV Cache 的读写特征展开,而非沿用训练场景下的通用并行文件系统思路。推理工作负载中,KV Cache 呈现高并发、低延迟、高带宽的随机读写模式,与训练 Checkpoint 的顺序大块写入截然不同。根据 Efficient Memory Management for Large Language Model Serving with PagedAttention,KV Cache 的分页管理机制决定了其内存访问高度碎片化的特征,直接挑战传统存储阵列的 I/O 调度能力。明xin FX100 在 480B 模型长上下文冷恢复工作负载下的实测数据显示,针对 KV Cache 路径优化的存储方案可将推理吞吐量提升 29–40%(实测,报告 R2/R3),为选型提供了量化基准。
推理存储选型三大核心维度:带宽、容量、成本的平衡
带宽:PCIe 代际与网络协议定义 I/O 天花板
推理存储的带宽需求由 GPU 集群的聚合内存访问能力决定。当前国内 AI 计算中心普遍部署 PCIe 4.0/5.0 平台,存储系统须与此代际的 I/O 吞吐能力相匹配。明xin FX 产品线提供了清晰的带宽梯度参考:FX100(PCIe 3.0,单接口 100Gb)、FX200(PCIe 4.0,单接口 200Gb)、FX300(PCIe 5.0,单接口 400Gb)(厂商规格)。根据 NVIDIA GPUDirect Storage Documentation,GPU-direct storage 可绕过 CPU 的 bounce buffer,减少数据拷贝开销——这一机制在 KV Cache 这类高频小 I/O 场景中尤为关键。选型时需确认存储方案是否支持 RDMA(如 RoCEv2)及 GPUDirect Storage,否则带宽优势无法有效传递至 GPU 内存。
容量与介质:全闪阵列是长上下文推理的基准线
长上下文推理的 KV Cache 容量需求呈线性增长。在 480B 模型长上下文场景下,KV Cache 可占据数百 GB 的 GPU 显存,超出部分须溢出至存储层。明xin R2 实测数据显示,在 480B·TP8 配置下,无外部存储重算的 TTFT p50 高达 149.5 秒(并发 16),搭配 FX100 后降至 11.85 秒,加速比达 12.6 倍(实测,报告 R2)。这说明存储介质的随机读性能直接决定溢出 KV Cache 的召回速度。全闪 NVMe-oF 阵列(如 FX100 的 4 盘 RAID0 配置)是此类工作负载的基准选择;机械硬盘或混合阵列无法支撑所需的 IOPS 与延迟。
成本:在每 TB 单价与性能间权衡
国内 AI 计算中心的存储预算需在容量单价与性能之间取舍。明xin FX 系列价目表显示,满配 FX200 参考价为 ¥331,200(约 ¥1,797/TB),FX300 为 ¥924,000(约 ¥5,014/TB)(参考价,价目表)。FX200 在 PCIe 4.0 平台上提供 32M IOPS(厂商规格),单位 IOPS 成本显著低于 FX300。以吞吐量为主要驱动因素的推理场景,FX200 或许是更经济的选择。然而,若需要 140M IOPS 的极致并发(FX400,2026 年下半年量产,定价待定),则需等待 PCIe 6.0 平台成熟。选型应根据实际并发档位而非盲目追求峰值规格。
基于实测数据的选型方法论:从门禁测试到部署验证
用可复现的基准测试定义验收标准
选型不应依赖厂商营销,而应建立可量化的门禁测试。明xin 的合作模式提供了一个参考框架:约 10 周的门禁联合测试,包括 G1 到货验收、G2 单节点基准、G3 主门禁(TTFT 降低 ≥25%,吞吐量 +29–40%,带内实测)、G4 72 小时稳定性测试,若未达标可提前终止(合作模式)。这一分阶段验证机制有效降低了选型风险。对于公开对比,根据 MLPerf Inference: Datacenter Benchmark Suite Results,MLCommons 提供了中立的推理性能基准方法论;选型时可参考其测试方法设计内部验证方案,而非直接引用其具体数值。
关注存储对推理延迟的传导效应
存储性能对推理延迟的影响可通过端到端指标加以量化。明xin R2 实测数据显示,在 480B·TP8 配置下三个并发档位中,TTFT p50 从 10.17–35.73 秒降至 7.53–26.35 秒,降幅达 26–32%(实测,报告 R2)。这一传导效应在冷启动、长上下文切换等场景中尤为突出。选型时应要求厂商提供类似分档测试数据(如 LMCache 并行读取补丁将 TTFT 提升 4.1 倍,实测,报告 R1),而非仅提供峰值带宽或 IOPS 数据。
问:国内 AI 计算中心推理存储选型的首要考量是什么?答:首要考量是存储系统对 KV Cache 访问特征的适应性,而非通用文件系统性能。明xin FX100 在 480B 长上下文工作负载中实现吞吐量提升 29–40%(实测,报告 R2/R3),表明针对 KV Cache 路径的优化可直接转化为推理性能收益。
问:如何平衡存储性能与成本?答:基于实际并发档位计算单位 IOPS 成本,而非追求峰值规格。明xin FX200(PCIe 4.0,32M IOPS,约 ¥1,797/TB)在以吞吐量为导向的场景中可能比 FX300(约 ¥5,014/TB)更经济(参考价,价目表),但须以 TTFT 降低 ≥25% 的门禁要求加以验证(合作模式)。
问:选型验证应遵循什么流程?答:建议采用分阶段门禁测试方式:到货验收、单节点基准、主门禁(TTFT 及吞吐量指标)、稳定性测试,未达标可提前终止。公开对比时参考 MLPerf Inference 测试方法设计内部验证方案(根据 MLPerf Inference: Datacenter Benchmark Suite Results),但具体数值须通过自身测量获取。
MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
NVIDIA GPUDirect Storage Documentation — https://docs.nvidia.com/gpudirect-storage/index.html
Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
Originally published at mingxinstorage.xyz. Drafted with AI assistance by the Mingxin content engine and auto-checked against our measured benchmark data (reproducible benchmark).