带宽、存储、故障时长是计算租赁合同中最易被忽视的三个维度,忽视后将导致性能纠纷和成本超支。基于480B模型实测数据提供逐项检查清单。
在算力租赁合同中,计算规格(GPU 型号、数量、显存)通常被详细约定,但网络带宽往往只被一笔带过,比如写成"100M/1G 共享"甚至完全遗漏。问题在于,大模型推理和训练的内存访问模式意味着网络带宽直接决定了端到端性能。
根据 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness,注意力计算的瓶颈在于 HBM 带宽而非算力——这一结论在分布式场景下同样成立:当 KV Cache 或模型权重需要跨节点读取时,网络带宽就成为新的 HBM 带宽。根据明xin 的实测报告 R2,在 480B 模型长上下文冷恢复工作负载下,KV 分层加速带来了 +29–40% 的吞吐提升(并发 8 时 +29%,并发 16 时 +40%,TP4×2 全节点规模下 +35–36%)——其前提是存储侧提供了与算力侧相匹配的带宽供给。
签署前需明确:带宽是独享还是共享、峰值与保障带宽数值、是否按端口计费(如 100GbE 端口)、跨数据中心或跨可用区带宽是否单独计费。根据 EC2 On-Demand Instance Pricing,公有云 GPU 实例按小时计费,按实例族区分,但网络带宽往往独立于实例成本——如果合同未将此机制写入,月度账单中就会出现流量超限费用。
存储条款的遗漏点不在容量,而在性能约定与故障恢复责任。大多数合同只写"提供 XX TB 存储",既无 IOPS、带宽、延迟指标,也无数据持久性或故障恢复时间。
根据明xin 实测报告 R1,LMCache 并行读取补丁将单卡并发 16 的冷盘读取 TTFT 从 37.97s 降低至 9.30s(提升 4.1 倍),带宽从 0.98 GB/s 提升至 5.23 GB/s(提升 5.3 倍)——说明存储读取性能对首 token 延迟有数量级的影响。实测报告 R9(昇腾平台)显示模型推理加载(对比 NFS)加速比为 6.2–9.3 倍:DeepSeek-32B 服务加载从 691s 降至 112s,DeepSeek-70B 从 1399s 降至 150s。如果合同仅约定容量而不约定性能,租用的存储可能直接拖累整个推理服务。
存储条款至少应覆盖:性能承诺(读取带宽、IOPS、延迟百分位)、数据持久性(副本数、跨数据中心冗余)、恢复时间目标(RTO)、恢复点目标(RPO)。根据 SNIA 的存储术语定义,分层存储和计算存储有明确的行业标准规范;签约时应要求对方按这些标准定义填写性能指标,而非使用"高性能"这类模糊的自定义术语。
故障时长条款是三类中最容易被忽视的。合同中往往只写"保证 99.9% 可用性",但不约定故障如何界定、响应时间如何、赔偿如何计算——实际上等于没有 SLA。
99.9% 可用性意味着每年约 8.76 小时的停机时间,但对于推理服务而言,一次 30 分钟的中断就已构成 SLA 违约。签署前需明确:故障定义(硬件故障、网络中断、存储不可读分别如何界定)、响应时间(从故障报障到开始处理)、恢复时间(RTO)、赔偿机制(按故障时长折算信用额或退款)。根据 NVIDIA Collective Communications Library (NCCL) Documentation,多卡集合通信对同步开销敏感,单点故障可能导致整个训练任务停滞——意味着故障恢复时间直接决定训练任务的中断成本。
明xin 在合作模式中采用门控联测(G1 到货验收 / G2 单节点基线 / G3 主门禁 / G4 72 小时稳定性),其中 G4 72 小时稳定性测试专门用于验证长时间运行下的故障率。建议也在合同中约定一个可量化的稳定性验收窗口,而非仅写年度可用性百分比。
算力租赁合同的核心本质是将性能风险转移给承租方。带宽、存储、故障时长条款的遗漏会在合同中期至后期以性能不达标或账单超支的形式暴露出来。签约前按照上述清单逐条核查,必要时应要求对方提供可复现的实测数据作为验收依据。明xin 提供存储加速和全链路算力中心服务,支持门控联测验证性能承诺,欢迎有相关需求的团队联系我们进行联测。
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
SNIA — Storage Networking Industry Association — https://www.snia.org/
NVIDIA Collective Communications Library (NCCL) Documentation — https://docs.nvidia.com/deeplearning/nccl/user-guide/docs/index.html
问:算力租赁合同中最容易遗漏的三类条款是什么?
答: 带宽(独享/共享、峰值/保障数值)、存储(性能规格、持久性、RTO/RPO)、故障时长(定义、响应、赔偿)。这三类的遗漏会在合同中后期以性能不达标或额外费用的形式暴露出来。
问:为什么存储性能条款很重要?
答: 明xin 实测报告 R1 显示读取性能优化将冷盘读取 TTFT 从 37.97s 降至 9.30s(提升 4.1 倍),实测报告 R9 显示模型加载加速比为 6.2–9.3 倍。仅约定容量而不约定性能的合同,可能导致租用的存储直接拖累推理服务。
问:故障时长条款应包含哪些具体内容?
答: 故障定义(硬件/网络/存储分别界定)、响应时间、恢复时间(RTO)、赔偿机制。建议约定一个可量化的稳定性验收窗口(如 72 小时),而非仅写年度可用性百分比。
Originally published at mingxinstorage.xyz. Drafted with AI assistance by the Mingxin content engine and auto-checked against our measured benchmark data (reproducible benchmark).