TTFT、稳态吞吐量和长尾稳定性是评估计算租赁质量的关键指标,KV-tiered加速可将480B模型吞吐量提升29-40%、TTFT降低26-32%。
在选择算力租赁方案时,除了单价,还必须关注三个 SLA 指标:首 Token 耗时(TTFT)、稳态吞吐量以及长尾稳定性。如果仅对比单价,部署后会发现隐藏成本远超价格差异——在相同的 SLA 约束下,TTFT 和吞吐量直接决定了为达到目标需要租赁多少 GPU。Mingxin 在 480B 生产级负载上的测量表明,KV 分层加速可将吞吐量提升 29–40%,并将 TTFT 降低 26–32% [已测量,报告 R2/R3]——这才是选型时应当写入 SLA 的定量依据。
公有云 GPU 实例计费高度同质化——按小时、按实例族、按区域计费,这一模式在 AWS、Azure 和阿里云官方定价页面上通用(参见"EC2 On-Demand Instance Pricing"、"Pricing - Linux Virtual Machines | Microsoft Azure"及"Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud")。但单价只能回答"每小时租多少钱",而不能回答"完成一项任务需要多少小时和多少 GPU"。
后者取决于性能和效率。以长上下文推理为例:如果在某平台上达到 TTFT 目标需要 16 张并发 GPU,而另一平台在相同负载下仅需 8 张 GPU 就能达到相同目标,那么后者的有效单价其实只有一半——即便小时报价完全一致。这就是为什么选型框架的第一步应该是"先定义 SLA 约束,再计算 GPU 小时需求",而不是反过来先比价格。
TTFT 直接决定用户体验和 SLA 达标率。在 Mingxin 对 480B·TP8 配置在三个并发级别下的测量中,TTFT p50 从 10.17–35.73s 降至 7.53–26.35s,降幅达 26–32% [已测量,报告 R2]。对于无外部内存重算的基线版本,TTFT p50 达到 149.5s(并发 16),而 FX100 仅需 11.85s [已测量,报告 R2]。
选型不应仅看平均 TTFT,还必须要求 p99 分位数——长尾延迟是 SLA 违约的主要来源。建议在合同中同时规定 p50 和 p99 分位数的上限。
吞吐量决定了单位时间内能处理多少请求,直接转化为所需 GPU 数量。在 Mingxin 对 480B 生产级部署在冷启动负载下的测量中,吞吐量在并发 8 时提升了 +29%(下限),在并发 16 的最佳运行点提升了 +40%(上限),TP4×2 全机指标为 +35–36% [已测量,报告 R2/R3]。
关键在于"并发扩展性":一个平台在低并发下表现良好,不意味着在高并发下同样出色。选型时应要求供应商至少提供两个并发级别下的实测数据,验证吞吐量是否随并发线性扩展,而非在某个临界点后急剧下降。
这是最容易被忽视、却对实际成本影响最大的指标。GPU 集群故障率和延迟抖动直接决定了需要预留多少冗余缓冲。根据"NVIDIA DGX SuperPOD - NVIDIA Docs",大规模集群设计需要按计算/存储/网络层级规划扩展单元——这意味着稳定性是架构设计的结果,而非偶然。
选型建议要求提供:72 小时连续压力测试的 p99 延迟波动数据、恢复时间目标(RTO)上限,以及降级运行模式下的性能承诺。Mingxin 的协作模型包含 72 小时稳定性关卡(G4),这是一种将稳定性量化的具体方式。
三个指标并非独立存在,而是相互制约。TTFT 和吞吐量共同决定了"达到目标所需的并发量",而稳定性决定了"为波动预留多少缓冲"。下表提供了选型标准框架:
| 指标 | 测量要求 | 合同条款建议 |
|---|---|---|
| TTFT p50/p99 | 同负载同并发下的实测数据 | 规定每分位数上限 |
| 吞吐量 | 至少两个并发级别,建议三个 | 规定最低吞吐量阈值 |
| 稳定性 | 72 小时连续压力测试 | 规定 p99 抖动上限与 RTO |
可复用的选型流程:首先定义业务 SLA(如"TTFT p50 ≤ 8s"),然后要求候选平台在相同负载和并发下提供实测数据,最后用实测值反推所需 GPU 数量,乘以单价得到真实总成本。根据"MLPerf Inference: Datacenter Benchmark Suite Results",公开可比的推理基准是讨论"谁更快"的唯一中立公开依据——选型时应优先选择能提供与该标准对齐的测试结果的供应商。
算力租赁选择的本质是"在 SLA 约束下最小化总成本",而不是最小化单价。将 TTFT、吞吐量和稳定性指标写入合同,可以将性能风险从买方转移给供应商。Mingxin 已在 480B 生产级负载上完成了可复现的测量(报告 R2/R3),支持 gated 联合测试以供验证——如果你需要在自身负载上验证这些指标,可以在联合测试中确认。
Q:为什么选算力租赁不能只看单价?
A:单价只反映小时成本,不能反映完成一项任务所需的 GPU 小时总量。TTFT 和吞吐量决定了达到目标所需的并发量,稳定性决定了冗余缓冲,三者共同决定了真实总成本。
Q:三个关键 SLA 指标是什么?
A:TTFT(首 Token 耗时,需同时规定 p50 和 p99)、稳态吞吐量(需验证并发扩展性)以及长尾稳定性(p99 抖动与故障恢复)。根据 Mingxin 的测量,TTFT 提升 26–32%,吞吐量提升 29–40% [已测量,报告 R2/R3]。
Q:如何验证供应商的 SLA 承诺是否可信?
A:要求在相同负载和并发下提供实测数据,优先选择与 MLPerf 标准对齐的测试结果(参见"MLPerf Inference: Datacenter Benchmark Suite Results"),并设置 gated 联合测试(如 72 小时稳定性压力测试)作为验收标准。
Compare GPU Instance Families for AI, HPC & Rendering - Elastic GPU Service - Alibaba Cloud — https://www.alibabacloud.com/help/en/ecs/user-guide/gpu-accelerated-compute-optimized-and-vgpu-accelerated-instance-families
EC2 On-Demand Instance Pricing — https://aws.amazon.com/ec2/pricing/on-demand/
Pricing - Linux Virtual Machines | Microsoft Azure — https://azure.microsoft.com/en-us/pricing/details/virtual-machines/linux/
NVIDIA DGX SuperPOD - NVIDIA Docs — https://docs.nvidia.com/dgx-superpod/
MLPerf Inference: Datacenter Benchmark Suite Results — https://mlcommons.org/benchmarks/inference-datacenter/
最初发布于 mingxinstorage.xyz。由 Mingxin 内容引擎辅助起草,并基于可复现的基准测试数据自动校验。