Token 单价掩盖了 GPU 预留容量这一固定成本本质:低利用率会大幅推高实际单 Token 成本。团队应关注利用率曲线而非 token 吞吐。
TL;DR — 按 token 计价掩盖了 AI 基础设施的真正成本驱动因素:GPU 容量是一种粗粒度的、预留制的、固定成本的资产,每个 token 的真实边际成本完全取决于该容量的利用效率。利用率过低会悄悄将真实单位 token 成本推高到 API 价格表所暗示的水平之上。那些通过观察 token 吞吐量而非利用率曲线来管理 AI 经济的团队,正在优化一个错误的指标。
每个 AI 定价页面都在说同一种语言:每百万 token 多少美元。这是一个简洁的抽象,但与底层成本的实际行为几乎完全脱节。Token 是客户看到的单位。利用率才是决定服务这些 token 是否盈利的单位。混淆这两者是团队在推理 AI 基础设施经济时最常见的错误,没有之一。
按 token 计价暗示了一种边际成本模型:每增加一个 token 的生产成本大致相同,因此可以线性定价并按请求计算利润率。该模型适用于带宽或存储这类容量具有弹性且可无限细分的事物。但对于 GPU 服务的推理场景,这一模型就失效了,因为 GPU 容量在匹配 token 量方面并不是可细分的。你不是按请求租用一小块 GPU,而是提前以固定增量预留节点,通常是数小时或数月,基准是一个"做出预测的瞬间就已经错了"的需求预测。
这意味着真实成本结构更像是拥有一支卡车车队。一旦你签了租约,卡车的成本就固定了。真正变化的是每辆卡车离开车场时装了多满。半空出发的卡车和满载出发的卡车成本相同——只是每英里获得的收入更少。GPU 服务车队的行为与此相同。Token 是货物。利用率是载货率。而大多数团队报告的单位 token 成本数字,都假设卡车一直是满载的。
以一个为目标负载配置好的集群为例,计算每个 token 的真实成本——即固定基础设施支出除以实际服务的 token 数量。在高利用率下,这个数字可能接近广告宣传的价格。但在大多数团队实际运行的利用率水平下——以突发流量、不均匀的请求长度以及峰值负载的安全裕度为主导——真实单位 token 成本可能是标牌数字所暗示的数倍。没有人会把那个数字放在幻灯片上,因为它完全取决于运营纪律,而非架构。
这就是为什么两个运行相同模型、在相同硬件上、以相同公开 token 价格运行的团队,可能拥有完全不同的单位经济学。一个因为聚合了来自多个客户和时区的多样化流量而维持高持续利用率。另一个因为服务单一内部应用——流量陡峭、事后才可预测——而运行在低利用率下。模型是一样的。经济学可完全不是一回事。
传统 Web 基础设施有一套几十年前的利用率应对法则:水平自动扩缩,在秒级启动普通实例,闲置时关闭。LLM 服务在三个特定方面打破了这套法则。
冷启动既慢又贵。将模型权重加载到 GPU、预热内核、填充 KV 缓存,这不是五秒钟能搞定的事。Web 服务的自动扩缩响应时间以秒计;大型模型服务以分钟计。等到新容量上线,触发它的流量高峰可能已经结束了。
请求不是统一的工作单元。基于 token 的心智模型假设同质性,但一个长上下文请求和一个短对话补全,每 token 消耗的内存和计算量差异巨大。仅按"每秒请求数"进行配置而不考虑这种差异,必然导致要么资源闲置、要么 SLO miss。
批处理创造了一种延迟-利用率权衡,在无状态 Web 服务中没有等价物。你可以通过等待将更多请求批量在一起来提高利用率,但每多等一毫秒进行批处理,就有人在响应时间上多等了一毫秒。利用率和延迟直接竞争同一把旋钮,而转动那把旋钮是一个伪装成基础设施设置的商业决策。
这些都不会出现在 token 价格对比中。它们全部体现在利用率曲线上,而基础设施团队之外几乎没人看那条曲线。
一旦理解了利用率是真正的成本驱动因素,几个看起来像基础设施问题的问题就露出了定价和产品问题的真面目。
预留容量与按需容量不仅仅是采购选择——这是对你能以多大信心预测和平滑自身需求曲线的押注。预留容量只有在你能让它保持繁忙时才是便宜的;否则它就是一种被打扮成折扣的固定损失。Spot 或弹性容量只有在你的工作负载能容忍中断且能接受更慢的配置延迟时才便宜——对于交互式推理来说,这通常是不成立的。
非高峰或批处理用量的折扣价不是营销噱头,它是利用率套利:它的存在专门是为了填补那些本应空车离开的卡车。任何无论时间段负载如何都提供统一按 token 定价的团队,要么是在用高峰时段的利润补贴非高峰用户,要么是在悄悄留足裕度以至于高峰时段利润几乎不存在。
而内部成本分摊——关于哪个团队"拥有"GPU 账单的无休止争论——几乎总是在争夺一个错误的数字。按消耗的 token 收取团队费用,而不考虑谁的流量模式在拖累车队利用率,这奖励了陡峭而低效的使用,惩罚了那些稳定的、可预测的负载——正是这种负载让共享基础设施得以维持运转。
如果利用率是真正的成本杠杆,它就需要成为一等一的可观测信号,而不是季度财务练习。这意味着要追踪付费 GPU 小时数与 productive serving 流量的 GPU 小时数,粒度与你追踪延迟或错误率一样。这意味着要区分"服务的 token 数"与"每美元预留容量服务的 token 数",因为第一个数字可能增长而第二个数字可能在悄悄崩塌。这意味着要把批处理窗口大小、请求准入策略和自动扩缩延迟当作有美元价值的经济杠杆来对待,而不是仅仅当作性能调优旋钮。
基于 token 的价格表将继续是客户看到的数字,因为它简单,而且在供应商之间可比较。但它永远不应该是基础设施团队用来推理自身经济的数字。Token 的价格是讲给市场的故事。Token 的成本是你的利用率曲线告诉你的故事,不管你有没有在听。