从硬件折旧、电费、吞吐率三要素推导本地 LLM 真实每 Token 成本,与 2026 年主流云 API 定价横向对比。
硬件摊销、电费、每秒 Token 数——这些要素如何换算成本地 LLM 的实际单 Token 成本,并与 2026 年云端 API 价格做对比。
The Pied Piper Trap: When Your Server Costs More Than It Makes
在硅谷,Richard Hendricks 研发了一套出色的压缩算法,最终却压垮了自家公司的基础设施——他越是深入,硬件账单就越是膨胀,而产品始终在努力证明自己的存在价值。这是虚构的故事,但每一个曾在本地托管过 LLM 的开发者都亲历过它的缩小版本:GPU 坐落在角落发着光,电表飞速旋转,在脑海深处始终萦绕着一个问题:"我是在省钱,还是只不过换了一种方式付账?"
要得到诚实的答案,需要一个大多数人都从未计算过的数字:本地部署的每个 Token 成本。云端 API 总是标出每百万 Token 的价格;本地硬件有标价,却没有每 Token 的费用。在你把二者换算成同一单位之前,"本地更便宜"和"本地更贵"都只是感觉,不是事实。本文从第一性原理出发建立计算模型,让你能够为自己的机器算出真实的答案。
The Local Cost per Token Formula
本地部署的每个 Token 成本由三个部分构成,所有这些在你购买任何设备之前都可以估算:

每部分在不同场景下的重要性各不相同。对于新购 GPU,硬件摊销占主导;对于 24/7 运行的机器,电费占主导;而运营开销——你的时间、维护、散热、存储——是每个人都会忘记的那块拼图,也是让小团队自托管悄悄变得昂贵的罪魁祸首。
关键的洞察是:分母随利用率增长而增大。一块每月生成 100 万 Token 的 GPU 将其固定成本分摊到 100 万 Token 上;同一块 GPU 只生成 1 万 Token,固定成本仍然分摊在 1 万 Token 上。这就是为什么"本地便宜"和"本地昂贵"都是对的——答案完全取决于你实际使用了多少硬件。
Amortizing the Hardware
硬件是固定成本,因此定价的方式是摊销:将购买价格分摊到机器的预期使用寿命上。消费级 GPU 硬件的标准假设是 36 个月——足够长以至于每月成本有意义,足够短以至于不会假装 GPU 永不淘汰。
一个真实的例子可以让这变得具体。RTX 5090 标价 $1,999 MSRP,实际市场价格更高。按 MSRP 摊销到 36 个月,每月约 $56,还不含电费。如果这张卡每月生成比如说 4,000 万 Token(在高速度模型上单用户重负载的真实数字),仅硬件就贡献约每百万 Token $1.40。
硬件每 Token 成本的公式很简单:
Hardware Cost per Token = (Purchase Price - Resale Value) / (Amortization Months × Tokens per Month)
如果你的用量只有十分之一——每月 400 万 Token——同样的卡每百万 Token 成本就是 $14,突然比许多云端 API 还贵。固定成本不在乎你用了多少,这就是陷阱所在。
两个改进可以让摊销计算更诚实。首先,减去转售价值:一块使用了 36 个月的消费级 GPU 仍然能以原价相当的比例售出,因此真实成本是购买价格减去最终能收回的金额,再除以你实际持有的月数。其次,记住扩展意味着再次购买硬件:从 7B 模型迁移到 70B 模型可能需要第二张卡或换一台工作站,这会重置摊销周期,固定成本在一夜之间翻倍。摊销不是一次性决策,而是每次需求增长时都会更新的承诺。
更深层的观点是:硬件成本是阶跃函数,而云端成本是曲线。你的本地设置在每次增加一块 GPU 或一台更大机器时都有离散的跳跃成本,在这些跳跃之间每 Token 成本随着生成量增加而持续下降。云端没有阶梯——无论你发送一个请求还是一百万个请求,每 Token 价格都是平的。这种形状差异正是本地有利于高强度、增长型使用,而云端有利于轻量、波动型使用的原因,两者的答案永远不会收敛到一个干净的结论。
一个有用的做法是按固定周期重新运行估算——每月一次,或每次你的用量明显变化时。硬件价格、电费率、云端定价和你自己的工作负载都在持续漂移,"本地值得吗"的答案也随之漂移。一个在 3 月明显值得的设置可能在 9 月悄悄变成烧钱机器,反之亦然,中间没有任何单一事件标记那个翻转点。把估算当作一个活的数字,而不是一次性的计算,是"做出决策"和"假装决策一成不变"之间的区别。
The Electricity Bill Nobody Mentions
电费是随实际运行时间而变化的成本,也是大多数成本估算完全跳过的那部分。公式很简单:
Electricity Cost per Month = (Watts / 1000) × Hours per Day × Days per Month × Price per kWh
RTX 5090 的热设计功耗是 575W。加上系统其余部分——CPU、主板、风扇——一台满载推理机器通常从电网取电 700-900W。按每度电 $0.15 的费率,满载运行每天 12 小时,每月电费约 $40-55。这通常比硬件摊销还高,而且这是永远不会消失的纯经常性成本。
这就是为什么电费部分会惩罚常开机设置。GPU 在请求之间空闲时仍然消耗基准电量;一台必须全天候保持响应的服务器即使你每天只使用 1 小时也要支付全单。相比之下,云端 API 只为你实际发送的 Token 收费——空闲时间是免费的,因为那是别人的电。
Putting It Together: Your Real Cost per Token
把同样的 RTX 5090 重度使用的各个部分加在一起,就能得到真实的图景。硬件摊销贡献约每百万 Token $1.40,电费根据利用率再加 $1.00-1.40,运营开销(你的时间、设置、维护)加上你为小时数估值的那部分。一台充分利用的单 GPU 设置诚实的全包数字在每百万 Token $2.50-4 范围内——这还不算你自己的劳动成本。
现在与 2026 年云端定价对比。DeepSeek V4 Flash 输入每百万 Token $0.14,输出每百万 Token $0.28。Claude Sonnet 5 输入每百万 Token $2,输出每百万 Token $10,GPT-5.6 各层根据模型不同跨度很大。
模式才是关键结论:充分利用的本地机器落在中档云端定价区间,与 Sonnet 5 竞争、远低于旗舰层,但比最便宜的云端模型(如 DeepSeek Flash)贵得多。如果你的工作负载能接受更小的模型,$0.14/M 的云端就是无法战胜的——无论你怎样摊销,本地硬件都无法在每 Token 价格上触及那个数字。
Cloud Pricing as the Benchmark You Cannot Ignore
本地成本只有一个参照物才有意义,而这个参照物就是同样的 Token 作为 API 调用的成本。2026 年云端市场跨越两个数量级——这正是为什么"本地更便宜?"这个问题从来不存在单一答案。区间如下,经 2026 年 8 月验证的定价:

具有代表性的 2026 模型每百万输入 Token 价格。预算级和旗舰级之间的差距是一个数量级——本地硬件必须与整个区间竞争。
使用这张表的方法是选择与你本地运行的模型最接近的云端模型。如果你打算自托管一个紧凑的 7B 模型,诚实的比较对象是 DeepSeek Flash 的 $0.14/M 输入——本地完败。如果你打算自托管一个顶级 70B 模型,比较对象是 Claude Sonnet 5 的 $2/M,充分利用的本地机器确实可以一战。
这就是为什么"本地更便宜"的争论总是信息不足。真正的问题是比哪个模型便宜、在什么利用率下?在你锁定两者之前,你是在把一个你没有计算过的数字同一个你没有界定过的区间做比较。
When Local Actually Wins the Cost Game
以上数字揭示了本地在纯每 Token 成本上很少是最便宜的选择。它真正获胜的地方在于每 Token 价格不是全部的场景。有三个案例可以让自托管在数学上仍然合理:
隐私与数据控制。如果你的提示词包含敏感数据,不想发送给 API 提供商,那么本地的成本就是数据留在本地的代价。这是合规和风险决策,不是每 Token 优化。
可预测的重度使用。如果你每月真的在中级模型上生成数千万 Token,固定硬件成本可以被分摊得足够薄,低于等效的云端模型——本地 LLM 盈亏平衡计算器会找到你具体的交叉点。
延迟和可用性控制。本地模型没有网络跳数、没有速率限制、没有提供商宕机。对于几百毫秒很关键的应用,或者可靠性是合同义务的场景,即使 Token 价格更高,也有真实价值。
在其他所有情况下——轻量使用、波动需求、预算敏感型项目,或只需要小模型的工作负载——云端在成本上获胜。原则是计算你自己的数字,而不是假设计算。
The Step-by-Step Cost Estimate
以下是你今天无需购买任何东西就可以运行的流程。首先,确定你现实的每月 Token 数量——用 Token 计数计算器统计实际用量,而不是猜测。其次,估算你考虑的硬件价格(显卡、电源、内存、存储)除以摊销月数。第三,从显卡功耗和预期运行时间估算电费。第四,加上运营开销这一行——你的时间是有价值的,即使你不给自己算账。最后,用月总成本除以月 Token 量得到每 Token 成本,与使用 LLM API 成本计算器算出的同类模型的云端价格做比较。
最常见的错误是跳过第一步、直接假设一个用量水平。为轻量月份和重度月份都跑一遍数字——差距会告诉你本地是一个舍入误差还是一个负债。多数人发现本地要么明显值得,要么明显不值得,灰色地带比营销宣传的要窄得多。
Practical Tips for Cost Estimation
按 36 个月摊销,而不是"永远"。GPU 物理损坏之前就先淘汰了。36 个月是诚实的折中。
电费按整机墙端功耗计算,而不是 TDP。在显卡额定功率上加 20-40% 以覆盖周围的系统。
把你的时间算进去。设置、更新、调试都是真实成本。如果你的时间值 $50,一周折腾就是 $400 的运营开销。
按你的真实用量重新计算。盈亏平衡点在用量和成本的交点处。用量猜错了,下游每个数字都是错的。
记住云端没有空闲成本。对于波动或不可预测的需求,按 Token 付费比为你无法充分利用的硬件按月付费更划算。
别忘了转售价值。36 个月的摊销可以在末尾减去部分转售价值,许多人忽略了这一点,这让本地在事后看来稍微便宜一点。
Limitations and Edge Cases
每 Token 估算的质量取决于其假设,有几个假设很容易搞错。电价因地区和时段差异很大;一张卡空闲时消耗远低于峰值 TDP,因此常开机设置可能比公式算出来更便宜或更贵。Token 量取决于分词器:同一工作负载在不同模型下产生不同的 Token 数量,这会悄悄改变每 Token 比较。用本地对比云端仅输出的定价会忽略现实:真实的 API 账单是便宜的输入和昂贵的输出混合在一起的。最后,通常最大的无法量化的项是你自己的劳动——它不会自动出现在公式里,除非你把它加进去,但它往往是本地是捡了便宜还是只是业余爱好的分水岭。
Frequently Asked Questions
Q: 运行本地 LLM 比云端 API 便宜吗?
A: 只有在重度、可预测的使用下才便宜。充分利用的机器落在中档云端定价区间,但在纯每 Token 价格上,最便宜的云端模型(如 DeepSeek 的 $0.14/M 输入)打败本地硬件。本地在隐私、控制和延迟上获胜,通常不在原始成本上。
Q: 在本地运行 RTX 5090 每月成本是多少?
A: 摊销约 $56 加上每天 12 小时运行的电费 $40-55,不含你的劳动。按重度利用率换算约每百万 Token $2.50-4——与中档云端竞争,远高于最便宜的云端模型。
Q: 本地与云端的盈亏平衡点是什么?
A: 取决于你的模型选择、硬件和用量。与 Claude Sonnet 5 相比交叉点约在每月 1.35 亿 Token;与便宜的 DeepSeek 定价相比,在单块消费级 GPU 上可能永远达不到。用本地 LLM 盈亏平衡计算器算你的具体数字。
Q: 为什么供应商从不报价本地 LLM 每 Token 成本?
A: 因为它完全取决于你的利用率、电费和硬件。没有固定的每 Token 硬件价格,所以没人能诚实报价。你必须用自己的数字来计算。
Q: 如果我偶尔使用,本地会更便宜吗?
A: 几乎从不。偶发使用让固定硬件和电费分摊到非常少的 Token 上,这会把每 Token 成本推到远高于云端费率。轻度用户应强烈偏好按 Token 付费的云端 API。
Q: 我如何在成本中计算自己的劳动?
A: 估算在设置、更新和维护上花费的小时数,按你的时间价值估值,再除以每月 Token 量。它通常是最被隐藏的最大项,也是把"免费"自托管变成真实开销的那个变量。