Sonnet 5输入/输出定价将从$2/$10涨至$3/$15,且tokenizer更换后相同文本token消耗增加约35%,已有生产负载需尽快评估成本。
2026 年 LLM API 定价跨度约三个数量级:从价值端每百万输入 token 0.14 美元到前沿端 10 美元甚至更高——而使用最广泛的模型之一将在 9 月 1 日涨价 50%。Claude Sonnet 5 的入门价格 $2/$10 每百万 token 将于 8 月 31 日结束,调整至 $3/$15;与此同时分词器变更意味着同一段文本消耗的 token 可能比 Sonnet 4.6 多出 35%。如果你的生产负载跑在 Sonnet 5 上,不到一个月账单就会变化。
更宏观的图景比"价格上涨"更为复杂。2025 年初到 2026 年初,整个市场的输入定价下降了约 80%,随后开始剧烈分化:价值层模型持续走低,而前沿模型保持持平或上涨。每 token 成本不再是单一数字,而成为一道战略选择题。
这是一份实用参考——当前目录价、9 月 1 日变更的精确解读,以及五个真正能降低账单的优化杠杆,按每小时工程投入的回报排序。
Claude Sonnet 5 的入门定价 $2/$10 每百万 token 将于 2026 年 8 月 31 日结束;9 月 1 日起调整为 $3/$15——涨幅 50%。
Sonnet 5 分词器对同一段文本可能多消耗达 35% 的 token,因此实际成本增幅超过标价变化。
2026 年 8 月前沿模型目录价:Claude Opus 5 为 $5/$25,GPT-5.6 Sol 为 $5/$30,Claude Fable 5 为 $10/$50。
DeepSeek V4 Flash 0731 位于 $0.14/$0.28,缓存输入仅 $0.0028/M——比前沿模型便宜约 35 倍。
Prompt 缓存可将重复前缀的输入成本削减高达 90%;Batch API 通常再额外提供 50% 折扣。
2026 年 8 月 LLM API 定价对比
以下价格为每百万 token 目录价。缓存、批处理与批量协议都能实质性降低实际费用。
两个观察比单个数字更重要。
第一,输出定价才是差距所在。Sol 和 Opus 5 在输入侧相同($5.00),但在输出侧相差 $5.00。对于生成密集型负载,这个差异主导了账单的大部分,而大多数成本比较都低估了它,因为输入 token 更容易统计。
第二,价值层不再是降级之选。DeepSeek V4 Flash 0731 在 Terminal-Bench 2.1 上得分 82.7,而收费只是前沿定价的零头——我们在 DeepSeek V4 Flash 0731 发布分析中详细拆解过。你付出 35 倍差价所购买的差距,如今在很多任务上只体现在几个基准分上,而不是模型能否完成任务。

两件事同时发生,而且只有一件在定价页上。
标价。 Sonnet 5 以 $2 输入 / $10 输出每百万 token 的入门价上线。该价格于 2026 年 8 月 31 日截止。9 月 1 日起标准价格为 $3/$15——两边都涨了 50%。
分词器。 Sonnet 5 使用了新的分词器,正如 Finout 的分析所记录的,同一文本产生的 token 数量可能比 Sonnet 4.6 多出 35%。由于 $3/$15 与 Sonnet 4.6 的标价完全相同,很容易被误读为成本中立的迁移。实际上不是:标价相同,但每个请求的 token 多了,账单更高。
实际意义在于,你不能简单用 8 月 token 数乘以 1.5 来估算 9 月成本。先用当前分词器在 Sonnet 5 上测量实际 token 消耗量,再应用新价格。没有这一步的团队会遭受双重惊讶。
值得注意的另一方面:分词方式不同并不纯粹是一种"税"。不同的分词方式在代码和非英文文本上可能提升质量。这对你的负载是否值得是一个评估问题,而非定价问题。
按每小时工程投入的回报从高到低排列。综合使用,这些通常能在不改变系统产出的前提下削减 70–85% 的支出。
1. Prompt 缓存(缓存输入最高可省 90%)
各大提供商现在都将缓存输入定价为新鲜输入的约 10%,DeepSeek 更为激进,定价为目录价的 2%。命中缓存时延迟也降低 30–80%,因为 prefill 通常是请求中最慢的部分。唯一的要求是稳定内容必须出现在消息序列的最前面:
messages = [
# 不变的前缀 — 可缓存。系统规则、schema、few-shot 示例。
{"role": "system", "content": SYSTEM_RULES + JSON_SCHEMA + FEW_SHOT},
# 可变的后缀 — 每个请求不同。始终在最后。
{"role": "user", "content": user_input},
]
在系统提示顶部放一个时间戳或请求 ID 会导致每次调用都使缓存失效。这个错误是缓存"不起作用"最常见的原因。
2. 模型路由
简单请求发给便宜模型,困难请求发给前沿模型。用分类器甚至基于输入长度和任务类型的启发式规则就能捕获大部分收益。如果 80% 的流量是分类和格式化,按 $30/M 输出的价格为此付费就是纯粹的浪费。
3. Batch API(5 折)
如果负载可以接受以小时而非秒计的延迟——评估运行、批量富化、离线摘要——批处理端点将价格减半,同时输出质量相同。
4. 输出长度控制
在所有提供商中,输出 token 成本是输入的 2–5 倍。限制 max_tokens、请求结构化输出而非散文、明确指示简洁——这些都直接攻击账单中最贵的部分。
5. Prompt 压缩
删除冗余的 few-shot 示例和冗长的指令。五者中回报最低,却是大多数团队因为"感觉有成效"而最先尝试的。
一个具体的公开案例:一个管道每次调用几乎都重复约 3,500 token 的系统指令,仅冗余输入就花费约 $180/月;在启用 prompt 缓存后降至约 $70/月——一次配置变更带来 61% 的削减。

先测量,再相乘。大多数团队在原型阶段之后才发现实际支出是预算的 3–5 倍,原因几乎总是重试、失败的 agent 分支和上下文重读,这些在粗略估算中从不会出现。
PRICES = { # $ per million tokens, list, Aug 2026
"fable-5": (10.00, 50.00),
"gpt-5.6-sol": ( 5.00, 30.00),
"opus-5": ( 5.00, 25.00),
"sonnet-5-sep": ( 3.00, 15.00),
"v4-flash": ( 0.14, 0.28),
}
def monthly(model, in_tok_day, out_tok_day, cache_hit_rate=0.0, days=30):
pin, pout = PRICES[model]
effective_in = pin * (1 - cache_hit_rate) + pin * 0.1 * cache_hit_rate
return days * (in_tok_day / 1e6 * effective_in + out_tok_day / 1e6 * pout)
for m in PRICES:
print(f"{m:14s} ${monthly(m, 20e6, 4e6, cache_hit_rate=0.7):>10,.2f}/mo")
用你自己的数字和现实的缓存命中率跑一遍。结果通常会重新排列你的候选清单,因为高缓存命中率压缩了层级之间的差距——远比大多数人预期的幅度更大——而低命中率则扩大了差距。
几乎每篇 LLM 定价文章都按每 token 成本对模型排序,并称最便宜的为赢家。这个单位就是错的。
真正重要的单位是每完成一个任务的成本。一个每 token 成本低 35 倍但需要三次尝试、更长提示和验证环节的模型,并不算便宜 35 倍——而一个能一次完成你原本需要重试四次的任务的前沿模型,反而真正更划算。我们见过团队迁移到价值层模型,每 token 价格降了一个数量级,但总支出只降了一半,因为重试率上升了,而且他们不得不增加一个检查步骤。
三个后果随之而来:
为任务成功埋点,而非 token 计数。 如果你的仪表盘显示的是 token 而非完成率,你就无法做出这个决策。
为所需的验证定价。 便宜模型并非失败更少,而是失败方式不同。要为捕获它的测试运行或第二模型检查做好预算。
路由而非替换。 几乎每个负载都是简单和困难请求的混合。最优解几乎从不是单一模型。
另一个值得规划的结构性变化:推理定价已不再是唯一的成本曲线。Thinking Machines 发布的 Inkling 采用 Apache 2.0 许可,完全没有计量 API,赌的是价值将沉淀在定制化而非 token 上。如果这个模式扩散,"API 成本是多少"就变成了关于你自己的基础设施而非供应商定价表的问题。
2026 年 9 月 1 日 Claude Sonnet 5 价格上涨多少?
Sonnet 5 的入门价 $2 输入 / $10 输出每百万 token 将于 2026 年 8 月 31 日截止。9 月 1 日起标准价格为 $3/$15,涨幅 50%。新的分词器也可能使同一段文本多消耗达 35% 的 token。
2026 年最便宜的 LLM API 是哪家?
在有能力的模型中,DeepSeek V4 Flash 0731 以 $0.14 输入 / $0.28 输出每百万 token 占据成本领先地位,缓存输入降至每百万 $0.0028。它在 Terminal-Bench 2.1 上得分 82.7,因此在价格所暗示的能力层面并非一种权衡。
Prompt 缓存能省多少?
缓存部分输入最高可省 90%,因为提供商通常将缓存命中定价为新鲜输入的约 10%。命中时延迟也降低 30–80%。前提是你的不变内容出现在消息序列的最前面。
为什么输出比输入贵?
输出 token 是一个一个生成的,每次都需要完整的模型前向传播,而输入 token 在 prefill 阶段可以并行处理。2–5 倍的价格差异反映的就是这种计算不对称。
GPT-5.6 Sol 还是 Claude Opus 5 更便宜?
输入侧相同,均为每百万 $5.00。Opus 5 输出侧更便宜:$25.00 对比 Sol 的 $30.00,因此对于生成密集型负载,Opus 5 实际成本更低。
构建前如何估算 LLM 成本?
用真实负载做原型,测量实际 token 消耗量(包括重试和失败分支),然后根据你的缓存命中率调整目录价后应用。团队仅从单个理想请求估算,通常会低估 3–5 倍。
本文最具可操作性的单一事实有一个截止期限:Claude Sonnet 5 从 2026 年 9 月 1 日起贵 50%,而分词器变更意味着你的实际增幅更大。如果你的生产流量跑在 Sonnet 5 上,这周就测量你真实的 token 消耗量,然后审慎决定是吸收它、将部分负载路由到别处,还是迁移。
我们更宏观的建议是:停止优化每 token 成本,开始衡量每完成一个任务的成本。今天就开启 prompt 缓存——这是每工时回报最高的手段,而且大多数团队都配置错误或关闭了。然后按难度路由而非选择单一模型,因为对于混合负载没有一个价格点是绝对正确的。
对于本文比较的两个极端,详见我们在前沿端的 Claude Opus 5 拆解和价值端的 DeepSeek V4 Flash 0731 拆解——以及中间层的 Grok 4.5。
Token 价格一年跌了 80%,大多数团队的账单却反而上涨。模型更便宜了;负载更贪心了。只有后者是你能控制的。