文本生成、转录、OCR、嵌入等已商品化,应优先调用 API;只有当能力构成差异化壁垒、快速迭代且成本可控时才考虑自建。
今日成本影响最大的变化是 Z.ai GLM 5.2 的大幅降价:Prompt 和 Completion 成本均下降超过 80%。
Prompt:从 $0.266 / 1M 降至 $0.07 / 1M(‑73.7%)。
Completion:从 $0.836 / 1M 降至 $0.22 / 1M(‑73.8%)。适用对象:高量级聊天、摘要或代码生成工作负载、以 Token 使用量为成本主导的团队。
DeepSeek V4 Flash Latest
Prompt:从 $0.090 / 1M 小幅降至 $0.080 / 1M。
Completion:从 $0.180 / 1M 升至 $0.252 / 1M(+40%)。适用对象:Completion 密集型应用(如创意写作)可能会看到账单增加。
MoonshotAI Kimi Latest
Prompt:从 $2.50 / 1M 升至 $2.80 / 1M(+12%)。
Completion:保持在 $14.00 / 1M 不变。适用对象:对 Prompt 成本敏感的用户,例如使用大 Context Window 的场景。
Qwen:Qwen3.6 35B A3B
Prompt:从 $0.14 / 1M 升至 $0.15 / 1M(+7%)。
Completion:稳定在 $1.00 / 1M。适用对象:使用该模型进行中等规模生成的注重成本的开发者。
MiniMax:MiniMax M2.7
Prompt:从 $0.27 / 1M 升至 $0.30 / 1M(+11%)。
Completion:从 $1.08 / 1M 升至 $1.20 / 1M(+11%)。适用对象:Prompt/Completion 均衡的工作负载会看到小幅上涨。
NVIDIA:Nemotron 3 Super
Prompt:从 $0.085 / 1M 飙升至 $0.30 / 1M(+253%)。
Completion:从 $0.40 / 1M 升至 $0.90 / 1M(+125%)。适用对象:依赖该大模型进行推理的用户应重新评估预算或考虑替代方案。
DeepSeek:DeepSeek V3.2
Prompt:从 $0.26 / 1M 小幅升至 $0.269 / 1M(+3.5%)。
Completion:从 $0.38 / 1M 升至 $0.40 / 1M(+5.3%)。适用对象:影响较小,适用于跟踪边际成本漂移的长期运行服务。
今日无模型新增或移除。
三个最低价模型(按 Token 计费):
inclusionai/ling-2.6-flash – $0.01 / 1M prompt,$0.03 / 1M completion
mistralai/mistral-nemo – $0.019 / 1M prompt,$0.03 / 1M completion
ibm-granite/granite-4.0-h-micro – $0.017 / 1M prompt,$0.112 / 1M completion
原文发表于 The Token Ledger。订阅每日摘要。