2026年8月7日这周,NVIDIA Nemotron 3 Super提示词价格暴涨70%(从0.085到0.30美元/百万token),多家厂商有价格下调,对高用量推理成本影响显著。
成本影响最大的变动:NVIDIA Nemotron 3 Super 价格上调。Prompt token 从 $0.085/1M 涨至 $0.30/1M(+$0.215/1M);completion token 从 $0.40/1M 涨至 $0.90/1M(+$0.50/1M)。使用该模型进行高频推理的团队需要为约 70% 的成本增长做好准备。
MoonshotAI Kimi 最新动态:Prompt token 从 $2.90/1M 降至 $2.50/1M(−$0.40/1M)。Completion token 保持在 $14.00/1M 不变。对成本敏感的用户可节省约 14% 的 prompt token 费用。
Qwen VL 235B Thinking:Prompt token 从 $0.98/1M 降至 $0.40/1M(−$0.58/1M);completion token 从 $3.95/1M 小幅涨至 $4.00/1M(+$0.05/1M)。净下降 $0.53/1M,有助于视觉-语言工作负载成本优化。
Thinking Machines Inkling Small:Prompt token 从 $0.50/1M 降至 $0.45/1M(−$0.005/1M);completion token 稳定在 $1.20/1M。低流量使用场景的轻微节省。
InclusionAI Ling-3.0-flash:Prompt token 从 $0.075/1M 大幅砍至 $0.021/1M(−$0.054/1M);completion token 从 $0.22/1M 砍至 $0.063/1M(−$0.157/1M)。总计 −$0.211/1M——对现有用户而言降幅显著。
Z.ai GLM 5.2:Prompt token 从 $0.76/1M 降至 $0.679/1M(−$0.081/1M);completion token 从 $2.42/1M 降至 $2.134/1M(−$0.286/1M)。净下降 $0.367/1M。
Qwen 3.5-122B:Prompt token 从 $0.26/1M 涨至 $0.29/1M(+$0.03/1M);completion token 从 $2.08/1M 涨至 $2.40/1M(+$0.32/1M)。净增加 $0.35/1M——依赖该模型的用户面临小幅成本上涨。
模型目录更新:新增 61 个模型亮点包括免费模型 inclusionai/ling-3.0-tiny、Claude Opus 5 的 batch 变体、 Gemini 3.6 Flash 以及多个 OpenAI GPT-5.6 Luna/Terra/Sol 版本。下线一个模型:免费模型 inclusionai/ling-3.0-flash。
开发者应审查新增 batch 方案中潜在的延迟-成本权衡,并据此调整所涉及模型的用量。
Originally published at The Token Ledger. Subscribe for the daily digest.