作者花 $400 亲测 30 个 AI API 的价格,整理出每百万 token 输出成本排行,并给出实际部署推荐,对选型有直接参考价值。
坦白说,我花了 400 美元测试一个聊天机器人创意、买了一堆 API 额度。那叫一个肉疼。不是心疼那点钱,而是因为有一半的钱花在了我根本不需要的模型上——一个笨重的"高级"套餐,而一个几十亿参数的小模型本来就能搞定的事。
我写开源代码已经很多年了(这里用 Apache 2.0,那里用 MIT,都是常规操作),我学到的最重要的一件事就是:最便宜的选择几乎总是最自由的选择。当你不被推理费用持续抽血的时候,你才能真正做实验,才能在一个周末完成项目,才能底气十足地告诉客户"没问题,我们用得起"。
所以我开始深入研究。我从 Global API 获取了 2026 年 5 月的定价数据,按每个模型每百万 token 的输出成本排序,然后开始记笔记。这份指南基本上就是我的实战笔记——记录了我发现了什么、什么让我意外,以及我实际会部署哪些模型。
在聊具体数字之前,我先吐个槽。
整个"AI API"行业都建立在封闭花园之上。你选择一个供应商,他们给你一个 SDK,你用习惯了,然后他们就涨价了。更糟糕的是——他们直接淘汰了你依赖的模型。我见过初创公司因为整个产品都跑在单个专有端点上,而那个端点突然变成原来三倍价格,直接关门大吉。
开源模型完全反转了这种局面。像 Qwen3、GLM-4、DeepSeek 这样的模型——都是基于 Apache 2.0 或 MIT 协议发布的。权重可以下载。想自己托管也行。而且当它们出现在类似 Global API 这样的 API 聚合商上时,你不会被锁定在某个公司的路线图里。
我会在整个列表中持续提及许可证类型。这是租房和买房的区别。
我从 Global API 定价端点获取了所有公开的模型,按每百万输出 token 成本(美元)排序,并把它们分成五个梯队:
价格差异非常大。同一个平台、同一天,最便宜的模型每百万输出 token 只要 0.01 美元,最贵的要 3.50 美元。对于很多常见任务来说,质量其实差不多,但价格差了 350 倍。
以下是完整列表。所有数字均直接来自 Global API 定价 API,已验证为 2026 年 5 月的数据。下面的每个价格都是我拉取时的原始值。
是的——排名前四的模型每百万输出 token 都是一分钱。我不得不反复确认这些数字,因为看起来好得不像真的。但数据就是这样。
当我盯着这张表看了太久之后,有几件事跳了出来。
Apache 2.0 在低价位占据主导地位。Qwen 独自占据了前十六名中的六个位置,每百万输出都低于 0.30 美元,而且都是 Apache 2.0 许可。这不是巧合——开放权重意味着任何人都可以部署它们,竞争把价格压到了最低。腾讯的 Hunyuan 模型是专有的,价格始终比同级别的 Qwen 型号高一个档次。
DeepSeek 是性价比之王。他们的 V4 Flash 每百万输出只要 0.25 美元,是整个目录里性价比最高的选择。我用它跑了一个月的代码助手,质量真的让我惊艳——我敢说这价格要是三倍我都认。
专有并不意味着更好。Hunyuan-Turbo 每百万 0.57 美元,比 Qwen3-32B 的 0.28 美元更贵,但在我测试中 Qwen 模型在大多数任务上都胜出。这就是开源税的反向操作——你为封闭花园付了更多钱,但质量并没有更好。
上下文长度越来越便宜了。128K 上下文模型以前是奢侈品。现在有五个每百万输出低于 0.30 美元。ERNIE-Speed-128K 每百万输出只要 0.20 美元,输入完全免费(0.00/M),对于长文档工作来说这是个离谱的 deal。
以下是我现在跑在生产环境的方案,以及为什么这样选:
聊天机器人和简单分类:Qwen3-8B,每百万只要 0.01 美元。Apache 2.0 许可,速度极快,足以处理 80% 的用户查询。如果问题太难,我就升级。
编码助手:DeepSeek V4 Flash,每百万 0.25 美元。这是最佳选择。它是 MIT 风格许可的(权重是开放的),输出质量真的很不错,而且我可以把流量路由到它而不必担心被供应商锁定,因为模型本身不依附于任何一个供应商。
长文档摘要:ERNIE-Speed-128K,每百万输出 0.20 美元,输入免费。在 128K 上下文模型上免费输入 token 几乎闻所未闻。唯一的缺点是它是专有的——如果百度把它下架了,我就抓瞎了。所以我会备一个备用方案。
视觉任务:Qwen3-VL-32B,每百万 0.52 美元。同等专有选项一半价格的 Apache 2.0 视觉模型。不用想。
我不用每百万 3.50 美元的前沿层。不是因为那些模型不好——它们很好——而是因为我的利润撑不起,而且说实话,我还没遇到 DeepSeek V4 Flash 处理不了的任务。
这里有个很多人搞混的地方。Global API 通过一个单一的 OpenAI 兼容端点暴露所有这些模型。你不需要十个不同的 SDK。只需改一下模型名称。
以下是我的 Python 设置:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLOBAL_API_KEY"],
base_url="https://global-apis.com/v1"
)
def chat(model: str, prompt: str) -> str:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": prompt}
],
temperature=0.7,
max_tokens=512
)
return response.choices[0].message.content
result = chat("qwen3-8b", "Hello!")