用相同的50个真实prompt跑DeepSeek、OpenAI GPT-5、Claude Sonnet等8个API,给出精确的成本数据和质量评分(质量差异0.8分,成本差26倍)。
声明:我是于侃(Yu Kan),NovAI 的开发者,一个中文 AI 模型的 API 网关。本文中的每个数字都是通过运行下面的测试脚本测量的。我分别测试了 DeepSeek 的官方 API,以验证网关不增加任何开销。测试 prompt 和完整结果已开源 —— 链接在下面。
所有发布 API 定价对比的人,要么在精选 prompt,要么直接引用官方定价页面,而不是实际测试。我厌倦了这种做法,所以我用同样的 50 个现实世界中的 prompt,通过 8 个不同的 AI API 进行了测试,并追踪了每一个 token 和每一分钱。
这是我实际发现的 —— 包括一些令我惊讶的结果。
最便宜的选项比最昂贵的便宜 26 倍。排名第 1 和第 8 的质量差异是 5 分制中的 0.8 分。
对于每个 prompt,我测量了:
定价于 2026 年 7 月从官方定价页面验证。价格会变化 —— 始终检查来源。
我测试了 DeepSeek 的官方 API 和通过 NovAI 的 DeepSeek,以检查网关是否增加开销(剧透:不增加 —— token 计数相同,延迟差异 <50ms)。
最便宜的选项比最昂贵的便宜 26 倍。排名第 1(Qwen-Plus,$0.011)和第 8(Claude,$0.287)的质量差异是 5 分制中的 0.8 分。
在 $0.08/1M 输入和 $0.32/1M 输出的价格下,Qwen-Plus 是我测试的最便宜的模型 —— 在质量上获得 3.9/5 分,超过成本高 2.4 倍的 Gemini 3.1 Flash(3.8/5)。对于编码任务,它获得 4.2/5 分,与 DeepSeek V4 Flash 相当。
我怀疑一个网关是否会增加延迟或改变 token 计数。我用完全相同的 prompt 通过两者进行了测试。结果:
网关不增加任何开销。这很重要,因为 NovAI 让你通过一个 API 密钥访问 40+ 个中文模型,而 DeepSeek 的官方 API 仅提供 DeepSeek。
看定价表,你会认为 GPT-5($1.25/$10)和 DeepSeek V4 Flash($0.14/$0.28)之间有巨大的质量差异。实际上,对于我测试的 50 个 prompt:
对于 90% 的生产工作负载(聊天机器人、内容生成、代码补全、文档处理),0.5 分的质量差异对最终用户是无法察觉的。10-36 倍的价格差异对你的 CFO 来说非常明显。
Claude Sonnet 4.6 获得 4.7/5 —— 最高质量。但它的 50 个 prompt 成本是 $0.287,而 DeepSeek V4 Flash(获得 4.1/5)的成本是 $0.019。这是 0.6 分质量的 15 倍成本。Claude 适合用于法律文件和医学摘要。对于其他一切,它都是浪费。
在以下情况下使用 OpenAI GPT-5:
在以下情况下使用 DeepSeek V4 Flash:
在以下情况下使用 Claude Sonnet 4.6:
这是我使用的 Python 脚本。它很简单、可重现,你可以自己运行。
from openai import OpenAI
import time, json
# Test with NovAI (works identically with any OpenAI-compatible API)
client = OpenAI(
base_url="https://aiapi-pro.com/v1",
api_key="nvai-your-key-here"
)
prompts = [
"Write a Python function to merge two sorted linked lists",
"Explain the difference between mutex and semaphore",
"Translate to Chinese: 'The quick brown fox jumps over the lazy dog'",
# ... 47 more prompts (full list in the GitHub repo)
]
results = []
for prompt in prompts:
start = time.time()
response = client.chat.completions.create(
model="deepseek-v4-flash", # or qwen-plus, doubao-seed-2.0-lite
messages=[{"role": "user", "content": prompt}],
)
latency = time.time() - start
results.append({
"prompt": prompt,
"input_tokens": response.usage.prompt_tokens,
"output_tokens": response.usage.completion_tokens,
"latency_ms": round(latency * 1000),
"response": response.choices[0].message.content,
})
# Calculate cost
INPUT_PRICE = 0.14 # $/1M tokens for deepseek-v4-flash
OUTPUT_PRICE = 0.28
total_input = sum(r["input_tokens"] for r in results)
total_output = sum(r["output_tokens"] for r in results)
total_cost = (total_input * INPUT_PRICE + total_output * OUTPUT_PRICE) / 1_000_000
print(f"Total cost for {len(prompts)} prompts: ${total_cost:.4f}")
print(f"Avg latency: {sum(r['latency_ms'] for r in results)/len(results):.0f}ms")
你可以交换 base_url 和 api_key 来测试任何提供商。OpenAI Python SDK 适用于任何与 OpenAI 兼容的 API —— 这就是标准的美妙之处。
如果你想验证这些数字(你应该 —— 别信任随机博客文章),这是方法:
获取来自每个提供商的 API 密钥。 OpenAI、Anthropic、Google、DeepSeek 都提供免费额度。对于 NovAI,你可以在 aiapi-pro.com/register 注册并获得免费额度 —— 无需信用卡。
运行相同的 50 个 prompt。 我已经在 github.com/vvvvking/ai-api-cost-comparison 开源了我的测试 prompt 和脚本。
使用官方定价页面计算成本。 不要使用我的数字 —— 使用官方定价页面:
50 个 prompt 是一个很小的样本。 你的工作负载会不同。在你自己的 prompt 上运行测试。
质量评分是主观的。 我手动评分。你可能不同意我的 4.1 vs 4.6 评分。重点是相对差异,而不是绝对数字。
我没有测试图像/视频生成。 这仅是文本。图像和视频生成有完全不同的经济学 —— 而中文模型有强制性的 AI生成 水印,使用前你应该了解这一点。(声明:我在 NovAI 工作,这是这些模型的网关。水印是中国的法律要求,无法删除。参见 aiapi-pro.com/watermark-notice。)
延迟因地区而异。 我是从东南亚测试的。如果你在美国或欧洲,将所有延迟数字加上 50-150ms。DeepSeek 和 NovAI 在亚洲有服务器,所以对亚洲用户自然更快。
我在 NovAI 工作。 我在整篇文章中都对此保持透明。但数字是真实的且可重现的 —— 我分别测试了 DeepSeek 的官方 API,得到了相同的结果。网关开销是可忽略不计的。如果你持怀疑态度,自己运行测试。
如果你为足以使用 GPT-4 级质量的生产工作负载支付 OpenAI 价格,你在浪费钱。数学很简单:
对于典型的 SaaS 应用每天处理 1M 输入 + 500K 输出 token:
切换代码就一行:
client = OpenAI(
base_url="https://aiapi-pro.com/v1", # was: https://api.openai.com/v1
api_key="nvai-your-key-here" # was: sk-your-openai-key
)
自己测试。免费额度足以运行 50 个 prompt 并验证本文中的每个数字。
我是于侃(Yu Kan),NovAI(aiapi-pro.com)的开发者。我写这篇文章是因为我对缺乏诚实、可重现的 API 成本对比感到沮丧。本文中的每个数字都是通过运行上面的测试脚本测量的。测试 prompt 和完整结果已在 github.com/vvvvking/ai-api-cost-comparison 开源。如果你发现错误,请开 issue。