实测中国大模型 API 批发价,Qwen3.7-Flash 仅 $0.16/M input,GPT-5 为 $1.25;20M 输入+5M 输出场景下 GPT-5 月费是中国模型的数十倍。
我运营一个小型的 OpenAI 兼容网关,对接中国模型服务商,这意味着我每天都能看到批发价格。与西方前沿模型的差距比大多数人想象的要大——更多团队没有切换的原因不是价格,而是注册。
以下是真实数据,外加没人写过的那部分。
价格表(USD / 1M tokens)
西方前沿模型,当前公开列表价:
通过网关销售的中国模型(零售价,即批发成本 + 固定 30% 溢价——公式是公开的,不是隐藏的):
供参考,直接从各厂商控制台购买同样的中国模型,列表价与批发价大致相同——网关并没有漫天加价。智谱 GLM-5.3 标价为 $1.40 / $4.40,阿里 Qwen3.8-Flash 标价为 $0.16 / $0.47。
实际账单换算
假设你的产品每月处理 20M 输入 tokens 和 5M 输出 tokens。不算大应用——一个小型的编程助手、支持机器人或摘要工具而已。
GPT-5:20 × $1.25 + 5 × $10.00 = $75.00 / 月
Qwen3.7-Flash 级别模型:约 $4–7 / 月
这就是 API 账单吃光你的利润和不吃光的区别。对于每天处理几千次请求的个人产品,这通常是副项目能否存活的关键差异。
什么时候不应该切换
直接说清楚,因为这比价格表更重要:
复杂的代码生成和长周期 agent 循环仍然对前沿模型有利。如果你的 agent 需要在 40 次工具调用中保持计划连贯,GPT-5/Claude 级别的推理能力值这个钱。
任何有严格准确性要求的场景(医疗、法律、金融建议)——便宜模型会以节省的 token 费用远远弥补不了的方式失败。
超长上下文且要求严格召回的场景。有些中国模型有 1M 的上下文窗口,但窗口大小不等于检索质量。
诚实的框架:对中国模型用于高volume、范围明确的工作(分类、提取、摘要、聊天草稿、批量 enrichment),把前沿模型留给那困难的 10%。
没人写过的那部分:你根本注册不了
以上价格在中国服务商控制台上都是公开的。问题是,大多数中国境外的开发者根本访问不了这些控制台:
智谱(GLM)——需要中国大陆手机号和支付宝/微信支付
阿里(DashScope / Qwen)——同样:大陆身份、人民币支付
腾讯(Hunyuan)——同样
字节(Volcano / Doubao)——同样,而且偏重企业账号
有些平台有"国际版"控制台,接受国际卡,但模型阵容和速率限制与大陆版不同,有几个模型根本就不会出现在那里。
所以真正的障碍不是成本。最低价格那一档的能力模型被一道注册壁垒挡住了——美国、欧盟或巴西的开发者都跨不过去。这就是我运营的这类网关存在的全部原因:一个 OpenAI 兼容端点,一套密钥,国际卡或 USDT 支付,无需中国大陆手机号。
真正切换的做法
如果你已经用了 OpenAI SDK,只需要改一个 base URL——其他什么都不用动:
from openai import OpenAI
client = OpenAI(
base_url="https://tidelink.xyz/v1",
api_key="YOUR_KEY",
)
resp = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "Summarise this support ticket..."}],
)
换 model 就能在 GLM、Qwen、DeepSeek、Hunyuan 和 Doubao 之间切换,代码其他部分不用动。这比听起来重要得多:它让你可以在真实流量上对中国模型和现有模型做 A/B 测试,然后才决定迁移,而不是直接重写整个技术栈。
先试再付费
有免费 tier,不需要信用卡——glm-4.7-flash 和 glm-4.6v-flash 是免费的,速率限制为 5 requests/minute。这足够让你用自己的真实 prompt 做评估、测量质量对比你现有的方案,这才是唯一真正重要的基准。
获取密钥:https://tidelink.xyz/dashboard.html?cid=devto-costtable
如果你已有中国服务商账号,也可以自带(BYOK),按固定平台费支付而不是零售 token 费率。
价格于 2026 年 9 月根据服务商公开定价页核对。费率经常变动,中国服务商也会做促销活动(GLM-5.3-Flash 低至 $0.075/$0.25 也出现过)。承诺预算前请自行核实。