作者亲身测试 DeepSeek、Qwen、Kimi、GLM 的 API 成本与输出质量,聚焦国内模型相比 OpenAI 的费用优势,对选型有直接参考价值。
我从编程培训班毕业六個月时,以为自己对 AI 格局已经了如指掌。GPT-4o、Claude、Gemini——这些名字在我们同期学员的 Slack 频道里飞来飞去。然后某个周末,我在刷 Reddit 帖子时,偶然发现了一个我压根不知道存在的中国 AI 模型宇宙。
说实话?那刻真的大开眼界。
我不断看到 DeepSeek、Qwen、Kimi 和 GLM 的提及,但每个帖子对它们的描述要么是神话,要么是一无是处。我找不到任何一个把它们放在一起用真实数据对比的来源。于是,作为一名固执的培训班毕业生,我决定自己全部测一遍。
接下来几周发生的事情,彻底改变了我对 AI 定价的认知。
培训班里没人告诉你的事实:API 费用涨得飞快。当我构建自己的第一个"真正"项目——为朋友的电商网站做一个小型的客服聊天机器人——看到月底的 OpenAI 账单时差点哭出来。我在 token 上的花费比接自由职业挣的钱还多。
所以当我开始看到那些比西方巨头便宜得像便士一样的模型时,我必须一探究竟。正好在上一个合同工作和下一个之间有几周空闲,我直接开启了疯狂科学家模式。
问题是,每家中国 AI 公司都有自己的文档、自己的定价页面、自己的 SDK 怪癖。把它们一个个分别测试,感觉就像在一个周末内学习四种不同的编程语言。后来有人在 Discord 服务器里提到了 Global API,它可以让你通过一个单一的端点访问所有这些模型。这才是我真正需要的突破口。
在深入之前,先给你一个快速概览。有四个主要的中国 AI 模型系列值得关注:
这四家都提供 OpenAI 兼容的 API,这对于像我这样已经把 OpenAI Python 库用烂了的人来说意义重大。我不需要为其中任何一个去学习新的 SDK。
以下是真的让我震惊的定价格局:
看到有些模型的定价低到每百万输出 token 只需一分钱,我非常震惊。这不是笔误。一分钱。每一百万 token。我以前完全不知道还有这种价格存在。
我从 DeepSeek 开始,因为说实话,网上所有人都在吹它。我现在理解为什么了。他们的 V4 Flash 模型每百万输出 token 只需 $0.25,在我看来,这是目前 AI 领域性价比最高的选择。
我用自己惯用的一系列测试来跑它。首先,我让它用恰好 100 词解释量子计算。然后给它出了一些 LeetCode 风格的题目。再然后让它用 FastAPI 写一个基本的 CRUD API。
结果呢?说实话,对于我的使用场景,和 GPT-4o 几乎没有区别。而且价格只是它的一个零头。
以下是我测试的完整 DeepSeek 系列:
速度也让我震惊。V4 Flash 在我的测试中能达到每秒约 60 个 token,这是我用过的最快速度之一。当我在构建聊天界面时,延迟很关键,而 DeepSeek 表现出色。
唯一让我不爽的一点?视觉能力。DeepSeek 的图像理解支持相比其他几家比较有限。如果你需要给模型投喂图片,你得看看别家。
在中文任务上,DeepSeek 表现不错,但 GLM 和 Kimi 略胜一筹。我通过给它喂一些中文产品描述然后对比输出来测试这一点。
给你看看基本的 DeepSeek 配置,说实话,这是我整个项目中学到的最简单的东西之一:
from openai import OpenAI
client = OpenAI(
api_key="ga_xxxxxxxxxxxx",
base_url="https://global-apis.com/v1"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explain quantum computing in 100 words"}]
)
print(response.choices[0].message.content)
就这样。完全一样的代码。我已经熟知的 OpenAI 库。我觉得自己之前为此紧张有点傻了。
如果说 DeepSeek 是一把锐利专注的工具,那 Qwen 就是你家抽屉里那堆 47 件小工具的集合。有些你每周都会用,有些你已经忘了它们的存在,但有它们在那里你很高兴。
阿里巴巴做了 Qwen,他们在模型变体上真的玩得很疯。让我列一下我亲自测试过的:
Qwen3-8B 每百万输出 token 只要 $0.01,这是真的离谱。我用它构建了一个垃圾邮件分类器,运行成本几乎为零。就像,一个月后我去看仪表盘,看到账单显示 $0.00 还以为是出了 bug。
但真正让我印象深刻的是:多模态方面的能力。Qwen3-Omni 模型在单个 API 调用中处理音频、视频和图像。我用它构建了一个小工具,可以转录语音笔记并总结它们,就这样……work 了。在培训班那会儿,这种功能需要拼接三个不同的服务才能实现。
缺点呢?命名规则真的让人困惑。Qwen3、Qwen3.5、Qwen3.6——凌晨两点多的时候我无数次搞混了哪个版本是哪个。有些中档模型的英文表现没有达到 DeepSeek 或顶级西方模型的水平。仍然很优秀,但就是差了那么一点点。
还有,我想提一下:Qwen3.6-35B 每百万输出 token 约 $1,对我来说感觉偏贵了。更小的 Qwen3 模型给你更好的性价比,除非你真的有特定需要那个档次的能力。
以下是我如何使用 Qwen3-32B 处理通用编码任务:
response = client.chat.completions.create(
model="Qwen/Qwen3-32B",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted lists"}]
)
print(response.choices[0].message.content)
注意到 "Qwen/" 前缀了吗?这是 Global API 对不同提供商模型的命名空间方式。一旦你知道了这个模式,在模型之间切换就像改一个字符串一样简单。
好了,实话实说——我在学校里讨厌数学。我勉强熬过了微积分。但 Kimi 的推理能力让我觉得,也许我的高中数学老师只是没有使用对的工具。
Kimi K2.5 模型每百万输出 token 要 $3.00,是我日常使用中最贵的,但天哪,在难题上它真的物有所值。我给它出了一道我真的解不开的逻辑谜题,它一步一步地展示推理过程,直到我理解为止。我以前不知道 AI 能用一种真正让我恍然大悟的方式解释哥德尔不完备定理。
Kimi 定价在每百万 token $3.00 到 $3.50 之间,属于明确的"高端"档次。背后的公司是月之暗面,这是一个比我能给创业公司起的任何名字都酷的名字。
以下是我在测试中注意到的:
在推理基准测试中绝对碾压。如果你需要一个模型去深入思考某件事,这是你的首选。
中文语言表现是顶级的。可能和 GLM 并列第一。
速度是代价。明显比 DeepSeek 或 Qwen 的小模型慢。对于实时聊天,这很关键。
不支持视觉功能,这对多模态工作流来说是个遗憾。
对于我这种培训班风格的项目,我因为价格因素不常选 Kimi。但当我用的时候,是因为任务真的需要那种推理深度。而且每一次,它都没有让人失望。
智谱AI的 GLM 系列实际上是我整个测试旅程中最大的惊喜。我进去时预期它是一个可靠但无聊的选择。出来时完全重新思考了我的整个技术栈。
价格区间很疯狂:每百万输出 token 从 $0.01 到 $1.92。GLM-4-9B 只要 $0.01,和 Qwen3-8B 一起处于那个荒谬便宜梯队。我用它构建了一个 7×24 小时运行的内容审核辅助工具,花了我真金白银的零钱。
他们的旗舰产品 GLM-5 每百万输出 token $1.92,直接和那些价格高得多的西方模型竞争。而且他们的 GLM-4.6V 视觉模型处理了我丢给它的每一个图像相关任务。
以下是我诚实的分析:
真正让我印象深刻的:
中文语言理解是真正的一流水平。如果你在为中国市场构建任何东西,这是你的首选。
通过 GLM-4.6V 的视觉支持很扎实。它正确读出了我上传的一张手绘图表,而 GPT-4o 在那上面费了劲。
上下文窗口达到 128K token,和其他家一样。
API 与 OpenAI 兼容,所以没有迁移的麻烦。
缺点?它没有 DeepSeek 那么快。英文表现虽然不错,但没有达到我对 DeepSeek 的那种高度。
经过所有这些测试,以下是我真实的技术栈:
对于日常编码和内容工作,我默认用 DeepSeek V4 Flash。$0.25/M 的价格对于我得到的东西来说无与伦比。
当我需要视觉或多模态能力时,我用 Qwen。Qwen3-VL 和 Qwen3-Omni 模型覆盖了我基本上所有的使用场景。
对于深度推理任务——数学、逻辑谜题,任何需要模型真正思考的东西——我为 Kimi K2.5 付了溢价。当我真的需要它的时候,每一分钱都值得。
对于中文项目和高容量轻量级任务,GLM 是我的选择。$0.01/M 的 GLM-4-9B 简直好得不像真的。
我学到的一些让我惊讶的事情:
四家提供商都使用 OpenAI 兼容的 API。这意味着它们之间切换只是改一下模型名称字符串。这对于担心供应商锁定的人来说意义重大。
上下文窗口都是 128K。所以这方面没有取舍。
速度差异很大。DeepSeek 快,Kimi 慢。提前规划好。
定价变动频繁。我上面列出的数字在我测试时是准确的,但在承诺之前一定要查看当前定价。
Global API 让这一切成为可能。我不需要在四个不同平台注册、管理四个不同的 API 密钥、处理四个不同的计费系统,我用 global-apis.com/v1 的一个端点就能访问它们全部。如果你是独立开发者或小团队,这是游戏规则的改变者。
六个月前,我以为我已经搞清楚了 AI 格局。我错了,而且我很高兴我错了。
中国 AI 生态系统不只是"便宜的替代品"——它是一个真正的竞争激烈的格局,各模型在不同领域各有所长。DeepSeek 价格优,Qwen 多功能,Kimi 推理强,GLM 中文任务出色。每一个都找到了自己的位置。
如果你是一个想在不牺牲质量的前提下节省成本的开发者,你有必要自己去测试这些。我只是把默认模型换了一下,每月 API 账单就下降了约 70%,之后再没回头看过。