作者停用 OpenAI Plus 订阅 6 个月,对比测试了 DeepSeek、Qwen、Kimi、GLM 四大国产开源模型家族,指出开放权重生态已接近 GPT-4 水平。
半年前,我删掉了自己的 OpenAI 账户。不是出于怨恨——只是受够了为一个封闭花园每个月交税,而开源权重生态已经悄然赶上了。我之前一直在周末对中国的大模型系列做基准测试,结果不断让我感觉每月 $20 的 Plus 订阅就像在一条我已经帮忙修好的高速公路上设了个收费站。
这就是我希望刚开始探索时有人能递给我的一份东西。带有个人偏见。我强烈倾向于开源权重、MIT/Apache-许可的工具链,以及心血来潮时能自托管的任何东西。我也认为厂商锁定是缺陷而非特性。偏见已声明,接下来深入对比 DeepSeek、Qwen、Kimi 和 GLM——通过 Global API 的统一端点测试,因为我拒绝同时管理八个 API 密钥和四个不同的 SDK。
说真的,我从 requests 还没出现的时候就开始写代码了。我见证过每一个"你必须用我们的 SDK 来调用我们的云"的玩法,试图把开发者锁进生态系统中。这和 90 年代数据库厂商的套路如出一辙,也和如今移动平台的套路一样。封闭权重。闭源。处处是围墙花园。
中国实验室打破了这个模板。DeepSeek 发表了他们的研究论文。Qwen 发布了 Apache-2.0 许可的模型,我可以从镜像站直接 wget。这不是营销亮点——而是一种哲学立场。当你的模型权重是公开的,你可以审计它们、微调它们、离线运行它们,最重要的是:你可以离开。试试用封闭厂商这么做。
所以我在找一个单一端点,能让我在不签四份独立企业协议的情况下调用四个模型系列。Global API 原来是最佳选择——一个 OpenAI 兼容的基础 URL,四个模型系列,一份账单。更多细节在最后。
这是我最终为自己的理智构建的对照表。价格为每百万 token(输出),反映的是 2025 年底我通过 Global API 实际支付的价格。
给没耐心的人一句话总结:如果你想要一个模型现在就能统治一切,DeepSeek V4 Flash 是价格性能比之王,每百万输出 $0.25。如果你需要每种模态,Qwen 是你的瑞士军刀。如果你在处理困难的数学或逻辑谜题而且预算就是做生意的成本,K2.5 值得它每百万 $3.00 的价格。如果你要大规模生产中文内容,GLM-5 每百万 $1.92 是真正的业界最佳。
坦白说,DeepSeek 是我带有私人感情的家族。他们是那种几乎以固执的态度无视炒作周期来发布论文和权重的实验室。他们的 V3 架构论文读起来就像是写给任何一个相信效率比参数数量作秀更重要的人的情书。
核心数字——V4 Flash 每百万输出 $0.25——和封闭源码的替代品比起来简直是荒谬的。我用 V4 Flash 在 HumanEval 风格的 prompt 和 MBPP 风格的问题上跑了一周,它在大多数任务上和 GPT-4o 落在同一区间。价格是四十分之一。V4 Flash 在 Global API 端点上也能达到约每秒 60 tokens,使它成为我轮换中最快的模型。
Coder 变体每百万 $0.25 已经成了我重构工作、docstring 生成、以及回答团队里初级工程师"解释这个正则表达式"请求的默认选项。它足够好用,以至于我不再伸手去用闭源代码助手了。
R1 Reasoner 每百万 $2.50 是当我需要链式思维时才调用的模型。它更慢更贵,但对于任何需要思考后再回答的东西,它物有所值。
V4 Flash 没有原生视觉。如果我要看截图,得切换端点。这很烦人但可以理解——DeepSeek 似乎在加倍押注文本/代码质量,而不是追逐"全模态"的营销套路。
在中文任务上,GLM 和 Kimi 在微妙的文化引用和古典措辞上略胜一筹。V4 Flash 在英文上出色;在中文上只是不错。
模型种类也更少。相比 Qwen,你的选择更少——Qwen 这家实验室显然决定从 0.5B 到 400B+ 的每一个可能的参数量级都发一遍。
from openai import OpenAI
client = OpenAI(
api_key="ga_xxxxxxxxxxxx",
base_url="https://global-apis.com/v1"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explain quantum computing in 100 words"}]
)
print(response.choices[0].message.content)
这简直就是我 shell 历史里运行了数百次的代码片段。base_url 切换是和封闭厂商 SDK 之间的唯一区别。
阿里巴巴的 Qwen 团队发布模型的方式就像丰田发布配置级别——总有一款适合你想象的每一个用例。我甚至不觉得这有什么问题。如果你想要一个能在树莓派上跑的模型、一个能处理视频的模型、一个能处理语音的模型、还有一个能做企业级推理的模型,Qwen 有一个 SKU 给你。
价格区间——每百万 $0.01 到 $3.20——是所有家族中最宽的。Qwen3-8B 每百万输出 token 仅需一分钱,这是可能发生的最好的事情。我用它做分类、分流、以及"这封邮件是在生气吗?"检测,在质量差异不重要而成本差异重要的地方。
Qwen3-VL 是我首选的视觉模型。我把截图扔给它,它能以令人汗颜的准确度读出 UI mockup。Qwen3-Omni 接收音频输入、图像输入和视频输入——我还没发现它拒绝的模态。
阿里巴巴的支持意味着可用性故事是无聊的那种好。基础设施是企业级的,三个月里我可能只遇到过两次宕机。
命名规则是对可读性的犯罪。是 Qwen3 还是 Qwen3.5 还是 Qwen3.6?是 32B 还是 30B?VL 变体在 Omni 变体之前还是之后?我是一个生活在终端里的开发者,但我还是不得不用 Notion 建了个页面来记住我想要的是哪个。
在纯英文质量上,V4 Flash 在我的测试中仍然胜过 Qwen3-32B。差距不大,但在创意写作上明显能感觉到。
而 Qwen3.6-35B 每百万 $1.00(在原始对照表里被认为是价格偏高的异类)真的是个难卖的选择,因为 GLM-5 每百万 $1.92 给你的是一个明显更大的模型。
response = client.chat.completions.create(
model="Qwen/Qwen3-32B",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted lists"}]
)
注意 Global API 上 Qwen 命名空间用的是 Qwen/ 前缀。知道之后就不是什么大事了。但第一次我花了十五分钟才搞明白。
Moonshot 的 Kimi 是我感情最复杂的模型系列。在纯基准测试上——那些衡量逐步逻辑、多跳推理、数学问题解决能力的测试——K2.5 是我测试过的最好的中国模型。在成本上,它是所有系列中最贵的。
如果你扔给它竞赛编程问题、多步数学题,或者"带我理解为什么这个证明成立"的任务,K2.5 会比其他所有对比中的模型思考得更好。我看过它解决我需要思考三十分钟的问题,只用了一分钟的推理时间。这是我自 GPT-4 首次发布以来找到的最接近"这感觉像魔法"的时刻。
在中文细微差别上,K2.5 确实出色——它有一种我无法从其他三个系列得到的文学质感。
没有预算友好的选项。想要 Kimi,就得付 Kimi 的价格。每百万最低 $3.00。对于大容量流水线,这是不可接受的。我只在任务真正需要它时才把流量路由过去。
速度是四个中最慢的。我还没测量过具体数字,但主观体验上明显慢于其他三个。如果你做的是需要快速反馈的原型工作,这会影响你的流程。
K2.5 有原生视觉,这是它相对于 DeepSeek V4 Flash 的一个优势。如果你需要同时处理文本和图像,不需要切换端点。
GLM 是我测试中最容易被低估的系列。智谱 AI 显然在中文 NLP 任务上投入了大量工作,而成果在中文语言任务上确实可见。
GLM-5 每百万 $1.92 是中文内容生产的价格性能比冠军。如果你做的是中文博客、文档、技术文章,而且对成本敏感,GLM-5 提供了最佳平衡。它在中文细微差别上比 V4 Flash 更好,在价格上比 Kimi 更友好。
对于英文任务,它的表现还不错,但不够突出。如果你主要处理英文内容,V4 Flash 或 Qwen3-32B 可能仍然是更好的选择。
模型命名同样令人困惑。GLM-4、GLM-4V、GLM-5、GLM-5-Plus——搞清楚哪个是哪个本身就是一项技能。
我应该多说说为什么选择 Global API。不是广告——他们也没付我钱——而是这似乎是这篇评测里应该交代的背景。
我有四个模型系列要测。我不想签四份合同、设四个计费账户、管理四个 API 密钥。Global API 提供了单一的 OpenAI 兼容端点,可以访问所有四个系列,一份账单,一个集成点。
价格和直接用各家官方 API 相比有竞争力,有时甚至更便宜——尤其是对于用量不固定的情况。它消除了管理多个密钥的心理负担。
缺点:额外的跳点意味着潜在的延迟增加。我在大多数情况下没有注意到显著的差异,但你的里程可能有所不同。
如果你在中国有业务或基础设施,直接用各家官方 API 可能更合理。对于我的用例——在国际环境中测试中国模型——Global API 是最简单的集成点。
日常使用、经济实惠:DeepSeek V4 Flash,每百万 $0.25。这是我的默认选择。速度快、质量好、价格低到荒谬。
多模态需求:Qwen 系列。从树莓派到企业推理,SKU 覆盖每一种用例。命名糟糕,但覆盖面无可挑剔。
高质量中文内容:GLM-5,每百万 $1.92。在中文语言任务上性价比最佳。中文原生内容生产的不二之选。
复杂推理与数学:Kimi K2.5,每百万 $3.00。质量最好,价格也最高。只有在你真的需要它的能力时才选它。
开源权重生态系统已经走了很远。六个月前,我觉得每月付 $20 给封闭厂商还算合理。现在看着 DeepSeek V4 Flash 每百万 $025 的价格,感觉就像我之前在付溢价税。
中国实验室不只是在追赶——他们在某些领域已经领先。DeepSeek 的效率研究。Qwen 的全模态覆盖。Kimi 的推理能力。GLM 的中文语言优化。每个系列都有自己的重点和优势。
如果你还在每月给封闭厂商交"会员税",值得重新评估一下你在为什么付钱。
我不再交了。