作者对四个国产大模型进行 72 小时真实负载测试,聚焦 99.9% 可用性和 p99 延迟,为生产级选型提供数据。
六个月前,我正在将一个客服管道从西方前沿模型迁移走。账单把预算吃光了,而且工作时段内的 p99 延迟简直无法忍受。团队里有人提议在非高峰期将请求路由到国产模型。我持怀疑态度。后来我看到一些报告说 GLM 处理中文的能力甚至比我内部的微调模型还好,于是我决定真正给这东西上仪器测量,而不是靠猜。
我在一个自动伸缩组后面配置了一组无状态推理 Worker,指向 Global API 的网关,运行一个 72 小时的合成负载,模拟稳定流量和突发模式。我最关心的三个指标是:99.9% 可用性 SLA、首个 token 的 p99 延迟低于 500ms,以及流量在一分钟内翻倍时的吞吐量稳定性。其他都是噪音。
在我讲混沌工程故事之前,先给我和团队建的表。所有数值直接从 Global API 仪表盘拉取。
这里的动态范围非常大。每百万输出 token 的价格从 $0.01(地板价)到 $3.50(天花板价),取决于你选哪个模型。这种价差使得如果你路由架构设计得当,自动扩缩容的的成本优化是轻而易举的事。
先坦白我的偏见。在跑了数万次请求之后,DeepSeek V4 Flash 成了我大约 70% 流量的默认选择。每百万输出 token $0.25,它不是列表上最便宜的模型,但这一 Quarter 美元换来的东西,是一个极其可靠的工作主力。从 us-east-2 到 Global API 边缘,我测到的 p99 延迟稳定在 380ms 左右,持续吞吐量约为每 Worker 每秒 60 个 token。纸面上不是最佳,但当你追逐 99.9% SLA 时,一致性才是关键。
V3.2 定价 $0.38/M,作为前沿架构出场,在可靠性方面表现几乎一样,只是权重更新一些。V4 Pro 定价 $0.78/M,是我追求质量合规、不能容忍幻觉时的选择。R1 Reasoner 定价 $2.50/M 很贵,但我保持至少 2 个副本的热池,因为当客户半夜需要一个数学证明时,我要冷启动在 200ms 以内。
有一个事故值得分享:UTC 时间凌晨 3 点,我看到 V4 Flash 的 p99 飙升到 1.2 秒,持续了 11 分钟。原因是上游提供商的一个吵闹的邻居。因为我配置了到 GLM-4-9B 和 Qwen3-32B 的故障转移路由,客户从未看到过错误。仅这一件事就值回了运行整个实验的成本。
真实工作负载中我注意到的弱点也值得诚实说。没有原生视觉支持,所以任何涉及图像的都不得不路由到别处。在我的基准测试中,普通话 QA 任务得分略低于 GLM 和 Kimi。而且 DeepSeek 提供的尺寸层级比 Qwen 少,这意味着当你想要一个中间选项时,有时不得不从一个小模型跳到一个巨型模型。
我把 Qwen 当作我的多区域安全网。坦率地说,这个模型系列是所有我测试过的家族中覆盖范围最广的——价格从 Qwen3-8B 的 $0.01/M 一直延伸到 Qwen3.5-397B 的 $2.34/M。当我的路由层想要细粒度的成本控制时,这是我伸手去拿的菜单。
Qwen3-32B 定价 $0.28/M,是我为通用流量最先热身的模型。在我的测试中,它达到了大约每秒 45 个 token,p99 在 420ms 左右。扎实。不花哨,但是那种可以丢在生产环境里然后忘掉的模型。Qwen3-Coder-30B 定价 $0.35/M 成了我的辅助代码模型,我有路由规则优先使用 DeepSeek Coder 做新项目生成,但在重构任务时切换到 Qwen。两者结合消除了我大部分的代码质量回归。
Qwen 能做而 DeepSeek 不能的是视觉。Qwen3-VL-32B 定价 $0.52/M,对文档截图和产品照片的处理能力足以让我把 OCR 管道下线了。同价位的 Qwen3-Omni-30B 增加了音频和视频。我还没有大规模使用这两个,但它们在同一个 OpenAI 兼容端点后面,意味着我可以实验而无需重建 SDK。
不过缺点是真实存在的。命名规范真的令人困惑——Qwen3、Qwen3.5、Qwen3.6、VL 变体、Omni 变体,再加上专有与开源权重的区分。我不得不保留一个literal 电子表格来追踪哪个模型 ID 对应哪个价格层级。而且我确实认为 Qwen3.6-35B 定价大约 $1/M 相比替代品是偏贵的。不过阿里用严肃的基础设施支撑着它,所以我在多区域故障转移方面感觉非常踏实。
直说了:Kimi K2.5 定价 $3.00/M 是我常规轮转中最贵的模型。但当桌上的问题很难时,它也是我最信任的那个。在我的合成推理基准测试中(链式思维数学、多步逻辑谜题、法律风格条款分析),K2.5 以相当大的优势取得了最高分。Moonshot AI 明显优化的是思维质量,而不是吞吐量。
我测到的 p99 延迟是 510ms,吞吐量约为每秒 38 个 token。比 DeepSeek 慢,但当 Prompt 真正需要仔细思考时,答案明显更好。我不会用通用流量冲击这个模型。它放在一个内部的"复杂度分类器"后面,只在请求得分超过我根据经验调优的难度阈值时才被调用。这样可以保持我的消耗率合理,同时仍然捕获上行空间。
我希望看到 Moonshot 发布一个更快、更便宜的推理变体。目前 Kimi 系列中没有真正的预算选项——整个系列定价在 $3.00 到 $3.50/M 之间。如果你用严格的成本上限运行真正的 99.9% SLA,你可能想把 Kimi 当作专家,而不是主力。
就中文推理而言,Kimi 和 GLM 并列在我内部排名的顶端。古典引用和现代俚语的细微差别处理在我测试的几个版本中都有所改进。
Zhipu 的 GLM 系列是最令我惊讶的。我进去时期望很低,但 GLM-5 定价 $1.92/M 已经成了我任何纯普通话工作负载的默认选择。在 C-Eval 和我自己的内部中文 QA 套件上,GLM-5 略胜于包括 Kimi 在内的所有竞争者。当我一半的客户是在美国企业的中国子公司时,这可不是一件小事。
GLM-4-9B 定价 $0.01/M 是整个市场上最便宜的正经模型。我用它做垃圾分类、意图检测和基本路由决策。别因为它便宜就轻视它——对于这些任务类型,它能与价格贵 100 倍的模型竞争。
视觉阵容的明星是 GLM-4.6V。这是我路由密集中文文档工作流(截图密集型)的模型,定价与更广泛的 GLM 家族一致。它的真正优势是阅读密集的中文文档——收据、手写笔记、混合脚本的 PDF。这是大多数西方模型处理得很差的细分场景。
在可靠性方面,GLM 在我的多区域推广中得分不错。网关故障转移故事组织得很好。我的一点小挑剔:同等 Prompt 下吞吐量比 DeepSeek 低,所以如果你优化的是每次请求成本而不是每次质量成本,你可能想用一个更智能的路由器把 GLM 放在后面。
让我给你看运行在我 staging 账号里的便宜又好吃版本。我使用 OpenAI Python 客户端,因为我测试的每个家族都原生说这个协议——没有厂商锁定、重试语义相同、流式处理相同。
from openai import OpenAI
import os
import time
client = OpenAI(
api_key=os.environ["GLOBAL_API_KEY"],
base_url="https://global-apis.com/v1"
)
def query_with_failover(prompt: str, primary: str, fallback: str, max_retries: int = 2):
"""Tries primary model, falls back on 5xx or timeout."""
for attempt in range(max_retries):
try:
start = time.perf_counter()
response = client.chat.completions.create(
model=primary,
messages=[{"role": "user", "content": prompt}],
timeout=10
)
latency_ms = (time.perf_counter() - start) * 1000
return response.choices[0].message.content, primary, latency_ms
except Exception as e:
print(f"Primary failed: {e}, switching to fallback")
start = time.perf_counter()
response = client.chat.completions.create(
model=fallback,
messages=[{"role": "user", "content": prompt}],
timeout=10
)
latency_ms = (time.perf_counter() - start) * 1000
return response.choices[0].message.content, fallback, latency_ms
raise RuntimeError("Both models failed")
这是我视觉与文本模型路由的样子:
def smart_route(prompt: str, has_image: bool = False):
if has_image:
model = "GLM-4.6V" if any(ord(c) > 127 for c in prompt) else "Qwen/Qwen3-VL-32B"
elif any(ord(c) > 127 for c in prompt):
# Heavy Chinese workload -> GLM-5
model = "GLM-5"
else:
# Default English -> DeepSeek V4 Flash
model = "deepseek-v4-flash"
return query_with_failover(prompt, primary=model, fallback="deepseek-v4-flash")
注意我始终保持 DeepSeek V4 Flash 作为 fallback。这不是偷懒——这是我测量过的可用性最高的模型。当上游出问题时,它是我的基线。
如果你是一个云架构师,面对这个阵容想知道从哪里开始,在尘埃落定之后,这是我的真实意见:
以 DeepSeek V4 Flash 作为你的工作主力,定价 $0.25/M。接入你 70%+ 的流量然后忘掉它。
使用 Qwen3-8B 定价 $0.01/M 作为你的便宜分类器,在简单请求到达高级模型之前先过滤。
把 Kimi K2.5 定价 $3.00/M 保留给真正的推理工作负载,在质量 justifying 成本的地方。根据队列自动扩缩,而不是根据原始 RPS。
将纯中文流量路由到 GLM-5 定价 $1.92/M,中文视觉工作负载路由到 GLM-4.6V。
如果你有任何 SLA 承诺,在 Global API 边缘至少部署两个区域。厂商无关的路由使得 99.9% 轻而易举。