作者实测 15 个模型的 150 次速度测试,发现多数营销数据与真实体验差距显著,并提供了按延迟选型的具体数据参考。
坦白说,我做这件事的动机不是学术性的。几个月前我在做一个客服聊天机器人,快速响应和慢吞吞的回复之间的差别,直接决定了用户是完成对话还是直接离开页面。当你在盯着一个旋转的光标时,两秒钟漫长得像两个世纪。
这段经历让我开始思考:现在有几十种 LLM 可用,当速度是约束条件时,我到底应该选哪个?每个人都在谈质量基准线,但第二个维度的故事——用户实际感知的延迟——却很少有人关注。所以我决定自己生成数据,并在这里分享出来,省得你再重复一遍。
先说我是怎么做的。
在展示结果之前,让我精确地告诉你我测试了什么、怎么测的。我希望这个测试可以复现,所以保持简单。
我选的 prompt 是"用 200 词解释递归",因为它迫使模型做真实的工作——解释、结构、一点教学技巧——但又不会重到触发所有思维链模式。这对标的是生产环境中经常出现的"中等难度"任务。
每个响应我都用流式传输。输出 token 我设定在 150 个左右。每个测试跑 10 次取平均值。测试从两个区域发起:美国东部(俄亥俄)和亚洲(新加坡)。所有调用都通过 Global API 的统一端点 https://global-apis.com/v1,这是我找到的避免为每个提供商单独管理 API key 的最干净方式。
哦,还有一点:这是我在 2026 年 5 月 20 日做的。这个领域的数字变化很快,记住这个日期。
好,让我展示重头戏。我按每秒 token 数对所有模型排序,因为当用户在观看流式响应时,这是我最关心的指标。以下是从最快到最慢的完整表格:
有几点我想特别说明:
首先,TTFT(Time to First Token,首 token 到达时间)和 tokens/sec 衡量的是不同东西。TTFT 是看到任何内容之前的等待时间。Tokens/sec 是后续内容的流速。两者都重要,但在不同产品中重要性不同。
其次,列表中最慢的模型——DeepSeek-R1 和 Kimi K2.5——它们慢不是因为差。它们慢是因为它们是推理模型,在发出第一个可见 token 之前要花真实时间"思考"。这是你为更高质量输出所做的权衡。我后面会回来谈这个。
让我展示当我按价格切片数据时会发生什么,因为这里才是真正有趣的地方。
在超低价档位(每百万输出 token 低于 0.15 美元),我有两个候选:Qwen3-8B 价格 0.01 美元/M,Step-3.5-Flash 价格 0.15 美元/M。Qwen3-8B 的性价比简直离谱。每秒 70 token、几乎免费的价格,这个数字会让你忍不住反复确认自己的键盘输入有没有错。Step-3.5-Flash 是速度冠军,每秒 80 token,而且依然足够便宜,不用担心成本。
现在,"便宜"不一定意味着"快"——我得说清楚。对于那些只需要快速翻译、快速重构、快速分类的任务,超低价档位是无敌的。别在能用 0.01 美元模型完成的事情上浪费一个 3 美元的模型。
在低价档位(0.15–0.30 美元/M),我得到了三个真正的选项:DeepSeek V4 Flash 每秒 60 token、价格 0.25 美元/M,Hunyuan-TurboS 每秒 55 token、价格 0.28 美元/M,Qwen3-32B 每秒 45 token、价格 0.28 美元/M。这是我认为的甜点档位。DeepSeek V4 Flash 速度排在中间,但质量更接近 GPT-4o 级别。如果让我为一个新项目选默认项,我会选这个。
中档(0.30–0.80 美元/M)我看到速度开始下降。Doubao-Seed-Lite 每秒 50 token、价格 0.40 美元/M 是这里最快的,而 DeepSeek V4 Pro 每秒 30 token、价格 0.78 美元/M 是最慢的。总的来说,这个档位的模型更大,所以每个 token 耗时更久。你在买质量,速度是代价。
然后是高端档位(0.80 美元以上/M)。MiniMax M2.5 每秒 28 token、价格 1.15 美元/M,GLM-5 每秒 25 token、价格 1.92 美元/M,Kimi K2.5 每秒 20 token、价格 3.00 美元/M。这些是"我需要答案必须正确"的模型。当每个回答比等待更重要时,用它们。
如果只按速度排序,不考虑质量,我个人的前三名是:
每秒 80 token、TTFT 120ms 的 Step-3.5-Flash
每秒 70 token、TTFT 150ms 的 Qwen3-8B
每秒 60 token、TTFT 180ms 的 DeepSeek V4 Flash
如果你的产品是实时的——自动补全、语音助手、在线聊天——这些是首先要考虑的。前两个是绝对的速度怪兽,但它们是小型模型。DeepSeek V4 Flash 是我心中速度/质量的"金发姑娘"选择。
有些事我是直到从两个区域测试之后才完全理解的。网络延迟是真实存在的,而且它不是对称的。
规律很清楚:亚洲模型(Qwen、GLM、Kimi)从我从新加坡测试时延迟低 16–20%。这很合理——它们的服务器在那边。DeepSeek 感觉是全球分布的,区域间只有 30ms 的差异。
结论是:如果你的用户在亚洲,而你从美国数据中心为他们服务,你白白在桌上留了 80–120ms。选择一个区域感知的端点。Global API 实际上帮你跨区域处理了这个问题,这也是我选择他们的原因之一。
原始的毫秒数有点抽象。让我把它们落地到用户实际感受到的东西,因为我认为这是整个测试最有用的部分。
对于交互式聊天,我个人会把 TTFT 目标定在 400ms 以下。这样 DeepSeek V4 Flash(180ms)、Qwen3-8B(150ms)、Step-3.5-Flash(120ms)、Doubao-Seed-Lite(220ms)、Hunyuan-TurboS(200ms)、Qwen3-32B(250ms)都在可选范围内。任何比这更慢的,就是在要求用户耐心,而用户最不擅长的就是耐心。
对于批量处理、文档生成、异步工作流,延迟没那么重要。Qwen3.5-397B 的 1200ms TTFT 在你通宵处理一千份文档时是完全可接受的。不同问题,不同工具。
这是我用来做这些基准测试的实际 Python 片段。它非常简单——只是一个兼容 OpenAI 的客户端指向 Global API 的端点:
python
import time
import httpx
from statistics import mean
API_URL = "https://global-apis.com/v1"
API_KEY = "your-global-api-key"
def benchmark_model(model_name, runs=10):
ttft_list = []
tps_list = []
for _ in range(runs):
start = time.perf_counter()
first_token_time = None
token_count = 0
with httpx.stream(
"POST",
f"{API_URL}/chat/completions",
headers={"Authorization": f"Bearer {