前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9309
  • AI 建站最佳实践:分阶段评审而非一次性生成
  • DeepSeek V4 Pro GA 评测:推理 token 减少 18-62%,JSON 提取终于可靠
  • tracelint:用静态分析检测 Agent 工具调用失败
  • Agent安全第三轴:身份与授权之外的工具安全
  • crewai-go v0.4.0:Go语言多Agent编排框架量产就绪
  • PromptShrink:生产级Prompt压缩工具,省60%Token
  • 多模型 Node.js 路由架构深度对比
  • AI 编程 Agent 正在走出 IDE
  • GPT-5.6 Sol API 价格下调 50%
  • AI 编程的边界:代码能跑≠系统可维护
  • 以色列疑似利用虚假智库诱导AI聊天机器人
  • GitHub Actions绿色不等于发布成功
  • AI 修复工具引入漏洞,另一 AI 自主发现并利用
  • Snowflake CLI 与 OpenHands 高危漏洞预警
  • Claude 新增生产语音 Agent 管理和删除功能
  • AI;DR:程序员视角审视AI阅读工具的局限
  • 同集群利用率提升33点:调换任务顺序就够了
  • AI Agent应锁定工具契约而非仅工具名
  • Vercel发布Agent Plugins 1.0:AI Agent互操作标准成型
  • robots.txt 对 AI 爬虫的屏蔽效果:你可能误读了 RFC 9309
  • 15 款 AI API 真实延迟横评:150 次测试揭示实际响应速度
  • 给 AI Agent 加记忆模块避免重复踩坑
  • 五个程序员必知的Prompt管理工具
  • 5 款值得关注的 Prompt 管理工具评测
  • 我把AI API费用削减了95%的真实经验
  • 我的 AI API 账单如何降低了 95%(质量不降)
  • 免费模型端点上线 CI 前必做的 5 项检查
  • MiniMax 开源音乐生成模型:一次生成 5 分钟完整歌曲
  • 用哈希链审计免费 LLM 模型输出:防止响应篡改
  • Tracewood:将 AI 编码 Agent 遥测数据变为 3D 森林可视化
  • 私有知识库 Node.js 应用的多模型路由计费设计
  • NVIDIA 30B MoE 模型登陆 SageMaker:Agent 任务吞吐量提升 4 倍
  • xAI + Cursor 联合推出 Grokbot:云端操控电脑的 AI Agent 体验评测
  • 2025 本地优先 AI Agent 实战总结:ScreenPipe、Headroom 与隐私代价
  • AI Agent 上线前必须回答的权限设计问题
  • 2026年AI模型延迟实测:TTFT与吞吐量全排行
  • Circle推出AI Agent应用商店:机器间支付发现成为竞争壁垒
  • 从零构建 Agentic AI 系统:混合 RAG、GraphRAG、12 工具与 K8s 部署
  • AI Agent 监控的实战教训:空输出比报错更难发现
  • TokenCap 2.1:AI 编码助手的上下文压缩与 Debt Ledger
  • Qwen3.8-27B 基准测试逼近 DeepSeek V4 与 GPT-5.6 Luna Max
  • AI Agent 测试范式转变:从验证代码到评估行为
  • LLM 路由指南:按任务选对模型
  • 2026年AI Agent实战指南:选型核心维度与架构对比
  • 付费沙箱中 AI Agent 的隐性计费陷阱
  • 免费模型端点 ≠ 免费服务器:四层对比选型框架
  • Amodei反驳开源AI:开放权重并非万能解
  • Replit 引入黑盒渗透测试强化 AI 应用安全
  • 生产级 LLM 记忆系统实战设计
  • 本地 LLM 每 Token 成本估算指南
  • 实测10款编程LLM生产级负载表现
  • 已加载 51 / 9309
8.0
热点
AI SCORE
编程提效2026-08-18 03:25

15 款 AI API 真实延迟横评:150 次测试揭示实际响应速度

dev.to · AI#AI API#性能评测#延迟
Editor brief · 编辑速览

作者实测 15 个模型的 150 次速度测试,发现多数营销数据与真实体验差距显著,并提供了按延迟选型的具体数据参考。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我为什么差点因为延迟放弃上一个项目

坦白说,我做这件事的动机不是学术性的。几个月前我在做一个客服聊天机器人,快速响应和慢吞吞的回复之间的差别,直接决定了用户是完成对话还是直接离开页面。当你在盯着一个旋转的光标时,两秒钟漫长得像两个世纪。

这段经历让我开始思考:现在有几十种 LLM 可用,当速度是约束条件时,我到底应该选哪个?每个人都在谈质量基准线,但第二个维度的故事——用户实际感知的延迟——却很少有人关注。所以我决定自己生成数据,并在这里分享出来,省得你再重复一遍。

先说我是怎么做的。

测试环境:枯燥但诚实

在展示结果之前,让我精确地告诉你我测试了什么、怎么测的。我希望这个测试可以复现,所以保持简单。

我选的 prompt 是"用 200 词解释递归",因为它迫使模型做真实的工作——解释、结构、一点教学技巧——但又不会重到触发所有思维链模式。这对标的是生产环境中经常出现的"中等难度"任务。

每个响应我都用流式传输。输出 token 我设定在 150 个左右。每个测试跑 10 次取平均值。测试从两个区域发起:美国东部(俄亥俄)和亚洲(新加坡)。所有调用都通过 Global API 的统一端点 https://global-apis.com/v1,这是我找到的避免为每个提供商单独管理 API key 的最干净方式。

哦,还有一点:这是我在 2026 年 5 月 20 日做的。这个领域的数字变化很快,记住这个日期。

速度排行(我的王座厅版本)

好,让我展示重头戏。我按每秒 token 数对所有模型排序,因为当用户在观看流式响应时,这是我最关心的指标。以下是从最快到最慢的完整表格:

有几点我想特别说明:

首先,TTFT(Time to First Token,首 token 到达时间)和 tokens/sec 衡量的是不同东西。TTFT 是看到任何内容之前的等待时间。Tokens/sec 是后续内容的流速。两者都重要,但在不同产品中重要性不同。

其次,列表中最慢的模型——DeepSeek-R1 和 Kimi K2.5——它们慢不是因为差。它们慢是因为它们是推理模型,在发出第一个可见 token 之前要花真实时间"思考"。这是你为更高质量输出所做的权衡。我后面会回来谈这个。

低价区间很疯狂

让我展示当我按价格切片数据时会发生什么,因为这里才是真正有趣的地方。

在超低价档位(每百万输出 token 低于 0.15 美元),我有两个候选:Qwen3-8B 价格 0.01 美元/M,Step-3.5-Flash 价格 0.15 美元/M。Qwen3-8B 的性价比简直离谱。每秒 70 token、几乎免费的价格,这个数字会让你忍不住反复确认自己的键盘输入有没有错。Step-3.5-Flash 是速度冠军,每秒 80 token,而且依然足够便宜,不用担心成本。

现在,"便宜"不一定意味着"快"——我得说清楚。对于那些只需要快速翻译、快速重构、快速分类的任务,超低价档位是无敌的。别在能用 0.01 美元模型完成的事情上浪费一个 3 美元的模型。

在低价档位(0.15–0.30 美元/M),我得到了三个真正的选项:DeepSeek V4 Flash 每秒 60 token、价格 0.25 美元/M,Hunyuan-TurboS 每秒 55 token、价格 0.28 美元/M,Qwen3-32B 每秒 45 token、价格 0.28 美元/M。这是我认为的甜点档位。DeepSeek V4 Flash 速度排在中间,但质量更接近 GPT-4o 级别。如果让我为一个新项目选默认项,我会选这个。

中档(0.30–0.80 美元/M)我看到速度开始下降。Doubao-Seed-Lite 每秒 50 token、价格 0.40 美元/M 是这里最快的,而 DeepSeek V4 Pro 每秒 30 token、价格 0.78 美元/M 是最慢的。总的来说,这个档位的模型更大,所以每个 token 耗时更久。你在买质量,速度是代价。

然后是高端档位(0.80 美元以上/M)。MiniMax M2.5 每秒 28 token、价格 1.15 美元/M,GLM-5 每秒 25 token、价格 1.92 美元/M,Kimi K2.5 每秒 20 token、价格 3.00 美元/M。这些是"我需要答案必须正确"的模型。当每个回答比等待更重要时,用它们。

只按速度选:不同的排序

如果只按速度排序,不考虑质量,我个人的前三名是:

每秒 80 token、TTFT 120ms 的 Step-3.5-Flash

每秒 70 token、TTFT 150ms 的 Qwen3-8B

每秒 60 token、TTFT 180ms 的 DeepSeek V4 Flash

如果你的产品是实时的——自动补全、语音助手、在线聊天——这些是首先要考虑的。前两个是绝对的速度怪兽,但它们是小型模型。DeepSeek V4 Flash 是我心中速度/质量的"金发姑娘"选择。

你从哪里运行很重要

有些事我是直到从两个区域测试之后才完全理解的。网络延迟是真实存在的,而且它不是对称的。

规律很清楚:亚洲模型(Qwen、GLM、Kimi)从我从新加坡测试时延迟低 16–20%。这很合理——它们的服务器在那边。DeepSeek 感觉是全球分布的,区域间只有 30ms 的差异。

结论是:如果你的用户在亚洲,而你从美国数据中心为他们服务,你白白在桌上留了 80–120ms。选择一个区域感知的端点。Global API 实际上帮你跨区域处理了这个问题,这也是我选择他们的原因之一。

这些数字对用户实际上意味着什么

原始的毫秒数有点抽象。让我把它们落地到用户实际感受到的东西,因为我认为这是整个测试最有用的部分。

对于交互式聊天,我个人会把 TTFT 目标定在 400ms 以下。这样 DeepSeek V4 Flash(180ms)、Qwen3-8B(150ms)、Step-3.5-Flash(120ms)、Doubao-Seed-Lite(220ms)、Hunyuan-TurboS(200ms)、Qwen3-32B(250ms)都在可选范围内。任何比这更慢的,就是在要求用户耐心,而用户最不擅长的就是耐心。

对于批量处理、文档生成、异步工作流,延迟没那么重要。Qwen3.5-397B 的 1200ms TTFT 在你通宵处理一千份文档时是完全可接受的。不同问题,不同工具。

让我给你看代码

这是我用来做这些基准测试的实际 Python 片段。它非常简单——只是一个兼容 OpenAI 的客户端指向 Global API 的端点:

python
import time
import httpx
from statistics import mean

API_URL = "https://global-apis.com/v1"
API_KEY = "your-global-api-key"

def benchmark_model(model_name, runs=10):
    ttft_list = []
    tps_list = []

    for _ in range(runs):
        start = time.perf_counter()
        first_token_time = None
        token_count = 0

        with httpx.stream(
            "POST",
            f"{API_URL}/chat/completions",
            headers={"Authorization": f"Bearer {
Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
robots.txt 对 AI 爬虫的屏蔽效果:你可能误读了 RFC 9309
下一篇
给 AI Agent 加记忆模块避免重复踩坑