2026年三大家国产旗舰LLM横评,Kimi K3能力最强(57分)、DeepSeek V4 Flash性价比最高(50分费用仅为K3的1/34)、Qwen 3.7 Max延迟最低(206 tok/s),成本差距达34倍。
三个中国旗舰系列,同一套评测标准,成本差异高达 34 倍。最强与最弱之间的能力差距为 13 个索引点。费用差距为 2365 美元。
最强能力:Kimi K3(max 版),Artificial Analysis Intelligence Index v4.1 上得分 57
最佳性价比遥遥领先:DeepSeek V4 Flash 0731,得分 50,每次索引运行费用 72.02 美元
最快输出:Qwen 3.7 Max,206.4 output tokens/秒
意外发现:组内最便宜的模型击败了两个价格更高的旗舰
四款模型目前均在 ofox 上架,切换只需改一下 model ID
TL;DR:该选哪一款?
有两种方式可以在这里停止阅读。如果你的月 Token 消耗在 200 美元以下,直接选 DeepSeek V4 Flash 即可,因为下面所有的优化都不值得你花一个下午去研究。如果你每月生产级 AI 智能体循环的支出超过 2000 美元,直接跳到 eval-cost 那一节,因为那里藏着 34 倍的差距。
快速规格对比
下表所有数据均来自 ofox 模型目录,采集时间为 2026-08-03。
表中三件事值得停下来注意。
缓存读取列不是四舍五入的差异。DeepSeek 每 100 万缓存输入 Token 收费 0.0028 美元。Qwen 3.7 Max 同样服务收费 0.50 美元,是前者的 179 倍;K3 收费 0.30 美元,是前者的 107 倍。对于一个系统提示词很大且会被多次读取的工作负载,缓存读取费率才是决定账单的数字,而不是标题栏的输入费率。
Qwen 3.7 Max 的 64K 输出上限是四款中最紧的,比 DeepSeek 紧 6 倍,比 K3 紧 16 倍。如果你的任务是"读取一个大仓库并输出一个大产物",这个上限会在其他任何因素之前先卡住你。Qwen 3.8 Max 将其提升到 131K,见 Qwen 3.8 Max 发布详解。
只有 K3 具备开源权重和前沿得分。DeepSeek 的权重采用 MIT 许可证且可下载,但其在这里得分最高的其实是廉价型号而非旗舰。Qwen 3.7 Max 完全没有开源权重,不过阿里巴巴已宣布在 2026-08-10 当周发布 Max 级开源权重版本。
同一基准下得分如何?
Artificial Analysis Intelligence Index v4.1,快照日期 2026-08-03。这是本文中唯一以相同方式测量全部四款模型的来源,这也是整个比较以其为锚点的原因。
该索引是九项评测的复合分数:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR。
看排名顺序,不要看绝对数字。这是一个滚动榜单,会随索引版本和模型版本的变化而重新评分,所以"K3 第一、Flash 第二"会比"57 分和 50 分"保存得更久。Flash 与 Qwen 3.7 Max 之间的四分差距在重新运行一次的范围之内。
不会改变的是这个惊喜的方向:组内最便宜的模型排在两个旗舰之上,其中一个还是同一家厂商的。
有三个因素会改变这个排名,且都在一个季度内合理发生:
Qwen 3.8 Max 被评分。它比 3.7 Max 更便宜,而且阿里巴巴自己的表显示它远超前代。如果它以 2.00 美元 / 6.00 美元的价格落在 K3 附近,性价比一栏就会发生变化。
DeepSeek 新版本发布。0731 重新训练在不改变架构的情况下将 Flash 提升了 10 分。没有人能说这不是最后一次。
索引版本变化。v4.1 新增并重新加权了评测;v4.2 可以在没有任何模型改变的情况下重新排列相差四分的模型顺序。
这就是为什么应该每季度运行自己的评测而不是继承一篇文章的排名,包括本文。
各家厂商也各自发布了评测表,但这些表之间不可比较。Qwen 的 3.8 Max 发布表用自己选择的测试环境对比了 Claude 和 GPT。Moonshot 的 K3 发布表报告 Terminal-Bench 2.1 为 88.3,而领先者为 88.8,这是第二名而非第一名。DeepSeek 自己报告的 V4 Flash Terminal-Bench 数字高于 Artificial Analysis 对同一模型测量的数字。那是不同的测量设置,把它们混在一张表里只会让比较变得毫无意义。
一次 Eval 运行实际成本是多少?
这是重新定义整个比较的数字。Artificial Analysis 公布了在其索引上运行每个模型的总成本,因此这是一份相同工作负载的真实账单,而不是用挂牌价格相乘。
由这四行数据推导:
K3 的成本是 V4 Flash 的 33.8 倍,得分高 7 分。
Qwen 3.7 Max 的成本是 V4 Flash 的 22.3 倍,得分低 4 分。
V4 Pro 的成本是 V4 Flash 的 2.4 倍,得分低 6 分。
K3 的成本是 Qwen 3.7 Max 的 1.5 倍,得分高 11 分。
关于价格列的一条说明:Artificial Analysis 列出的 DeepSeek V4 Pro 为 0.435 美元 / 0.87 美元,而 ofox 目录将其四舍五入为 0.45 美元 / 0.88 美元。eval-cost 数字来自 Artificial Analysis 并使用其自己的数字;上面的规格表使用的是目录的数字。
这四个比较中只有一个描述的是一笔交易。另外三个描述的是一个同时更差且更贵的模型。
K3 的溢价至少是合理的:你为比 Qwen 3.7 Max 多付 1.5 倍的钱换来了真正的 11 分提升,如果你的工作在最困难推理上遇到瓶颈,这是一个理性的购买。为比 V4 Flash 多付 22 倍的钱却得到低 4 分,这不是一笔交易,这是 2026-07-31 之后没有人重新计算的结果。
为什么最便宜的模型能击败两个旗舰?
因为 0731 版本是一次重新训练,而不是一个新模型,它移动了 10 分。DeepSeek V4 Flash 0731 保持了相同的 284B 总参、13B 激活 MoE 架构,重新回来后得分 50,而前一个版本是 40。
答案的后半部分是冗长输出,而这对 DeepSeek 不利。
V4 Flash 在索引上生成了 2.1 亿输出 Token,四款中最多的。
Qwen 3.7 Max 生成了 1 亿输出 Token,四款中最少的。
所以 Flash 为相同的工作输出了比 Qwen 多 2.1 倍的 Token。
这就是为什么实际差距比标价差距小。Qwen 3.7 Max 的输出速率是 Flash 的 26.8 倍(7.50 美元对 0.28 美元),但实际索引账单相差 22.3 倍。Flash 通过多说话要回了大约五分之一的价格优势,而且仍然遥遥领先。
思考功能在 DeepSeek 上默认开启,而推理 Token 是按输出计费的,这就是冗长输出的来源。它可以关闭。如果你关闭了,你也就放弃了让 Flash 超越两个旗舰的部分分数,所以在自己的提示词上两种方式都测一下再决定。
本节的实践版本:每 Token 挂牌价格是成本的糟糕代理。两个有 27 倍速率差异的模型完成相同工作相差 22 倍,而两个有 1.5 倍速率差异的模型完成工作相差 2.4 倍。模型之间的 Token 数量差异比价格差异更大。
这每月要花你多少钱?
基准测试套件不是你的工作负载。下面用规格表中 ofox 目录的费率为一个具体团队做同样的比较。
场景:5 名开发者运行一个编码 AI 智能体。
每人每天 40 个任务,每月 21 个工作日
中等任务:12000 个输入 Token 的仓库上下文,3000 个输出 Token
40% 的输入命中提示词缓存
每位开发者每月用量:1008 万输入 Token(403 万缓存,605 万非缓存)和 252 万输出 Token。
K3 与 Flash 之间最终是 36.5 倍,接近索引运行显示的 33.8 倍。两个完全不同的工作负载产生相同的比率是一个合理的信号,说明这个比率是真实的。
表中有一个对 Flash 不利的修正。它假设每个模型每个任务输出 3000 个输出 Token,而索引运行表明这是错误的:Flash 为相同工作生成的输出 Token 是 Qwen 的 2.1 倍。将 Flash 的输出行乘以 2.1 倍,其团队成本从每月 7.82 美元上升到约 11.70 美元,这将 K3 对 Flash 的差距从 36.5 倍缩小到大约 24 倍。
仍然是 24 倍。冗长税是真实存在的,但它远远不足以弥合差距。
这个场景会误导你的地方:
缓存命中率在这里起了很大作用。在 40% 命中率下,DeepSeek 近乎免费的缓存读取几乎可以忽略不计,因为绝对数字很小。在一个有着 20 万 Token 系统提示词每天被读取数百次的工作负载上,这一列成为整个账单,差距会进一步扩大。
它为 Token 定价,而不是为结果定价。如果 K3 完成了 Flash 需要重试三次的任务,重试成本和工程师时间会淹没上面所有的数字。
费率会变动。DeepSeek 的两个版本都在最近一个季度内改变了价格和得分。在承诺之前获取当前数字。
Qwen 3.7 Max 的输出吞吐量比 Kimi K3 快 5.9 倍。
Artificial Analysis 特别指出 K3 明显较慢,V4 Pro 低于平均水平,而 Qwen 3.7 Max 在其价格类别中明显高于平均水平。写稿时没有发布 0731 Flash 版本的速度测量数据,所以那一行留空,而不是借用前一个版本的数字。
速度与分数改变的东西不同。12 分的索引差距表现为模型能完成或不能完成的任务。5.9 倍的吞吐量差距表现为一个 40 分钟的 AI 智能体运行是否变成四个小时。对于交互式工具和长时自主循环,后者往往是人们实际感受到的瓶颈。
当任务在其他三个模型上失败,且失败代价高于 token 成本时。
你的评估表明其他模型是在某一类任务上完全失败,而不是做得稍微差一点。
你需要配合前沿推理能力使用图像输入。我们于 2026-08-03 通过网关测试:发送一张图像将提示词 token 数从 97 提升到 189,并返回了准确的描述——所以视觉是真实可用的,并非只是列举在功能列表里。
你需要非常大的单次输出。K3 的 1,048,576 最大输出是 Qwen 3.7 Max 上限的 16 倍。
你想要最高分模型的开放权重,K3 是而 Qwen 3.7 Max 不是。
信号表明它不是正确的选择:高请求量、对延迟敏感的 UX,或任何你尚未实际测量出质量差异的工作负载。以每秒 35 个 token 和每 100 万输出 $15 的价格,K3 对体量和耐心都是惩罚。《Kimi K3 对比 GPT-5.5 和 Opus 4.8》涵盖了它在中文模型范围之外的表现,以及《Kimi K3 使用指南》涵盖了配置方法。
作为默认选项,直到有模型让它失败。
它在四个模型中排名第二,成本低一个数量级,拥有 100 万上下文窗口和 38.4 万输出上限,且以 MIT 许可发布开放权重。反对它的理由很窄:
纯文本。没有图像输入,因此任何涉及截图或文档图片的流水线都不适用。
冗长。索引上输出了 2.1 亿 token,四个模型中最多。要为推理 token 做预算,并在长循环中限制 max_tokens。
比 K3 低 7 分。真实的差距,对最难的那部分工作会有影响。
如果你目前使用的是 DeepSeek V4 Pro,这一节是必须采取行动的。Flash 0731 分数高 6 分,索引运行成本低 2.4 倍。任何将困难工作发送到 Pro、简单工作发送到 Flash 的路由规则,都是针对一个已不存在的版本写的。《V4 Pro 对比 V4 Flash》有旧框架和更新说明,《V4 Flash 对比 Gemini 3.6 Flash》涵盖了跨供应商预算层级。
当吞吐量是瓶颈时,或者当你已经在阿里云生态内时。
Qwen 3.7 Max 在这个组别中的论据是速度:每秒 206.4 个输出 token,接近 V4 Pro 的 4 倍、K3 的 6 倍。对于聊天产品(用户看着 token 逐字出现)或用 wall-clock 而非美元衡量的 AI 智能体循环,这是一个真实的产品差异,是任何索引分数都无法捕捉的。
反对它的理由是:从这些数字看,它在能力上处于中间位置,但在成本上接近最高,这是一个尴尬的处境。它的分数比一个运行相同测试套件成本低 22 倍的模型低 4 分。
而且它不再是阿里巴巴最新的模型。Qwen 3.8 Max 于 2026-08-03 发布,价格为 $2.00/$6.00,两边都比 3.7 Max 便宜,输出上限 13.1 万,支持图像输入。它不在本次对比中,原因比初看时要窄。Artificial Analysis 在 Intelligence Index v4.1 上给它打 53 分,高于这里比较的所有三个模型,但只在索引图表中发布该分数。没有模型页面就没有它的成本对索引数字,而成本每分正是本文所依据的轴。如果你今天在选择 Qwen 而不是比较已发布数字,3.8 Max 是起点。《3.7 Plus 对比 3.7 Max 基准测试》涵盖了更便宜的同门型号,《3.7 Max 开发者指南》涵盖了长 AI 智能体会话上的冗长税。
三种情况表明整个档次都不是正确的选择:
你需要视频输入。四个模型都不通过网关支持。Qwen 3.8 Max 目录条目只列出文本和图像,尽管 QwenCloud 自己的页面列出了视频。
你需要这些模型不具备的特定前沿能力。如果你的评估是针对 Claude 或 GPT 行为校准的,7 分的索引差异不会告诉你切换是否安全。跑你自己的测试套件。
瓶颈不是模型。如果检索 bug 或糟糕的提示词比 token 账单更费钱,本文中的任何数字都帮不了你。
所有四个模型都在同一个目录中,所以对比是对模型 ID 的循环,而不是四次集成。
Python:用同一提示词运行四个模型
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("OFOX_API_KEY"),
base_url="https://api.ofox.ai/v1",
)
MODELS = [
"moonshotai/kimi-k3",
"deepseek/deepseek-v4-flash",
"deepseek/deepseek-v4-pro",
"bailian/qwen3.7-max",
]
prompt = "Refactor this module and explain the risk in the migration."
for model in MODELS:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
max_tokens=2048,
)
u = r.usage
print(f"{model:<32} out={u.completion_tokens:<7} total={u.total_tokens}")
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.OFOX_API_KEY,
baseURL: "https://api.ofox.ai/v1",
});
for (const model of ["moonshotai/kimi-k3", "deepseek/deepseek-v4-flash", "bailian/qwen3.7-max"]) {
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: prompt }],
max_tokens: 2048,
});
console.log(model, r.usage.completion_tokens);
}
打印 completion_tokens,而不只是延迟。上述评估成本表的核心是,token 数量在这些模型之间的差异比价格差异更大,所以在你自己提示词上每个模型的输出计数比任何已发布的索引都更有价值。
关于目录的一个注意事项。K3 的条目只列出 /v1/chat/completions,而 Qwen 和 DeepSeek 的条目还列出 /v1/responses。该字段以前在两个方向上都曾有过错误,所以发送一个真实的请求到你计划使用的协议,而不是根据元数据做规划。当前各模型的费率在 Kimi K3、DeepSeek V4 Flash 和 Qwen 3.7 Max 的模型页面上。
2026 年最好的中文模型是哪个? 在 2026-08-03 快照的 Artificial Analysis Intelligence Index v4.1 上,Kimi K3 (max) 以 57 分成为本组最高分。按每分成本,DeepSeek V4 Flash 0731 以大约一个数量级的优势胜出。
Kimi K3 相比 DeepSeek V4 Flash 值得这个价格吗? 它用 33.8 倍相同评估运行的成本购买了 7 分索引分数。只有当特定类别的任务在 Flash 上失败而在 K3 上成功时才值得,你必须在自己提示词上测量。
DeepSeek V4 Flash 有开放权重吗? 有。0731 版本在 Hugging Face 上以 deepseek-ai/DeepSeek-V4-Flash-0731 发布,MIT 许可,fp8 精度,不限流。
为什么用 Qwen 3.7 Max 而不是 3.8 Max 进行对比? Artificial Analysis 在 Intelligence Index v4.1 上给 3.8 Max 打 53 分,高于本表所有模型,但它在那里没有模型页面,所以下面每一行所依赖的成本对索引数字对它不存在。Qwen 3.7 Max 是有完整已发布数字的最新 Qwen。于 2026-08-04 再次核实。
哪个模型输出上限最大? Kimi K3,1,048,576 token。DeepSeek 的两个模型允许 38.4 万,Qwen 3.7 Max 允许 6.4 万。
这些模型支持视觉吗? Kimi K3 支持,于 2026-08-03 通过网关测试。Qwen 3.8 Max 支持。Qwen 3.7 Max 和两个 DeepSeek V4 模型在目录中都是纯文本。
Artificial Analysis 索引成本和我最终的账单一样吗? 不一样。它是一个特定的 9 项评估套件,所以它告诉你的是固定工作负载下模型之间的比率,而不是你的绝对支出。用它来排名选项,然后用你自己的提示词测量。