两个模型性能打平但价格差 10 倍,DeepSeek 适合高量文本任务成本优先,Gemini 优于多模态,决策需看实际 token 消耗而非标价。
DeepSeek V4 Flash 0731 和 Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index v4.1 上都得分 50,GPT-5.6 Luna 领先一分为 51。它们的标价相差超过一个数量级。有趣的是当你停止比较价签、开始比较同一评估工作负载的实际发票时会发生什么。Artificial Analysis 公布了它运行每个模型花费的成本:DeepSeek 72.02 美元,Luna 190.87 美元,Gemini 726.70 美元。输出价格的标价差距是 27 倍。实际账单的差距是 10.1 倍,因为 DeepSeek 在那次运行中消耗了 2.1 亿个输出 token,而 Gemini 只有 5900 万个。两个数字都表明:如果你的工作负载是纯文本,就选择 DeepSeek;但如果流程中涉及图像输入,两个都不行。
有两种方式可以停止继续阅读。如果你的工作负载涉及任何非文本输入,第二行就足以决定,文章的其余部分都是背景信息。如果你的工作负载是纯文本,且月 token 消耗量在约 2000 万以下,那么最便宜和最昂贵选项之间的年成本差异会小于一天的工程成本,这种情况下根据延迟选择就行。下面的所有内容都是为账单大到值得优化的情况而写的。
DeepSeek 在 2026-07-31 发布了 V4 Flash 的新构建版本,但并未改变模型本身。仍然是 284B 总参数,13B 活跃参数,1M 上下文窗口,以及相同的 $0.14 / $0.28 定价。API 模型名称也没有变化,仍是 deepseek-v4-flash,DeepSeek 文档中将这个新构建标记为模型版本 DeepSeek-V4-Flash-0731。变化的是后训练阶段。
测量到的改进幅度超出了"仅后训练"通常带来的效果。在 Artificial Analysis Intelligence Index v4.1 上,得分从 40 跳到了 50。AA 的 AI 智能体评估基准 GDPval-AA v2 从 1189 Elo 上升至 1559。Terminal-Bench 2.1 提升了 17 个百分点至 79%。AA 还将这个 0731 版本排在 DeepSeek V4 Pro(DeepSeek 自家的旗舰产品)前面 6 分,这对任何基于"Pro 处理高难度任务"的路由规则都很尴尬。
我们正是那样的人。我们在 5 月份发布的《DeepSeek V4 Pro vs Flash 路由指南》中得出结论,多文件工作和长周期 AI 智能体循环应该跑在 Pro 上。但对于 0731 版本,这个结论已经不成立了,现实情况是 Flash 现在应该是默认选择,Pro 反而成了需要你去证明正当理由的例外。
权重下载的速度比任何人预测的都快。AA 的发布报道说完整权重预计在"未来几周"内发布,大多数转载仍在重复这个说法。但在 2026-08-01 查证时,Hugging Face 上的 deepseek-ai/DeepSeek-V4-Flash-0731 已经以 48 个 safetensors 分片的形式可用,采用 MIT 许可,完全开放。如果你在某处看到说 0731 只能通过 API 访问,那只是最初大约一天的情况。
在开始展示数字之前,有一条注意事项值得说明。Intelligence Index 是一个实时排行榜,下面的所有信息都是 2026-08-01 的快照。应该把排名视为持久的事实,把绝对分数看作特定日期的读数。
有两行值得仔细看。最大输出长度是真正的分水岭:384K 对 64K,这是能在一次调用中生成长文件和需要构建续接循环之间的区别。空的延迟数据格子不是排版错误。AA 在 2026-08-01 快照时,其提供商页面上没有列出 0731 版本的速度或首个 token 延迟数据,所以任何人引用你这个版本的 token-每秒数据,都是在引用其他地方的数据。
这是 AA 对 0731 版本子项得分的详细分解,对比 April 版本(AA 曾发布过)的变化。
全知性这一行很容易被跳过。AA 的报告指出改进来自减少幻觉而非知识增加,准确度持平。对于你即将用在生产流量的模型,"出错更少"是比"知道更多"更有用的升级,这是单一综合分数隐藏不了的。
关于数据来源有两点需要说明,因为这次发布有多组数字在流通。
DeepSeek 官方发布的材料报告 Terminal-Bench 2.1 为 82.7,DeepSWE 为 54.4,Cybergym 为 76.7。而 Artificial Analysis 报告 Terminal-Bench 2.1 为 79%。两者都可能没错;基准工具、脚手架和工作量设置都不同,而且在快照时间点没有对 DeepSWE 和 Cybergym 数据的第三方验证。我们全程使用 AA 的数字,因为这是唯一以一致方式跨这三个模型的测量。如果你在某处看到 82.7 这个数字,那是供应商的测试框架,不是矛盾。
另一个来源问题:大多数模型目录页面(包括我们的)列出的 DeepSeek V4 Flash 的 LMArena 分数,显示 1438 Overall,排名 70 多位,更新时间是 2026-07-12。那是 0731 版本发布前 19 天。它测的是 April 版本的模型。新版本的 Arena 排名需要新一轮投票,在那之前任何比较页面上"DeepSeek V4 Flash"旁边的数字都代表的是在 AA 评分上低 10 分的老模型。
任何这两个模型的对比都是从 $0.14 对 $1.50 开头,然后就停止了。这个比率是真实的,但也是本文最不可靠的数字,因为它是在给 token 定价,而不是给工作定价。
Artificial Analysis 公布了更好的数据:它实际为运行每个模型通过相同的 Intelligence Index 测试套件花了多少钱,连发票都公开了。
同一评估,三份真实账单。Gemini 的成本是 DeepSeek 的 10.1 倍,Luna 是 2.7 倍。相比输出价格的 27 倍和 4.3 倍标价差,这大约是 DeepSeek 纸面优势的 60% 在价签和发票之间消失了。
消失到哪里了?token 数量。DeepSeek 在那个测试套件上消耗了 2.1 亿个输出 token,Gemini 只有 5900 万个,AA 标记这在业界属于非常冗长。仅按列表价格对输出部分定价,你得到:DeepSeek 58.80 美元,Luna 156.00 美元,Gemini 442.50 美元,输出部分的差距是 7.5 倍。两份账单的成本结构相应不同:输出占 DeepSeek 运行总成本的约 82%,占 Gemini 的约 61%。这是一个特征:这个模型需要写三倍半的内容才能达到相同分数。AA 没有公布每个模型的输入 token 计数,所以从公布数据无法进一步分解剩余部分。
你按哪个数字规划取决于你的业务场景。如果工作负载主要是输入提示,就按照 10.7 倍的输入比计算。如果主要是生成输出,就会因为冗长被压缩到 7.5 倍。AA 的端到端 10.1 倍数字介于两者之间,它本身就是混合工作的测试套件,这就是为什么对于任何需要在预算评审会上辩护的东西,10 倍是比 27 倍更好的默认数字。
关于 token 计数有两点需要注意。这些数字来自 AA 的最大工作量和高工作量配置,代表的是每个模型成本范围的高端而不是典型的生产设置。另外,冗长是工作负载相关的;充满困难推理题的测试套件会美化那些推理简洁的模型,而你的数据提取管道不会是那种套件。
关于 2.1 亿这个数字有一条脚注,因为有两个 AA 发布的数据在流通。模型页面为索引运行报告 2.1 亿个输出 token;AA 的发布博文报告约 206M,还提到了一个更有趣的事实:这比前一个 V4 Flash 版本的输出 token 消耗少 12%(约 234M)。所以 0731 比同行更冗长,但比它自己的前身更精简。我们全程使用 2.1 亿,因为模型页面的数字是所有三个模型以相同方式发布的数字。
不过,这个杠杆是真实存在的,也是一个重要标志。DeepSeek 的文档中列出 deepseek-v4-flash 同时支持非思考和思考模式,思考模式为默认,推理 token 按输出计费。对于有明确边界的工作,关闭思考模式就是冗长税消失的地方。
AA 的比率是一个起始估计,不是你的实际数字。要获得你自己的,需要在你的真实提示样本上运行一次,因为每个 OpenAI 兼容的响应都会返回你需要的 token 计数:
import collections
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_API_KEY")
costs = { # input, output, per 1M tokens
"deepseek/deepseek-v4-flash": (0.14, 0.28),
"google/gemini-3.6-flash": (1.50, 7.50),
"openai/gpt-5.6-luna": (0.20, 1.20),
}
totals = collections.defaultdict(float)
for prompt in load_your_real_prompts(): # 50 is enough to see the shape
for model, (pin, pout) in costs.items():
u = client.chat.completions.create(
model=model, messages=[{"role": "user", "content": prompt}]
).usage
totals[model] += (u.prompt_tokens * pin + u.completion_tokens * pout) / 1e6
for model, spend in sorted(totals.items(), key=lambda kv: kv[1]):
print(f"{model:32} ${spend:.4f} over the sample")
在所有三个模型上运行 50 个有代表性的提示词,只需花费几美分,却能告诉你比任何排行榜都更多的信息。有两点需要注意。第一,针对 DeepSeek,分别在开启和关闭思考模式的情况下各运行一次,因为这个开关对输出列的影响比模型选择本身还大。第二,应从实际流量分布中抽样,而不是只选最难的案例,因为在高难度推理问题上测得的冗长度比例,并不适用于一个充斥着两行文本分类任务的队列。
以下均为厂商标价,快照日期为 2026-08-01,单位为每 100 万 token。
场景 A:一个抽取流水线。每月 2 亿输入 token 和 1000 万输出 token,不使用缓存,输出为简短的结构化内容。
输入占据主导,因此该场景基本遵循输入价格的比例:Gemini 的成本是 DeepSeek 的 12 倍,Luna 是 1.7 倍。请注意,7 月 30 日的降价对 Luna 在这里的位置影响有多大。按照之前 $1 / $6 的价格,同样的工作负载每月需要 $260。
场景 B:一个编程智能体循环。每月 1 亿输入 token,缓存命中率为 70%,另有 4000 万输出 token。
该表保持 token 数量不变,这实际上暗中假设三个模型为完成同一项工作会生成相同数量的内容。但事实并非如此。更公平的比较方式是保持工作量不变,并按照指数测试中测得的冗长度比例缩放输出,由此可以更准确地呈现同一个智能体循环的成本:
DeepSeek 从便宜 23 倍变为便宜 8 倍。决策并没有改变,但你放在幻灯片里的数字应该改变。
如果想了解专门针对 DeepSeek 的更深入计算,包括缓存未命中会如何影响真实账单,请参阅我们的 V4 Pro 成本分析和 DeepSeek V4 API 定价指南。
DeepSeek 即将引入高峰时段定价。其定价文档中有一条脚注:API 将采用峰谷定价策略,高峰时段价格为常规价格的 2 倍,适用于所有计费项目,生效日期有待官方公布。高峰时段为北京时间(UTC+8)09:00 至 12:00,以及 14:00 至 18:00。
在假设这项政策不会造成影响之前,请先将这些时间换算成你所在地的时间。它们对应美国东部时间 21:00 至次日 00:00,以及 02:00 至 06:00;对于美国日间工作负载来说,正值深夜。换算成中欧时间则为 03:00 至 06:00,以及 08:00 至 12:00,几乎覆盖了欧洲团队的整个上午。如果你在欧洲运行服务,并且 DeepSeek 启用了这项政策,那么工作日前半段的价格将从 $0.14 变成 $0.28。它仍然低于 Gemini,但已经不是你编制预算时采用的数字。
你所购买的接入线路,其价格可能与厂商标价不同。OpenAI 于 2026-07-30 将 GPT-5.6 Luna 的价格下调了 80%,从 $1 / $6 降至 $0.20 / $1.20。截至 2026-08-01 的快照,通过 Azure 提供 Luna 的平台尚未跟进降价,其中也包括我们自己的平台:openai/gpt-5.6-luna 使用的是 Azure 线路,显示的标价仍为 $1 / $6。同一个模型 ID,仅仅因为最终接入的上游不同,价格就相差 5 倍。
关于该表还有两点需要说明。在快照时点,我们的 Luna 服务正在进行八折促销,使 Azure 线路的实际价格降至 $0.80 / $4.80,但仍然是 OpenAI 标价的四倍。缓存读取一列也值得单独关注:在 Azure 的 DeepSeek 线路上,读取缓存与新输入的价格相同,这会抹去该模型最大的单项成本优势。
该表揭示的一般规律是:检查线路,而不是模型名称。某个实验室宣布降价后,其自有 API 会立即采用新价格,而其他服务商则会按照各自的时间表调整。上述七行中,有两行是同一个模型,价格却大不相同。
本次比较中最便宜的模型没有视觉能力。DeepSeek V4 Flash 0731 可以接受文本、调用函数、返回 JSON,并支持 OpenAI 和 Anthropic 两种通信格式——完整的能力列表到此为止。Gemini 3.6 Flash 可以接受文本、图像、视频、音频和 PDF。GPT-5.6 Luna 可以接受文本和图像。
这种能力差距无法通过提示词工程或增加预算来弥补。如果你的流水线会发送出错 UI 的截图、扫描发票或视频帧,那么 DeepSeek 调用并不会以更高价格优雅地完成任务,而是会在结构上直接失败。对于这类工作,上面的所有成本表都失去了意义。这也正是模态这一行位于规格表靠前位置,而不是被埋在底部的原因。
一种常见的解决方案是拆分流量:多模态请求发送给 Gemini,其余请求全部发送给 DeepSeek,并在前面放置一个路由器。这比只选择一个模型需要更多工作,但对于 90% 请求都是文本的流水线而言,通常第一个月就能收回投入。
适合大规模纯文本工作负载,尤其是在账单确实构成重要成本项的情况下。任何缓存命中率较高的工作负载都能获得格外显著的收益,因为每百万 token $0.0028 的缓存读取价格,相比新输入便宜 98%,降幅达到 50 倍。较长的单次生成任务同样适合它:其最大输出长度为 384K,是 Gemini 上限的六倍。它还是三者中唯一公开权重的模型,并以 MIT 许可证发布在 Hugging Face 上。因此,如果计划先通过 API 构建原型,之后再自行托管,只有它提供了这样的迁移路径。
对于边界明确的工作,请关闭思考模式。这正是上文 $15.60 与 $44.16 两行之间差异的来源。
只要涉及非文本模态,就应该选择它;在这种情况下,价格甚至还没有进入讨论,结论就已经确定。当延迟对用户可见时也应选择它:每秒输出 219.6 个 token,使其在快照时点的 AA 速度排行榜上位列 185 个模型中的第三名,而 15.11 秒的首 token 时间对于推理模型来说也很快。此外,如果你希望即将依赖的模型已经由第三方进行过测量,Gemini 也更合适,因为 AA 已发布 Gemini 的速度和延迟数据,而当时尚未发布 0731 构建版本的数据。
批处理层级的价值被低估了。对于可以容忍延迟的工作,其价格为 $0.75 / $3.75,这使 Gemini 与 DeepSeek 的实际价格差距缩小了一半。
当你既希望获得三者中最高的指数得分,又需要同一个模型具备视觉能力时,可以选择它。80% 的降价让这种组合变得负担得起,而就在三周前还并非如此。Luna 目前的价格为 $0.20 / $1.20,在价格上已更接近 DeepSeek 而非 Gemini,同时得分比两者都高 1 分。
首先需要检查两件事。AA 测得的 121.89 秒首 token 时间来自最大推理强度配置,而最大推理强度并不适合交互场景;如果要在 UI 中使用 Luna,请采用较低的推理强度。其次,请确认网关最终将请求路由到哪条线路,因为降价前的 Azure 层级价格是 OpenAI 标价的 5 倍。我们的 GPT-5.6 层级指南介绍了 Sol、Terra 和 Luna 如何划分工作。
如果工作负载很小,这一切都无关紧要。每月只有几百万 token 时,这些选项中最便宜和最昂贵者之间的差额,相比一个小时的工程时间只相当于四舍五入误差。此时应该根据能力做出选择,然后继续推进工作。
如果你追求零成本,那么托管式 API 并不是正确的工具。该模型家族的免费和自行托管方案是另一项需要单独处理的工作,并且都附带实际限制,具体可参阅《DeepSeek V4 Flash 免费使用:四条零成本路径》。这些路径是基于 0731 之前的构建版本验证的,因此在依赖它们之前,请重新检查相关限制。自行托管方案此后已经发生变化:0731 的权重目前已在 Hugging Face 上以 MIT 许可证发布,因此免许可证费用的选项现在适用于当前构建,而不再只是 4 月的版本。
如果任务是深度、多步骤的智能体工作,并且工具调用次数达到两位数,那么这三个 Flash 层级模型都不是显而易见的合适选择。这属于前沿层级模型的适用领域。坦率地说,你应该使用自己的运行轨迹进行基准测试,而不是依赖任何人的指数。我们之前对 Gemini Flash Lite 与 DeepSeek V4 Flash 智能体循环的比较,详细说明了随着任务深度增加,工具调用可靠性会如何改变成本计算。
三个模型都可以通过同一个兼容 OpenAI 的端点运行,因此比较它们只需替换一个字符串,而不必进行三套集成。模型 ID 分别为 deepseek/deepseek-v4-flash、google/gemini-3.6-flash 和 openai/gpt-5.6-luna。
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_API_KEY")
MODELS = [
"deepseek/deepseek-v4-flash",
"google/gemini-3.6-flash",
"openai/gpt-5.6-luna",
]
prompt = "Refactor this function to remove the nested loop. Return only code."
for model in MODELS:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
u = r.usage
print(f"{model:32} in={u.prompt_tokens:6} out={u.completion_tokens:6}")
请记录 completion_tokens,而不仅仅是延迟。这一列能够反映不同模型在你自身流量上的冗长度差异,而这正是标价无法告诉你的数字。
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.ofox.ai/v1",
apiKey: process.env.OFOX_API_KEY,
});
const models = [
"deepseek/deepseek-v4-flash",
"google/gemini-3.6-flash",
"openai/gpt-5.6-luna",
];
for (const model of models) {
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: "Summarize this changelog in 3 bullets." }],
});
console.log(model, r.usage.prompt_tokens, r.usage.completion_tokens);
}
相同的客户端,相同的端点,一个内容块就改变了一切。把这个发送给 google/gemini-3.6-flash 或 openai/gpt-5.6-luna,你会得到答案。发送给 deepseek/deepseek-v4-flash,就没有任何价格能让它工作。
import base64
img = base64.b64encode(open("screenshot.png", "rb").read()).decode()
r = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Which element is misaligned?"},
{"type": "image_url",
"image_url": {"url": f"data:image/png;base64,{img}"}},
],
}],
)
print(r.choices[0].message.content)
如果这三者都不符合,值得检查的替代选项就在同一个端点上。DeepSeek V4 Pro 定价为 $0.435 / $0.87(ofox 列表中显示为 $0.45 / $0.88),现在成了 AA 指数上更贵、评分更低的同级产品,尽管如果你有工作负载特定的证据表明它在你的场景中表现更好,它仍是正确选择。GPT-5.6 Terra 在 flash 级别真的不够用时位于 Luna 之上。在 ofox 目录之外,相同的模型可从 DeepSeek、Google AI Studio 和 OpenAI API 的官方渠道获得,如果你只需要一个供应商,并希望在价格下降当日就获得优惠而不是等待路由更新,那这是正确选择。
包含实时定价的模型页面:DeepSeek V4 Flash、Gemini 3.6 Flash、GPT-5.6 Luna。
https://artificialanalysis.ai/models/deepseek-v4-flash
https://artificialanalysis.ai/models/gemini-3-6-flash
https://artificialanalysis.ai/models/gpt-5-6-luna
https://api-docs.deepseek.com/quick_start/pricing
https://ai.google.dev/gemini-api/docs/pricing?hl=en
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/3-6-flash
https://developers.openai.com/api/docs/pricing
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
最初发表于 ofox.ai/blog。
如需进一步行动,你可以考虑屏蔽此用户和/或举报滥用。