澄清 DeepSeek 应用免费但 API 按 Token 计费的差异,避免开发者集成前的成本估算误区。
在 Google Play 的 DeepSeek 应用介绍中,这款助手被称为免费产品,但 DeepSeek 官方 API 文档却按 token 计算费用。集成前,务必要看清这条边界:DeepSeek 在面向用户的应用中免费,并不意味着 API 也免费。你可以在应用里体验这款助手,但使用 API 时,需要提前弄清楚账单由哪些 token 和何种缓存状态构成。
这并不是在挑措辞的毛病。团队可能根据平时使用免费聊天应用的体验做出决策,随后却通过 API 传入冗长的指令、对话历史,并要求生成详尽的回答。此时,成本取决于具体请求,而不是使用界面时留下的印象。
Google Play 上的应用信息于 7 月 9 日更新。对于想试用聊天功能的人来说,这是一个有用的信息:Google Play 将 DeepSeek 应用描述为免费产品。但 DeepSeek 官方的 Models & Pricing API 文档采用的是另一种计费模式:费用等于 token 数量乘以相应费率,而且 cache hit、cache miss 和 output 分别采用不同的费率。
对于 API,需要关注三个彼此独立的部分:
因此,上线前真正应该问的并不是“这个模型总体上便不便宜”,而是“按照我们的上下文长度和预期回答长度,这个请求需要多少钱”。7 月 21 日,Hacker News 上有人讨论了一篇关于 DeepSeek 降价 75% 的文章。这只能说明该话题受到了关注,既不能视为新的费率,也不能作为待验证模型的标识符:计算费用时,需要使用模型名称,以及核算当天 API 官方价格页面上的准确费率。
在集成前做一次小规模 canary 测试。它无法证明未来每月的实际成本,但可以展示之后需要按规模推算的计费机制。
选择一个固定且不包含敏感信息的 prompt,例如:“请用两个中性的句子说明,在集成前检查 token 用量有什么好处。”每次运行时都不要修改它。
本文不会把一份模板冒充已经执行完成的 canary 测试:没有 API 的实际响应,就无法如实给出模型、token 数量、缓存状态或成本。只有真正发起一次请求,并保存该 prompt 和响应的计量信息之后,这项验证才具备可复现性。完成请求后,整理出一条计算记录:
{
"model": "<фактический_идентификатор_модели>",
"price_page_date": "YYYY-MM-DD",
"cache_state": "<hit_или_miss>",
"cache_hit_tokens": "<число>",
"cache_miss_tokens": "<число>",
"output_tokens": "<число>",
"cost": "cache_hit_tokens × hit_rate + cache_miss_tokens × miss_rate + output_tokens × output_rate"
}
核对已执行请求的计量数据,确保每个字段都能填入实际值,而不是假设值。请在同一天从官方价格页面抄录费率,并同时记录模型名称。如果界面或响应无法显示模型、缓存状态、所需的 token 数值和适用费率的日期,这本身就是验证结果:你无法通过一次请求,以可复现的方式计算账单。
不要在公式中代入单一的平均输入价格。也不要隐藏 output tokens:如果产品要求模型进行详细解释、重写内容或生成大量结果,它们同样会增加费用。

一种看似合理的说法是:既然费率降低了,就可以立即迁移负载。这种观点很有说服力,尤其是在任务简短、上下文很少,并且回答被限制在几行以内时。在这种情况下,一次请求的费用确实可能非常低。
转折并非始于某种抽象风险,而是始于第一张账单。它可能展示的不是单一的“请求价格”,而是彼此分开的 cache hit、cache miss 和 output。即使固定 prompt 得到了简短回答,也仍然无法证明包含冗长历史记录或大篇幅生成内容的场景会花费多少。官方计费规则已经为这些类别设置了不同费率:缓存未命中会改变输入所属的计费类别,而“请详细回答”这类要求则会增加输出量。降价会降低观察当时的费率,却不会改变费用的构成方式。
因此,不应把一次 canary 测试变成预算承诺。它的任务更克制,也更有价值:找出产品中究竟有哪些变量可能让账单变得不可忽视。
如果你需要自动化处理,并且愿意在真实但受限的场景中测量 token,就可以使用 API。不要仅仅因为 Google Play 将 DeepSeek 应用描述为免费产品,就把它称为免费 API。
扩大负载之前,如果满足以下任何一项条件,就应暂停并重新审视决策:
无法查看关键请求所使用的模型、输入 token、输出 token 或缓存状态;
计算时使用了没有核查日期的旧价格;
试图用一次测试回答预测所有用户的情况;
产品没有限制上下文或回答长度;
测试中包含敏感数据。
canary 测试之后的下一步不再是猜测,而是基于明确记录的假设设计三个场景:短请求、典型请求,以及发生 cache miss 的长请求。为每个场景代入你自己的 token 数量和当前费率。上线前,提前设定阈值:达到什么条件时,需要限制上下文、限制回答长度,或重新评估模型。限制上下文可以控制输入 token 的数量,而 cache miss 状态则需要单独测量和验证。这样得到的是一个范围和一套决策规则,而不是虚假的精确数字。
如果需要通过统一的 API 路由比较同一组受限 workload,最好确保模型清晰可见,并采用可比较的费用计量方式。provod.ai 可以作为这样的比较平台,但它不会让 DeepSeek 变成免费产品,也不能取代对费率和 token 的核查。

对于涉及个人数据的场景,重要的不只是模型,还有整个流程的组织方式:该平台在设计时考虑了俄罗斯法律的要求,而具体能否适用,则取决于数据的构成和客户的配置。
一个目录中汇集了当前用于文本和媒体处理的模型:OpenAI 的 GPT、Anthropic 的 Claude、Google 的 Gemini、xAI 的 Grok,以及 DeepSeek、Qwen、GLM、Kimi 和 MiniMax;图像模型包括 Nano Banana 2 Pro 和 GPT Image;视频模型则包括最新版本的 Seedance、Kling、Veo 和 Google Omni。此外,还提供用于 reasoning、搜索、文档、embeddings、音乐和音频处理的模型。
企业流程方面的要求不会提高模型费率:价格与提供商的官方价格保持 1:1,provod.ai 不收取额外加价。
了解企业场景的适用条件:注册表单 · 模型价格 · 依据俄罗斯联邦第 152-FZ 号法律保护数据 · 数据处理政策
在你的场景中,完成 canary 测试后,优先限制哪一项更合理:限制上下文长度以控制输入 token,还是限制回答长度以控制 output tokens?cache miss 将另行测量。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。