除模型API费用外,Token总量(系统提示词+上下文+输出全算)、向量数据库、日志、人类审核链路月度成本往往超预期。
大家记住的往往是构建成本。真正决定一个 AI 功能能否活下来的,是每个月的运行费用,而它通常会在第二个月冒出来——就在试用额度用完、真 实流量涌入的时候。
我把 AI 功能的预算,当作厢式货车的预算来算。买车是一次性的。油费、保险、司机,永远持续。下面来说说油钱到底藏在哪儿。
Token,包括那些你忘记算的。大家都会计算用户的提问。很少有人把系统提示词、检索到的上下文、Few-shot 示例以及模型自己的输出一起算进去——这些在每次调用时都要计费。一个在测试时只有 3000 token 上下文规模、看起来很小的功能,一旦每个请求都拖着这些提示词跑,成本就会变成估值的 10 倍。
重试与检索。失败重试一次,当次调用成本翻倍。RAG 功能还要为每个文档支付嵌入费用、存储向量,以及每次查询运行一次相似性搜索。模型账单只是长长收据上的一行。
模型周围的 machinery。向量数据库托管。可观测性日志——对于 AI 功能来说这不是可选项。流量 egress。未来你会加的缓存——用来避免为同一个答案付两次钱。
Human in the Loop。如果有人审核标记过的输出,这个审核时间就是功能的持续运行成本,应该计入预算,尽管没有任何供应商会为此给你开账单。
在功能还没写一行代码之前,我们就估算每个 action 的成本。输入的平均 token 数 × 输出的平均 token 数 × 模型单价 × 预期量。这是一个粗略估算,但因为输入都是可知的的数据,所以通常结果八九不离十。
然后我们选择能通过评估的最便宜的模型,而不是排行榜上名次最高的。在你的真实任务上够用的小模型,可以把账单砍到原来的 1/5 到 1/10。我们把简单的 80% 请求发给便宜模型,只把困难的那些升级处理。对重复查询加缓存可以再削掉一块。
最后一步是在上线前接入硬性支出上限。按用户、按天、按功能。一个失控循环或者爬虫猛击你的端点,应该触发限制并通知人,而不是一直计费到卡片被拒。
我们在评估 AI 工作量时,会给客户两个数字。一次性的构建成本,和按预期流量的每月运行成本,并把假设条件写在旁边。一个批准了每月 600 美元运行成本客户,在看到账单是 600 美元时会保持冷静。只看到构建价格的客户会觉得被偷袭了,而且他们这么想是对的。
这个对话虽然不光鲜,但它是防止项目在第六周就变味的那个关键。Shanti Infosoft 的团队把运行成本估算作为报价的一部分,而不是事后才一起发现的东西,你可以在 https://shantiinfosoft.com 看到我们是怎么做估算的。
我们在《没有人会告诉你的自动化成本权衡》一文中更详细地拆解了运行成本数学。
你的 AI 功能每个月实际运行成本是多少?第一次估算偏差有多大?