通过将任务按复杂度拆分到不同定价层( Opus / Sonnet / Haiku ),实现 66% 成本削减,同时设置明确接受标准防止低质分类器节省的成本被支持工时抵消。
Disclosure:我在 zltokens 团队工作。以下数字是针对这个工作负载的月度成本计算,不承诺每个项目都能取得相同的节省。

支持分类、字段提取、短摘要。
月度计算结果是 $864。我的第一反应是找一个更便宜的 Claude API 提供商。
然后我看了看这些任务。这些功能之所以使用 Claude,并非因为我们对每个任务都做过方案对比。项目早期选定了它,后来的功能就沿袭了这个选择。既然能用,就没人去改。
初始计算涵盖每月约 54,000 次模型请求,平均每次 1,700 个输入 token 和 300 个输出 token。按照本次计算所用的 Opus 4.6 费率——每百万输入 token $5,每百万输出 token $25——不含缓存和批量折扣,总计 $864。
当我接触到 zltokens 时,价格确实值得关注。但更有价值的问题是:如何拆分工作——哪些请求可以用更经济的模型,哪些应该继续用 Claude?
我从那些有明确验收标准的任务开始测试。没有只挑简单的例子来测。
「我的订单还没到,我不想等了,请帮我退款。」
如果分类器把这句话归为「物流咨询」而漏掉了退款请求,那么省下的 API 成本很快就会以售后返工的形式回来。
所以规则很简单:只有在通过原有验收标准之后,才能把任务迁移过去。困难请求留给更强的模型,当第一条路径处理不了时升级到更强的模型。
以 DeepSeek V4 Pro 作为经济型候选,月度费用分解如下:
升级成本已含在合计里,不要再重复加上。
$864 减 $294 等于每月节省 $570,API 费用降低约 66%。
这不是「把所有请求都发给最便宜的模型」。复杂工作仍然用更强的模型,常规工作则测试是否有更便宜的方案能同样满足需求。
测试和配置需要时间。但你不必替换整套兼容工具。使用 zltokens,工作负载可以拥有独立的 API key、模型范围和配额,调用按约定规则组织。特定模型的优惠也值得比较。
我会从一个小功能开始,而不是全项目迁移。保留它的验收标准,查看可用的模型和集成路径,然后判断这个改动对这个任务是否有意义。
在 zltokens 上探索模型和 API 配置:https://www.zltokens.com/en/start?utm_source=dev&utm_medium=organic_social&utm_campaign=story2_202609&utm_content=main