通过两周 Sprint 追踪 OpenCode 和 Claude Code 的每任务实际成本,揭示_token计费背后的隐藏费用结构,提供可复用的成本度量框架。
Cloud AI 编程助手把成本藏在月度订阅或捆绑积分里。Terminal 代理不这样做。OpenCode、Claude Code 和类似工具按 token 计费,这意味着每次 prompt、每次文件读取、每次测试运行都有价格。如果你不做测量,第一张账单一定会让你惊讶。
我们在两周的 sprint 中使用 OpenCode 和 Claude Code 追踪了每个任务的成本。目标不是最小化开支,而是了解哪些任务便宜、哪些昂贵,以及模型选择在哪里起作用。
成本按 token 从提供商仪表板拉取很容易,但它具有误导性。如果一个任务用更多 token 却在更少轮次内完成,它不一定更贵。如果 agent 陷入重试循环,用更少 token 的任务也可能很贵。
按任务计费捕捉了整个循环:prompt、上下文读取、工具调用、重试,以及最终的 diff。这个数字映射到节省的工程时间,这才是你使用 agent 的真正原因。
把"任务"定义得足够窄才能对比。"给 API 添加限流"是一个任务。"修 bug"太模糊了。在开始追踪成本之前,把模糊的请求拆解成具体的结果。
我们在两周内为每个 agent 会话记录了四个字段:
任务分为三个成本区间:
最便宜的任务并不总是最小的。一条措辞精准的一句话请求往往比模糊的三段式请求成本更低,因为 agent 减少了猜测。
成本最大的杠杆是模型,不是 prompt。我们用四个模型跑了相同的样板生成任务:
对于日常任务,DeepSeek V3 足够好,成本降低了 80%。对于出错代价高昂的任务,Claude Sonnet 值得溢价。OpenCode 让切换变得很简单,因为模型只是一个设置项。
不要单独优化成本。产生微妙 bug 的更便宜模型可能在调试上花费更多时间,远超它节省的 token。追踪结果和成本并重。
你不需要仪表板。上述五个字段的电子表格就足够第一个月用了。跑了三十个任务后,你就会知道自己的基准,并能回答三个问题:
一旦有了基准,你就可以决定订阅工具的捆绑积分是否比按 token 计费更便宜。答案取决于你的任务构成,而不是标称价格。
Originally published at pickuma.com. Subscribe to the RSS or follow @pickuma.bsky.social for new reviews.