CodeBurn通过解析coding agent的session文件,将token消耗与实际代码产出(commit/PR)关联,回答哪个项目/模型/任务类型消耗最多,帮助工程团队做AI成本决策。
AI 编程工具正在成为开发者和工程团队一笔不可忽视的开销。
但大多数提供商的控制台只回答一个问题:
你消耗了多少?
它们很少告诉你:
哪个项目消耗了它?
哪个模型产生的费用?
Agent 是在写代码、调试、规划,还是仅仅在对话?
它重试同一次编辑的频率是多少?
这项工作最终是否产生了 commit 或 pull request?
昂贵的模型是否在做便宜模型就能完成的工作?
这些信息通常已经存在。它们就躺在编程 Agent 写入本地磁盘的会话文件里。
我们构建了 CodeBurn 来读取这些文件,并将其转化为有价值的信息。
AI 编程可观测性中缺失的那一层
仅仅知道 token 总量不足以做出好的工程决策。
假设两次编程会话都花费了 10 美元。
第一个会话实现了功能;编辑了正确的文件;首次尝试即成功;产生的代码最终进入了代码库。
第二个会话反复重新读取相同的文件;重试了多次编辑;大部分时间花在对话上;最终没有任何 commit。
账单上看到的是 20 美元。
而工程团队看到的是两种截然不同的结果。
更有用的单位不仅仅是每 token 成本,而是更接近于:
每成功工作单位的成本。
实现这一点首先要从更好的归因开始。
数据就在你的机器上
Claude Code、Codex、Cursor、Copilot、Copilot 以及众多其他编程工具都会保留本地会话数据。
根据工具的不同,这些数据可能包括:
读取或编辑过的文件;
对话历史。
CodeBurn 目前支持 40 种编程工具和 Agent。它将这些工具不同的存储格式统一为同一种本地使用视图。
模型前方没有代理,工作流周围也没有包装。CodeBurn 读取的是工具已经写好的记录。
这个区别很重要。
你的编程记录可能包含源代码、文件路径、架构决策、调试输出以及其他敏感的项目上下文。你不应该为了了解自己的使用情况,而被迫将所有这些上传到另一个服务。
因此 CodeBurn 在本地运行:
不会上传任何记录;
不会暴露会话内容。
从 token 总数到工作模式
一旦将使用量与项目、模型和工具活动关联起来,更多有价值的问题就变得可能了。
钱花在哪里了?
CodeBurn 按以下维度拆分使用量:
npx codeburn
这会使用机器上已有的会话数据打开交互式终端面板。
如需生成可复制的报告:
codeburn overview
你也可以缩小分析范围:
codeburn overview --provider claude
codeburn overview --from 2026-08-01 --to 2026-08-12
模型的工作效率如何?
仅凭 token 消耗无法判断模型是否费力。
CodeBurn 衡量以下模式:
每次调用的输出 token;
委托和规划行为;
codeburn compare
这使用你自己的工作来比较两个模型,而不是通用的基准测试。
在公开基准测试上看起来更强的模型,在你的项目上可能仍然不够经济。它可能需要更多重试、生成更多输出,或在调试、功能开发和重构方面的表现不同。
你的工作负载才是最终重要的基准。
哪里有可以避免的浪费?
CodeBurn 可以检查会话和本地配置,查找反复出现的浪费模式:
codeburn optimize
跨会话反复加载到上下文中的文件;
在读取足够多的相关代码之前就开始编辑;
未使用的 MCP 服务器增加工具模式开销;
未使用的 Agent 或技能被加载到会话中;
过大的指令文件;
会话内容繁重但输出甚少;
反复重试但没有可观测交付物的昂贵会话。
对于支持的修复,CodeBurn 可以准备或应用更改,并保留本地日志以便撤销:
codeburn optimize --apply
codeburn act list
codeburn act undo --last
在有足够的变更后数据存在时,它会比较预估的节省与实际观察到的结果。
目标是衡量一项优化是否真的有帮助,而不是仅仅声称它应该有帮助。
最难的问题是 AI 支出是否产生了有用的工作。
CodeBurn 开始通过将会话窗口与 Git 活动关联来接近这个问题:
codeburn yield
结果将支出分类为:
这种归因被刻意描述为启发式的。接近会话的 commit 并不从数学上证明该会话导致了它。并行会话使归因更加困难。
但即使是一个可检查的启发式方法,也比将每个消耗的 token 视为同等有价值要有用得多。
为什么这不仅仅对个人开发者重要
对于个人开发者来说,直接的好处是可见性:
哪个工具成本最高?
哪个模型最适合我的任务?
我在哪里浪费了上下文?
哪些会话产生了有用的工作?
对于团队来说,问题变得更大了:
我们从 AI 支出中获得了哪些有用的工程产出?
这需要的不仅仅是汇总账单。它需要将成本与项目、工作流程和结果联系起来,同时尊重开发者数据的敏感性。
我们认为本地优先的可观测性是解决这个问题的一个有用起点。
CodeBurn 是免费、开源且采用 MIT 许可证的项目。
无需安装即可运行:
npx codeburn
GitHub: https://github.com/getagentseal/codeburn
Product Hunt: https://www.producthunt.com/products/codeburn?launch=codeburn-2
如果你重度使用编程 Agent,我们特别希望看到你对一个问题的回答:
关于你的 AI 编程使用情况,你目前无法测量什么,但你希望能够测量?
这是我们下一步想要构建的方向。

