JetBrains实验发现宣传的65% token节省实际仅7.5%,揭示AI编程工具中常见的成本夸大,对预算评估有重要参考。
用你的 AI 助手在许多 JetBrains 产品中强化工具功能
在真实 agentic 任务中节省输出 token,技能被强制激活。这是理论上限,而非常规情况下的结果。
JetBrains 正在投入越来越多的精力来正确测试围绕编码 agent 的工具,其中一项技能引起了我们的注意:"Caveman"。它的宣传最好用它自己的方言来描述:
Skill 让 agent 说话像山顶洞人。为什么用多词令少词做戏。填充词死。代码、命令保持字节精确。节省 65% 输出 token。每次回复。永远。兼容 30+ agent。许多 GitHub 星。
声称很便宜来验证。验证很贵。Agent 不是聊天窗口。Agent 输出主要是工具调用、文件编辑、代码:技能承诺不触碰这些。所以我们测量两件事 README 没有测量:真实的多步 agent 工作中的节省,以及挤压 agent 思维外化是否会伤害任务结果。
为什么"强制"很重要:Caveman 是用户激活的。它在诸如"caveman mode"或"be brief"这样的短语上触发。我们在每个回复中强制启用它,这意味着下面的每个数字都是该技能的最佳情况。在正常使用中,agent 必须自己决定是否激活它,实现的节省只能等于或低于这里测量的大约 10% 的理论上限。
宣传的节省来自于聊天风格的散文答案。Agentic 输出是不同的:代码、diff、工具调用和精确的错误字符串主导 token 流,Caveman 正确地保留所有这些。只有工具调用之间的叙述得到压缩,而且数量不多。
我们真正关心的问题:让 agent 言简意赅会让它变差吗?在整个运行的 82 个配对任务中,答案是否定的:两组在统计上是无法区分的。
风格转移本身完全按设计工作:强制启用的 arm 明显呈现山顶洞人风格,而代码工件保持不变和正常。
成本跟踪约 8.5% 的 token 节省,所以技能 arm 应该大约便宜 10%,而且按每个任务计算,它确实如此。但我们完整运行中的原始 arm 总计显示技能 arm 贵 11.6%:40.60 美元 vs. 36.39 美元。整个反转来自单次试验:一次依赖审计任务在技能 arm 中膨胀超过 200k 长上下文定价层,计费 8.29 美元 vs. 0.33 美元。在较早的运行中,同样的任务在基线 arm 中抛出了 3.25 美元的离群值。这是任务的属性,而非技能的属性。
安全、对风格诚实、对节省宣传过度。强制启用时,Caveman 能可靠地改变 agent 的说话方式,而对 agent 产生的东西没有任何可测量的损害:82 个配对任务,符号检验 p = 0.82。但在真实 agentic 工作中,它最多修剪约 8.5% 的输出 token 和约 10% 的成本,因为主导 agent 会话的 token 是代码和工具调用,这些是技能刻意保留的。宣传的 65% 属于聊天风格的问答,而非编码 agent。
建议:如果你喜欢它就用它。这很有趣,而且对质量的影响几乎可以忽略不计。只是不要期望在日常 agentic 任务中获得巨大节省:个位数百分比是现实的上限。
质量:没有可检测的下降:8 个任务更好,10 个更差,64 个持平;平均任务分数相差 0.015(在 0-1 尺度上)(p = 0.82)。
Token:在激活强制的情况下输出 token 减少 8.5%,这意味着这是理论上限;自动触发使用节省更少或不节省。
成本:期望中大约减少 10%,常常被单次试验的方差抵消。
方法论加分:我们最初的 10 任务运行"显示"了 -30% 的 token 节省。它随着样本量增长而消散。永远不要相信 k=1 的评估。
你想测试下一个技能吗?在评论中放名字。少数词语足矣。我们测试。
运行详情:Harbor 0.17;claude-sonnet-5,推理努力低;SkillsBench 86/87 任务;约 240 次试验;总支出约 106 美元。
感谢你们!
本系列第 3 部分,我们采用公开的"token 节省"编码 agent 附加组件,针对每个组件运行相同的配对 A/B 基准测试。第 1 部分是 caveman 技能(宣传 -65%,测量 -8.5%)。第 2 部分是 rtk(宣传 -60-90%,测量 +7.6%)。我们运行了 80 个配对任务来测试这匹...
今天,我们推出了 JetBrains Context,一个新的代码库智能层,帮助编码 agent 更高效地工作,并在复杂代码库上产生更高质量的结果。作为 JetBrains AI for Teams and Organizations 推出的一部分,JetBrains Context 现已在早期访问中提供...
"rtk"是否减少了 Claude Code token 使用?本系列第 2 部分,我们采用公开的"token 节省"编码 agent 附加组件,针对每个组件运行相同的配对 A/B 基准测试。第 1 部分是 caveman 技能(宣传 -65%,测量 -8.5%)。简而言之:rtk 宣传节省:60-90%。测量...
源于 JetBrains 和 GitHub 之间的深度合作,这一集成使 Copilot 在 agent 选择器中原生化,并在你每天已使用的 IDE 中直接提供更稳定的 agent 体验。从 ACP Registry 到原生体验 Copilot 以前可以通过...