性能基准监测工具实时展示Claude Code的日常表现和退化情况,为程序员选择工具提供透明的质量参考。
我们正在使用 Opus 5.0 为 Claude Code 在 SWE 任务上收集新的性能基准。
• 每日更新:SWE-Bench-Pro 精选子集上的每日基准
• 检测下降:用于检测性能下降的统计测试
• 所见即所得:我们直接在 Claude Code CLI 中使用 SOTA 模型(当前为 Opus 5.0)进行基准测试,无自定义工具。
启用 95% CI 复选框显示置信区间
相同的不确定性切换适用于 7 天时间窗口。
基准数据正在收集中。
建立基准后,性能差异将可用。
每日总输入使用量
每日总输出使用量
按天的每实例运行时间
按天的总工具调用数
这个追踪器的目标是在 Claude Code 与 Opus 5.0 在 SWE 任务中的性能中检测统计上显著的下降。我们是与前沿模型提供者无关的独立第三方。
背景:2025 年 9 月,Anthropic 发布了关于 Claude 性能下降的事后分析报告。我们希望提供一个资源来在未来检测这类下降。
我们每天在 SWE-Bench-Pro 的精选、抗污染子集上运行 Claude Code CLI 的评估。我们始终使用最新可用的 Claude Code 发布版本和 SOTA 模型(当前为 Opus 5.0)。基准测试直接在 Claude Code 中运行,无自定义工具框架,因此结果反映实际用户可以期望的效果。这使我们能够检测与模型更改和工具变化相关的性能下降。
每个日常评估在 N=50 个测试实例上运行,因此每日变异性是预期的。周度和月度结果聚合以获得更可靠的估计。
我们将测试建模为伯努利随机变量,并计算围绕每日、每周和每月通过率的 95% 置信区间。报告任何这些时间范围内的统计上显著差异。