mini-swe-agent在调试任务上Token消耗比Codex CLI低54%、通过率更高,简单bash+线性历史配置表现强劲。
DeepSWE 的评测对比让我产生了兴趣,于是在一组匹配的调试任务上用 GPT-5.6 SOL(High reasoning模式)跑了 mini-swe-agent。
当前的数据出乎我的意料:
Codex CLI High:151.91M tokens,60% 通过率
plain mini-swe-agent:70.33M tokens,67%
同样的 mini harness 加上 macro execution(不改变 prompt):60.59M tokens,78%
也就是说 plain mini-swe-agent 比 Codex 节省了约 54% 的 tokens,同时得分还高了 7 个百分点。在这个小规模的消融实验中,仅改变执行方式就又削减了约 14% 的 tokens,并提升了 11 个百分点。
这并不能证明它全面更优。这只是一组匹配的基准测试切片,DeepSWE 本身也指出 prompt 调优可能部分解释了这个 harness 差距。不过对于调试场景而言,这个极简的"bash + 线性历史"组合看起来异常强大。
有人用它做过日常 bug 修复或功能开发吗?在基准测试之外什么东西最先出问题:仓库配置、长时间运行的测试、权限,还是 patch 质量?
我的跑分记录:https://turaai.net/benchmark
mini-swe-agent:https://github.com/swe-agent/mini-swe-agent
DeepSWE 的解读:https://deepswe.datacurve.ai/blog/deepswe
Disclosure:我是 Tura 的维护者,以上基准测试也是我跑的。
