Backboard CLI在Terminal-Bench 2.1达到85.4%准确率,超越Claude Code和Codex,完全基于外部模型Claude Opus 4.8,单次运行成本280美元。
本周我们向官方 Terminal-Bench 2.1 排行榜提交了 Backboard CLI。数据如下:
准确率:85.4% ± 0.8%
覆盖范围:89 个任务 × 5 次尝试 = 445 次试验,全部纳入
模型:通过 AWS Bedrock 调用 Claude Opus 4.8
完整运行总成本:$280.72
本次提交超过了排行榜上所有已发布的参赛作品。当前进度最快的已发布结果分别是 Claude Code(Fable 5)83.8% ± 1.2% 和 Codex(GPT-5.5)83.1% ± 1.1%。我们的 PR 已开放并等待审核,所有试验日志均已公开。
Terminal-Bench 2.1 衡量的是开发者实际做的事情:真实终端环境中的多步骤任务。构建失败、依赖混乱、约束条件下的调试。这是目前最具可信度的 Agent 编程基准测试之一。
排行榜的顶级选手都是由开发底层模型的实验室构建的 Agent。Claude Code 是 Anthropic 自家的 Agent 运行在自家模型上。Codex 是 OpenAI 自家的 Agent 运行在自家模型上。
Backboard CLI 超越了他们双方。而且是在一个我们并不生产的模型上做到的。
这才是重点。Harness 决定成败。一个 Agent 如何分解任务、如何委托给有边界的子上下文、如何管理进入上下文窗口的内容,决定了你从一个模型中能榨取出多少能力。我们的 CLI 建立在递归编程引擎之上,围绕的正是这一点,这意味着性能并不绑死在任何单一的前沿模型上。同样的 harness,换一个模型,依然能打。我们已经在 GLM 5.2(一个完全开源的模型)上运行了同样的 harness,在该基准上得分 72%。如果你在乎成本,或者在乎在自己掌控的基础设施上运行编程 Agent,这很重要。
没有 cherry-picking,没有重新造数据,没有覆盖:
同一 Agent 配置下五个顺序任务
固定数据集(SHA-256 验证),默认设置
全部 445 次试验纳入报告数字
出错的试验按零奖励计分
完整日志已上传并公开
基准测试只有在你能核查时才有意义。来查我们的:PR #200。
我们即将开源 CLI
Backboard CLI 将要开源。很快。
我们构建的是与模型无关的基础设施。整个thesis就是:你不应该被锁死在某个实验室、某个模型或某个供应商的 Agent 上。开源 CLI 就是这个thesis的实践:拿走这个 harness,指向你想用的模型,在你想要的地方运行它。
关注这个空间,或者 follow 我们获取发布公告。
你不必等到仓库开放。CLI 现在就可以在 backboard.io/cli 获取。
Backboard 是一家加拿大公司,构建全栈、与模型无关的 AI 基础设施:在 LoCoMo 和 LongMemEval 上记忆排名第一路由跨越 17000+ 模型、Agent 混合 RAG,以及一个 API key背后的有状态线程。CLI 是这个平台的其中一个界面。
使用任何模型。保持你的选择开放。更快交付。
来源:Terminal-Bench 2.1 排行榜 | 排行榜提交 PR #200