加拿大初创公司Backboard提交Terminal-Bench 2.1测评,得分85.4%±0.8%,超越Anthropic和OpenAI自家编程Agent,pass@5达0.888。
我需要先坦白一件事:这不是我做的,是我们工程团队做的。但我有机会来写它,而且我已经等这一刻很久了。
本周我们将 Backboard CLI 提交到了官方 Terminal-Bench 2.1 排行榜。得分:85.4% ± 0.8%,pass@5 为 0.888,运行的是通过 Bedrock 调用的 Claude Opus 4.8。
作为参考,排行榜上目前最高的已发布成绩是 Claude Code(Fable 5)83.8% 和 Codex(GPT-5.5)83.1%。那是 Anthropic 和 OpenAI 自己的编程 Agent。由训练出这些模型的实验室构建。
我们的提交高于所有已发布成绩。目前正在等待排行榜审核,你可以去看每一轮测试的完整记录。
Backboard 是加拿大安大略省 Nepean 的一家初创公司。不是旧金山。不是拥有前沿模型和数十亿算力的实验室。是一支加拿大的团队在构建 AI 基础设施,而 CLI 编程 Agent 只是其中一部分。
Terminal-Bench 是目前最难的 Agent 基准测试之一:89 个真实终端任务,都是那种混乱的多步骤工作,看起来就像开发人员每天面对的实际问题。排行榜上被 AI 领域最大的玩家霸占——他们用自己的 Agent 运行自己的模型。
所以当我们的测试工具在一个我们根本不生产的模型上跑出更高分数时,这告诉我一件我一直相信的事:测试工具(harness)和模型一样重要。Agent 如何规划、如何委托、如何管理上下文,决定了你从一个模型上实际获得多少能力。
测试过程
团队没有 cherry-pick。五个顺序任务,一个相同配置,全部 89 个任务,每个跑 5 次。总共 445 次试验,每一次都算在内。报错的试验计为零。固定数据集、默认设置、无覆盖、日志全公开。
整个测试的总成本:280.72 美元。
我喜欢这个数字。前沿级别的 Agent 编程性能,完全经过基准测试验证,还不到一张 conference 门票的钱。
我们打算开源它
这是最让我兴奋的部分。我们打算开源这个 CLI。很快。
一家初创公司靠囤积是赢不了的。我们赢的方式是让开发者真正用起来、检验它、把它弄坏,然后告诉我们哪里不对。基准测试分数让人注意到你。工具本身还得靠实力说话。
CLI 今天就可以在 backboard.io/cli 获取。它是模型无关的,所以你不会被锁定在任何一家提供商。
如果你试用了,我很乐意听到你的想法,好或坏。我们团队足够小,你的反馈真的能到达构建它的人手中。通常就在同一天。
还有团队的各位:你知道我说的是谁。这是你们的。
证据:Terminal-Bench 2.1 排行榜仓库的 PR #200 | Terminal-Bench 排行榜