Claude Fable 5.1 在 SWE-bench 仅 38.8% 通过率却拿下第一,说明当前 AI 编程工具仍有六成失败率,benchmark 刷榜与实际可用性存在落差。
Claude Fable 5.1 在一项新的编程基准测试中夺魁,尽管它失败率超过六成。38.8% 的成绩来自 Real-SWE,这是由 Y Combinator 支持的 Specific Labs 推出的基准测试,对编程 Agent 采用了截然不同的评估方式:不再从公开代码库中抽取问题,而是将它们投入真实企业的私有代码库中,要求处理与工程师日常工作相似的任务。
这些代码及其解决方案未公开,这使得它们出现在模型训练数据中的可能性进一步降低。Specific Labs 无法保证模型完全未接触过任何代码,但该公司表示使用私有代码大大降低了这种可能性。该公司还估计,现实企业中有 99% 的 token 对前沿模型是不可见的。一旦 Agent 被投入到陌生的代码领地,分数便急剧下降。
通过 Claude Code 运行的 Fable 5.1 以 38.8% 领先,Codex CLI 上的 GPT-6 Astra 以 33.8% 位居其后,Gemini CLI 上的 Gemini 3.8 Flash 则为 31.2%。
此后分数大幅下降。GLM 5.3 为 28.8%,Grok 4.6 和 Muse Spark 1.3 均为 23.8%,Kimi K3 为 18.8%,GPT-5.6 Sol 仅为 16.2%。
每个模型在每项任务上有八次尝试机会。Real-SWE 还使用各自的编码工具测试每个模型——Fable 5.1 配 Claude Code、Astra 配 Codex CLI、 Gemini 3.8 Flash 配 Gemini CLI——因此分数反映的是完整配置(而非仅模型本身)。
正如 GPT-6 Astra 的 ARC-AGI 分数所示,改变模型的支撑框架(scaffolding)会改变其表现。例如,在 Cursor 中运行的 Fable 5.1 可能产生截然不同的结果。
Real-SWE 使用从真实企业授权的专有代码,包括一款拥有超过 20 万用户的消费产品和一款处理过超过 10 万份银行对账单的金融科技平台。任务还分布在代码库各处,Real-SWE 解决方案涉及的中位文件数为 11 个,几乎是 FrontierCode 和 DeepSWE 等基准测试中 6 个文件中位数的两倍。
单看各任务,分数进一步下降,10 项任务中有 6 项成功率低于 15%。计费计划迁移的修复率为 14.1%,API token 计量为 12.5%,S3 存储追踪为 10.9%,线性化扫描仅为 4.7%,而税务辖区 bug 的修复率仅为 3.1%。
在全部 64 次尝试中,没有任何模型成功解决 analytics stream reducer。与此同时,Astra 和 Gemini 在多区域扫描中 8 次全对,Fable 解决了 8 次中的 7 次,但这三者在线性化扫描任务上每次尝试都失败了。在整个基准测试中,没有任何 Agent 能持续保持可靠。
Fable 5.1 最常出现需求遗漏(36.7%)或遭遇集成错误(34.7%)。Astra 的失败中集成错误和未验证假设各占 34%。
集成错误出现在 Gemini 3.8 Flash 近一半的失败运行中,而 GPT-5.6 Sol 在 43.3% 的失败中做出了未验证的假设。
Real-SWE 并不能证明公开编程基准测试因数据污染而被夸大,且 10 项任务仍然是一个较小的样本。
但表现最佳的 Agent 在很可能是首次接触的私有代码上仍然失败了超过 60%,这表明解决编程问题与在陌生的生产代码库中找到方向是完全不同的两回事。