针对私有、真实企业代码库评估 AI 编程模型的 Benchmark,弥补了现有评测基于公开代码的偏差,是工程化选型的可靠参考。
.
;+;+;:;+;+;.#
; ;
; . . . . ; .
+ ;
; . . : @;;+;+# +;+;+;+;:;+:#
: : ; . ; ; ; @;+;+.+;:;+;+*
; . . : ; . . : ; @++:;:;+.;;@ ;. . . . .: . ; . . . .; @++;;;;+;:;@
; : ; ; @;+++:@;++;:+ ; : : . :+.+;;;+:;@ ; : + .
; . . . ; ; . ; : . . . . ; . . . . .; ; . . . . .+ + . . . .; ; . . . . .; ; . . :
; : ; ; ; ; : ; . ; . ; ; ; ; :
; . . % . . ; : . . . . ; ; ... . . .; +. . . . .: ;. . :.. .: : . . ::. . . ; . . . .;
: *. @ ; ; +.@ . ; : +: *+ : ; :. %+; +. ; *. *# @: :.*. ;
; . . .;::@;; . . ; :#@;. ..@:. . ;.@%: .:@%:: :. . #+. :@%;. .:@*. .: @+ . #*. . ;@#.;.* . . .:
.::: ..:%@@+@+#... :+:%@@+..:@@@::*.:;@@:..+@@:; *.::#@@#:..:@@#...+@#: :*:%@@+ .:.+::..*@@:@@@#;.. ::.#
+@#.@ .*@: .*@%: *: :@%. ;@@: .@%. @ .;@@: .: :@#..#@*.
+@#.@ .@ .*@%:. *: %+ ;@@: #; +# .;@@: .. @: .#@*.
@. .. ;@ .*@%: *: @@ ;@@: %# * # .;@@: @+ .@
:*#.. @:: @. . ::;. @@ .. . @% .*@ ;@.
%.@ .. .@; . @@ .. .@@. .. @:#
... . ;%# . @@ +;#: .. .@ @
. ... ... .. ..
... .. ... .
今天我们正式发布 Real-SWE,这是一套用于评估前沿 AI 模型在私有、真实企业代码库上表现的基准测试。每一项任务都来自我们从真实公司授权的私有生产代码库。这些是他们的工程师日常工作中的真实问题,包含了现有产品所带来的所有上下文和复杂性。
私有代码库。 AI 智能体必须能够在专有系统中导航,这类系统的代码和解决方案在公共互联网上无法找到。
带有业务后果的工作。 正确计算账单、核算税费、迁移客户。影响企业运营方式的各种变更,往往横跨多个服务。
企业特定的复杂性。 每家公司都有自己的规范和编写代码的方式。AI 智能体必须理解这些约定,并做出与现有代码相契合的变更。
AI 智能体能否真正完成现实世界中的软件工程师工作?
| 排名 | 模型 | Harness | 解决率 |
|---|---|---|---|
| 1 | Fable 5.1 | Claude Code | 38.8% |
| 2 | GPT-6 Astra | Codex CLI | 33.8% |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31.2% |
| 4 | GLM 5.3 | Claude Code | 28.8% |
| =5 | Grok 4.6 | Grok Build | 23.8% |
| =5 | Muse Spark 1.3 | Muse Code | 23.8% |
| 7 | Kimi K3 | Kimi Code | 18.8% |
| 8 | GPT-5.6 Sol | Codex CLI | 16.2% |
解决率等同于 pass@1,取每个任务八次独立运行的平均值。图中展示了 95% 置信区间。
1Fable 5.1Claude Code解决率: 38.8%
2GPT-6 AstraCodex CLI解决率: 33.8%
3Gemini 3.8 FlashGemini CLI解决率: 31.2%
4GLM 5.3Claude Code解决率: 28.8%
=5Grok 4.6Grok Build解决率: 23.8%
=5Muse Spark 1.3Muse Code解决率: 23.8%
7Kimi K3Kimi Code解决率: 18.8%
8GPT-5.6 SolCodex CLI解决率: 16.2%
专家生成或合成任务可以设计得很好,但它们并非真实公司工程师需要完成的逐字逐句的实际任务。我们的任务在两个维度上有所不同:底层编码产物和指令的具体性。两者都增加了挑战当前前沿模型的复杂性。
我们使用原生 Harness 来反映企业工程师的实际工作方式,评估的是模型与 Harness 的组合,而非孤立地对模型进行评测。
正确的账单结算取决于业务规则和外部服务
修复发票账单,使每个企业正确计算税费,且免税客户不被征税。
周一账单调单重新开放,而该服务开具的每张发票都没有征税。平台上的每个企业结算税费的方式各不相同:有些自行维护税率,有些希望每张发票按照买方的目的地通过我们的税务机关合作方定价,有些则完全不征税,而持有免税证明的客户无论其企业配置如何都不被征税。目的地定价需要将两个地址、已定价的行项目以及该企业销售的商品类别提交给税务机关,根据企业账户选择沙箱环境还是生产环境;如果税务机关拒绝某个地址,必须上报但不能阻止发票开具。税率、税额和总额应显示在开具的发票上,一旦发票结清,销售记录需按照该发票编号回传给税务机关,以便对账。欧盟双方之间的发票需显示双方的 VAT 注册号。税务机关和账本分别可通过 TAX_JAR_URL、PROD_TAX_JAR_URL 和 INFLUX_URL 访问。
AI 智能体跨代码、基础设施和业务工具工作
Real-SWE 任务环境中跨工具和服务的示意图。每个任务只暴露其工作流所需的服务。
我们通过严格的筛选流程选择代码库,聚焦于拥有大量用户、强大工程团队和高要求生产工作负载的真实公司。以下分析中的示例任务来自这些代码库:
我们优先选择为满足真实用户或业务需求而编写的代码,而非单纯为创建基准测试任务而编写的代码。生产工程需要理解现有架构、保留用户依赖的行为,并在真实的运营约束内进行变更。
简短的指令可能涉及跨多个文件的修改
我们的任务描述所需的变更,由 AI 智能体在代码库和周边工具中发现实现细节。验证器所需的任何行为都必须被说明或合理可发现。这导致我们的提示略微不够具体,大致与 DeepSWE 和 Terminal Bench 相当,但足够具体以至于不会遗漏指令。
这项工作是跨功能的且复杂的:单个变更可能跨越应用的多个部分。AI 智能体必须理解现有业务逻辑和公司编码模式,同时保持周围系统正常运行。
| 数据集 | 提示长度 · 中位数 |
|---|---|
| FrontierCode | 2,056 字符 |
| DeepSWE | 1,975 字符 |
| Terminal-Bench 3 | 1,584 字符 |
| FrontierSWE v2 | 992 字符 |
| Real-SWE | 1,742 字符 |
典型的 Real-SWE 指令为 1,742 字符。
| 数据集 | 参考方案修改的文件数 · 中位数 |
|---|---|
| FrontierCode | 6 |
| DeepSWE | 6 |
| Real-SWE | 11 |
Real-SWE 的参考方案修改了 11 个文件,而 FrontierCode 和 DeepSWE 均为 6 个。
所有数字均为中位数。FrontierCode 和 DeepSWE 使用 Cognition 发布的对比数据;FrontierCode 包含任务描述和代码库指南。我们测量了 Terminal-Bench 3 的 74 个任务、FrontierSWE v2 的 34 个任务以及 Real-SWE 的八个有代码库支撑的示例任务中的指令文件字符数。字符数四舍五入到最接近的整数。Terminal-Bench 3 和 FrontierSWE v2 未包含可比较的文件修改数。
即便在短期 rollout 中,模型也会失败。
71.4% 的发布在 10 分钟内失败,而超过 10 分钟的发布失败率为 73.4%。
同时处理多个系统并理解满是既有业务逻辑和编码模式的代码库中的需求,是一件困难的事。
10 分钟以内 70/98 失败
10 分钟或更长 398/542 失败
每项任务都源自私有、真实企业代码库,或从中直接提取。我们认为这类任务非常有趣,原因有三:
私有代码库上的任务天然处于分布之外。这类编码任务在互联网上无处可得,任何其他 AI 智能体模型都不太可能曾经训练过它们。真实企业中有 99% 的 token 都对前沿模型隐藏着。
这些任务具有经济价值。每项任务都与企业支出有直接关联,且曾分配给领取薪水的工程师完成。大多数基准测试评估的是有趣的、实验性的能力,而这些能力在现实世界中往往不太可能普及。
企业特定的工程模式很重要。AI 生成的代码是否符合真实企业的水准?我们的结果表明,我们离这一现实还很远。许多企业重视代码标准和模式。我们发现,当今的模型在理解企业编码模式方面较弱,而且经常遗漏需求或不去验证自己的假设。
以下是对我们基准测试中一小部分任务的分析。如果你对样本感兴趣,在此申请访问。
6 of 10 tasks have resolution rates below 15%(10 个任务中有 6 个的解决率低于 15%)
选择一项任务查看模型结果。百分比显示总体解决率。
Multi-region sweep 67.2% ⌄
API keys & environments 65.6% ⌄
Entitlement overage lines 50.0% ⌄
Customer identity migration 40.6% ⌄
Billing schedule migration 14.1% ⌄
API token metering 12.5% ⌄
S3 datastore measurement 10.9% ⌄
Linearizable scan 4.7% ⌄
Tax jurisdiction 3.1% ⌄
Analytics stream reducer 0.0% ⌄
Task Fable 5.1 GPT-6 Astra Gemini 3.8 Flash GLM 5.3 Grok 4.6 Muse Spark 1.3 Kimi K3 GPT-5.6 Sol Resolution rate
Multi-region sweep 7/8 8/8 8/8 2/8 3/8 8/8 2/8 5/8 67.2%
API keys & environments 8/8 5/8 7/8 5/8 4/8 6/8 0/8 7/8 65.6%
Entitlement overage lines 8/8 7/8 5/8 3/8 1/8 1/8 6/8 1/8 50.0%
Customer identity migration 3/8 1/8 3/8 4/8 8/8 3/8 4/8 0/8 40.6%
Billing schedule migration 3/8 1/8 2/8 2/8 0/8 0/8 1/8 0/8 14.1%
API token metering 1/8 5/8 0/8 1/8 0/8 0/8 1/8 0/8 12.5%
S3 datastore measurement 0/8 0/8 0/8 3/8 2/8 1/8 1/8 0/8 10.9%
Linearizable scan 0/8 0/8 0/8 2/8 1/8 0/8 0/8 0/8 4.7%
Tax jurisdiction 1/8 0/8 0/8 1/8 0/8 0/8 0/8 0/8 3.1%
Analytics stream reducer 0/8 0/8 0/8 0/8 0/8 0/8 0/8 0/8 0.0%
每个任务每个模型有 8 次发布。
6 of 10 tasks have resolution rates below 15%(10 个任务中有 6 个的解决率低于 15%)
选择一项任务查看模型结果。百分比显示总体解决率。
Missed requirements are the most common failure(遗漏需求是最常见的失败原因)
Failures are grouped by observed submission behavior using the same taxonomy across models, following DeepSWE.(失败按观察到的提交行为分组,使用跨模型相同的分类法,遵循 DeepSWE。)
No model solves every task(没有模型能解决所有任务)
One square per rollout: each row is a task, each column a trial, eight trials per task for every model.(每个发布一个小方块:每行是一个任务,每列是一次试验,每个任务的每个模型有八次试验。)
Percentages are out of each model's failed runs, not all runs.(百分比基于每个模型失败运行的次数,而非所有运行。)
Unverified assumption(未验证的假设)
Builds on a guess about the system instead of checking it in the workspace.(基于对系统的猜测进行构建,而不是在工作区中验证它。)
Missed requirement(遗漏的需求)
Leaves out behavior the instruction requires.(遗漏了指令要求的行为。)
Integration error(集成错误)
Right idea, wired into the surrounding system incorrectly.(想法是对的,但接入周围系统时出错。)
Regression(回归)
Breaks existing behavior while making the change.(在进行更改时破坏了现有行为。)
Wrong file 将变更投递到运行中的应用从不调用的地方,例如一次性脚本。
GLM 5.37.0%:4/57 次失败运行
Kimi K33.1%:2/65 次失败运行
Fable 5.10%:0/49 次失败运行
GPT-6 Astra0%:0/53 次失败运行
Gemini 3.8 Flash0%:0/55 次失败运行
Grok 4.60%:0/61 次失败运行
Muse Spark 1.30%:0/61 次失败运行
GPT-5.6 Sol0%:0/67 次失败运行
将变更投递到运行中的应用从不调用的地方,例如一次性脚本。
GLM 5.37.0%:4/57 次失败运行
Kimi K33.1%:2/65 次失败运行
Fable 5.10%:0/49 次失败运行
GPT-6 Astra0%:0/53 次失败运行
Gemini 3.8 Flash0%:0/55 次失败运行
Grok 4.60%:0/61 次失败运行
Muse Spark 1.30%:0/61 次失败运行
GPT-5.6 Sol0%:0/67 次失败运行
03Effort & the Frontier
更高的成本不能保证更高的解决率
成本(美元)输出 tokens估计前沿
1Fable 5.138.8% · $6.962
2GPT-6 Astra33.8% · $4.673
3Gemini 3.8 Flash31.2% · $2.504
4GLM 5.328.8% · $5.125
5Grok 4.623.8% · $3.446
6Muse Spark 1.323.8% · $2.747
7Kimi K318.8% · $3.908
8GPT-5.6 Sol16.2% · $2.65
预计发布成本范围从 $2.50 到 $6.96
滑动图表查看所有任务。
每个智能体都在隔离的沙箱中运行。所有任务均采用 Harbor 格式,验证器在评分时注入。验证器的灵感来源于代码库中现有的测试套件或直接使用这些测试。