前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8336
  • Perplexity 用 GPT-6 Astra 接管端到端系统
  • OpenAI 用 AI 写代码再用 AI 审查:Codex 安全门禁实践
  • 生产环境 LLM 推理性能与可靠性优化实战
  • 多 AI 协作必须设计交接机制而非仅靠上下文
  • deepseek-harness 体验:22 万星的开源 AI 插件框架
  • Cognition 发布 SWE-2:低成本对标 Fable 5.1 的代码模型
  • 边缘 AI 部署:LLM 优化最佳实践
  • 边缘设备 LLM 扩展:完整技术指南
  • VS Code 1.137:AI 自动化、语音模式与 GitHub 深度集成
  • Real-SWE:基于私有企业代码库的 AI 模型基准测试
  • OpenResearch:本地优先的多 Agent 研究工作台
  • Check:给 Claude Code 加幻觉防护层
  • Postman 集合一键转为 MCP 工具:实操路径
  • NestJS 测试覆盖提升与安全加固实战
  • Next.js Serverless 下 PDFKit 字体缺失修复
  • 评测编码Agent前,先用同一组任务跑两遍
  • LLM Wiki:文档自动构建可维护知识库的开源桌面应用
  • 深入解析结构化输出:让 AI 生成绝对可解析的 JSON
  • MCP安全核心是权限体系重设计,而非传统边界防护
  • GPT-6 Astra 在机器人基准测试中展现空间推理飞跃
  • Auterix:零依赖通用协议,跨 21 个 AI 工具统一上下文规范
  • 后量子 TLS 是平台迁移工程,不是密码学研究
  • Anthropic 发布 AI-Native SDLC 实践手册:代码不再是瓶颈
  • OpenAI 建议 GPT-6 Astra 提示词应精简,减少安全限制
  • Claude Code 创始人:AI 编程要守住代码质量标准
  • Hyperresearch:Agent 驱动的研究知识库,单次跑 250+ 信源
  • 12 个已落地的 B2B 营收 AI Agent 用例,附代码
  • LLM 项目上线后才会暴露的 6 个隐蔽 Bug
  • OpenAI 代理向 RubyGems 上传两千恶意包
  • AI 时代缓存失效难题复发:LLM 推理的隐性成本
  • Google发布TimesFM-3:单次前向传播即可完成多步时间序列预测
  • 阿里 Qoder CLI 开放自定义模型接入
  • 开源项目 Minitap 指控谷歌盗用代码用于 Artemis,许可证违规引热议
  • GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学能力达新里程碑
  • Kimi K2.8发布:性能逼近K3百万上下文全员开放
  • DeepSeek v4.1-Flash发布:763B参数新型因果编解码架构
  • AI Agent 何时该停:成本控制的核心工程问题
  • 三大AI编程工具实战对比:Claude Code六个月生产级使用报告
  • Trail of Bits开源Coop:用隔离VM安全运行Claude Code和Codex
  • OpenAI代理今年5月攻击RubyGems详情披露
  • 已加载 40 / 8336
8.0
热点
AI SCORE
技术实践2026-09-13 04:25

Real-SWE:基于私有企业代码库的 AI 模型基准测试

Hacker News#AI编程#Benchmark#代码库
Editor brief · 编辑速览

针对私有、真实企业代码库评估 AI 编程模型的 Benchmark,弥补了现有评测基于公开代码的偏差,是工程化选型的可靠参考。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Real-SWE:在私有、真实企业代码库上对 AI 模型进行基准测试

                                                                                                        
                                                                                                        
                                                                              .                         
;+;+;:;+;+;.#                                                                                           
;           ;                                                                                           
; .   . . . ;                                    .                                                      
+           ;                                                                                           
; .     .   : @;;+;+#                            +;+;+;+;:;+:#                                          
:           : ;     .       ;                    ;           ;              @;+;+.+;:;+;+*              
; . .       : ; . . :       ;       @++:;:;+.;;@ ;. . .   . .:     .        ; .     . . .;  @++;;;;+;:;@
;           : ;     ; @;+++:@;++;:+ ;          : :           . :+.+;;;+:;@  ;            :  +          .
; . .   .   ; ;   . ; : . . . .     ; . . . . .; ;  . . . . .+ +  . . . .;  ; . .   . . .;  ;     . .  :
;           : ;     ; ;           ; :          ; .           ; .         ;  ;            ;  ;          :
;       . . %   . . ; : . .   . . ; ; ... . . .; +. .   . . .: ;. . :.. .:  : . . ::. .  .  ; .   . . .;
:        *. @ ;     ; +.@     .   ; : +:    *+ : ;    :.     %+;    +.   ;  *.    *#     @: :.*.       ;
; .   . .;::@;; . . ; :#@;. ..@:. . ;.@%: .:@%:: :. . #+.   :@%;. .:@*. .:  @+  . #*. . ;@#.;.*   . . .:
.::: ..:%@@+@+#... :+:%@@+..:@@@::*.:;@@:..+@@:; *.::#@@#:..:@@#...+@#: :*:%@@+ .:.+::..*@@:@@@#;.. ::.#
        +@#.@         .*@:  .*@%:     *:   :@%.      ;@@:   .@%.    @     .;@@:   .:    :@#..#@*.       
        +@#.@          .@   .*@%:.    *:    %+       ;@@:    #;     +#    .;@@:   ..     @: .#@*.       
         @. ..         ;@   .*@%:     *:    @@       ;@@:    %#    * #    .;@@:          @+  .@         
        :*#..          @::    @.       .   ::;.       @@     ..     .       @%          .*@  ;@.        
        %.@            ..    .@;            .         @@     ..            .@@.          ..  @:#        
        ...             .    ;%#             .        @@                   +;#:          .. .@ @        
         .                   ...                      ...                   ..               ..         
                              ...                     ..                   ...                .

今天我们正式发布 Real-SWE,这是一套用于评估前沿 AI 模型在私有、真实企业代码库上表现的基准测试。每一项任务都来自我们从真实公司授权的私有生产代码库。这些是他们的工程师日常工作中的真实问题,包含了现有产品所带来的所有上下文和复杂性。

私有代码库。 AI 智能体必须能够在专有系统中导航,这类系统的代码和解决方案在公共互联网上无法找到。

带有业务后果的工作。 正确计算账单、核算税费、迁移客户。影响企业运营方式的各种变更,往往横跨多个服务。

企业特定的复杂性。 每家公司都有自己的规范和编写代码的方式。AI 智能体必须理解这些约定,并做出与现有代码相契合的变更。

AI 智能体能否真正完成现实世界中的软件工程师工作?

排名 模型 Harness 解决率
1 Fable 5.1 Claude Code 38.8%
2 GPT-6 Astra Codex CLI 33.8%
3 Gemini 3.8 Flash Gemini CLI 31.2%
4 GLM 5.3 Claude Code 28.8%
=5 Grok 4.6 Grok Build 23.8%
=5 Muse Spark 1.3 Muse Code 23.8%
7 Kimi K3 Kimi Code 18.8%
8 GPT-5.6 Sol Codex CLI 16.2%

解决率等同于 pass@1,取每个任务八次独立运行的平均值。图中展示了 95% 置信区间。

1Fable 5.1Claude Code解决率: 38.8%

2GPT-6 AstraCodex CLI解决率: 33.8%

3Gemini 3.8 FlashGemini CLI解决率: 31.2%

4GLM 5.3Claude Code解决率: 28.8%

=5Grok 4.6Grok Build解决率: 23.8%

=5Muse Spark 1.3Muse Code解决率: 23.8%

7Kimi K3Kimi Code解决率: 18.8%

8GPT-5.6 SolCodex CLI解决率: 16.2%

专家生成或合成任务可以设计得很好,但它们并非真实公司工程师需要完成的逐字逐句的实际任务。我们的任务在两个维度上有所不同:底层编码产物和指令的具体性。两者都增加了挑战当前前沿模型的复杂性。

我们使用原生 Harness 来反映企业工程师的实际工作方式,评估的是模型与 Harness 的组合,而非孤立地对模型进行评测。

真实公司任务需要企业特定的上下文

正确的账单结算取决于业务规则和外部服务

修复发票账单,使每个企业正确计算税费,且免税客户不被征税。

周一账单调单重新开放,而该服务开具的每张发票都没有征税。平台上的每个企业结算税费的方式各不相同:有些自行维护税率,有些希望每张发票按照买方的目的地通过我们的税务机关合作方定价,有些则完全不征税,而持有免税证明的客户无论其企业配置如何都不被征税。目的地定价需要将两个地址、已定价的行项目以及该企业销售的商品类别提交给税务机关,根据企业账户选择沙箱环境还是生产环境;如果税务机关拒绝某个地址,必须上报但不能阻止发票开具。税率、税额和总额应显示在开具的发票上,一旦发票结清,销售记录需按照该发票编号回传给税务机关,以便对账。欧盟双方之间的发票需显示双方的 VAT 注册号。税务机关和账本分别可通过 TAX_JAR_URL、PROD_TAX_JAR_URL 和 INFLUX_URL 访问。

AI 智能体跨代码、基础设施和业务工具工作

Real-SWE 任务环境中跨工具和服务的示意图。每个任务只暴露其工作流所需的服务。

我们通过严格的筛选流程选择代码库,聚焦于拥有大量用户、强大工程团队和高要求生产工作负载的真实公司。以下分析中的示例任务来自这些代码库:

  • 一款 Luma/Partiful 竞品,拥有 20 万以上用户,App Store 排名前 100
  • 一款处理 10 万以上银行对账单的消费金融科技平台
  • 支持复杂企业工作流程的企业级 AI 销售平台

我们优先选择为满足真实用户或业务需求而编写的代码,而非单纯为创建基准测试任务而编写的代码。生产工程需要理解现有架构、保留用户依赖的行为,并在真实的运营约束内进行变更。

简短的指令可能涉及跨多个文件的修改

我们的任务描述所需的变更,由 AI 智能体在代码库和周边工具中发现实现细节。验证器所需的任何行为都必须被说明或合理可发现。这导致我们的提示略微不够具体,大致与 DeepSWE 和 Terminal Bench 相当,但足够具体以至于不会遗漏指令。

这项工作是跨功能的且复杂的:单个变更可能跨越应用的多个部分。AI 智能体必须理解现有业务逻辑和公司编码模式,同时保持周围系统正常运行。

数据集 提示长度 · 中位数
FrontierCode 2,056 字符
DeepSWE 1,975 字符
Terminal-Bench 3 1,584 字符
FrontierSWE v2 992 字符
Real-SWE 1,742 字符

典型的 Real-SWE 指令为 1,742 字符。

数据集 参考方案修改的文件数 · 中位数
FrontierCode 6
DeepSWE 6
Real-SWE 11

Real-SWE 的参考方案修改了 11 个文件,而 FrontierCode 和 DeepSWE 均为 6 个。

所有数字均为中位数。FrontierCode 和 DeepSWE 使用 Cognition 发布的对比数据;FrontierCode 包含任务描述和代码库指南。我们测量了 Terminal-Bench 3 的 74 个任务、FrontierSWE v2 的 34 个任务以及 Real-SWE 的八个有代码库支撑的示例任务中的指令文件字符数。字符数四舍五入到最接近的整数。Terminal-Bench 3 和 FrontierSWE v2 未包含可比较的文件修改数。

即便在短期 rollout 中,模型也会失败。

71.4% 的发布在 10 分钟内失败,而超过 10 分钟的发布失败率为 73.4%。

同时处理多个系统并理解满是既有业务逻辑和编码模式的代码库中的需求,是一件困难的事。

10 分钟以内 70/98 失败

10 分钟或更长 398/542 失败

每项任务都源自私有、真实企业代码库,或从中直接提取。我们认为这类任务非常有趣,原因有三:

私有代码库上的任务天然处于分布之外。这类编码任务在互联网上无处可得,任何其他 AI 智能体模型都不太可能曾经训练过它们。真实企业中有 99% 的 token 都对前沿模型隐藏着。

这些任务具有经济价值。每项任务都与企业支出有直接关联,且曾分配给领取薪水的工程师完成。大多数基准测试评估的是有趣的、实验性的能力,而这些能力在现实世界中往往不太可能普及。

企业特定的工程模式很重要。AI 生成的代码是否符合真实企业的水准?我们的结果表明,我们离这一现实还很远。许多企业重视代码标准和模式。我们发现,当今的模型在理解企业编码模式方面较弱,而且经常遗漏需求或不去验证自己的假设。

以下是对我们基准测试中一小部分任务的分析。如果你对样本感兴趣,在此申请访问。

6 of 10 tasks have resolution rates below 15%(10 个任务中有 6 个的解决率低于 15%)

选择一项任务查看模型结果。百分比显示总体解决率。

Multi-region sweep 67.2% ⌄

  • Fable 5.1 7/8 passed
  • GPT-6 Astra 8/8 passed
  • Gemini 3.8 Flash 8/8 passed
  • GLM 5.3 2/8 passed
  • Grok 4.6 3/8 passed
  • Muse Spark 1.3 8/8 passed
  • Kimi K3 2/8 passed
  • GPT-5.6 Sol 5/8 passed

API keys & environments 65.6% ⌄

  • Fable 5.1 8/8 passed
  • GPT-6 Astra 5/8 passed
  • Gemini 3.8 Flash 7/8 passed
  • GLM 5.3 5/8 passed
  • Grok 4.6 4/8 passed
  • Muse Spark 1.3 6/8 passed
  • Kimi K3 0/8 passed
  • GPT-5.6 Sol 7/8 passed

Entitlement overage lines 50.0% ⌄

  • Fable 5.1 8/8 passed
  • GPT-6 Astra 7/8 passed
  • Gemini 3.8 Flash 5/8 passed
  • GLM 5.3 3/8 passed
  • Grok 4.6 1/8 passed
  • Muse Spark 1.3 1/8 passed
  • Kimi K3 6/8 passed
  • GPT-5.6 Sol 1/8 passed

Customer identity migration 40.6% ⌄

  • Fable 5.1 3/8 passed
  • GPT-6 Astra 1/8 passed
  • Gemini 3.8 Flash 3/8 passed
  • GLM 5.3 4/8 passed
  • Grok 4.6 8/8 passed
  • Muse Spark 1.3 3/8 passed
  • Kimi K3 4/8 passed
  • GPT-5.6 Sol 0/8 passed

Billing schedule migration 14.1% ⌄

  • Fable 5.1 3/8 passed
  • GPT-6 Astra 1/8 passed
  • Gemini 3.8 Flash 2/8 passed
  • GLM 5.3 2/8 passed
  • Grok 4.6 0/8 passed
  • Muse Spark 1.3 0/8 passed
  • Kimi K3 1/8 passed
  • GPT-5.6 Sol 0/8 passed

API token metering 12.5% ⌄

  • Fable 5.1 1/8 passed
  • GPT-6 Astra 5/8 passed
  • Gemini 3.8 Flash 0/8 passed
  • GLM 5.3 1/8 passed
  • Grok 4.6 0/8 passed
  • Muse Spark 1.3 0/8 passed
  • Kimi K3 1/8 passed
  • GPT-5.6 Sol 0/8 passed

S3 datastore measurement 10.9% ⌄

  • Fable 5.1 0/8 passed
  • GPT-6 Astra 0/8 passed
  • Gemini 3.8 Flash 0/8 passed
  • GLM 5.3 3/8 passed
  • Grok 4.6 2/8 passed
  • Muse Spark 1.3 1/8 passed
  • Kimi K3 1/8 passed
  • GPT-5.6 Sol 0/8 passed

Linearizable scan 4.7% ⌄

  • Fable 5.1 0/8 passed
  • GPT-6 Astra 0/8 passed
  • Gemini 3.8 Flash 0/8 passed
  • GLM 5.3 2/8 passed
  • Grok 4.6 1/8 passed
  • Muse Spark 1.3 0/8 passed
  • Kimi K3 0/8 passed
  • GPT-5.6 Sol 0/8 passed

Tax jurisdiction 3.1% ⌄

  • Fable 5.1 1/8 passed
  • GPT-6 Astra 0/8 passed
  • Gemini 3.8 Flash 0/8 passed
  • GLM 5.3 1/8 passed
  • Grok 4.6 0/8 passed
  • Muse Spark 1.3 0/8 passed
  • Kimi K3 0/8 passed
  • GPT-5.6 Sol 0/8 passed

Analytics stream reducer 0.0% ⌄

  • Fable 5.1 0/8 passed
  • GPT-6 Astra 0/8 passed
  • Gemini 3.8 Flash 0/8 passed
  • GLM 5.3 0/8 passed
  • Grok 4.6 0/8 passed
  • Muse Spark 1.3 0/8 passed
  • Kimi K3 0/8 passed
  • GPT-5.6 Sol 0/8 passed

Task Fable 5.1 GPT-6 Astra Gemini 3.8 Flash GLM 5.3 Grok 4.6 Muse Spark 1.3 Kimi K3 GPT-5.6 Sol Resolution rate

Multi-region sweep 7/8 8/8 8/8 2/8 3/8 8/8 2/8 5/8 67.2%

API keys & environments 8/8 5/8 7/8 5/8 4/8 6/8 0/8 7/8 65.6%

Entitlement overage lines 8/8 7/8 5/8 3/8 1/8 1/8 6/8 1/8 50.0%

Customer identity migration 3/8 1/8 3/8 4/8 8/8 3/8 4/8 0/8 40.6%

Billing schedule migration 3/8 1/8 2/8 2/8 0/8 0/8 1/8 0/8 14.1%

API token metering 1/8 5/8 0/8 1/8 0/8 0/8 1/8 0/8 12.5%

S3 datastore measurement 0/8 0/8 0/8 3/8 2/8 1/8 1/8 0/8 10.9%

Linearizable scan 0/8 0/8 0/8 2/8 1/8 0/8 0/8 0/8 4.7%

Tax jurisdiction 1/8 0/8 0/8 1/8 0/8 0/8 0/8 0/8 3.1%

Analytics stream reducer 0/8 0/8 0/8 0/8 0/8 0/8 0/8 0/8 0.0%

每个任务每个模型有 8 次发布。

6 of 10 tasks have resolution rates below 15%(10 个任务中有 6 个的解决率低于 15%)

选择一项任务查看模型结果。百分比显示总体解决率。

Missed requirements are the most common failure(遗漏需求是最常见的失败原因)

Failures are grouped by observed submission behavior using the same taxonomy across models, following DeepSWE.(失败按观察到的提交行为分组,使用跨模型相同的分类法,遵循 DeepSWE。)

No model solves every task(没有模型能解决所有任务)

One square per rollout: each row is a task, each column a trial, eight trials per task for every model.(每个发布一个小方块:每行是一个任务,每列是一次试验,每个任务的每个模型有八次试验。)

Percentages are out of each model's failed runs, not all runs.(百分比基于每个模型失败运行的次数,而非所有运行。)

Unverified assumption(未验证的假设)

Builds on a guess about the system instead of checking it in the workspace.(基于对系统的猜测进行构建,而不是在工作区中验证它。)

  • GPT-5.6 Sol 43.3%: 29 of 67 failed runs
  • GPT-6 Astra 34.0%: 18 of 53 failed runs
  • GLM 5.3 28.1%: 16 of 57 failed runs
  • Grok 4.6 24.6%: 15 of 61 failed runs
  • Fable 5.1 24.5%: 12 of 49 failed runs
  • Muse Spark 1.3 19.7%: 12 of 61 failed runs
  • Kimi K3 15.4%: 10 of 65 failed runs
  • Gemini 3.8 Flash 10.9%: 6 of 55 failed runs

Missed requirement(遗漏的需求)

Leaves out behavior the instruction requires.(遗漏了指令要求的行为。)

  • Grok 4.6 67.2%: 41 of 61 failed runs
  • Kimi K3 53.8%: 35 of 65 failed runs
  • GLM 5.3 38.6%: 22 of 57 failed runs
  • Fable 5.1 36.7%: 18 of 49 failed runs
  • Muse Spark 1.3 36.1%: 22 of 61 failed runs
  • GPT-5.6 Sol 31.3%: 21 of 67 failed runs
  • Gemini 3.8 Flash 29.1%: 16 of 55 failed runs
  • GPT-6 Astra 28.3%: 15 of 53 failed runs

Integration error(集成错误)

Right idea, wired into the surrounding system incorrectly.(想法是对的,但接入周围系统时出错。)

  • Gemini 3.8 Flash 49.1%: 27 of 55 failed runs
  • Muse Spark 1.3 41.0%: 25 of 61 failed runs
  • Fable 5.1 34.7%: 17 of 49 failed runs
  • GPT-6 Astra 34.0%: 18 of 53 failed runs
  • Kimi K3 27.7%: 18 of 65 failed runs
  • GLM 5.3 26.3%: 15 of 57 failed runs
  • GPT-5.6 Sol 16.4%: 11 of 67 failed runs
  • Grok 4.6 8.2%: 5 of 61 failed runs

Regression(回归)

Breaks existing behavior while making the change.(在进行更改时破坏了现有行为。)

  • Gemini 3.8 Flash 10.9%: 6 of 55 failed runs
  • GPT-5.6 Sol 9.0%: 6 of 67 failed runs
  • Fable 5.1 4.1%: 2 of 49 failed runs
  • GPT-6 Astra 3.8%: 2 of 53 failed runs
  • Muse Spark 1.3 3.3%: 2 of 61 failed runs
  • GLM 5.3 0%: 0 of 57 failed runs
  • Grok 4.6 0%: 0 of 61 failed runs
  • Kimi K3 0%: 0 of 65 failed runs

Wrong file 将变更投递到运行中的应用从不调用的地方,例如一次性脚本。

GLM 5.37.0%:4/57 次失败运行

Kimi K33.1%:2/65 次失败运行

Fable 5.10%:0/49 次失败运行

GPT-6 Astra0%:0/53 次失败运行

Gemini 3.8 Flash0%:0/55 次失败运行

Grok 4.60%:0/61 次失败运行

Muse Spark 1.30%:0/61 次失败运行

GPT-5.6 Sol0%:0/67 次失败运行

将变更投递到运行中的应用从不调用的地方,例如一次性脚本。

GLM 5.37.0%:4/57 次失败运行

Kimi K33.1%:2/65 次失败运行

Fable 5.10%:0/49 次失败运行

GPT-6 Astra0%:0/53 次失败运行

Gemini 3.8 Flash0%:0/55 次失败运行

Grok 4.60%:0/61 次失败运行

Muse Spark 1.30%:0/61 次失败运行

GPT-5.6 Sol0%:0/67 次失败运行

03Effort & the Frontier

更高的成本不能保证更高的解决率

成本(美元)输出 tokens估计前沿

1Fable 5.138.8% · $6.962

2GPT-6 Astra33.8% · $4.673

3Gemini 3.8 Flash31.2% · $2.504

4GLM 5.328.8% · $5.125

5Grok 4.623.8% · $3.446

6Muse Spark 1.323.8% · $2.747

7Kimi K318.8% · $3.908

8GPT-5.6 Sol16.2% · $2.65

预计发布成本范围从 $2.50 到 $6.96

滑动图表查看所有任务。

每个智能体都在隔离的沙箱中运行。所有任务均采用 Harbor 格式,验证器在评分时注入。验证器的灵感来源于代码库中现有的测试套件或直接使用这些测试。

Original source

本文由 AI 翻译整理自 Hacker News,原文版权归原作者所有。

阅读英文原文
上一篇
VS Code 1.137:AI 自动化、语音模式与 GitHub 深度集成
下一篇
OpenResearch:本地优先的多 Agent 研究工作台