JetBrains 推 Kotlin AI Agent 基准测试
首个 Kotlin 专用的 agent 评测标准,从完整开发流程(读 issue→实现→测试通过)出发,测评 agent 真实能力。
首个 Kotlin 专用的 agent 评测标准,从完整开发流程(读 issue→实现→测试通过)出发,测评 agent 真实能力。
由 JetBrains 开发的简洁多平台语言
阅读本文的其他语言版本:
Agentic coding 基准测试正越来越贴近真实的软件开发场景。对于 Kotlin 团队来说,最重要的问题是:AI Agent 能否可靠地端到端完成 Kotlin 任务——从阅读 issue,到产出能够通过验证的解决方案。
为了填补这一空白,我们迈出了第一步,正式发布 Kotlin Benchmark。这是 JetBrains 官方推出的基准测试,用于评估 AI coding Agent 处理 Kotlin 软件工程任务的能力。我们的目标是为开发者提供一种可信、公开的方式,用更贴近日常开发工作的任务,评估不同 Agent 在 Kotlin 上的表现,并比较不同的 Agent 配置。
在发布基准测试的同时,我们还将在 GitHub 上公开相关资源,并推出官方排行榜,用于跟踪评估结果。
在 GitHub 上探索该基准测试
在排行榜中查看首批结果
Kotlin Benchmark 的首个公开版本基于 SWE-bench 方法,专注于代码仓库级别的 Kotlin 软件工程任务。
Kotlin 已经拥有一批优秀的模型评估资源,包括 Kotlin_HumanEval 和 Kotlin_QA,它们可以帮助衡量模型对 Kotlin 语法及核心概念的理解程度。Kotlin Benchmark 关注的是另一个层面:AI coding Agent 在现有 Kotlin 项目中完成经过验证的软件工程任务的能力。
该数据集包含 105 项工程任务,均来自活跃的开源代码仓库。每项任务都要求 AI Agent 理解真实的 issue 描述、探索项目上下文,并生成可正常工作的补丁。解决方案会在容器化环境中接受严格验证,只有当生成的方案通过规定的测试验证后,该任务才会被标记为已解决。
你可以在方法论页面中进一步了解我们的环境配置和数据收集方式。
首批评估结果表明,领先的 coding Agent 已经能够完成当前 Kotlin Benchmark 中相当大一部分任务。这些结果反映的是基准测试首个公开版本的情况,尚未包含最新发布的模型。我们已经开始开发第二个版本,并会随着新评估结果的加入持续更新排行榜。
在本轮评估中,Claude Code 搭配 Opus 4.7 xhigh 取得了最佳成绩:在 105 项任务中解决了 90 项,解决率达到 85.71%。紧随其后的是搭配 Opus 4.7 max 的 JetBrains Junie(81.9%),以及搭配 GPT 5.5 xhigh 的 Codex(81.9%)。
完整排行榜可在 kotlinlang.org/benchmark 查看,你可以在其中详细比较不同的 Agent 和配置。
对于正在评估 coding Agent 的团队来说,这项基准测试提供了一个统一的参照框架,可以根据 Kotlin 任务比较不同配置,而不必只依赖厂商的宣传。这些分数旨在提供参考信号,并不保证 Agent 在每个代码库中都能达到相同效果。实际表现取决于你的系统架构、内部 API、编码规范、工具链和验证流程。
我们重视开放的方法,因此这项基准测试基于开源的 Multi-SWE-bench 基础设施构建,并公开了所有数据集和测试工具。
我们将基准测试视为一条持续衡量质量的流水线。接下来,我们计划从以下几个方面扩展这一框架:
更广泛地覆盖 Kotlin 生态:我们希望任务组合能够更准确地反映 Kotlin 在实际场景中的使用方式,包括 Android、Kotlin Multiplatform 等领域,并覆盖更丰富的任务难度等级。
更多评估指标:通过测试是一项很有价值的正确性指标,但它只是 Agent 评估的一部分。未来版本还将考察成本、性能、可维护性和代码质量。
更多 Agent 和模型配置:我们计划评估更多商业 Agent、Agent 与模型的组合配置,以及开放权重模型,让团队能够比较范围更广的方案。
该基准测试完全开放,因此你可以查看任务、比较结果,并告诉我们接下来应该覆盖哪些 Kotlin 场景。
谢谢,我们已经收到你的信息!
轻松跟踪 AI 驱动的 Kotlin 项目中的 LLM 使用情况、工具调用和应用流程。只需进行少量代码修改,即可添加由 OpenTelemetry 支持的可观测性能力。