JetBrains AI Chat 引入推荐 AI Agent,默认使用 Codex 配合 GPT 5.6 Luna,提升 IDE 内编程助手的代码生成质量。
自从撰写这篇博文以来,OpenAI 发布了 GPT 5.6;经过重新评估,这个模型的表现优于 GPT 5.4。JetBrains 中推荐的 agent 现在是 Codex with GPT 5.6 Luna,medium reasoning。
JetBrains AI 支持多个编码 agent,包括 Junie、Codex、Claude Agent,以及任何你引入的 ACP 兼容 agent。过去,JetBrains IDE 中的 AI 用户从 Chat 模式开始,需要自己选择 agent。
随着模型变得更先进,agent 变得更强大,其采用率也随之增长。我们认识到 agent 帮助用户成就更多,所以我们建议从一开始就使用一个 agent。
为了简化这种体验,我们选择了一个特定的 agent 作为默认选项。这篇文章解释了我们如何做出这个选择。
你仍然可以随时切换到任何其他 agent。
"JetBrains 基于实践中的重要因素评估了编码 agent:它们能否解决真实的软件工程任务,快速地解决,以及成本合理吗?我们很荣幸 Codex 成为 JetBrains AI 中推荐的起点。这是从 AI 聊天向 agent 转变的重要一步,这些 agent 满足开发者的实际需求,在他们已经使用的工具中工作,并承担复杂的多步工作。"
Stuart McMeechan,OpenAI EMEA 部署工程负责人
我们使用从真实软件工程任务构建的基准数据集,跨三个生态系统对候选 agent 进行了评估:Java(225 个任务)、C#(38 个任务)和 Python(90 个任务)。
每个任务都基于真实的代码库,有一个描述需要做什么的 prompt,以及自动化测试来验证结果。这些任务共同涵盖了真实应用、库、框架和开发者工具中的 bug 修复、功能开发、增强和其他常见开发任务。
用于选择推荐 agent 的数据点可以在开发者生产力 AI 竞技场(Developer Productivity AI Arena,DPAIA)仓库中获得——这是 JetBrains 用于评估 AI 编码工具的开放基准,使评估可重现。C# 数据集是内部的,不公开提供。
Java 数据集是我们的主要评估集。它是三个中最大的,跨越五个组织的 17 个仓库,涵盖了任务类型的广泛组合。
C# 和 Python 数据集产生了类似的候选 agent 总体排名,这使我们更加确信结果不是特定于单个生态系统的。
我们在相同的模型级别内比较候选者。我们的目标不是找到最强大的可用模型,而是在可比的模型能力和成本下找到最佳的 agent 行为。我们预计了 agent 使用的成本,考虑到了 JetBrains AI 的 token 使用。会推动超过 2% 用户月支出超过 $20 的设置在质量和延迟排名之前被排除。
在选择推荐的 agent 时,我们关注三个问题:
它能处理任务吗?→ 在这里,我们通过解决率衡量——所有测试通过的基准任务的百分比。
成本合理吗?→ 我们查看了每个任务的中位成本。
它足够快吗?→ 我们查看了中位端到端延迟。
这三个指标(解决率、成本和延迟)形成了我们排名的基础。我们还追踪了额外的信号,包括编译成功和平均工具调用,但它们对结果没有实质性的影响。
除了离线基准,我们还与真实用户进行了在线 A/B 测试。这个实验作为验证层,帮助我们了解离线结果是否转化为实际使用。因为在规模上可靠地衡量任务成功很困难,我们关注行为信号,比如参与度以及用户多久切换到另一个 agent 或返回到 chat。在线结果与离线基准一致,给了我们额外的选择信心。
我们在多个模型配置中测试了 JetBrains AI 可用的 agent(Codex、Junie 和 Claude Agent)。候选者是根据之前的基准测试和内部评估选择的;我们专注于每个 agent 模型系列内最有前景的选项,而不是测试每一种可能的设置。最终,Codex 和 Junie 入选。
Codex — 我们从 GPT-5.2 和 GPT-5.3 的初始扫描开始。当 GPT-5.4 mini 可用时,它在解决率和成本方面都超过了之前的顶级表现者,使模型选择变得很直接。剩下的问题是推理级别:medium 还是 low。GPT-5.4 mini 配合默认的 medium 推理在所有三个生态系统中都有最好的解决率,在合理的成本范围内,并被选为最终评估。
Medium Reasoning 在 Java、C# 和 Python 中解决了更多任务。Low Reasoning 更便宜,通常也更快,但成本和延迟的收益还不足以弥补解决率更明显的下降。这就是为什么我们选择了 Medium Reasoning。
Junie — Junie 可以与不同的模型提供商合作。我们评估了 Gemini 模型系列,基于 Junie 团队自己的基准预先选择为最有前景的选项。Gemini 3 Flash 被选为获胜模型。
Gemini 3 Flash 有更强的解决率;Gemini 3.1 Flash Lite 在成本和速度上持续更便宜和更快。
离线结果本身很接近,无法直接判出胜负。没有一个 agent 在所有指标和生态系统上占绝对优势。
最终候选名单对比了 Codex with GPT-5.4-mini medium 与 Junie with Gemini 3 Flash。
我们在在线 A/B 测试中都包含了他们,看看哪一个在实际使用中表现更好。我们追踪了激活、流失和失败率。Codex 表现更好。这决定了选择。
Junie 仍然是 JetBrains 原生的最佳 agent,适合 IDE 深度工作流、Java 密集项目、BYOK 设置和成本敏感的团队。
Codex 现在是推荐的 agent,在我们测试的任务中提供了最强的解决率和成本组合。然而,这不是一个永久的决定。随着模型的演进、新 agent 的加入和我们的基准覆盖范围扩大,我们将重新评估这个决定,并根据数据告诉我们的内容更新我们的推荐。
而且如果另一个 agent 对你的工作流效果更好,你可以随时切换。我们的推荐是一个起点,而不是限制。
**免责声明:**由于 GPT 5.6 最近发布,我们也在进行新的评估。如果这个模型版本被证明更好,我们将更新推荐的 agent 使用这个模型。
感谢你的关注!
这是一个系列的第 3 部分,我们对编码 agent 的公开"token 节省"插件进行相同的配对 A/B 基准测试。第 1 部分是 caveman skill(宣传的 −65%,实测 −8.5%)。第 2 部分是 rtk(宣传 −60–90%,实测 +7.6%)。我们运行了 80 个配对任务来测试...
今天,我们推出了 JetBrains Context,这是一个新的仓库智能层,帮助编码 agent 更高效地工作,在复杂代码库上产生更高质量的结果。作为 JetBrains AI for Teams and Organizations 推出的一部分,JetBrains Context 现在在早期访问中提供...
"rtk" 是否减少了 Claude Code token 使用量?这是一个系列的第 2 部分,我们对编码 agent 的公开"token 节省"插件进行相同的配对 A/B 基准测试。第 1 部分是 caveman skill(宣传的 −65%,实测 −8.5%)。TL;DR:rtk 宣传的节省:60–90%。实测...
对 token 压缩技能 Caveman 的配对 A/B 基准测试,在 SkillsBench 上运行:它是否真的节省 token,它是否降低了 AI agent 输出质量?宣传的节省:65%。实测节省:8.5%。真实 agent 任务上的输出 token 节省,技能被强制激活...