独立评测机构数据显示AI PR审查工具排名半年内大幅变动,Greptile取代CodeRabbit登顶,CodeRabbit/Qodo Merge/Graphite Diamond各有消长。

2026 年 3 月,一家没有代码审查产品可卖的实验室,对 AI 拉取请求审查工具进行了首次真正独立的基准测试。CodeRabbit 名列前茅,它的官方博客也如实报道了这一结果,因为这一次这个说法不是自评的。到了 7 月 30 日,同一个实验室对新的拉取请求运行了相同的基准测试,榜首换了一个名字:Greptile。CodeRabbit 跌至第五。
没有人作弊。没有任何东西坏掉。两家公司在此期间都发布了模型和流水线方面的变更,基准测试持续对新 PR 进行采样而不是冻结在旧的上面,排名变动是因为底层产品在变动。这实际上是基准测试在按设计运行。但这也是一个应该让你停下脚步的细节——不要从本周搜索结果中排名最高的比较帖子里随便选一个 AI 代码审查工具,因为这个领域唯一值得信赖的那个数字今年已经易主一次,不到五个月,而且没有理由认为它会停止变动。
这篇文章要探讨的是这番喧嚣之下的真正决策:在四款领先的 AI PR 审查工具——CodeRabbit、Greptile、Qodo Merge 和 Graphite Diamond——中,哪一个真正适合你的团队,以及为什么诚实的答案与其说取决于排行榜截图,不如说取决于你在一个没有任何工具能够回避的权衡中愿意站在哪个位置。
根据 Greptile 自己的追踪数据,AI 生成的代码在约一年内从所有拉取请求的大约 1% 增长到了 27.6%,而且这些代码携带的漏洞明显多于人类手写的代码。无论你是否信任一个明显有动机公开这一数据的厂商给出的确切百分比,其底层模式与许多工程组织直接看到的情况一致:PR 变长了,它们产生得更快了,而曾经的瓶颈"谁有时间写这个"已经干净利落地转移到了"谁有时间审查这个"。
人工审查不会像 AI 辅助编写循环那样随 PR 数量线性扩展。一位高级工程师在编程智能体的辅助下可以生成五倍的代码,但他们无法在同一天内审查五倍的拉取请求而不变成橡皮图章或过劳 burnout。这个差距就是为什么两年前还被视为新奇事物的 AI 代码审查,如今成了团队像对待 CI 分钟数一样列入预算的项目,也是为什么四家获得风投支持的公司在同一个 GitHub Action 中的同一个审查环节上激烈竞争。
CodeRabbit 在 GitHub、GitLab、Bitbucket 和 Azure DevOps 上发布 PR 导览、内联差异评论和一键修复,是四款工具中平台覆盖最广的。它还提供 CLI、一个智能体对话界面,以及越来越多的功能,旨在与编程智能体形成闭环而不是仅仅为人留下评论。该公司已融资 1.43 亿美元,宣称其野心是构建"软件变更的控制层",这是一个比"我们审查你的 diff"更大的声明。
Greptile 在查看单个 PR 之前先将整个代码库索引为代码图,然后追踪变更如何波及 diff 从未触及的文件。它语言无关,支持 GitHub 和 GitLab(包括自托管实例),并且有一个慷慨的免费层,让个人维护者和小规模开源项目无需付费即可使用。它最新的功能 TREX 使 Greptile 从纯静态分析转向在实际执行代码来验证某个说法后再提出,相比阅读 diff 并针对已知 bug 模式进行匹配,这是一个本质不同的能力。
Qodo Merge(开源项目 PR-Agent 的商业继承者)于 2026 年 2 月以 Qodo 2.0 重新发布,采用多智能体架构:独立的智能体并行处理 bug 检测、安全分析、代码质量和测试覆盖率,由一个由 RAG 驱动的上下文引擎(品牌为 Qodo Aware)协调,该引擎可同时索引多个代码库。四款工具中只有它拥有专用的跨仓库破坏性变更检测器(处于 beta 阶段),可以追踪一个代码仓库中的 schema 或 API 变更将在另一个仓库中造成什么破坏,在两者中任何一个合并之前。
Graphite Diamond(在整个 Graphite 产品线中以"Graphite Chat"的名义销售 AI 审查功能)不是一个你独立加到现有工作流中的审查工具。它是 Graphite 堆叠式 diff 工具的一个功能——这个工具围绕将大型变更拆分为小的、依赖性的 PR 而构建,这些 PR 按顺序合并。AI 审查被编织进这个流水线而不是作为独立产品销售,Graphite 自己的仪表板公开发布其数据:审查了 1,482 个 PR,281 个问题导致了修复,评论-downvote 率为 3.5%。
这个类别中最大的技术分歧在于审查者是看 diff 还是看代码库。纯 diff 级审查者看到的是变更的行以及紧邻的上下文;它运行快速、成本低廉,但对 patch 之外的任何内容视而不见,比如三 个文件之外假设旧函数签名的调用者。全代码库审查者在处理 PR 之前先构建索引、依赖图或两者,这能捕获仅 diff 的工具在结构上根本无法看到的跨文件破坏性变更,代价是更多的计算量以及在首次为大型 monorepo 建立索引时更多的 onboarding 时间。
Greptile 和 Qodo 都处于该光谱的全代码库一端,但原因各异。Greptile 的代码图是为追踪"这个变更触动了哪些不在 diff 中的内容"而构建的,这也是 Greptile 审查 catch 到对 NVIDIA NeMo Guardrails 的重构会破坏下游客户端(它们期望特定的响应格式)的原因——这是一个从 diff 单独来看完全不可见的问题。Qodo 的上下文引擎在代码库索引之上增加了工单历史和跨仓库依赖感知,精准面向"这个 PR 看起来没问题"和"这个 PR 不会破坏调用此端点的另外三个服务"是两个不同问题的团队。
CodeRabbit 在其核心审查循环中更偏向 diff 中心,但它通过广度来补偿:更多 Git 平台、在任何智能体编码循环中都可工作的 CLI,以及减少往返次数的功能(像是自动单元测试和合并冲突解决这类收尾工作),而不是加深单次审查通过中对代码库其余部分的理解。Graphite 的架构是其中最特殊的,因为审查智能体并不是真正的产品;堆叠式 diff 工作流才是,AI 审查内嵌在本来就已经按结构被拆小的 PR 流水线中,这意味着任何审查者——人类或 AI——在每个 PR 上需要推理的表面积都天然较小。
第一代 AI PR 机器人(包括 Qodo 自己的前身 PR-Agent)本质上就是一个 LLM 调用,对 diff 进行总结并标记显而易见的问题。从那以后有两件事发生了变化,而且两者都指向同一个方向。
首先,架构从单次调用迁移到了多智能体和全代码库。Qodo 2.0 的并行智能体套件和 Greptile 的代码图都是对仅 diff 审查局限性的直接回应:你无法通过孤立地阅读四十行新增代码来 catch 到跨服务破坏性变更,无论背后的模型有多好。
其次,更重要的是,审查评论的目标受众正悄然从"打开这个 PR 的人类"转向"将依据此反馈采取行动的 AI 智能体"。CodeRabbit 的定价页面现在将"与编程智能体循环"作为一等功能来广告。Qodo 生成它所谓的"Agent Prompt",一个可供直接粘贴的问题上下文和技术策略块,旨在直接粘贴到 Cursor、Claude Code 或任何最初编写该 PR 的工具中。Graphite 的着陆页主打"Cursor Cloud Agents 现已登陆 Graphite:在 PR 内创建、审查和发布,无需离开。"当被审查的代码中越来越大的比例是由智能体编写的时候,审查输出越来越多地以智能体为目标也就顺理成章了,闭环了过去需要一个位于中间的人类来完成的流程。
每款 AI 代码审查工具都会走向两种失败模式之一。将其调校为激进地标记问题,它就能捕获更多真实 bug(更高的召回率),但也会在 PR 中灌入大量最终被证明是误报评论,训练开发者在几周内停止阅读机器人的输出。将其调校为保持沉默,评论噪音会下降,开发者会继续信任它,但真实缺陷会漏网未被捕获(更低的召回率)。精确率衡量的是工具的评论中有多少实际导致了代码变更;召回率衡量的是开发者在之后进行的修复中有多少已经被工具标记过。F1 是两者的调和平均值,这才是真正重要的数字,因为只最大化其中一个指标的工具正在悄无声息地让另一个指标失败。
这就是 Martian 的基准测试比厂商发布的替代方案更值得信赖的原因。Martian 是一家研究实验室,成员来自 DeepMind、Anthropic 和 Meta,但并不销售与之竞争 code review 产品,其 Code Review Bench 测量的是比精心策划的 bug 集更难被操控的东西:在约 300,000 个真实 pull request 中,开发者是否实际采纳了工具的建议,采用持续采样方式,这样工具就无法简单地记忆一个冻结的测试集。其 2026 年 7 月 30 日的排行榜如下:
五个月前,在 Martian 首次发布运行时,CodeRabbit 以 51.2% 的 F1 分数领先,并且在所有评估工具中拥有最高的召回率,比第二名竞争对手高出约 15 分,精确率为 49.2%。两个快照都是真实的。都不是永久性的。3 月到 7 月之间真正发生变化的是 Greptile 的精确率跃升至所有测量工具中的最高水平(76.2%),而 CodeRabbit 保持了相当强的召回率(51.6%,技术上仍略胜 Greptile),但损失了足够的精确率,在综合分数上落后。将两次运行并排比较,故事并不是"Greptile 比 CodeRabbit 更好"。而是"CodeRabbit 目前以一定精确率换取召回率,Greptile 目前以少量召回率换取大量精确率,你更想要哪个取决于你的团队是假警报代价更高还是漏检 bug 代价更高。"
Qodo 和 Graphite Diamond 没有出现在 7 月快照的前五名中,这一点值得深思而不是一带而过。Qodo 在 2026 年 2 月发布的自己的基准测试声称在测试的八款工具中达到最高 F1,为 60.1%,比第二名高出 9 分,但这是 Qodo 的内部测试,不是经过独立验证的 Martian 排名,这两个数字不能直接比较,因为它们针对的是使用不同方法论的不同 pull request 集。同样的警告也适用于 Greptile 自己早些时候声称在 2025 年 7 月的自我运行测试中捕获了 82% 的 bug,这个数字早于 Martian 的基准测试,根本不是能与 2026 年 7 月排行榜进行比较的召回率数字。到目前为止,这个类别中每个厂商发布的基准测试都将该厂商排在第一位。这不一定是不诚实的,团队确实会针对他们发布的指标进行优化,但这意味着唯一值得大力加权的数字是来自那个不向你销售任何东西的实验室的数字。
延迟和开发者体验
四家厂商都没有公布硬性的审查延迟 SLA,这本身就很说明问题:审查时间很大程度上取决于 PR 大小以及需要对多少代码仓库进行索引,所以固定数字反正也会造成误导。在实践中,架构划分大致映射到速度权衡上。CodeRabbit 的 diff 中心方法和 Graphite 的小 PR 构造模型都倾向于更快的首次评论延迟,因为两者都不需要在响应前推理完整的依赖图。Greptile 和 Qodo 的全仓库索引在冷启动、新连接的大型 monorepo 首次审查时成本更高,但在之后的每次审查中成本更低,因为索引是增量式的而不是每个 PR 重建的。对于每天发布数十个小 PR 的团队来说,首次评论延迟会累积成真正的 DX 差异:需要九十秒而不是二十秒的审查者会训练开发者切换到其他任务稍后回来,这悄悄地侵蚀了自动化审查的全部意义——紧密的反馈循环。CLI 优先的工具(CodeRabbit 的 CLI、Greptile 和 Qodo 的 Git 无关钩子)也对 DX 有意义,这是 web 仪表板无法捕捉的:在 PR 甚至打开之前就在本地运行的审查者能够捕获完整 CI 门控审查仅在几分钟后才能暴露的问题。
成本、延迟、锁定,以及营销页面没有前置说明的事项
这个类别的成本比较确实很混乱,因为四家厂商的计费方式不同。CodeRabbit 的 Pro 等级为每人每月 24 美元(按年计费),Pro Plus 为 48 美元,单独的安全插件为每用户每月 40 美元,超出计划限额的无限 CLI 和 PR 审查使用量计费;Slack 代理插件按每个代理分钟 0.50 美元计费,这对于每次事件来说很容易计算,但在规模上很容易失控。Greptile 的 Pro 计划约为每席位每月 30 美元,有免费入门等级每月 50 个审查积分,符合条件的开源项目免费访问,对于估值低于 200 万美元递延收入的 Pre-Series A 初创公司有 50% 折扣。Qodo 的定价在第三方追踪中位于类似的每席位 30 美元左右,不过其企业故事更多强调部署灵活性(单租户、多租户或完全本地部署),而不是简单的按席位数字。Graphite 根本不将 Diamond 作为独立产品销售:AI 审查被 gating 在 Graphite 核心订阅的 Team 等级后面(Hobby 和 Starter 只有"有限"的 AI 审查),第三方定价追踪器将 Team 定为每位开发者每月约 40 美元。
最后一点是这个类别中真正的锁定故事。CodeRabbit、Greptile 和 Qodo 是与工作流无关的附加组件:将它们指向现有的 GitHub 或 GitLab 流程,它们就开始在 PR 上评论,无需更改团队的分支或合并方式。Graphite Diamond 无法与采用 Graphite 的堆叠式 diff git 工作流分离,这是一种合法的且越来越受欢迎的工作方式,但这比安装一个 GitHub App 更大的要求。一个团队仅仅因为其 AI 审查功能而评估 Graphite,却不想重构其分支方式,那他们评估的维度就错了。
安全性和合规姿态比营销页面最初暗示的差异更大。Qodo 在这方面推动最力,承诺零数据保留、SOC2 认证,以及为受监管环境的真正本地部署——在这些环境中,无论审查器有多好,将代码发送到第三方 API 都不是一个选项。CodeRabbit 的企业等级增加了自定义 RBAC、SSO、审计日志、自托管选项,以及用于数据主权要求的欧盟 SaaS 部署,外加通过 Claude、AWS 或 GCP 市场结算,如果采购已有可以路由的厂商关系会很有用。Greptile 的自托管 GitLab 支持覆盖了真正无法使用 SaaS GitHub 的企业买家群体。四家厂商都没有发布逐项对应的安全比较,这是可以理解的,因为让这变得容易并不符合任何一方的利益。
没有任何厂商页面突出的是审查疲劳作为一个真实的组织成本,而不是抽象的成本。Graphite 自己发布的数据实际上在这里最有用的参考点,恰恰因为它们没有被包装成营销胜利:在 1,482 个被审查的 PR 中,只有 281 个问题导致了实际修复,约占 19%。Graphite 将此描述为"高信号、低噪音",考虑到其负面评论率低于 5%,这是一个站得住脚的解读。但同样的数字也可以被解读为"大约五分之四的审查评论没有改变任何东西",而这是特性还是限制完全取决于其他五分之四是正确地被判断为非问题还是没有人在意的 bug。Graphite 的页面及其任何竞争对手的页面都没有为你辨析这一点,而这正是 Martian 的基准测试存在的意义,这是独立数字比任何厂商自己的仪表板更重要的又一个原因。
各选项的实际用例
CodeRabbit 适合想要一个跨真正混合的 Git 资产(一些在 GitHub 上,一些在 Bitbucket 上,还有一个没人迁移过的传统 Azure DevOps 项目)工作的审查者的团队,并且重视广泛的平台支持而不是最深度的跨文件推理。其 CLI 和 agentic-chat 界面也使其成为已经运行多个编码 AI 智能体的团队的合理选择,这些团队希望审查步骤插入那个循环中,而不是坐在一边旁观。
Greptile 适合拥有大型、复杂单一平台代码库(GitHub 或 GitLab)的团队,这类代码库中的 bug 经常隐藏在跨文件交互中,仅靠 diff 根本无法发现。对于开源项目维护者或极小规模的团队来说,它是最佳选择,因为它提供免费层和 OSS 计划。TREX 转向实际运行代码的方向值得关注——如果你的 bug 覆盖面更偏向运行时行为而非静态逻辑错误,这一点尤为重要。
Qodo Merge 适合受监管或企业环境,在这些场景中本地部署不是可选项,同时也适合 PR 定期涉及多个仓库的团队——一个仓库中的 schema 或 API 变更可能会悄无声息地破坏另一个仓库;跨仓库破坏性变更检测器是这类工具中最具特色的功能,直接针对其他三款工具没有明确解决的问题。
Graphite Diamond 适合已经决定采用堆叠式 diff,或正在积极评估这一工作流变更的团队,它希望将 AI 审查捆绑在这个决策中,而不是在主干开发之后叠加到基于 trunk 的开发流程之上。对于只想在当前 GitHub 流程上加一个审查机器人而不做其他改动的团队来说,它并不适合。
这四款工具中没有哪一款能被称为"最佳 AI 代码审查工具"——至少在竞争对手持续交付的几个月内,这种说法就站不住脚,Martian 排行榜五个月内的逆转就是证明。比任何单一排名更持久的是其背后的权衡:召回率与精确度之间是一条真实的曲线,不是一个可以解决的问题,每个供应商都在这条曲线上选择了一个特定的位置,无论他们是否公开说明。在试用期间问供应商最有价值的问题不是"你的基准测试得分是多少",而是"当你的工具出错时,它是保持沉默还是主动发声"——因为这个答案预测的是十八个月后你的团队将如何实际体验这个工具,那已经是本周的排行榜再次变动之后的事了。
值得关注的第二个趋势是转向智能体对智能体的审查——评论格式化为供编码 AI 智能体消费和执行的内容,而不是供人类阅读和分类的内容。这与"PR 机器人留言"是截然不同的产品形态,随着 AI 生成的 PR 占比 27.6% 并持续上升,这个问题可能会变得更加重要。因为人类审查 AI 生成的代码,而这些代码又被第二个 AI 重新审查并部分自动修复——这与这些工具在 2023 年最初设计的代码审查流程完全不同。
哪种用户画像应该选择哪款工具
如果你是独立开发者或维护开源项目,从 Greptile 的免费层开始;在零成本的情况下尝试当前独立 F1 得分最高的工具,没有实质性的成本障碍。如果你在混合 Git 平台环境中工作,或已将编码 AI 智能体接入 CI 循环,CodeRabbit 的平台广度和智能体循环功能是更直接的选择,尽管它在唯一重要的基准测试中排名第五,因为平台覆盖和工作流集成是排行榜无法捕捉的真实需求。如果你在受监管行业或代码库跨越多个仓库,存在真正的跨服务破坏性变更风险,Qodo 的本地部署选项和跨仓库检测器解决了其他三款工具没有专门针对的问题。如果你的团队已经承诺或正在认真评估堆叠式 diff 工作流,Graphite Diamond 基本上是免费附赠的,没有太多理由再为它付费买第二个审查工具。
什么才能真正改变你对这份榜单的看法——更好的基准测试方法、当前审查工具漏掉的某个具体 bug,还是最终与你团队发布方式匹配的定价模式?
Best Code Review Tools 2026: 8 AI Code Review Tools Compared | Greptile
Greptile vs CodeRabbit vs Qodo: AI Code Review 2026 | Particula Tech
CodeRabbit Pricing | AI Code Review Plans
Graphite AI Reviews (Diamond)
Qodo Merge: AI Code Review Agent
CodeRabbit tops the first independent AI code review benchmark
Greptile Ranks #1 on Martian's AI Code Review Benchmark
AI Code Review Benchmark 2026: Precision, Recall, and F1 Results | CodeAnt AI