从Google Big Sleep提前发现CVE的案例出发,梳理生产RCA、主动漏洞狩猎、自动化修复的Agent工具现状与差异。
2025年7月,谷歌披露了CVE-2025-6965,这是SQLite的一个高严重性缺陷,其AI Agent Big Sleep已在谷歌的威胁情报团队发现相同bug即将被利用的迹象之前找到并上报。补丁首先发布。谷歌将其描述为AI Agent直接预防真实世界利用尝试的第一个确认案例。这是一个非常不同的声明,与"我们的linter捕获了一个拼写错误"相比。这也是为什么2026年的"AI bug检测"意味着全新的东西。
这是DevToolLab上更长指南的浓缩版本:Best AI Bug Detection Tools for Development Teams in 2026。它刻意跳过PR审查bot和静态分析linter(那些有自己的比较),而专注于处理已经存在的bug的工具:生产错误、未报告的漏洞,以及直接打开修复PR的Agent。
混淆这些会导致购买错误的工具:
生产根本原因分析。 一个Agent读取堆栈跟踪、最近提交和遥测数据,解释错误为什么发生,而不仅仅是在哪里。Sentry Seer和Rollbar RCA,都是2026年新推出的。
主动漏洞狩猎。 一个Agent搜索没有人触发过的安全缺陷,并通过构建可行的利用来证明它们是真实的。谷歌DeepMind的CodeMender和Big Sleep。
逻辑bug检测。 竞态条件、内存泄漏和边界情况,需要理解代码做什么,介于linter和安全扫描器之间。这是Metabob的领地。
第四类,自主修复Agent如OpenHands,跨越所有三个类别:给它一个bug报告,它会在沙箱中重现、诊断、修补并打开PR。

Seer于2026年4月28日推出,是Sentry对"你已捕获错误,现在谁来修复它"的回答。它跨越本地开发(通过Sentry MCP server)、代码审查和生产环境工作,在生产环境中进行问题分类,对Sentry已经掌握的错误、spans、日志和追踪进行根本原因分析,并起草修复。
自动修复限制非常保守:一个问题需要至少记录10个事件,必须来自最近14天,并且必须通过可修复性评分才能让Seer提议补丁。价格是捕捉。Seer不绑定到任何层级;它在基本计划之上每个活跃贡献者每月费用为$40(在连接的仓库中该计费期间有2+个PR的任何人)(Team $29/mo,Business $89/mo)。它也仅针对sentry.io运行,没有自托管路径。

Rollbar的AI根本原因分析,于2026年4月13日发布,很好地解决了一个更窄的问题:失败始于表面之上游。它使用会话和传播ID跨所有Rollbar项目关联发生,所以由三跳之外的后端引起的前端错误会作为一条结构化链条返回,而不是跨五个服务的grep。
免费层覆盖每月5,000个发生次数,付费层包括月度AI积分(大约6-14次RCA运行,取决于层级,测试期数字),独立附加服务从$5/月起,提供15,000积分。它进行调查;它不起草PR。如果你想要自动修复,这不是那个工具。
谷歌DeepMind在2025年10月推出了CodeMender,并在2026年7月通过Gemini Enterprise Agent Platform扩大了访问权限。其差异化之处在于利用验证:不像SAST工具那样进行模式匹配(并继承它们的误报问题),它构建概念验证利用并在隔离沙箱中运行,只有在bug被确认是真实的后才升级到人工。它覆盖内存损坏、注入、加密弱点等,跨越C/C++、Go、Java、Python、Ruby、Rust和TypeScript,在大约六个月内向开源上游了72个安全修复,包括在4.5M行代码库中。缺陷是:没有自助注册,仅限企业渠道。
Big Sleep,Project Zero/DeepMind协作,根本不是产品,但它是该类别的天花板:在FFmpeg和ImageMagick等软件中发现的约20个以前未知的漏洞(2025年8月),加上介绍中的SQLite CVE。CodeMender是同一想法的产品化版本。

Metabob将图神经网络与LLM配对,在真实bug修复上进行训练,以捕获linter在结构上无法做到的事情:竞态条件、内存泄漏和跨越多个文件的边界情况。作为GitHub App,它在每个PR上运行并将发现发布到Checks选项卡。它较新的定位是作为编码Agent的智能层,暴露工具如analyze_change_impact,Claude Code及其他可在进行风险变更之前调用。NEC在2026年2月宣布,在内部运行Metabob将技术验证时间与手动审查相比缩短了最多66%。免费层级,付费从约$20/开发者/月起。它与你的SAST扫描器和错误跟踪器并行,而不是替代。

OpenHands(前身为OpenDevin,2025年10月更名,~80k stars,MIT)是开源自主修复工具:将其指向GitHub issue或失败的测试,它会在沙箱中重现、诊断、编辑、运行测试套件,并打开PR。它是模型无关的,这对于阅读其基准很重要——广泛引用的~72% on SWE-bench Verified是用Claude Sonnet 4.5加extended thinking测量的,这个数字随模型变化。设置是一个Docker命令,在端口3000上启动UI(注意镜像注册表在更名后更改;较早的ghcr.io/all-hands-ai/...指南已过时):
docker run -it --rm --pull=always \
-e AGENT_SERVER_IMAGE_REPOSITORY=ghcr.io/openhands/agent-server \
-e AGENT_SERVER_IMAGE_TAG=1.26.0-python \
-v /var/run/docker.sock:/var/run/docker.sock \
-v ~/.openhands:/.openhands \
-p 3000:3000 \
--add-host host.docker.internal:host-gateway \
--name openhands-app \
docker.openhands.dev/openhands/openhands:1.8
它是免费的(你支付LLM成本),它是基础设施而不是产品:沙箱、模型选择和PR审查由你负责。一个对你仓库有写入权限的Agent是一个与只读扫描器不同的风险概况——将其输出视为来自快速、无监督贡献者的草案。
针对一个你已经手动修复的真实bug进行测试,而不是合成演示。如果你运行Sentry,将Seer的调查流程指向那个历史问题;单独的根本原因叙述是有信息的,无需自动修复订阅。如果你既不运行Sentry也不运行Rollbar,用免费SDK装备一个端点并首先在本地确认捕获路径触发(完整指南包括捕获具有占位符DSN的真实TypeError的可运行Python代码片段)。然后在具有历史的仓库上尝试Metabob的VS Code扩展,如果你想要自主的末端,针对一个小的、低风险的问题运行OpenHands并审查它打开的PR。
当你挖掘生产bug留下的东西时,DevToolLab的Nginx Log Analyzer解析访问和错误日志,JSON Path Finder从嵌套错误有效载荷和遥测事件中提取精确字段。
已在Sentry,足够大的团队来证明每个贡献者定价: Seer。
起源于不同服务而不是可见错误的失败: Rollbar RCA,通过积分附加服务便宜尝试。
大型C/C++/Rust代码库且具有谷歌企业访问权限: CodeMender用于验证利用发现。
你的linter看不到的逻辑bug: Metabob,每个开发者每月少于一个工程小时。
想诚实地判断自主修复: 自己运行OpenHands并审查它的PR而不是阅读基准图表。
这些解决了完全不同的问题;大多数团队最终想要多个。
Original article on DevToolLab
Google DeepMind: Introducing CodeMender
For further actions, you may consider blocking this person and/or reporting abuse