基准测试评估了当前 AI Agent 破解验证码的能力水平,反映了 AI 安全防御的现状和挑战。
我们评估了三款领先的 AI 模型——Claude Sonnet 4.5(Anthropic)、Gemini 2.5 Pro(Google)和 GPT-5(OpenAI)——解决 Google reCAPTCHA v2 挑战的能力。与 Sonnet 和 Gemini 相比,GPT-5 漫长而缓慢的推理过程导致挑战反复超时,表现明显更差。
许多网站使用 CAPTCHA 来区分人类与自动化流量。面对现代 AI Agent,这些 CAPTCHA 还能有多大作用?我们测试了三款领先模型——Claude Sonnet 4.5、Gemini 2.5 Pro 和 GPT-5——解决 Google reCAPTCHA v2 挑战的能力,结果发现它们的表现存在显著差异。Claude Sonnet 4.5 表现最好,成功率达到 60%,略高于成功率为 56% 的 Gemini 2.5 Pro。GPT-5 的表现明显更差,只在 28% 的试验中成功解出了 CAPTCHA。
每个 reCAPTCHA 挑战都属于三种类型之一:静态型(Static)、刷新型(Reload)和跨图块型(Cross-tile)(见图 2)。模型的成功率在很大程度上取决于挑战类型。总体而言,所有模型在静态型挑战上的表现最好,在跨图块型挑战上的表现最差。
为什么 Claude 和 Gemini 的表现优于 GPT-5?我们发现,这种差异主要源自过度且执着的推理。Browser Use 会将任务作为一系列离散步骤执行——Agent 生成「Thinking」token 来推理下一步,选择一组操作,观察操作结果,然后重复这一过程。与 Sonnet 和 Gemini 相比,GPT-5 花在推理上的时间更长,还会生成更多 Thinking 输出,用来详细阐述自己的推理和计划(见图 3)。
糟糕的规划与验证进一步放大了这些问题:GPT-5 会执着地修改和纠正自己的答案,反复选中、取消选中同一个方格。再加上缓慢的推理过程,这种行为显著提高了 CAPTCHA 超时错误的发生率。
与静态型挑战相比,所有模型在刷新型和跨图块型挑战上的表现都更差。由于 Browser Use 采用推理—操作循环,刷新型挑战尤其困难。Agent 经常能正确选中最初的方格,并准备提交答案,但随后会看到新的图片出现,或者收到 reCAPTCHA 要求其重新检查答案的提示。它们往往会把图片刷新理解为错误,于是试图撤销或重复之前的点击操作,陷入浪费时间的失败循环,最终导致任务超时。
跨图块型挑战暴露了模型在感知方面的弱点,尤其是在识别局部可见、受到遮挡或横跨边界的物体时。每个 Agent 都难以正确判断物体边界,选出的区域几乎总是规整的矩形。根据我们的个人体验,跨图块型 CAPTCHA 反而比静态型和刷新型 CAPTCHA 更容易——只要找到一个符合目标的图块,就很容易识别出相邻哪些图块也包含该目标。这种难度差异表明,人类与 AI 系统解决这些挑战的方式存在根本性的不同。
开发者和研究人员能从这些结果中学到什么?更多推理并不总是更好。确保 Agent 能够快速、自信且高效地作出决策,与深度推理同样重要。在聊天环境中,长时间延迟可能只是让用户感到烦躁;但在 Agent 驱动的实时场景中,它可能意味着任务彻底失败。次优的 Agent 架构还可能进一步放大这些失败——在我们的案例中,Agent 循环鼓励了执着于反复检查的行为,同时又无法妥善应对动态界面。我们的研究结果强调,推理深度与性能之间并不总是呈线性关系;有时候,过度思考本身就是另一种失败。现实世界中的智能不仅需要准确性,还要求在压力之下及时采取行动,并具备灵活适应的能力。
每个 Google reCAPTCHA v2 挑战都会向用户呈现视觉任务,要求他们在图片网格中识别交通信号灯、消防栓或人行横道等特定物体(见图 5)。
我们要求每个 Agent 前往 Google 的 reCAPTCHA 演示页面,并解决页面呈现的 CAPTCHA 挑战(100% 的试验都会明确呈现基于图片的挑战)。需要注意的是,在 Google 自己的页面上运行测试,可以避开跨源和 iframe 相关的复杂问题;而在生产环境中,CAPTCHA 通常会跨域嵌入,并受到更严格的浏览器安全规则约束,因此这些问题经常出现。
我们使用 Browser Use 评估生成式 AI 模型。Browser Use 是一个开源框架,可让 AI Agent 执行基于浏览器的任务。在完成 CAPTCHA 时,我们向每个 Agent 提供了以下指令:
我们要求 Agent 最多尝试五个不同的 CAPTCHA。如果 Agent 能在这些尝试次数内成功完成 CAPTCHA,该次试验就记为成功;否则记为失败。
尽管我们要求模型在每次试验中尝试的挑战不得超过五个,但 Agent 经常超出这一限制,尝试的 CAPTCHA 数量明显更多。这种计数困难至少有两个原因:第一,我们发现 Agent 经常没有在 Browser Use 的 memory store 中使用状态计数器变量。第二,在刷新型和跨图块型挑战中,一个挑战何时结束、下一个挑战何时开始并不总是很明确,而且某些挑战需要处理多张图片。¹ 为保持一致,我们把 Agent 尝试标注的每一张独立图片都视为一次单独的尝试,因此在 75 次试验中总计产生了 388 次尝试(我们允许 Agent 继续尝试,直到它们自行判定失败)。
当第一个挑战属于跨图块型时,reCAPTCHA 会依次呈现两张图片。即使成功解决第一张图片,也不能保证整个挑战成功,因为还必须解决第二张图片。我们将每张图片分别计为一次尝试。在少数几个案例中(不到五个),Agent 成功解决了其中一张图片,却没能解决另一张。
Mathew Hardy、Mayank Agrawal 和 Milena Rmus 就职于 Proof of Human, PBC,正在开发真人身份证明认证系统。在此之前,他们分别获得了认知科学博士学位:Matt 和 Mayank 毕业于普林斯顿大学,Milena 毕业于加州大学伯克利分校。