Anthropic 发布新型 Browser Use 工具,通过结构化页面视图而非模拟浏览器的方式让 Claude 与网页交互。
Check your inbox for a confirmation email where you can adjust your preferences and even join additional groups.
Follow TNS on your favorite social media networks.
Become a TNS follower on LinkedIn.
Check out the latest featured and trending stories while you wait for your first TNS newsletter.
Anthropic 推出了一款新的 Browser Use 工具,让 Claude 能够在视觉渲染之外,以结构化的方式查看网页。该工具于周四发布,利用页面的无障碍树(accessibility tree)帮助 Claude 直接找到并与特定元素交互,而无需计算它们在屏幕上的位置。
Browser Use 是 Anthropic 更广泛发布的一部分,同步进入正式版的还有 Computer Use、Skills API 和 Files API。开发者可以通过 Claude API 使用 browser_toolset_20260801 访问该浏览器工具。
Browser Use 是 Anthropic 更广泛发布的一部分,同步进入正式版的还有 Computer Use、Skills API 和 Files API。
这一改进为 Claude 提供了一种更直接的方式与网页交互。过去 Claude 需要从视口截图中推算按钮位置并以坐标(如 x: 640, y: 320)为目标,现在它可以收到一个绑定到该元素的引用(如 ref_3),并在需要执行操作时使用它。
Computer Use 通过截屏和发送鼠标坐标及键盘命令来操作整个桌面。Browser Use 则在浏览器内部运作,它可以利用页面结构——这些结构仅从像素中难以可靠地还原。
当 Claude 调用 read_page 时,开发者的执行器(executor)返回无障碍树的文本表示,其中链接、按钮、文本框等元素可以被标记上引用。如果 Claude 后续想要点击由 ref_3 表示的按钮,它可以发送该引用并附带请求的操作,而无需计算按钮在屏幕上的位置。
话虽如此,如果标签页导航到新页面或页面发生了足够大的变化,之前指向某个按钮的引用可能不再有效。API 本身不会捕捉这种情况,因此执行器必须识别出引用与底层元素不再匹配,拒绝该操作,并让 Claude 重新读取页面后再继续。
例如,Playwright 可以将页面表示为 ARIA 快照,并按角色而非坐标定位元素。与此同时,微软的 Playwright MCP 服务器已经暴露了结构化的无障碍快照,其中包含模型可用于识别元素的引用。这些概念与 Browser Use 高度一致,但协议并不对齐:Playwright MCP 使用 MCP 协议,而 Anthropic 的工具使用自己的 client-toolset 协议,因此开发者仍然需要一个适配器,将 Claude 的请求转换为 Playwright 操作,并以 Claude 期望的格式返回结果。
Puppeteer 提供了许多相同的构建块,通过 Accessibility.snapshot() 暴露浏览器的无障碍树,并提供控制 Chrome 和 Firefox 的 API。开发者可以使用这些 API 进行导航或页面读取,然后在顶层维护 Anthropic 的引用映射。
开发者可以使用这些 API 进行导航或页面读取,然后在顶层维护 Anthropic 的引用映射。
略显混乱的是,一个同名的开源项目 Browser Use 也通过 Chrome DevTools 协议运行 AI 浏览器代理。尽管名称相同,但它与 Anthropic 的工具没有任何关联,自带代理循环和浏览器抽象层,因此将两者连接起来仍需要集成工作。
Anthropic 还在减少 Claude 与浏览器之间的往返次数,允许在单次模型调用中请求多个操作。现在多个操作可以作为多个 tool_use 块一起到达。应用程序按顺序执行它们并将结果一起返回,避免了在每次点击和按键之间都需要再次调用模型。Anthropic 表示,这样可以降低延迟和成本,特别是当工作流从少量交互扩展到数十甚至数百次时。
随着浏览器任务变长,这一点变得更加重要。仅仅依靠更便宜的模型无法解决代理工作流中的 token 成本问题,因此削减不必要的模型调用是降低成本的另一种方式。
如果 Claude 在每次点击或按键后都必须回到模型,一次长的浏览器任务会迅速累积大量模型调用。批量操作通过允许 Claude 一次请求多个操作来减少这种往返,但浏览器仍然必须按顺序执行它们,因为每个操作都依赖于前一个操作的结果。例如,如果 Claude 请求点击一个按钮、填写一个字段并提交表单,执行器不能简单地继续下一步——如果第一次点击失败,因为后续所有操作都基于 Claude 从未达到的页面状态。
批量操作通过允许 Claude 一次请求多个操作来减少这种往返,但浏览器仍然必须按顺序执行它们,因为每个操作都依赖于前一个操作的结果。
Browser Use 目前仅限于 Claude API,尚未在 Claude Managed Agents 中可用。将其添加到 Messages API 请求中默认暴露 27 个浏览器操作。Claude 可以决定它想使用哪些操作,但 Anthropic 不会执行它们。应用程序必须将每个请求转换为自身浏览器环境中的操作,在各轮次之间保持会话,并返回足够的信息让 Claude 理解发生了什么。
加载所有这些操作有 token 成本。Anthropic 的定价文档指出,默认的 Browser Use 工具集会在请求上增加约 6,600 个输入 token,这还不包括截屏、无障碍树和其他返回给 Claude 的结果。开发者可以关闭不需要的操作以减少这种开销。
这也创造了与 Anthropic 周四宣布的其他工具不同的托管分工。通过 Skills API 上传的技能可以在 Anthropic 的代码执行沙箱中运行,而 Files API 存储可按 ID 重用的文档。浏览器会话及其下载和上传的文件则保留在开发者的环境中。
Claude 仍可能在网页内容中遇到提示注入或被重定向到意外位置,这就是为什么 Anthropic 建议在具有最小访问权限的隔离容器或虚拟机中运行浏览器。JavaScript 和文件上传应保持禁用状态,除非确实需要,因为 Claude 生成的代码以页面的权限运行,可以访问该页面可用的数据或发起请求。
批量操作使审批变得更加复杂,因为多个操作可能同时到达,序列开头的常规点击最终可能导向需要用户权限的操作。这意味着执行器必须在操作发生时进行检查,并在需要时停下来请求审批。