browser-use 通过 LLM 动态理解页面结构来实现网页自动化,无需硬编码 CSS 选择器,支持 MCP 协议,可完成多步骤网站任务。

传统 Web 自动化一直依赖僵化的脚本、固定 CSS 选择器以及自定义 API 集成。一旦网站重新设计布局或更改了类名,传统自动化脚本就会立即失效。
browser-use 是一个开源 Python 库,旨在解决这种脆弱性问题。它将大语言模型(LLM)与 Playwright 等浏览器自动化工具配对,使 AI Agent 能够动态地导航、交互并完成任意网站上的多步骤任务。
browser-use 充当 AI 模型与浏览器驱动之间的智能层。它不需要开发者编写硬编码的点击路径,而是向 LLM 提供视觉和 DOM 上下文。然后由 LLM 决定下一步操作——比如点击按钮、输入文本或滚动页面——直到完成目标任务。
由 browser-use 驱动的 AI Agent 不依赖硬编码的选择器。它们动态读取页面状态,能够填写复杂表单、解决交互式 UI 流程,并处理站点变化而不会崩溃。
browser-use 内置支持 Model Context Protocol(MCP)。这使得 Claude Desktop、Cursor 和 CLI 编码 Agent 等 AI 助手能够在其工具集中原生触发浏览器自动化。
该库与模型无关。你可以使用商业 API(如 OpenAI GPT-4o 或 Anthropic Claude 3.5 Sonnet)来驱动浏览器 Agent,也可以通过 Ollama 完全离线运行本地 LLM。
只需几行 Python 代码即可开始:
from langchain_openai import ChatOpenAI
from browser_use import Agent
import asyncio
async def main():
agent = Agent(
task="Find a flight from NYC to London on Kayak for next Tuesday",
llm=ChatOpenAI(model="gpt-4o"),
)
result = await agent.run()
print(result)
asyncio.run(main())
随着软件工作流从手动点击操作转向自主 Agent 执行,将 LLM 与现实世界接口连接起来的库正在成为基础设施工具。通过赋予 AI 模型对浏览器环境的完全控制权,browser-use 正在解锁新一代智能 Web 自动化。
想构建自己的浏览器 AI Agent?可以查看 browser-use GitHub Repository。