开源项目

browser-use

browser-use

让 LLM Agent 像人一样操作浏览器的开源工具,能自动打开页面、点击、填表、提取数据,用自然语言描述任务即可完成。核心亮点是同时提供 Python 库和 CLI skill,可接入 Claude Code、Cursor 等编码 agent,并在 Odysseys 榜单上超越 OpenAI/Anthropic 的 computer-use agent;配合云端浏览器还能处理验证码和指纹对抗,适合网页自动化、数据采集和 QA 场景。MIT 许可,可免费商用。

README

Shows a black Browser Use Logo in light color mode and a white one in dark color mode. The AI browser agent. Browser-Use Package Download Statistics
Demos Docs Blog Merch Github Stars Twitter Discord Browser-Use Cloud

Browser Use 能做什么?

Browser Use 让 AI agent 像人类一样使用网页浏览器——它能打开页面、点击按钮、输入文字、填写表单。你描述任务,它来执行。例如,你可以让它:

📋 填写表单

任务:「用我的简历和信息填写这份求职申请。」

Job Application Demo

示例代码 ↗

🍎 提取数据

任务:「提取关于我关注者的结构化数据并导出为 CSV。」

https://github.com/user-attachments/assets/485fd3ec-61b9-4afc-9e86-ee9b85acb592

Browser Use Cloud 文档 ↗


快速开始

如果你想在自己的 agent(Claude Code、Codex、Cursor、Hermes、OpenClaw 等)中使用 Browser Use,粘贴以下提示词,它会自动完成所有设置:

Install or upgrade browser-use to the latest stable version with uv using Python 3.12, run `browser-use skill install` to register the skill, and connect it to my browser. If setup or connection fails, follow https://github.com/browser-use/browser-harness/blob/main/install.md.

然后告诉你的 agent 你想要完成什么任务。


Python 库:自动化网页的最简单方式

想要从你自己的代码中、使用任意 LLM 大规模自动化网页操作?使用 Python 库:

1. 安装 Browser Use(Python >= 3.11):

uv add browser-use
# or: pip install browser-use

2. 将你的 LLM API 密钥添加到 .env。从 Browser Use Cloud 获取一个,或使用你自己的 provider 密钥:

# .env
BROWSER_USE_API_KEY=your-key
# GOOGLE_API_KEY=your-key
# ANTHROPIC_API_KEY=your-key

3. 运行你的第一个 agent:

import asyncio

from browser_use import Agent, ChatBrowserUse

async def main():
    agent = Agent(
        task="Find the number of stars of the browser-use repo",
        llm=ChatBrowserUse(model='openai/gpt-5.5'),
        # llm=ChatBrowserUse(model='bu-2-0-mini-preview'),  # Browser Use's optimized model
        # llm=ChatOpenAI(model='gpt-5.5'),
        # llm=ChatAnthropic(model='claude-opus-4-8'),  # Sonnet also works well
    )
    history = await agent.run()

if __name__ == "__main__":
    asyncio.run(main())

更多内容请查看库文档和云文档!


开源版 vs 云端版

BU Bench V1 - LLM Success Rates

我们在 100 个真实浏览器任务上对 Browser Use 进行了基准测试。完整基准测试已开源:browser-use/benchmark。

Browser Use 还在 Odysseys 排行榜 上以 87.4% 的平均得分排名第一,领先于 OpenAI、Anthropic、Google 和 Microsoft 的 computer-use agent。Odysseys 评估的是 agent 在 200 个长周期网页任务上的表现。

使用开源 Agent

  • 免费,运行在你自己的机器上
  • 深度代码级集成和控制:选择你的 LLM,自定义 agent 行为
  • 我们建议将其与我们的云浏览器搭配使用,以获得领先的隐身能力、代理轮换和扩展性

使用全托管云端 Agent(推荐)

  • 针对复杂任务更强大的 agent(见上图)
  • 最轻松的启动和扩展方式
  • 最佳隐身能力,支持代理轮换和验证码解决
  • 1000+ 集成(Gmail、Slack、Notion 等)
  • 持久化文件系统和记忆
  • 可重复运行的脚本即使在网站变更时也能获取实时数据(指南)
curl -X POST https://api.browser-use.com/api/v4/runs \
  -H "X-Browser-Use-API-Key: $BROWSER_USE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"task": "Your task"}'

集成、托管、自定义工具、MCP 及更多内容,请查看我们的文档 ↗


常见问题

我应该使用 CLI 还是 Python 库?

如果你的 agent(Claude Code、Codex、Cursor、Hermes、OpenClaw 等)需要完成浏览器任务,使用 CLI。agent 只需安装一次 skill(见快速开始),之后就能控制浏览器。示例:

  • 「把这个视频上传到 YouTube」
  • 「比较这三款笔记本电脑,给我一张带价格的表格」
  • 「用我的简历填写这份求职申请」

当你正在构建自动化网页操作的软件时,使用 Python 库。示例:

  • 按计划或并行运行大量任务(爬取、监控、QA)
  • 将浏览器 agent 嵌入你自己的产品
  • 自定义工具、自定义系统提示词、结构化输出、细粒度浏览器控制

经验法则:通过 agent 完成一次性任务 → CLI。在代码中实现可重复的自动化 → Python 库。

用什么模型最好?

我们专门针对浏览器自动化任务优化了 ChatBrowserUse()。平均而言,它以 SOTA 精度完成任务的速度比其他模型快 3-5 倍。

关于定价和其他 LLM provider,请查看我们的支持的模型文档。

我可以通过 ChatBrowserUse 使用 Claude / GPT / Gemini 吗?

可以。ChatBrowserUse 接受带 provider 前缀的模型 ID,因此一个 BROWSER_USE_API_KEY 即可访问所有模型——无需分别获取 OpenAI/Anthropic/Google 密钥:

from browser_use import Agent, ChatBrowserUse

llm = ChatBrowserUse(model='anthropic/claude-sonnet-4-6')  # or 'openai/gpt-5.5', 'google/gemini-3-pro'
agent = Agent(task='...', llm=llm)

为了最佳速度和成本,我们仍然推荐默认的 bu-* 模型。

我应该将 Browser Use 系统提示词与开源预览模型一起使用吗?

是的。如果你使用 ChatBrowserUse(model='browser-use/bu-30b-a3b-preview') 搭配普通的 Agent(...),Browser Use 仍会默认发送其 agent 系统提示词。

你不需要仅仅因为切换到开源预览模型就额外添加自定义的「Browser Use 系统消息」。只有当你确实想要针对你的任务自定义默认行为时,才使用 extend_system_message 或 override_system_message。

如果你想要最佳的默认速度和精度,我们仍然推荐更新的托管 bu-* 模型。如果你想使用开源预览模型,除了 model= 的值之外,设置保持不变。

我可以和 agent 一起使用自定义工具吗?

可以!你可以添加自定义工具来扩展 agent 的能力:

from browser_use import Tools

tools = Tools()

@tools.action(description='Description of what this tool does.')
def custom_tool(param: str) -> str:
    return f"Result: {param}"

agent = Agent(
    task="Your task",
    llm=llm,
    browser=browser,
    tools=tools,
)
我可以免费使用这个吗?

可以!Browser-Use 是开源的,完全免费使用。你只需要选择一个 LLM provider(如 OpenAI、Google、ChatBrowserUse,或使用 Ollama 运行本地模型)。

服务条款

这个开源库采用 MIT 许可证。关于 Browser Use 服务和数据政策,请查看我们的服务条款和隐私政策。

如何处理身份验证?

查看我们的身份验证示例:

这些示例展示了如何无缝地维护会话和处理身份验证。

如何解决验证码?

对于验证码处理,你需要更好的浏览器指纹和代理。使用 Browser Use Cloud,它提供旨在避免检测和验证码挑战的隐身浏览器。

如何投入生产?

Chrome 会消耗大量内存,并且并行运行多个 agent 可能难以管理。

对于生产环境用例,请使用我们的 Browser Use Cloud API,它处理:

  • 可扩展的浏览器基础设施
  • 内存管理
  • 代理轮换
  • 隐身浏览器指纹
  • 高性能并行执行

引用

如果你在研究或项目中使用了 Browser Use,请引用:

@software{browser_use2024,
  author = {Müller, Magnus and Žunič, Gregor},
  title = {Browser Use: Enable AI to control your browser},
  year = {2024},
  publisher = {GitHub},
  url = {https://github.com/browser-use/browser-use}
}

告诉你的电脑要做什么,它就能搞定。

Twitter Follow     Twitter Follow

在苏黎世和旧金山用 ❤️ 制作
开源项目browser-use2026-08-26原文

相关内容