ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Browser-Use 深度调研:让 AI Agent 像人一样操作浏览器的开源框架

Browser-Use 深度调研:让 AI Agent 像人一样操作浏览器的开源框架 Browser-Use 深度调研让 AI Agent 像人一样操作浏览器的开源框架调研时间2026-08-13数据来源GitHub 官方仓库实时 API、官方文档 docs.browser-use.com、PyPI、本地实测项目地址https://github.com/browser-use/browser-use目录项目概况核心定位与价值架构与设计理念核心特性详解安装与快速上手用法 Demo模型支持竞品对比分析商业版本与定价版本演进与兼容性警告综合评分与选型建议参考资源1. 项目概况指标数值GitHub Stars108,967调研当日实时Forks11,972主要语言Python许可证MIT宽松商业友好创建时间2024-10-31最近活跃2026-08-12持续高频更新PyPI 最新版本0.13.72026-07-27最低 Python 3.11官方推荐 3.12一句话定位让 AI Agent 使用浏览器的人类操作方式打开页面、点击、输入、填表Browser-Use 是一个让大语言模型LLM驱动真实浏览器完成任务的 Python 框架。你只需描述任务自然语言它就能像人一样打开网页点击按钮填写表单提取数据多步骤完成任务它目前是AI Agent 浏览器操控领域的绝对头部项目Odysseys 基准测试第一名87.4% 平均分超过 OpenAI、Anthropic、Google、Microsoft 的 computer-use agent在 200 个长时程网页任务的基准上领先2. 核心定位与价值它解决什么问题传统网页自动化Selenium/Playwright需要你手写每一步操作# Playwright写死每一步page.goto(https://example.com/login)page.fill(#username,myuser)page.fill(#password,mypass)page.click(#submit)Browser-Use 则是用对话驱动frombrowser_useimportAgent,ChatOpenAI agentAgent(task登录 example.com使用 myuser/mypass然后发布一条状态,llmllm,)awaitagent.run()LLM 自动决定每一步打开哪个页面、点哪个按钮、填什么内容、出错怎么纠正。关键区别是浏览器操控层不是爬虫框架类型代表定位浏览器操控 AgentBrowser-Use让 AI 操作浏览器干活爬虫框架Selenium / Playwright / Scrapling网页数据抓取LLM 友好爬虫Crawl4AI生产干净 Markdown 供 RAG/Agent 消费网站数据 APIFirecrawl云优先的网页数据服务Browser-Use 适合的是需要做事的场景填表、点按钮、多步骤流程、交互式任务而不只是抓数据。3. 架构与设计理念3.1 包结构GitHub main 分支browser_use/ ├── agent/ # 核心 Agent 循环service.py Agent 类 │ ├── message_manager/ # 消息历史管理 │ ├── system_prompts/ # 系统提示词模板 │ └── prompts.py ├── actor/ # 动作执行器 ├── browser/ # 浏览器会话管理BrowserSession / BrowserProfile ├── controller/ # 动作注册器可扩展自定义工具 ├── dom/ # DOM 解析与元素定位 ├── llm/ # 多提供商 LLM 封装OpenAI/Google/Anthropic/BrowserUse 自家 ├── tools/ # 内置工具 ├── mcp/ # MCP (Model Context Protocol) 集成 ├── telemetry/ # 遥测匿名 ├── skills/ # Agent 技能 └── cli.py # CLI 入口3.2 核心运行循环用户任务自然语言 ↓ Agent 类agent/service.py ↓ 生成下一步动作LLM 决策 Controller 动作注册表打开/点击/输入/滚动/截图... ↓ Browser 会话真实 Chrome 通过 CDP 控制 ↓ 观察新页面状态DOM 摘要 可选截图 ↓ Agent 评估结果 → 下一步或完成这是典型的ReActReasoning Acting循环LLM 每步推理 → 执行动作 → 观察结果 → 再推理。3.3 本地实测的本机 API0.12.9结构本机实测发现 0.12.9 已重构为 Browser Harness 架构frombrowser_use.agent.serviceimportAgent# Agent 类frombrowser_use.browserimportBrowserSession,BrowserProfile# 浏览器会话frombrowser_use.llm.modelsimportChatOpenAI# LLM 封装4. 核心特性详解4.1 Agent智能任务执行 自然语言任务驱动自动分解为多步浏览器操作支持max_steps限制、中断/暂停控制内置结构化输出AgentStructuredOutput直接得到 JSON 而不是文本支持技能Skills注册子技能作为可调用的 action4.2 自定义工具扩展 frombrowser_useimportTools toolsTools()tools.action(description计算两个数字之和)defcustom_add(a:int,b:int)-int:returnab agentAgent(task...,llmllm,toolstools)4.3 浏览器控制 默认启动全新 Chromium 实例支持复用真实 Chrome profile保留登录态# examples/browser/real_browser.pybrowserBrowserProfile(chrome_instance_path/Applications/Google Chrome.app/Contents/MacOS/Google Chrome,# 使用你的真实 profile登录态保留)支持无头模式、视口配置、代理设置远程浏览器Cloud Browser支持隐身指纹与代理轮换4.4 认证与登录 真实浏览器 profile 复用保留 cookie 和会话临时收件箱 AgentMail注册临时账户收验证码profile sync本地 profile 同步到远程浏览器4.5 CLIBrowser-Use CLI 3.0️0.13.3 起发布的 CLI 3.0 由 Browser Harness 驱动browser-use install # 安装 Chromium 依赖 browser-use open url # 打开页面 browser-use click N # 点击元素 browser-use type ... # 输入文本 browser-use extract ... # LLM 提取数据 browser-use eval ... # 执行 JS browser-use connect # 连接现有 ChromeCDP browser-use sessions # 会话管理 browser-use profile # profile 管理安装了browser-use skill后Claude Code / Codex / Cursor / Hermes 等 Agent 可以直接通过 skill 控制浏览器。4.6 MCP 集成内置 MCP server任何支持 MCP 的 Agent 都可以接入 Browser-Use 的浏览器能力。4.7 反爬与验证码开源版普通浏览器自动化反爬能力有限Cloud 版隐身浏览器指纹 代理轮换 CAPTCHA 自动解决官方明确推荐用 Cloud 解决反爬4.8 遥测默认开启匿名遥测可关闭符合现代开源工具标准。5. 安装与快速上手安装官方推荐方式# 1. 创建环境推荐 Python 3.12pipinstalluv uv venv--python3.12source.venv/bin/activate# Windows: .venv\Scripts\activate# 2. 安装 browser-use 与 Chromiumuv pipinstallbrowser-use uvx browser-useinstall配置 LLM创建.env文件填入你的模型 API key。支持提供商环境变量Browser Use 自家模型推荐BROWSER_USE_API_KEY新用户 5 次免费OpenAIOPENAI_API_KEYGoogle GeminiGOOGLE_API_KEYAnthropicANTHROPIC_API_KEY本地 Ollama无需 key首次运行frombrowser_useimportAgent,ChatOpenAIfromdotenvimportload_dotenvimportasyncio load_dotenv()asyncdefmain():llmChatOpenAI(modelgpt-4o)# 也可用 ChatGoogle / ChatAnthropic / ChatBrowserUseagentAgent(taskFind the number 1 post on Show HN,llmllm,)awaitagent.run()if__name____main__:asyncio.run(main())本地实测要点macOSPython 3.11 是硬性要求低于 3.11 直接无法安装browser-use install需下载 Chromium国内网络可能较慢可用系统 Chrome 替代BrowserProfile(chrome_instance_path...)Agent API 是asyncawait agent.run()不要漏掉asyncio.run()免费开源模型如本地 Ollama 或第三方免费 API可以跑但复杂任务正确率明显低于商业模型6. 用法 Demo6.1 最简示例frombrowser_useimportAgent,ChatGoogle agentAgent(task搜索 今日天气 并告诉我结果,llmChatGoogle())awaitagent.run()6.2 填表单frombrowser_useimportAgent,ChatOpenAI agentAgent(task打开 jobs.example.com用我的简历信息填写这份求职申请,llmChatOpenAI(modelgpt-4o),)awaitagent.run()6.3 数据提取导出 CSVfrombrowser_useimportAgent,ChatBrowserUse agentAgent(task提取我的粉丝列表中的结构化数据并导出为 CSV,llmChatBrowserUse(),)awaitagent.run()6.4 结构化输出JSON Schemafrombrowser_useimportAgent,AgentStructuredOutputfrompydanticimportBaseModelclassProduct(BaseModel):name:strprice:floatin_stock:boolagentAgent(task提取这个商品页的信息,llmllm,output_model_schemaProduct,# 直接得到结构化对象)6.5 复用真实 Chrome登录态frombrowser_useimportAgent,BrowserProfile,ChatOpenAI browserBrowserProfile(chrome_instance_path/Applications/Google Chrome.app/Contents/MacOS/Google Chrome,user_data_dir~/.chrome-profile-with-login,# 你的带登录态的 profile)agentAgent(task检查我的 Gmail 新邮件,llmllm,browserbrowser)awaitagent.run()6.6 自定义工具frombrowser_useimportAgent,Tools toolsTools()tools.action(description获取当前股票价格)defget_stock_price(ticker:str)-str:returnf{ticker}: $100.00# 这里接真实 APIagentAgent(task检查 AAPL 股价并搜索相关新闻,llmllm,toolstools)awaitagent.run()6.7 CLI 方式配合 Agent 使用# 交给 AgentClaude Code/Codex/Cursor/Hermes执行browser-useopenhttps://example.com browser-use click2browser-usetypeHello--element3browser-use extract--query页面上的主要内容6.8 QA 自动化agentAgent(taskQA 测试我的本地网站报告任何 bug、可用性问题和视觉不一致,llmllm,)awaitagent.run()7. 模型支持7.1 ChatBrowserUse自家优化模型Browser-Use 官方推出了专门为浏览器自动化优化的模型bu-*系列任务完成速度比普通模型快 3-5 倍通过一个BROWSER_USE_API_KEY即可访问 Claude/GPT/Gemini 多个模型provider-prefix 格式frombrowser_useimportAgent,ChatBrowserUse llmChatBrowserUse(modelanthropic/claude-sonnet-4-6)# 或 openai/gpt-5.5agentAgent(task...,llmllm)7.2 开源预览模型llmChatBrowserUse(modelbrowser-use/bu-30b-a3b-preview)配合官方默认系统提示词直接可用无需额外自定义。7.3 常规提供商提供商类示例模型OpenAIChatOpenAIgpt-4o / gpt-5.5GoogleChatGooglegemini-flash-latestAnthropicChatAnthropicclaude-sonnet-4-6Browser UseChatBrowserUsebu-* 系列本地 / 任意 OpenAI 兼容ChatOpenAI(base_url...)Ollama 等8. 竞品对比分析8.1 四工具横向对比调研当日实时数据维度Browser-UseCrawl4AIScraplingFirecrawlStars108,96777,00073,000155,000许可证MITApache-2.0BSD-3-ClauseAGPL-3.0语言PythonPythonPythonTypeScript创建时间2024-102024-052024-102024-04核心能力AI 操作浏览器LLM 爬虫出 Markdown反爬最强云 API 一站式反爬能力一般Cloud 版强中最强强LLM 集成原生架构核心提取策略之一无重点有本地免费✅✅✅❌云服务交互式任务点击/填表✅唯一擅长❌❌⚠️ 有限8.2 与 Playwright / Selenium 的区别维度Browser-UsePlaywrightSelenium驱动方式LLM 自动决策代码写死代码写死学习成本极低描述任务中学 API中稳定性依赖模型正确率代码即稳定代码即稳定反爬一般一般低适用AI 任务自动化精确可重复测试/抓取传统 WebDriver 兼容核心结论Browser-Use 不是来替代 Playwright/Selenium 的而是补上AI 自主决策这一层。生产级爬虫和精确测试仍然用 Playwright/Selenium 更可控。8.3 各自的不可替代优势工具最亮眼的能力Browser-Use唯一成熟的让 AI 操作浏览器开源框架Odysseys 榜第一Crawl4AI自适应爬取 四种提取策略 双通道 MarkdownRAG 首选Scrapling开箱绕过 Cloudflare Turnstile比 BeautifulSoup 快 784xFirecrawl零配置 7 大 API云优先P95 3.4s9. 商业版本与定价9.1 双版本策略开源版Cloud商业托管成本免费自带 LLM key按量付费新用户 5 次免费任务浏览器本地 Chrome/Chromium云端托管浏览器反爬无特殊处理隐身指纹 代理轮换 CAPTCHA 解决集成108 集成1000 集成Gmail/Slack/Notion 等持久化本地文件持久文件系统 记忆并行需自管高性能并行执行9.2 API 版本API V4推荐高精度适合长复杂工作流当前主推 gpt-5.6-luna 模型API V2低成本、速度优先精度较低9.3 授权要点MIT 许可开源版 MIT 许可 → 可自由商用、修改注意区分Cloud 服务有自己的 ToS 和隐私政策非 MIT10. 版本演进与兼容性警告 ⚠️10.1 API 正在快速重构重要版本变化 0.8.x稳定经典 APIAgent Browser BrowserConfig0.12.xBrowser Harness 重构BrowserSession/BrowserProfile取代旧Browser导出变 lazy0.13.x当前CLI 3.0 Browser Harness 0.1.6ChatBrowserUse强化0.13.7最新稳定2026-07-27踩坑实测本机实测 0.12.9from browser_use import Browser, LLM会报 ImportErrorfrom browser_use.agent.service import Agent可用但browser_use.browser.service已不存在老教程代码大概率失效看文档一定要对版本docs.browser-use.com的 Get Started 是 0.13.x 标准10.2 免费模型使用注意事项开源版免费但需要自带 LLM API keyOpenAI/Google/Claude 或本地 Ollama用第三方免费 API 兼容模型可以跑通但复杂任务正确率明显下降响应可能超时本地实测 hy3-free 模型 5 分钟未完成 4 步任务想要高准确率建议用官方bu-*模型有免费额度11. 综合评分与选型建议11.1 评分1-10维度分数说明社区热度10108K stars增长迅猛易用性9自然语言驱动上手极快架构设计8ReAct 循环清晰模块化好可扩展性9自定义工具/Skills/MCP稳定性7API 快速演进需锁版本反爬能力5开源版弱需 Cloud商业友好9MIT 明确的双版本策略文档质量8官方文档完善但版本漂移11.2 选型建议场景推荐AI Agent 操作浏览器干活填表/点按钮/QA✅Browser-Use唯一选择RAG 管道抓网页转 MarkdownCrawl4AI绕过反爬抓数据Scrapling云 API 快速集成抓取Firecrawl精确可重复的自动化测试Playwright / Selenium编程 Agent 临时用浏览器Browser-Use CLI skill11.3 适合你吗适合想用自然语言让 AI 完成网页操作AI Agent 场景做 Web QA 自动化把浏览器能力接入 Claude Code / Codex / Cursor 等编码 Agent需要结构化数据提取 后续行动不只抓数据不适合大规模数据采集数据抓取用 Crawl4AI/Scrapling 更高效对每一步都要精确控制的场景用 Playwright 写死更可靠免费低成本大批量任务LLM token 成本不低12. 参考资源GitHubhttps://github.com/browser-use/browser-use108,967 stars, MIT官方文档https://docs.browser-use.com官方主页https://browser-use.comCloud 控制台https://cloud.browser-use.comPyPIhttps://pypi.org/project/browser-use/v0.13.7Odyssey 榜https://odysseysbench.com/leaderboard报告完 · Happy Browsing!
返回列表