Browser-Use 入门指南:用自然语言驱动浏览器完成网页任务
【免费下载链接】browser-use🌐 Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use
Browser-Use 是开源的 AI 浏览器自动化框架:你写一句任务描述,它驱动真实浏览器完成登录、填表、抓取、下载这类重复网页操作。跑通全文的最小任务后,你可以把任意一句工作描述交给它执行,并拿到结构化的执行记录。
能力速览:它能替你做什么
- 打开页面、点击、输入、滚动、下载,操作路径和人一致,任务描述用自然语言即可。
- 大脑可换:统一接口接 OpenAI、Google、Anthropic 等各家模型,也支持 Ollama 本地模型。
- 框架 MIT 开源免费,成本只在模型 API 调用;本地模型连这部分也省掉。
- 边界说清楚:它处理的是浏览器里看得见的操作,不替代服务端 API 集成;高并发生产负载建议用官方云端浏览器托管。
环境配置:从克隆到 API Key
安装要求 Python 3.11 及以上,共 3 步。第一条命令克隆仓库到本地:
git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use pip install -e ".[cli]"第二条命令把项目装进当前 Python 环境,依赖随之拉齐。最后在仓库根目录建一个.env文件,写入模型密钥,二选一即可:
# .env BROWSER_USE_API_KEY=你的密钥 # 或 GOOGLE_API_KEY / ANTHROPIC_API_KEY第一个任务:查一个真实的 GitHub 星标数
把下面脚本存成任意名字,运行后浏览器窗口会自己打开、找到项目主页、读出色星标数字,最后把执行记录打印出来——看到真实数字就算跑通了:
import asyncio from browser_use import Agent, ChatBrowserUse async def main(): agent = Agent( task="查找 browser-use 项目在 GitHub 上的星标数", llm=ChatBrowserUse(model="openai/gpt-5.5"), ) history = await agent.run() print(history) asyncio.run(main())输入只有task一句话;换掉这句描述,它就是你自己的自动化脚本。
场景实战:任务描述怎么写
电商比价——任务描述:“访问京东、天猫、拼多多,记录 iPhone 15 的当前售价和评价数量,整理成 CSV,列包含商品名、价格、评价数。”适合运营和市场研究。
批量入职申请——任务描述:“登录公司招聘系统,为张三(前端)、李四(后端)填写入职申请表,必填项核对无误后提交并截图留档。”适合人事和招聘团队。
站点巡检——任务描述:“每小时检查官网首页一次,若 404、加载超过 10 秒或出现报错页,给运维群发通知,并把时间戳与结果写入日志。”适合运维和客服值班。
复杂流程也有现成参照:examples/apps/ad-use/ 让 AI 抓取官网信息后生成广告素材和落地页。
进阶方向:工具注册与浏览器配置
注册自定义工具:给 AI 加一个它会主动调用的能力。运行后你在执行记录里能看到它在需要求和的步骤直接调了工具,而不是心算:
from browser_use import Agent, Tools tools = Tools() @tools.action(description="计算两个数字的和") def add_numbers(a: int, b: int) -> int: return a + b agent = Agent(task="计算 17 和 25 的和", llm=llm, tools=tools)调浏览器行为:无头模式、下载目录等参数都集中在 BrowserProfile 上,改一处全局生效:
from browser_use import Agent from browser_use.browser import BrowserProfile, BrowserSession profile = BrowserProfile(headless=True, downloads_path="./downloads") agent = Agent(task="下载本月账单 PDF", llm=llm, browser_session=BrowserSession(browser_profile=profile))页面加载、弹窗、下载完成这类时机还想挂自己的回调,可以去看 browser_use/browser/watchdogs/ 里的各 watchdog 实现,照着加一个即可。
模型选型:基准图怎么看
官方在 100 个真实浏览器任务上做了基准测试,各模型成功率对比如下:
- 追成功率:用官方优化模型 ChatBrowserUse,图上居首,官方口径完成任务比其他模型快 3-5 倍。
- 控成本:GPT-5.5、Gemini Flash 这类通用模型成本更低,成功率仍在六成上下。
- 数据不出内网:接 Ollama 跑本地模型,配置只换 llm 这一行,参见 examples/models/ollama.py。
稳定运行清单:稳定性 / 安全 / 性能
- 稳定性:任务里写明可验证的完成标准(例如“提交后出现成功提示”);用
max_steps参数给步数兜底,防止死循环。 - 安全:密钥只放
.env环境变量;敏感网站的账号密码交给 2FA 集成(examples/custom-functions/2fa.py),不要明文传给模型。 - 性能:并发 Agent 先控制在 3 个以内,每个都占一份浏览器内存;大站点任务用 BrowserProfile 关掉无谓加载、指定下载路径提速。
常见问题
框架收费吗?开源免费,MIT 协议。只为模型 API 付费,跑本地模型则不产生调用费。
不会写代码能用吗?最小任务十几行,照抄示例改任务描述即可;复杂场景直接翻 examples/ 目录的现成脚本。
需要登录的网站怎么办?支持保存登录态和真实浏览器配置,首次登录后后续任务保持登录,参考 examples/browser/save_cookies.py。
能用哪些大模型?见 llm/ 目录,OpenAI、Google、Anthropic、Ollama 等都有封装,ChatBrowserUse 还能用一个密钥访问多家供应商的模型。
会被网站检测到吗?基于 Chromium 内核,内置拟人化操作和随机延迟。高安全站点先小规模试跑,再决定是否放量。
下一步行动
- 跑通上文的最小任务,确认你的密钥和浏览器配置可用。
- 到 examples/ 挑一个最像你日常工作的示例,改掉任务描述再跑一次。
- 给高频任务注册一个自定义工具,或把 llm 换成 Ollama 本地模型。
常用资源:总览 README.md、能力速查 skills/、边界情况测试 tests/。
【免费下载链接】browser-use🌐 Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考