Browser Use教程2026:用AI Agent自动化任何网站操作

📘 教程 2026-08-02 约 5 分钟阅读

网站没有API,但你还是要从中提取数据或填写表单。Browser-use教LLM自己操作浏览器。

💡 你将学到

网站没有API,但你还是要从中提取数据或填写表单。Browser-use教LLM自己操作浏览器。

📜 目录

标题:Browser Use 教程 2026:用 AI 智能体自动化任何网站(107k Stars)

Browser Use:当 LLM 学会点击

Browser-use 是一个让 LLM 控制真实浏览器的 Python 库——截至 2026 年 8 月拥有 107,502 个 GitHub Stars,MIT 许可证。不同于为每个页面编写脆弱的 CSS 选择器,你只需用自然语言描述目标,模型就会检查页面、决定点击什么,并通过底层 Playwright 执行操作。

核心思想

传统爬虫是确定性的:找到 CSS 选择器,提取文本。Browser-use 是生成式的:智能体观察渲染后的页面(通过无障碍树和截图),选择动作,观察结果,然后迭代。这正是它能在布局每周变化的网站上工作的原因——智能体每次都会重新读取页面,而不是依赖固定的选择器。

一个可运行的示例

from browser_use import Agent
import asyncio

async def main():
    agent = Agent(
        task="登录到仪表盘,下载今天的销售 CSV,并用邮件发送给我",
        llm=llm,  # 任何支持工具调用的模型
    )
    await agent.run()

asyncio.run(main())

这个任务——登录、导航、下载、编写邮件——正是那种过去需要为每个网站编写自定义 Playwright 脚本的多步骤工作流。

适用场景与难点

它擅长:表单填写、多步骤购买、从 JS 密集的仪表盘中提取数据、以及 QA 流程。它不擅长:面对激进的机器人检测页面(如 Cloudflare 挑战)、长时间运行导致会话漂移、以及任何需要像素级视觉判断的任务——尽管视觉模型在 2026 年已经大幅缩小了这一差距。

成本与速度现实

每一步都是一次 LLM 调用。一个 20 步的工作流可能消耗 30-60k 个 token,耗时 1-3 分钟。这对于自动化和 QA 来说还不错,但对于批量爬取来说太慢太贵——因此团队往往将它与普通爬虫(如 Crawlee)配合使用来完成批量任务,而将 browser-use 用于需要判断力的任务。

常见问题

它是否兼容任何 LLM? 是的——OpenAI、Anthropic、Gemini 以及通过 Ollama 运行的本地模型都可以。

它和 Playwright 一样吗? Playwright 是底层驱动,browser-use 在其之上增加了 LLM 决策层。

它能处理需要登录的网站吗? 可以,你可以传入 cookies 或让它用凭据登录。

Browser-use 免费吗? 采用 MIT 许可证;你只需为它使用的 LLM 调用付费。

相关文章

❓ 常见问题

Does it work with any LLM?

Yes - OpenAI, Anthropic, Gemini, and local models via Ollama all work.

Is it the same as Playwright?

Playwright is the underlying driver; browser-use adds the LLM decision layer on top.

Can it handle login-protected sites?

Yes, you can pass cookies or let it log in with credentials.

Is browser-use free?

MIT-licensed; you pay only for the LLM calls it makes.

相关文章
2026-08-01
VS Code免费AI编程助手:7款实测对比
2026-08-14
Dify Workflow vs Chatflow 2026:你该建哪个?
2026-08-06
AI网络爬虫:用开源工具构建搜索引擎级爬虫

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论