Browser Use
Browser Use 作为开源浏览器 Agent harness 的动作空间、持久工具、恢复循环和网页任务拆解。
Browser Use 是面向浏览器自动化 Agent 的开源项目。它适合学习“怎样把真实网页变成 Agent 可操作环境”:模型需要观察页面、选择动作、执行点击输入、处理失败并完成网页任务。
基础核验
| 字段 | 信息 |
|---|---|
| 最近核验 | 2026-06-13 |
| 官方仓库 | browser-use/browser-use |
| 官方站点 | browser-use.com |
| 分类 | 浏览器智能体 / browser harness |
| 许可证 | MIT,已通过 GitHub API 核验 |
一句话定位
Browser Use 适合学习浏览器 Agent 的底层动作空间和恢复机制:它关注真实网页、真实浏览器、持久工具、失败恢复和网页任务完成链路。
值得学习的工程点
- 浏览器 harness:把网页状态、动作和观察变成 Agent 可以使用的接口。
- 动作空间:点击、输入、等待、下载、导航等动作必须有明确反馈。
- 恢复循环:网页任务经常失败、变化或需要重试,不能只靠一次点击。
- Python API + 底层 runtime:适合观察高层 Agent 逻辑和底层浏览器执行之间的边界。
- 与 coding agent 类比:浏览器任务也需要计划、执行、观察、恢复和终止条件。
不适合直接照搬的地方
- 浏览器 Agent 连接真实账号和外部网站时风险很高,必须处理登录态、隐私和确认动作。
- 网页结构变化快,不能只依赖脆弱 selector。
- 自动提交表单、购买、发消息、改权限等动作必须有人类确认。
后续深拆问题
- Browser Use 如何表示页面状态和可执行动作。
- 它如何处理失败重试和页面变化。
- 它如何和远程浏览器、云浏览器或本地浏览器组合。
核心链路
正在渲染图表…
Browser Use 的核心是 browser harness:把视觉和 DOM 状态转成模型可理解的观察,把模型动作转成可执行浏览器操作。
拆解清单
- 页面观察是否包含可点击元素、文本、URL、截图或 DOM 摘要。
- 动作空间是否有限制,是否能防止误提交。
- 登录态、cookie、下载文件和账号权限如何隔离。
- 网页变化、弹窗、验证码、超时如何处理。
- 高风险动作是否需要人工确认。