BrowserAct 实战:反爬、验证码、Skill 体系与浏览器自动化全解析
发布时间:2026-07-29 09:35 浏览量:39
零、题外话
昨天使用 AI 的时候突然给我来了这么一段:
好嘛,都会自我说明失误了,确定这不是你的失误吗?
下面进入正题👇
一、问题:为什么现有工具搞不定真实网站?
1.1 一个真实的踩坑经历
前阵子想让 AI Agent 去小红书抓一批热门帖子。Agent 写好脚本、拉起 Playwright、打开浏览器——然后 Cloudflare 的验证页面弹出来,任务直接卡死。
手动点掉验证码?脚本的状态已经丢了,前后对不上。重新跑?验证码可能又弹出来。来来回回折腾几次,最后放弃,老老实实复制粘贴了一下午。
💡 核心问题:这不是 AI "不够聪明",而是现有工具根本不是为 Agent 设计的。
1.2 传统工具 vs Agent 工作模式的错位
维度
Playwright / Puppeteer / Selenium
AI Agent
工作方式
人类写固定脚本,机器照着执行
观察页面 → 决策 → 执行
元素定位
XPath / CSS selector
需要理解页面结构
容错能力
低(selector 一变就崩)
需要自适应
Token 消耗
不关心
DOM 文本动辄几千 token
传统工具的底层逻辑是"录宏再回放"。但 Agent 的工作方式完全不同:它先观察当前页面,再决定下一步做什么。两种模式根本不在一个频道上。
1.3 BrowserAct 的解法
把页面上所有可交互元素列出来,编上号。
AI 只需要说"点 3 号"、"往 2 号框里填 xxx"就行。不需要 XPath,不需要 selector,AI 看一眼索引列表就能干活。
🔑 设计哲学:让工具适配 AI 的思考方式,而不是反过来。
二、BrowserAct 的四层核心设计
整体示意图
2.1 索引式交互:Token 消耗降低 93%
# 查看当前页面所有可交互元素
browser-act --session my-task state
输出示例(示意):
[1] 登录
[2] 搜索关键词
[3] 热门推荐
# 通过索引操作,无需写 selector
browser-act --session my-task click 3
browser-act --session my-task input 2 "AI Agent"
相比把整页 DOM 丢给 LLM 解析,索引式交互的 token 效率高得多——官方数据称可减少约 93% 的 token 消耗。
2.2 三层渐进式反爬
BrowserAct 把反爬拆成三个层次,而不是简单丢给你一个代理池:
第一层:环境层 —— 指纹伪装
不只是改 User-Agent,而是把请求头各字段、TLS 指纹、Canvas / WebGL / Audio 指纹都做到位,让每个会话看起来都是独立的真人用户。
这一步能挡掉大部分基础反爬。
第二层:执行层 —— 自动处理验证码
命令
功能
适用场景
solve-captcha
自动识别 hCaptcha、reCAPTCHA、Turnstile
遇到验证码弹窗
stealth-extract
零配置提取受保护页面内容
只需要内容,不需要交互
第三层:人工层 —— remote-assist
真搞不定了叫人帮忙。Agent 卡住时生成一个链接,你点开就能在浏览器里接管当前会话。手动处理完验证码或登录后,Agent 从断点继续执行,会话状态连续,不需要重新开始。
⚠️ 这个设计很务实:承认自动化有边界,给人留一个口子。比那些强撑"全自动无人值守"的方案靠谱得多——真实世界本来就是 messy 的。
2.3 三种浏览器模式
模式
用途
特点
chrome
复用本地登录态
继承 Gmail、GitHub、公司 SSO,无需重新登录
stealth 隐私模式
无痕批量抓取
每次新环境,指纹不同、IP 可轮换,用完即销毁
stealth 固定身份
多账号操作
每个账号绑定固定指纹 + IP,防止平台关联
2.4 会话隔离与并发安全
# 两个完全隔离的会话,互不影响
browser-act --session taobao-spider browser open https://taobao.com
browser-act --session jd-spider browser open https://jd.com
每个会话跑在独立的浏览器实例里,文件系统、内存、网络全隔离。同一个浏览器内开多个 tab 也行,但会话之间不会串 cookies、不会掉登录态。
2.5 安全确认机制
以下敏感操作每次都需要用户明确确认,且不会"记住"上一次的选择:
创建 / 删除浏览器
导入 Profile
修改代理
开关隐私设置
这个机制在 Skill 层强制执行,不是可以关掉的配置项。对于长期跑自动化的场景,能避免不少误操作事故。
三、Skill 体系:一次探索,重复使用
3.1 为什么要用 Skill?
如果每次让 Agent 抓数据都要重新打开浏览器、分析页面结构、找元素位置——效率太低,token 也烧得厉害。
Skill 的思路:探索一次,重复使用。
3.2 两层架构
┌─────────────────────────────────────────┐
│ Skill Forge(生成工具) │
│ 自然语言描述 → 自动探索 → 生成 Skill 包 │
│ 优先抓 API 端点,找不到再退到 DOM 模式 │
└─────────────────────────────────────────┘
↓
┌─────────────────────────────────────────┐
│ Solutions Catalog(预置库) │
│ 30+ 现成 Skill,开箱即用 │
└─────────────────────────────────────────┘
Skill Forge 工作流程
描述需求:用自然语言,不用写代码
自动探索:打开 stealth 浏览器,优先抓取网络请求发现内部 API(API 比 DOM 稳定,网站改版时接口一般不变)
生成包:包含 SKILL.md + 可执行脚本,业务参数作为命令行参数暴露出来,而不是硬编码
自动测试:子代理跑一遍,失败了自己修,直到通过
Solutions Catalog 覆盖范围
类别
代表 Skill
电商
Amazon 商品详情、淘宝关键词搜索、1688、闲鱼
线索挖掘
Google Maps 商家、LinkedIn 职位、Product Hunt
搜索研究
Google SERP、新闻、网站深度爬取
社媒监听
小红书、知乎、Reddit、Instagram、X
视频平台
YouTube、TikTok、抖音
3.3 三种使用路径
场景
推荐方式
临时任务、一次性需求
直接用 browser-act 命令行或实时操作
长期跑、批量跑、重复跑
先用 Skill Forge 生成 Skill,后面直接调用
懒得自己探索
去 Solutions Catalog 找现成的
📌 三条路径不互斥,可以混着用。
四、实际用法示例
4.1 零配置提取受保护页面
# 一条命令,不需要写抓取代码
browser-act stealth-extract https://www.xiaohongshu.com/explore
自动开反检测浏览器,等 JS 渲染完,结构化输出页面内容。
4.2 让 Agent 在知乎上搜东西
直接跟 Agent 说:
用 BrowserAct 在知乎搜"AI Agent 2026",把前十条标题和链接整理给我。
Agent 会自己调用 browser-act 打开知乎 → 输入关键词 → 点搜索 → 提取结果。全程旁观即可。
4.3 索引式操作完整流程
# Step 1: 启动会话并打开页面
browser-act --session my-task browser open https://example.com
# Step 2: 查看当前页面可交互元素
browser-act --session my-task state
# 输出示意: [1] 登录 [2] 搜索 [3] 链接
# Step 3: 通过索引点击
browser-act --session my-task click 3
# Step 4: 通过索引输入
browser-act --session my-task input 2 "hello"
五、安装与兼容性
5.1 一键安装
直接跟 Agent 说:
帮我安装 BrowserAct。Skill 源:https://github.com/browser-act/skills/tree/main/browser-act。安装完后验证一下能不能用。
Agent 会自动完成检测环境 → 拉取 Skill 文件 → 验证安装。前后不到一分钟。
5.2 兼容性
维度
支持情况
Agent
Claude Code、Cursor、VS Code、OpenCode、OpenClaw、Codex、Gemini CLI
操作系统
Windows、macOS、Linux
前提
能执行 shell 命令并加载 Skill 即可
六、定价与总结
6.1 定价表
功能
免费(无需注册)
免费(需登录)
付费
浏览器自动化、Chrome / Chrome-direct
✓
✓
✓
Stealth 浏览器(≤5 个)、stealth-extract、solve-captcha、remote-assist、隐私模式、Skill Forge
—
✓
✓
Stealth 浏览器(>5 个)、动态 / 静态代理
—
—
✓
大部分功能免费。付费项只有托管代理和超过 5 个 stealth 浏览器实例。
🎁 福利:给项目点 Star 后,加入 Discord 在 #claim-500-credits 频道可领取 500 免费积分。
6.2 一点看法
BrowserAct 做对了一件事:它没有试图让 AI 变得全能,而是承认了 AI 的边界,然后用工具把边界往外推了一点。
不需要让 AI 学会写 XPath → 把可交互元素编号让它选
不需要让 AI 硬扛验证码 → 把人类作为最后一层保障接进来
不需要让 AI 每次都重新探索页面结构 → 让 Skill Forge 生成可复用的包
如果你也被验证码、登录态、并发 session 这些东西搞到头大,BrowserAct 值得花一个下午试试。
6.3 相关链接
资源
链接
项目地址
https://github.com/browser-act/skills
文档
https://github.com/browser-act/skills/blob/main/docs/README.md
Discord 社区
https://discord.com/invite/UpnCKd7GaU
该站点最新相关文章