BrowserAct 实战:反爬、验证码、Skill 体系与浏览器自动化全解析

发布时间:2026-07-29 09:35   浏览量:39
蛋蛋之家
https://wuqishi.com/rss.xml
一枚蛋蛋的自留地

零、题外话
昨天使用 AI 的时候突然给我来了这么一段:



好嘛,都会自我说明失误了,确定这不是你的失误吗?
下面进入正题👇

一、问题:为什么现有工具搞不定真实网站?
1.1 一个真实的踩坑经历
前阵子想让 AI Agent 去小红书抓一批热门帖子。Agent 写好脚本、拉起 Playwright、打开浏览器——然后 Cloudflare 的验证页面弹出来,任务直接卡死。
手动点掉验证码?脚本的状态已经丢了,前后对不上。重新跑?验证码可能又弹出来。来来回回折腾几次,最后放弃,老老实实复制粘贴了一下午。

💡 核心问题:这不是 AI "不够聪明",而是现有工具根本不是为 Agent 设计的。

1.2 传统工具 vs Agent 工作模式的错位










维度


Playwright / Puppeteer / Selenium


AI Agent




工作方式


人类写固定脚本,机器照着执行


观察页面 → 决策 → 执行




元素定位


XPath / CSS selector


需要理解页面结构




容错能力


低(selector 一变就崩)


需要自适应




Token 消耗


不关心


DOM 文本动辄几千 token





传统工具的底层逻辑是"录宏再回放"。但 Agent 的工作方式完全不同:它先观察当前页面,再决定下一步做什么。两种模式根本不在一个频道上。
1.3 BrowserAct 的解法
把页面上所有可交互元素列出来,编上号。
AI 只需要说"点 3 号"、"往 2 号框里填 xxx"就行。不需要 XPath,不需要 selector,AI 看一眼索引列表就能干活。

🔑 设计哲学:让工具适配 AI 的思考方式,而不是反过来。


二、BrowserAct 的四层核心设计


整体示意图

2.1 索引式交互:Token 消耗降低 93%
# 查看当前页面所有可交互元素
browser-act --session my-task state
输出示例(示意):
[1] 登录
[2] 搜索关键词
[3] 热门推荐
# 通过索引操作,无需写 selector
browser-act --session my-task click 3
browser-act --session my-task input 2 "AI Agent"
相比把整页 DOM 丢给 LLM 解析,索引式交互的 token 效率高得多——官方数据称可减少约 93% 的 token 消耗。

2.2 三层渐进式反爬
BrowserAct 把反爬拆成三个层次,而不是简单丢给你一个代理池:
第一层:环境层 —— 指纹伪装
不只是改 User-Agent,而是把请求头各字段、TLS 指纹、Canvas / WebGL / Audio 指纹都做到位,让每个会话看起来都是独立的真人用户。
这一步能挡掉大部分基础反爬。
第二层:执行层 —— 自动处理验证码










命令


功能


适用场景




​solve-captcha​


自动识别 hCaptcha、reCAPTCHA、Turnstile


遇到验证码弹窗




​stealth-extract​


零配置提取受保护页面内容


只需要内容,不需要交互





第三层:人工层 —— remote-assist​
真搞不定了叫人帮忙。Agent 卡住时生成一个链接,你点开就能在浏览器里接管当前会话。手动处理完验证码或登录后,Agent 从断点继续执行,会话状态连续,不需要重新开始。

⚠️ 这个设计很务实:承认自动化有边界,给人留一个口子。比那些强撑"全自动无人值守"的方案靠谱得多——真实世界本来就是 messy 的。


2.3 三种浏览器模式










模式


用途


特点




​chrome​


复用本地登录态


继承 Gmail、GitHub、公司 SSO,无需重新登录




​stealth​ 隐私模式


无痕批量抓取


每次新环境,指纹不同、IP 可轮换,用完即销毁




​stealth​ 固定身份


多账号操作


每个账号绑定固定指纹 + IP,防止平台关联






2.4 会话隔离与并发安全
# 两个完全隔离的会话,互不影响
browser-act --session taobao-spider browser open https://taobao.com
browser-act --session jd-spider browser open https://jd.com
每个会话跑在独立的浏览器实例里,文件系统、内存、网络全隔离。同一个浏览器内开多个 tab 也行,但会话之间不会串 cookies、不会掉登录态。

2.5 安全确认机制
以下敏感操作每次都需要用户明确确认,且不会"记住"上一次的选择:


创建 / 删除浏览器


导入 Profile


修改代理


开关隐私设置


这个机制在 Skill 层强制执行,不是可以关掉的配置项。对于长期跑自动化的场景,能避免不少误操作事故。

三、Skill 体系:一次探索,重复使用
3.1 为什么要用 Skill?
如果每次让 Agent 抓数据都要重新打开浏览器、分析页面结构、找元素位置——效率太低,token 也烧得厉害。
Skill 的思路:探索一次,重复使用。

3.2 两层架构
┌─────────────────────────────────────────┐
│ Skill Forge(生成工具) │
│ 自然语言描述 → 自动探索 → 生成 Skill 包 │
│ 优先抓 API 端点,找不到再退到 DOM 模式 │
└─────────────────────────────────────────┘

┌─────────────────────────────────────────┐
│ Solutions Catalog(预置库) │
│ 30+ 现成 Skill,开箱即用 │
└─────────────────────────────────────────┘
Skill Forge 工作流程


描述需求:用自然语言,不用写代码


自动探索:打开 stealth 浏览器,优先抓取网络请求发现内部 API(API 比 DOM 稳定,网站改版时接口一般不变)


生成包:包含 SKILL.md​ + 可执行脚本,业务参数作为命令行参数暴露出来,而不是硬编码


自动测试:子代理跑一遍,失败了自己修,直到通过


Solutions Catalog 覆盖范围









类别


代表 Skill




电商


Amazon 商品详情、淘宝关键词搜索、1688、闲鱼




线索挖掘


Google Maps 商家、LinkedIn 职位、Product Hunt




搜索研究


Google SERP、新闻、网站深度爬取




社媒监听


小红书、知乎、Reddit、Instagram、X




视频平台


YouTube、TikTok、抖音






3.3 三种使用路径









场景


推荐方式




临时任务、一次性需求


直接用 browser-act​ 命令行或实时操作




长期跑、批量跑、重复跑


先用 Skill Forge 生成 Skill,后面直接调用




懒得自己探索


去 Solutions Catalog 找现成的






📌 三条路径不互斥,可以混着用。


四、实际用法示例
4.1 零配置提取受保护页面
# 一条命令,不需要写抓取代码
browser-act stealth-extract https://www.xiaohongshu.com/explore
自动开反检测浏览器,等 JS 渲染完,结构化输出页面内容。

4.2 让 Agent 在知乎上搜东西
直接跟 Agent 说:

用 BrowserAct 在知乎搜"AI Agent 2026",把前十条标题和链接整理给我。

Agent 会自己调用 browser-act 打开知乎 → 输入关键词 → 点搜索 → 提取结果。全程旁观即可。

4.3 索引式操作完整流程
# Step 1: 启动会话并打开页面
browser-act --session my-task browser open https://example.com

# Step 2: 查看当前页面可交互元素
browser-act --session my-task state
# 输出示意: [1] 登录 [2] 搜索 [3] 链接

# Step 3: 通过索引点击
browser-act --session my-task click 3

# Step 4: 通过索引输入
browser-act --session my-task input 2 "hello"

五、安装与兼容性
5.1 一键安装
直接跟 Agent 说:

帮我安装 BrowserAct。Skill 源:https://github.com/browser-act/skills/tree/main/browser-act。安装完后验证一下能不能用。

Agent 会自动完成检测环境 → 拉取 Skill 文件 → 验证安装。前后不到一分钟。

5.2 兼容性









维度


支持情况




Agent


Claude Code、Cursor、VS Code、OpenCode、OpenClaw、Codex、Gemini CLI




操作系统


Windows、macOS、Linux




前提


能执行 shell 命令并加载 Skill 即可






六、定价与总结
6.1 定价表











功能


免费(无需注册)


免费(需登录)


付费




浏览器自动化、Chrome / Chrome-direct













Stealth 浏览器(≤5 个)、stealth-extract、solve-captcha、remote-assist、隐私模式、Skill Forge













Stealth 浏览器(>5 个)、动态 / 静态代理














大部分功能免费。付费项只有托管代理和超过 5 个 stealth 浏览器实例。

🎁 福利:给项目点 Star 后,加入 Discord 在 #claim-500-credits​ 频道可领取 500 免费积分。


6.2 一点看法
BrowserAct 做对了一件事:它没有试图让 AI 变得全能,而是承认了 AI 的边界,然后用工具把边界往外推了一点。


不需要让 AI 学会写 XPath → 把可交互元素编号让它选


不需要让 AI 硬扛验证码 → 把人类作为最后一层保障接进来


不需要让 AI 每次都重新探索页面结构 → 让 Skill Forge 生成可复用的包


如果你也被验证码、登录态、并发 session 这些东西搞到头大,BrowserAct 值得花一个下午试试。

6.3 相关链接









资源


链接




项目地址


https://github.com/browser-act/skills




文档


https://github.com/browser-act/skills/blob/main/docs/README.md




Discord 社区


https://discord.com/invite/UpnCKd7GaU





查看原文

该站点最新相关文章