拒绝手动搬砖,Hermes操作浏览器的六种武器, 本地的不花钱,付费的能隐身
运营人每天花大量时间在竞品巡查、数据采集、多平台发布等重复操作上。本文从运营实战场景出发,用大白话讲透Hermes六种浏览器模式的原理、使用场景和上手方法——从免费默认模式到专业级反检测抓取,帮你找到最适合自己的自动化方案。
你有没有过这种体验?
早上到公司,打开十几个网页——竞品官网、电商平台、行业论坛、社交媒体后台——挨个看有没有新动态、价格有没有变、用户评价有没有新增。光是"看"完这些,一上午就没了。
然后你开始整理数据。从A网站复制产品名称,从B网站复制价格,从C网站复制用户评价,粘贴到Excel里排好。一个竞品整理完,还有五个。
最后你开始发内容。同一篇产品介绍,要发到公众号、知乎、小红书、今日头条——每个平台的格式不一样,后台登录方式不一样,发布流程也不一样。
这些事情,每一件都不难,但每一件都耗时间。加在一起,就成了运营人最大的时间黑洞。
如果有一个工具,能帮你自动打开网页、抓取数据、填写表单、提交内容、定时监控变化——你只需要告诉它"做什么",它自己去网页上"动手"——你的工作节奏会变成什么样?
Hermes Agent内置了六种浏览器操作模式,覆盖从零配置免费上手的日常自动化,到专业级反检测抓取的全场景需求。这篇文章用运营人最熟悉的场景,帮你搞清楚每种模式适合干什么、怎么装、怎么选。
运营的核心竞争力不是手速,是判断力。把重复操作交给AI,把思考留给自己。
先搞懂一件事:AI是怎么"操作网页"的?
在讲六种模式之前,先花一分钟理解一个底层逻辑——AI不是像人一样"看"网页的。
人打开一个网页,看到的是图片、颜色、排版。AI看到的是结构化的元素列表:这个按钮叫"登录"、那个输入框叫"搜索"、这串文字是"价格:¥299"。Hermes把网页转换成一张精简的"导航图",每个可操作的元素标上编号(比如 @e1、@e2),AI通过编号来执行操作——"点击 @e3"、"在 @e5 输入'蓝牙耳机'"、"读取 @e7 显示的价格"。
这套机制的好处是:速度快、占用资源少、不容易被复杂页面干扰。
六种模式的区别,不在于AI"怎么看"网页,而在于用什么浏览器去打开网页、在哪里运行、能不能绕过网站的反爬检测。
六种模式分两大类:按"隐身能力"划分
选模式之前,先搞清楚一个关键问题:你要操作的网站,会不会拦截自动化访问?
- 如果网站防护宽松(企业官网、内部系统、大部分SaaS后台)——用无隐身能力的模式就够了,免费、简单、速度快。
- 如果网站防护严格(电商平台、票务网站、需要长期维护登录态的场景)——需要有隐身能力的模式,否则频繁访问会被封IP或弹验证码。
下面按这两类分别介绍。
第一类:无隐身能力的模式(适合防护宽松的网站)
模式一:agent-browser——默认兜底,免费零配置
支持的浏览器
本地 Chromium(通过 Playwright 驱动)
核心场景
日常竞品巡查、简单数据抓取、表单填写、内容提交。
其他适用场景
- 批量填写内部系统表单(如批量录入产品信息到后台)
- 定时检查竞品页面变化(配合 Hermes 的定时任务功能)
- 自动化提交内容到防护宽松的发布平台
- 本地开发环境测试(访问 localhost)
工作原理
agent-browser 是 Vercel Labs 开源的 CLI 工具,采用三层架构:Rust CLI 负责快速命令解析,Node.js 守护进程管理浏览器生命周期,还有一个备用层在原生组件不可用时自动顶上。它的核心思路是"结构化快照 + 引用标记 + 原子化交互"——把复杂网页变成对象化、编号化的东西,让 AI 像操作命令行一样操作网页。
具体流程是一个循环:

一旦页面跳转或 DOM 结构发生重大变化,之前的引用编号会立即失效,AI 必须重新扫描获取新编号才能继续操作。这个设计保证了操作的准确性——不会对着一个已经消失的按钮"盲点"。
运营人怎么用
直接对 Hermes 说:
"帮我打开XX竞品的官网,找到产品页面,把产品名称、价格、核心功能描述整理成表格。"
或者:
"帮我登录XX后台,把这份产品信息表批量录入进去。"
Hermes 自动打开浏览器、导航到页面、读取内容或填写表单、提交。
优点
- 完全免费,快捷配置——安装之后自动适配Hermes默认的Local Browser模式
- 上下文占用极低——有测试显示相比传统方式能减少约 93% 的上下文消耗,因为它只把关键信息压缩成紧凑快照
- 支持多任务并行——同一台机器上可运行多个互不干扰的浏览器实例(通过
--session参数) - 不仅能抓取数据,还能提交内容、填写表单、点击按钮
缺点
- 不支持处理浏览器原生弹窗(alert/confirm/prompt)
- 遇到步骤复杂、需要多次判断的"陌生表单填写"流程时容易卡住
- 没有反检测能力,高频访问可能被网站限制
怎么装
npm install -g agent-browser
agent-browser install (注意这一步会需要访问谷歌网络下载最新适配的Chrome浏览器)
agent-browser 需要安装,安装完成之后自动就可以适配Hermes中默认Local Browser的Browser Use格式。
你的时间应该花在判断竞品动态上,不是花在逐个打开网页上。
仙踪问道提醒:在安装完agent-browser之后别忘记安装对应的skill哦,npx skills add vercel-labs/agent-browser一键安装!
模式二:Firecrawl——批量抓取文字内容的专家
支持的浏览器
云端浏览器(具体浏览器类型不暴露给用户,由 Firecrawl 服务端管理)
核心场景
批量采集行业网站内容、整理产品目录、抓取文章列表。
其他适用场景
- 从多个行业网站批量采集竞品信息,生成分析报告
- 抓取课程平台的内容列表(标题、价格、简介)
- 批量提取网页正文内容用于内容分析
- 配合 Hermes 定时任务,定期抓取行业数据生成日报
工作原理
Firecrawl 是云端浏览器服务,自带抓取能力,适合内容抓取为主的任务。浏览器运行在远程服务器上,不占你电脑资源。它的专长是把网页内容变成干净、结构化的文字数据——你告诉它 URL,它返回整理好的文字内容。
优点
- 批量抓取文字内容效率高
- 云端运行,不吃本地资源
- 有免费额度,轻度使用不花钱
- 支持自托管实例和自定义会话存活时间
缺点
- 没有反检测能力,遇到严格反爬的网站可能受限
- 大量使用需付费
- 更适合"抓取"而非"交互操作"(如点击按钮、填写表单)
怎么装
- 去 firecrawl.com 注册拿密钥
- 在
~/.hermes/.env文件里加一行:
FIRECRAWL_API_KEY=你的密钥
- 运行
hermes setup tools,在 Browser Automation 菜单选 Firecrawl 即可
模式三:本地 Chromium CDP 连接——用你自己已登录的浏览器
支持的浏览器
Chrome、Brave、Edge、Chromium(任何支持 Chrome DevTools Protocol 的浏览器)
核心场景
用已登录的账号操作多平台后台(公众号、知乎、小红书等),保留所有登录状态和 Cookie。
其他适用场景
- 需要实时观察 AI 操作过程(调试或演示时很有用)
- 操作需要处理原生弹窗(alert/confirm/prompt)的复杂页面
- 跨域 iframe 操作(其他模式目前不支持)
- 避免云端费用,所有操作在本地完成
工作原理
通过浏览器开发者协议(CDP),Hermes 直接连接到你正在运行的真实浏览器。这是六种模式里唯一支持完整原生弹窗处理和 CDP 原始协议直通的方案,遇到弹窗多或 iframe 嵌套多的复杂后台页面,它是最可靠的选择。
优点
- 保留所有登录状态,不用重复登录
- 能处理原生弹窗和复杂 iframe
- 可以实时观察操作过程
- 免费,数据完全本地化
缺点
/browser connect是交互式命令,只能在终端里的 Hermes 会话中执行(不能在 WebUI、Telegram、Discord 等 gateway 聊天里使用)- 浏览器需要以调试模式启动(Hermes 通常能自动帮你搞定,如果不行就手动加
--remote-debugging-port=9222参数) - 如果在 WSL2 里跑 Hermes 但想控制 Windows 主机上的 Chrome,通常行不通,需要改用 MCP 桥接方案
怎么装
除了你本地的浏览器(还是优先建议使用Chrome),不需要安装任何额外东西。在终端里输入:
/browser connect
Hermes 自动连接你的浏览器。
仙踪问道提醒: 这三种无隐身能力的模式,适合日常防护宽松的场景。如果你刚开始接触 Hermes 的浏览器自动化,建议从 agent-browser 起步——免费、零配置、上手最快。
第二类:有隐身能力的模式(适合防护严格的网站)
模式四:Browserbase——云端反检测,突破电商平台防护
支持的浏览器
云端 Chromium 系浏览器(由 Browserbase 服务端管理)
核心场景
突破电商平台的反爬机制,监控竞品价格和用户评价。
其他适用场景
- 需要长期维护某个网站的登录态,但不想污染本地浏览器环境
- 高频访问防护严格的网站(如票务网站、社交媒体)
- 需要住宅代理 IP 伪装成普通家庭宽带用户的场景
- 需要自动处理验证码(CAPTCHA)的抓取任务
工作原理
Browserbase 是六种模式里反检测能力相当突出的一个。它内置了一整套反检测工具包:
| 能力 | 说明 |
|---|---|
| 随机浏览器指纹 | 每次访问看起来都是不同的设备 |
| CAPTCHA 自动求解 | 遇到验证码自动处理 |
| 住宅代理 IP | 让你的访问看起来像普通家庭宽带用户 |
| Keep Alive 断线重连 | 网络波动也不会丢会话 |
优点
- 反检测能力强,适合严肃的公网抓取
- 稳定,不用自己维护服务器
- 超出免费计划的功能时会自动降级(先关 Keep Alive 再关代理),保证基础功能可用
缺点
- 正式使用需要付费计划
- 免费计划功能受限
怎么装
- 去 browserbase.com 注册拿 API Key 和 Project ID
- 在
~/.hermes/.env里加两行:
BROWSERBASE_API_KEY=你的密钥
BROWSERBASE_PROJECT_ID=你的项目ID
不需要额外安装,Hermes 自动识别。
模式五:Browser Use——Browserbase 的云端备选
支持的浏览器
云端 Chromium 系浏览器(由 Browser Use 服务端管理)
核心场景
Browserbase 的备选方案,或者你本身就在用 Browser Use 生态。
其他适用场景
- Browserbase 的某个功能在你的计划里不可用时,作为替代
- 需要与 Browser Use 平台集成的场景
工作原理
Browser Use 是 Browserbase 的备选云端浏览器提供商。两者功能类似,同时配置时 Browserbase 优先级更高。
怎么装
- 去 browser-use.com 拿密钥
- 在
.env里加一行:
BROWSER_USE_API_KEY=你的密钥
对多数运营用户来说不必额外关注它。
模式六:Camofox——本地反检测,数据不出电脑
支持的浏览器
Firefox 分支 Camoufox(带 C++ 指纹伪装技术)
核心场景
本地反检测 + 长期维护登录态,数据隐私敏感的场景。
其他适用场景
- 需要长期维护某个网站的登录态(如每天签到或定时操作的平台),同时不希望被网站检测到自动化操作
- 对数据隐私有要求,不希望抓取数据经过云端
- 需要 VNC 实时查看操作过程(调试或演示时很有用)
- 需要持久化 Profile(保留登录状态跨会话)
工作原理
Camofox 是本地运行的反检测方案——可以理解为"本地版的 Browserbase"。基于 Firefox 的一个特殊分支(Camoufox),带底层 C++ 指纹伪装技术。运行在你自己电脑上,数据完全本地化。
优点
- 数据完全本地化,隐私可控
- 反检测能力强
- 支持持久化 Profile(保留登录状态)
- 支持 VNC 实时查看
缺点
- 安装门槛相对较高(但比传统的 git clone + Docker 方式简单很多)
怎么装
推荐用 npx 直接运行,最快,无需克隆仓库:
npx @askjo/camofox-browser
或者 npm 全局安装:
npm install -g @askjo/camofox-browser
然后在 ~/.hermes/.env 里加:
CAMOFOX_URL=http://localhost:9377
这种方式比之前写的 git clone + make up 简单很多,临时体验或长期使用都方便。
仙踪问道提醒: 这三种有隐身能力的模式,适合需要突破反爬机制的场景。如果你需要频繁访问电商平台、票务网站等防护严格的站点,Browserbase 是最省心的选择——云端托管,不用自己维护服务器。如果你对数据隐私有要求,Camofox 的本地方案更合适。
六种模式速览对比表
| 模式 | 支持的浏览器 | 运行位置 | 费用 | 反检测能力 | 上手难度 | 最适合的运营场景 |
|---|---|---|---|---|---|---|
| agent-browser | 本地 Chromium | 本地 | 免费 | 无 | 一键安装 | 日常竞品巡查、表单填写、内容提交 |
| Firecrawl | 云端(不暴露) | 云端 | 有免费额度 | 无 | 填密钥即可 | 批量采集行业网站内容 |
| 本地CDP连接 | Chrome/Brave/Edge/Chromium | 本地 | 免费 | 无 | 中等 | 用已登录账号操作多平台后台 |
| Browserbase | 云端 Chromium | 云端 | 付费(有免费计划) | 强 | 填密钥即可 | 突破电商平台反爬机制 |
| Browser Use | 云端 Chromium | 云端 | 付费 | 一般 | 填密钥即可 | Browserbase 的备选方案 |
| Camofox | Firefox(Camoufox分支) | 本地 | 免费 | 强 | 中等(npx一键) | 本地反检测 + 长期维护登录态 |
运营人的选择指南:按需求选模式
按"网站防护程度"选
| 网站防护程度 | 推荐模式 |
|---|---|
| 防护宽松(企业官网、内部系统、SaaS后台) | agent-browser、Firecrawl、本地CDP连接 |
| 防护严格(电商平台、票务网站、社交媒体) | Browserbase、Camofox |
按"操作类型"选
| 操作类型 | 推荐模式 |
|---|---|
| 批量抓取文字内容 | Firecrawl |
| 填写表单、提交内容 | agent-browser、本地CDP连接 |
| 用已登录账号操作后台 | 本地CDP连接 |
| 高频访问防护严格网站 | Browserbase、Camofox |
| 需要处理原生弹窗 | 本地CDP连接(唯一支持) |
按"数据隐私要求"选
| 数据隐私要求 | 推荐模式 |
|---|---|
| 不敏感,可以经过云端 | 所有模式都可以 |
| 敏感,数据必须本地化 | agent-browser、本地CDP连接、Camofox |
一个对运营人特别实用的设计:混合路由
如果你同时配了云端浏览器(比如 Browserbase),但偶尔又要访问本地的 localhost 地址——比如你本地跑着一个测试页面——Hermes 会自动判断:公网 URL 走云端,localhost 和内网地址自动切回本地浏览器。

不需要手动切换。Agent 前一秒还在抓公开网站,下一秒就能操作你本地页面。全程自动。
好工具的衡量标准不是功能有多少,而是你用起来感觉"本来就应该这样"。
怎么开始?三步走
第一步,确保浏览器工具已启用:
hermes config set toolsets '["hermes-cli", "browser"]'
第二步,选模式。大部分运营用户到这步就结束了——agent-browser 默认可用。如需云端模式,去对应平台注册拿密钥,填到 ~/.hermes/.env 里。
第三步,开用。打开 Hermes,直接说:
"帮我打开XX竞品官网,找到产品定价页面,把各版本的价格和功能对比整理成表格。"
或者:
"帮我登录XX后台,把这份产品信息批量录入进去。"
Hermes 自动打开浏览器、导航、读取或填写、整理。
就这么简单。
运营人的浏览器自动化工作流
把六种模式串起来,一个完整的运营自动化工作流是这样的:

从竞品巡查到数据采集,从内容整理到多平台发布,从价格监控到报告生成——以前需要一整天的工作,现在压缩到几个小时,而且大部分时间是 AI 在干活,你在做判断。
写在最后:从工具到助手
浏览器自动化只是 Hermes 能力的一角。如果你想要一个真正能帮你干活的 AI 助手——不只是聊天,而是能自动操作网页、批量处理数据、定时监控竞品、甚至帮你写报告——你需要的是一个完整的本地部署环境。
说到这里,如果你也想搭建自己的 AI 工作台,可以试试仙踪问道·爱马仕助手——它是 macOS 上的 Hermes Agent 本地部署专家,一键安装、自动配置国内网络加速,帮你从零开始搭建 AI 工作台。今天文章里提到的六种浏览器模式,在爱马仕助手里都能直接使用,不需要折腾命令行和环境配置。
重要提醒:关于平台审核风险
虽然 Hermes 的浏览器自动化能力很强大,但仙踪问道团队必须提醒各位运营人:目前小红书、今日头条等平台对自动化提交内容的审核越来越严格。批量自动提交、高频发布等行为可能触发平台风控机制,存在封号风险。
建议在使用浏览器自动化功能时:控制操作频率,不要过于激进优先用于数据抓取、竞品监控等"读取"类任务内容发布类任务建议人工复核后再提交遵守各平台的运营规范和社区规则
工具的价值是帮你提效,不是帮你冒险。理性使用,才能长期受益。
你试过让 AI 帮你自动操作网页吗?在运营工作中,你最想让 AI 帮你自动化哪个环节?是每天重复的竞品巡查,还是批量整理数据,或者是多平台内容发布?
欢迎在评论区聊聊你的经历和需求。如果你已经在用 Hermes 的浏览器功能,也欢迎分享你的实战经验——你的一个技巧,可能帮其他运营人省下几小时。
如果觉得这篇文章对你有帮助,点个赞让更多人看到。觉得有用的话,转发给身边做运营的朋友。关注我,每周分享 AI 工具在运营实战中的落地方法——不讲概念,只讲能直接用的技巧。

