browse

其他 社区 v1.1.0
解读按原文结构重写,命令、链接、术语均保留;右侧可核对作者原始 SKILL.md

设计思路

browse 是 gstack 的浏览器自动化前端——不是再造一个 Puppeteer,而是把 Playwright daemon 包成一组面向 agent 的命令行 verb($B goto$B text$B chain),让 LLM 可以像写脚本一样驱动一个真实的 Chromium。同一个文件还附带了「Puppeteer → browse」的对照速查,方便从老脚本迁移过来。

工作流

SETUP 阶段先跑健康检查;如果 daemon 没起,会引导你 $B connect 启一个 headed Chromium 并装上配套的 Chrome 扩展。日常使用最常用三组命令:

  • 核心 QAgoto / text / click / fill / screenshot / snapshot 这一票看-点-填的基础动作。
  • chain:通过 stdin 传入一个 JSON 数组(如 [["goto","https://example.com"],["text","h1"]]),一次性把多步串起来跑,遇错即停,结果按命令顺序回 JSON。LLM 调用最爱这条。
  • domain-skill:每个站点的「自学笔记」。save 写入,跑够 N=3 次成功且没被 prompt-injection 分类器标红就自动从 quarantined 升到 active;再 promote-to-global 提升到机器全局。机制本身把 prompt-injection 防护内嵌进升迁流程。

还提供 frame 切 iframe、tabs/tab/tab-each 多标签批处理、state save|load 持久化登录态、handoff 把控制权交还人类用户、resume 接回。Headed 模式 + 代理可以应付反爬严格的站点。

适合谁

  • 写自动化测试、跑端到端 QA 的人
  • 需要 LLM 操作「需要登录的站点」的工程师(用 state 共享登录态)
  • 做爬虫/数据抓取,但要面对反爬的场景

不适合

  • 纯 API 取数——直接 curl 比开浏览器轻
  • 截屏对比 / 视觉回归——配 canary 用更顺手

配套

canary(部署后视觉巡检)、webapp-testing(QA 框架)、make-pdf(用 newtab --json 抓 tabId 再渲染)一起用。

流狐档案 作者与许可取自来源;运行、权限和网络为流狐检测或估算
流狐分类
通用
作者声明 Agent
未找到明确声明;不据此推断已兼容或已测试
静态检查
92 / 100 · 启发式扫描,不代表运行安全
作者 / 版本 / 许可
@garrytan · v1.1.0 · 未声明 license
流狐 Token 估算
较高消耗
流狐接入估算
需简单配置
是否需要外部 API Key
未发现要求
检测到的系统要求
macOS · Linux · Windows
底层运行要求
Bun
检测到的文件与系统行为
  • 只读
  • 允许写入 / 修改
  • Shell 执行
  • 读取环境变量
检测到的网络行为
允许外网请求
安装命令数
无(仅作为资料)

档案由构建时根据 SKILL.md 与安装命令自动衍生,可能与作者实际意图存在差异。

需要注意: 未限定 allowed-tools,默认拥有全部工具权限。

输出预览 browse.preview
作者没有在当前 SKILL.md 中定义固定输出样例。

讨论

基于 GitHub Discussions。登录 GitHub 即可参与讨论、点赞、订阅更新。