浏览器

web-session-miner

试用

⚠️ 前置依赖:browser-skill(bsk CLI + Chromium 扩展,需先在 WorkBuddy 插件市场安装)。 网页登录态数据挖掘器(通用版)。复用用户已登录浏览器的登录态(cookies),通过 browser-skill 驱动真实浏览器抓取网页版数据,把「人肉复制粘贴」变成程序化采集,零 API 成本获取企业工商、 人物图谱、股权穿透、财务等深度数据,并输出结构化 JSON 或 HTML 报告。当目标网站同时提供 「官方 MCP/API(按次计费)」与「网页版(会员展示)」时,还能额外绕开 API 积分计费。 采用「通用方法论 + 站点适配器(recipes)」可插拔架构,内置企查查适配器,可扩展天眼查、 爱企查、国家企业信用信息公示系统等任意有「网页版 + 会员登录态」的站点。当用户需要查企业、 查老板、查股东、查实控人、股权穿透、对外投资、企业尽调、供应商背调、批量采集时使用。 触发词:查企业、查老板、查股东、查实控人、股权穿透、对外投资、企业尽调、 工商信息、人物图谱、网页抓取、登录态抓取、批量采集、数据挖掘。

它能做什么

⚠️ 前置依赖:browser-skill(bsk CLI + Chromium 扩展,需先在 WorkBuddy 插件市场安装)。 网页登录态数据挖掘器(通用版)。复用用户已登录浏览器的登录态(cookies),通过 browser-skill 驱动真实浏览器抓取网页版数据,把「人肉复制粘贴」变成程序化采集,零 API 成本获取企业工商、 人物图谱、股权穿透、财务等深度数据,并输出结构化 JSON 或 HTML 报告。当目标网站同时提供 「官方 MCP/API(按次计费)」与「网页版(会员展示)」时,还能额外绕开 API 积分计费。 采用「通用方法论 + 站点适配器(recipes)」可插拔架构,内置企查查适配器,可扩展天眼查、 爱企查、国家企业信用信息公示系统等任意有「网页版 + 会员登录态」的站点。当用户需要查企业、 查老板、查股东、查实控人、股权穿透、对外投资、企业尽调、供应商背调、批量采集时使用。 触发词:查企业、查老板、查股东、查实控人、股权穿透、对外投资、企业尽调、 工商信息、人物图谱、网页抓取、登录态抓取、批量采集、数据挖掘。

技能文档

Web Session Miner(网页登录态数据挖掘器·通用版)

一句话定位

本 SKILL 复用你已登录浏览器的登录态,驱动真实浏览器抓取网页版数据,把「人肉复制粘贴」 变成程序化采集。只要目标网站有「网页版 + 会员登录态」,就适用。

当网站同时提供「官方 MCP / API(按次计费)」和「网页版(会员展示)」时,还能额外 绕开 API 积分计费,零 API 成本拿到全量深度数据。

这是「企查查浏览器抓取」案例的通用化抽象。它不绑定任何单一网站——凡是满足 「有网页版 + 会员登录态」的站点,都可以通过写一个「站点适配器(recipe)」接入; 若同时存在按量计费的 API,则额外获得「绕开积分」的收益。

核心认知:复用登录态采集,双轨计费时额外绕开 API

本 SKILL 的核心能力是「复用登录态,自动化采集网页版已授权数据」——只要网站有网页版 + 会员登录态,就能把「人肉复制粘贴」变成程序化采集。

在此基础上,许多数据服务采用「双轨计费」,能带来额外收益:

轨道你买到的是什么计费方式
网页版会员(SVIP/VIP/Pro)网页/App 内无限次查看深度字段的权益订阅制(包月/包年)
开放平台 API / MCP程序化调用数据的次数按次 / 积分制

两套计费互不相通:你买了网页版会员,通常不含 API 调用额度。于是——用浏览器复用 你网页版会员的登录态去抓数据,不仅自动化采集,还「零 API 成本拿数据」。

简言之:有网页版会员 = 核心适用(省人力);再叠加按量计费的 API = 额外适用(省积分)。

⚠️ 合规边界(使用前必读)

本 SKILL 是「高效采集你自己已授权数据」的效率工具,仅限以下范围:

  • ✅ 只抓取你自己账号有权查看的数据(你已付费/已授权的会员权益内)。
  • ✅ 遵守目标网站服务条款(ToS)与 robots 协议,控制抓取频率。
  • 禁止绕过付费墙获取未授权数据、大规模商业爬取、以及任何违法用途。
  • ⚠️ 使用者对自身行为负责;本工具不用于「破解付费墙」。

适用性判断:哪些网站适用

判断一个网站是否适用本 SKILL,只需回答一个问题,其余都是加分项:

核心判断(决定适不适用)——有没有「网页版 + 会员登录态」(登录后能看到深度数据)?

  • → 适用(核心价值:省人力,把「人肉复制粘贴」变程序化采集)
  • (只有 API,或纯功能无会员数据)→ 不适用

加分判断(决定额外收益,不影响适用性)——有没有按量计费的 API/MCP?

  • → 双轨:省人力 + 省积分(价值最大化)
  • (API 免费或无 API)→ 单轨:只省人力

现实中的数据网站,MCP/API 几乎都按量收费(免费额度很抠),所以「双轨」是主流形态, 本 SKILL 的适用面比「绕开计费」这个卖点所暗示的更广。

快速识别三步

  1. 网站靠什么赚钱?卖「数据/信息」还是卖「功能」?→ 数据类才适用
  2. 底部导航找「开放平台 / 开发者 / API」,或在 WorkBuddy 连接器市场搜官方 MCP
  3. 开发者/定价页看 API 是否「按次 / 积分 / 调用量」单独收费

前置条件

  1. bsk CLI 在 PATH(browser-skill 套件),Chromium 扩展已连接(bsk status 显示 browsers connected 1)。bsk 命令不存在或扩展未连接,先引导用户安装/启用 browser-skill(WorkBuddy 插件市场),不要盲目继续抓取。
  2. 目标网站已在浏览器中登录(复用现有登录态,无需重新扫码)。

通用五步法(对任意目标站点)

  1. 确认站点适用 — 确认该站点有「网页版 + 会员登录态」(见「适用性判断」)。顺带记录 是否有按量计费的 API/MCP(决定能否额外省积分,非必需)。
  2. 建立登录态bsk session start,agent 标签天然继承浏览器 cookies,无需重新登录。
  3. 页面侦察 — 摸清该站点的「URL 规律」和「数据 DOM 结构」: bsk snapshot 看结构,bsk evaluate "document.body.innerText" 取全文本。
  4. 数据定位 — 找到目标数据所在的容器/表格/字段(详见各站点适配器)。
  5. 抓取与结构化 — 提取 → 解析 → 输出 JSON 或 HTML 报告 → bsk session stop

核心原则:每个站点的「变体细节」都封装在 recipes/ 下的适配器里;五步法本身不变。 接到新任务时,先看有没有对应 recipe,没有就按 _template.md 现场写一个。

站点适配器(recipes)机制

recipes/ 目录下,每个站点一个 Markdown 适配器文件,包含该站点的可变细节

  • 站点名 + 登录态确认方式(如何判断已登录)
  • 搜索页 URL 模板 + 详情页 URL 规律(是 md5 哈希还是 ID 直拼?)
  • 关键字段的 DOM 定位(表格容器 class、关键词定位法)
  • 歧义/同名甄别规则(如何确认是目标对象而非同名者)
  • 反爬/风控注意事项(频控、验证码、分页)

已内置recipes/qcc.md(企查查,未登录可搜索)、recipes/tyc.md(天眼查,搜索强制登录)。 新增站点照 recipes/_template.md 填写即可。

登录门槛差异(重要):不同站点的登录门槛不同,直接决定能否「未登录预搜索」—— 企查查未登录可搜索(弱门槛);天眼查/爱企查搜索即强制登录(扫码)。写 recipe 时, 第 1 节务必先实测该站点的登录门槛,并在「硬前置」里标注。

坑位清单(通用,实测踩过)

  1. 浏览器会话会失效:bsk session id 会因 Agent Window 被关闭或并行会话/用户手动操作 而反复变化。对策:操作紧凑、报 session not registered 立即 bsk session list 重取 id、 核心数据在稳定 session 里按明确 URL 一次性抓取。
  2. 详情页 URL 别硬拼 ID:很多站点的详情页 URL 是内部哈希/加密 ID(如企查查用 md5), 硬拼信用代码/自增 ID 会被重定向。必须从搜索结果页提取真实 href
  3. 同名/多义词歧义:人物页标题关联的公司 ≠ 其主营业务身份(可能是兼任的上市公司)。 必须用「简介 + 归属 + 关联舆情」多处交叉验证,再下结论。
  4. 分页点不动:SPA 懒加载分页可能点了不刷新。多次无响应就抓当前页(前 N 条常已够), 并在报告诚实标注「前 N 家 / 共 M 家」。
  5. 别默认借用用户标签bsk tab borrow 会打扰用户、常被取消;优先在 agent 标签直接导航。
  6. navigate 报 RPC 超时 ≠ 页面没加载bsk navigate 偶发 tool RPC timed out,但页面可能 实际已加载完成。别急着重试导航,先 bsk evaluate "document.readyState" 确认——若已 complete 且 title 正确,直接继续抓取即可。

输出规范

  • 数据忠实:严格引用原始字段值,不推导、不编造;空数据如实报「暂无记录」。
  • 单位/日期:金额注明单位;日期用 YYYY-MM-DD
  • 报告格式:先结论 → 结构化表格 → 可视化(默认深色金融风 HTML,ECharts 关系图 + 明细表 + 时间线 + 数据来源脚注)。
  • 脚注必备:标注「站点 + 登录态来源 + 抓取时间 + 数据范围(如仅前 N 家)」。

与官方 MCP 的边界

  • 本 SKILL(浏览器抓取):批量、深度、零 API 成本,适合大范围采集 + 报告生成。
  • 官方 MCP 连接器:按次扣积分,适合少量精确查询(单点查实控人、核验字段), 返回结构更规整、可直接程序化。
  • 选择原则:查 1~2 个精确字段走 MCP;批量/图谱/报告走本 SKILL。两者互补。

如何新增一个站点适配器

  1. 复制 recipes/_template.mdrecipes/{站点名}.md
  2. 按模板填 6 项:登录态确认 / URL 规律 / 字段定位 / 歧义甄别 / 风控 / 备注。
  3. 用五步法跑通一次,把实测踩到的坑回填到该 recipe 的「坑位」段。
  4. 可选:把典型抓取案例追加到该 recipe 末尾,供后来者参考。

相关技能

国内站点(小红书/淘宝/天猫/微信/微博/B站/12306/知乎/各类 SaaS 后台)的登录态浏览器自动化。当用户需要抓取或操作需要登录的国内网站、复用本机已登录 Chrome 的会话、带 cookie 导出数据,或提到"登录态""已登录浏览器""带账号抓取""复用我的 Chrome""不想重新登录"时使用。This skill should be used when the user wants to scrape or operate Chinese domestic websites that require authentication, reuse the locally logg

根据目标 URL 生成可直接运行的 Python 爬虫脚本,覆盖选型、JS 逆向与反爬处理。

作者 末心3 次安装

网页数据采集技能。静态页用 requests+BeautifulSoup,JS 渲染页用 Playwright,自动尊重 robots.txt、轮换 User-Agent、限速,输出结构化 JSON/CSV。覆盖垂直领域采集、反爬应对、数据清洗与质量校验。适用于市场调研、竞品监控、公开数据聚合。

科研福音-小红书、抖音、b站数据抓取神器——AI Agent 驱动,连接用户已打开浏览器直接抓取标题/正文/评论/点赞并导出Excel,不走爬虫不调接口。必须配合 AI Agent 使用。触发:抓评论、抓数据、网页数据抓取、导出Excel。

2 次安装

General-purpose web-intelligence utilities via the Crawlora API — scrape any URL to clean markdown/HTML, extract schema-conforming JSON from a page, fingerprint a site's tech stack, geocode addresses, compare cost of living between cities/countries (Numbeo), look up a company's import/export trade records (ImportYeti), check a domain's traffic (SimilarWeb), or resolve a brand's identity from its domain. Use for one-off utility lookups that don't fit a specific platform skill.

1 次安装

在脚本里驱动真实 Chrome 完成网页交互:导航、填表、点击、截图、抽取数据。

50 次安装4 星标