浏览器

Zhihu Article Fetcher

试用

知乎专栏文章抓取器。专门用于抓取 `zhuanlan.zhihu.com/p/xxx` 单篇文章的标题和正文内容。 支持三级认证降级(Browser Profile → File Cookie → 高仿真请求头),在无 Cookie 时也尝试绕过反爬。 当用户提供知乎专栏文章链接、要求抓取/保存知乎文章、或 `g...

它能做什么

知乎专栏文章抓取器。专门用于抓取 `zhuanlan.zhihu.com/p/xxx` 单篇文章的标题和正文内容。 支持三级认证降级(Browser Profile → File Cookie → 高仿真请求头),在无 Cookie 时也尝试绕过反爬。 当用户提供知乎专栏文章链接、要求抓取/保存知乎文章、或 `git-repo-analyzer` 遇到知乎文章 403 无法获取时使用此技能替代。

技能文档

知乎专栏文章抓取器 | Zhihu Article Fetcher

Overview

本 skill 专门解决 知乎专栏文章zhuanlan.zhihu.com/p/xxx)的内容获取问题。

  • 参考 zhihu-fetcher 的三级认证降级思路
  • 参考 zhihu-keyword-content-search 的结构化输出设计
  • 核心差异:抓取单篇专栏文章而非热榜或问答

三级认证降级

优先级1: Browser Profile
    使用 OpenClaw browser 已登录状态(预留接口)
    ↓ 失败
优先级2: File Cookie
    读取 config/cookie.json 中的固化 Cookie
    ↓ 失败或未配置
优先级3: 高仿真请求头
    无 Cookie,但携带完整浏览器指纹(UA/Referer/Sec-Fetch 等)尝试绕过反爬

安装依赖

pip install requests beautifulsoup4

使用方法

1. 直接抓取(无 Cookie,尝试高仿真请求头)

python3 scripts/fetch_article.py "https://zhuanlan.zhihu.com/p/660571164"

浏览器打开 https://www.zhihu.com → F12 → Network → 任意请求 → Request Headers → 复制 Cookie 中对应字段到 config/cookie.json

{
  "cookie": {
    "_xsrf": "你的_xsrf",
    "_zap": "你的_zap",
    "d_c0": "你的_d_c0",
    "z_c0": "你的_z_c0",
    "SESSIONID": "你的_SESSIONID"
  }
}

然后运行:

python3 scripts/fetch_article.py "https://zhuanlan.zhihu.com/p/660571164"

3. 保存到文件

python3 scripts/fetch_article.py "https://zhuanlan.zhihu.com/p/660571164" -o /tmp/article.json

输出格式

{
  "meta": {
    "source": "zhihu-zhuanlan",
    "fetch_time": "2026-04-10T10:30:00",
    "auth_method": "simulated_headers",
    "url": "https://zhuanlan.zhihu.com/p/660571164"
  },
  "data": {
    "title": "文章标题",
    "url": "https://zhuanlan.zhihu.com/p/660571164",
    "content": "正文纯文本,段落以 \n\n 分隔...",
    "word_count": 3520,
    "fetch_method": "simulated_headers"
  }
}

与类似 skill 的对比

skill抓取目标认证方式你的场景匹配度
zhihu-fetcher知乎热榜三级降级❌ 不支持单篇文章
zhihu-keyword-content-search知乎问答(按关键词搜索)Cookie 必填❌ 不支持专栏 URL
zhihu-article-fetcher知乎专栏单篇文章三级降级正对症

常见问题

Q: 返回 "未能提取到正文内容" A: 知乎升级了反爬或页面结构。尝试配置有效 Cookie(方法2),或等待 skill 更新解析规则。

Q: 503/429 频繁出现 A: 脚本已内置动态延迟(1.5-2秒)。如仍被限,建议配置 Cookie 抓取,或间隔更长时间再试。

File Structure

zhihu-article-fetcher/
├── SKILL.md                      # 本文档
├── config/
│   └── cookie.json               # Cookie 配置(需用户自行填入)
└── scripts/
    └── fetch_article.py          # 核心抓取脚本

相关技能

知乎收藏夹与文章内容抓取:API/Playwright 多级降级、Cookie 持久化与保活、批量正文与图片、断点续传、可选写入 Obsidian。| Zhihu collection scraping, batch article fetch, Obsidian export.

24 次安装

Use when the user wants to download any Zhihu article/answer by URL — including '下载知乎文章', '抓取知乎回答', '帮我保存这篇知乎', '把这个知乎链接转成Markdown', or any request to extrac...

知乎内容抓取(搜索/读问答/抓专栏/看评论/看热榜)。默认走 API 路径 (`zhihu-fetch.py`),仅单篇专栏正文走 SPA HTML 解析(不渲染浏览器)。前置:注入 cookie 到 `$SKILL/data/cookies.txt`。

5 次安装

Write Zhihu articles that rank on the hot list and earn genuine upvotes, using a research-driven methodology with Phase 0 knowledge reconnaissance, structured credibility building, and Zhihu algorithm optimization. Covers everything from question selection to opening hooks, argument architecture, data citation, and title optimization for the Zhihu ecosystem.

1 星标

使用 Playwright headed 模式 + 真实系统浏览器抓取微信公众号文章。 当用户给出 mp.weixin.qq.com 链接、说要抓取/下载公众号文章、 或遇到"环境异常"验证页时,必须使用本技能。 本技能会弹出真实浏览器窗口绕过微信反爬,提取文章标题、作者、正文, 并同时保存 .md 和 .htm...