知乎收藏夹与文章内容抓取:API/Playwright 多级降级、Cookie 持久化与保活、批量正文与图片、断点续传、可选写入 Obsidian。| Zhihu collection scraping, batch article fetch, Obsidian export.
Browser
Zhihu Article Fetcher
Try it知乎专栏文章抓取器。专门用于抓取 `zhuanlan.zhihu.com/p/xxx` 单篇文章的标题和正文内容。 支持三级认证降级(Browser Profile → File Cookie → 高仿真请求头),在无 Cookie 时也尝试绕过反爬。 当用户提供知乎专栏文章链接、要求抓取/保存知乎文章、或 `g...
What it does
知乎专栏文章抓取器。专门用于抓取 `zhuanlan.zhihu.com/p/xxx` 单篇文章的标题和正文内容。 支持三级认证降级(Browser Profile → File Cookie → 高仿真请求头),在无 Cookie 时也尝试绕过反爬。 当用户提供知乎专栏文章链接、要求抓取/保存知乎文章、或 `git-repo-analyzer` 遇到知乎文章 403 无法获取时使用此技能替代。
The skill document
知乎专栏文章抓取器 | Zhihu Article Fetcher
Overview
本 skill 专门解决 知乎专栏文章(zhuanlan.zhihu.com/p/xxx)的内容获取问题。
- 参考
zhihu-fetcher的三级认证降级思路 - 参考
zhihu-keyword-content-search的结构化输出设计 - 核心差异:抓取单篇专栏文章而非热榜或问答
三级认证降级
优先级1: Browser Profile
使用 OpenClaw browser 已登录状态(预留接口)
↓ 失败
优先级2: File Cookie
读取 config/cookie.json 中的固化 Cookie
↓ 失败或未配置
优先级3: 高仿真请求头
无 Cookie,但携带完整浏览器指纹(UA/Referer/Sec-Fetch 等)尝试绕过反爬
安装依赖
pip install requests beautifulsoup4
使用方法
1. 直接抓取(无 Cookie,尝试高仿真请求头)
python3 scripts/fetch_article.py "https://zhuanlan.zhihu.com/p/660571164"
2. 配置 Cookie 后抓取(成功率更高)
浏览器打开 https://www.zhihu.com → F12 → Network → 任意请求 → Request Headers → 复制 Cookie 中对应字段到 config/cookie.json:
{
"cookie": {
"_xsrf": "你的_xsrf",
"_zap": "你的_zap",
"d_c0": "你的_d_c0",
"z_c0": "你的_z_c0",
"SESSIONID": "你的_SESSIONID"
}
}
然后运行:
python3 scripts/fetch_article.py "https://zhuanlan.zhihu.com/p/660571164"
3. 保存到文件
python3 scripts/fetch_article.py "https://zhuanlan.zhihu.com/p/660571164" -o /tmp/article.json
输出格式
{
"meta": {
"source": "zhihu-zhuanlan",
"fetch_time": "2026-04-10T10:30:00",
"auth_method": "simulated_headers",
"url": "https://zhuanlan.zhihu.com/p/660571164"
},
"data": {
"title": "文章标题",
"url": "https://zhuanlan.zhihu.com/p/660571164",
"content": "正文纯文本,段落以 \n\n 分隔...",
"word_count": 3520,
"fetch_method": "simulated_headers"
}
}
与类似 skill 的对比
| skill | 抓取目标 | 认证方式 | 你的场景匹配度 |
|---|---|---|---|
zhihu-fetcher | 知乎热榜 | 三级降级 | ❌ 不支持单篇文章 |
zhihu-keyword-content-search | 知乎问答(按关键词搜索) | Cookie 必填 | ❌ 不支持专栏 URL |
zhihu-article-fetcher | 知乎专栏单篇文章 | 三级降级 | ✅ 正对症 |
常见问题
Q: 返回 "未能提取到正文内容" A: 知乎升级了反爬或页面结构。尝试配置有效 Cookie(方法2),或等待 skill 更新解析规则。
Q: 503/429 频繁出现 A: 脚本已内置动态延迟(1.5-2秒)。如仍被限,建议配置 Cookie 抓取,或间隔更长时间再试。
File Structure
zhihu-article-fetcher/
├── SKILL.md # 本文档
├── config/
│ └── cookie.json # Cookie 配置(需用户自行填入)
└── scripts/
└── fetch_article.py # 核心抓取脚本
Related skills
Use when the user wants to download any Zhihu article/answer by URL — including '下载知乎文章', '抓取知乎回答', '帮我保存这篇知乎', '把这个知乎链接转成Markdown', or any request to extrac...
知乎内容抓取(搜索/读问答/抓专栏/看评论/看热榜)。默认走 API 路径 (`zhihu-fetch.py`),仅单篇专栏正文走 SPA HTML 解析(不渲染浏览器)。前置:注入 cookie 到 `$SKILL/data/cookies.txt`。
Write Zhihu articles that rank on the hot list and earn genuine upvotes, using a research-driven methodology with Phase 0 knowledge reconnaissance, structured credibility building, and Zhihu algorithm optimization. Covers everything from question selection to opening hooks, argument architecture, data citation, and title optimization for the Zhihu ecosystem.
抓取微信公众号、小红书、豆瓣、知乎文章,自动上传 OSS 图片,LLM 智能提取关键词,一键存档到 Obsidian 本地知识库(可选 Notion)
使用 Playwright headed 模式 + 真实系统浏览器抓取微信公众号文章。 当用户给出 mp.weixin.qq.com 链接、说要抓取/下载公众号文章、 或遇到"环境异常"验证页时,必须使用本技能。 本技能会弹出真实浏览器窗口绕过微信反爬,提取文章标题、作者、正文, 并同时保存 .md 和 .htm...