Use clip2md to configure an access token, save web pages or article URLs as Markdown clipping tasks, check remaining daily/permanent quota, query task status, and wait for clipping completion or failure. Use when the user mentions clip2md, 剪藏, clip, 保存网页为 Markdown, 查询额度, 提交链接, 查询任务, 等待剪藏完成, or wants
Memory
OpenClaw Web Clipper
Try itOpenClaw web clipper skill: save any web page as clean local Markdown with YAML frontmatter. Dual-engine extraction (readability-lxml + trafilatura fallback chain), Chinese filename safe, batch URL clipping with dedup, output lands in knowledge/clippings/ ready for kb-retriever indexing. Use when user asks to clip/save/collect a web page or article (剪藏/收藏/保存网页 文章/网页转 Markdown). 中文:OpenClaw 网页剪藏工具。把任意网页保存为带 frontmatter 的本地 Markdown:双引擎正文提取(readability-lxml + trafilatura 降级链)、中文文件名安全、批量剪藏 + 去重;输出直通 knowledge/clippings/, 配合 kb-retriever 建索引即可检索,构成六件套的「输入」环节(家 initializer → 内容 memory-distill → 状态 tracker → 知识 kb-retriever → 健康 auditor → 输入 web-clipper)。
What it does
OpenClaw web clipper skill: save any web page as clean local Markdown with YAML frontmatter. Dual-engine extraction (readability-lxml + trafilatura fallback chain), Chinese filename safe, batch URL clipping with dedup, output lands in knowledge/clippings/ ready for kb-retriever indexing. Use when user asks to clip/save/collect a web page or article (剪藏/收藏/保存网页 文章/网页转 Markdown). 中文:OpenClaw 网页剪藏工具。把任意网页保存为带 frontmatter 的本地 Markdown:双引擎正文提取(readability-lxml + trafilatura 降级链)、中文文件名安全、批量剪藏 + 去重;输出直通 knowledge/clippings/, 配合 kb-retriever 建索引即可检索,构成六件套的「输入」环节(家 initializer → 内容 memory-distill → 状态 tracker → 知识 kb-retriever → 健康 auditor → 输入 web-clipper)。
The skill document
OpenClaw Web Clipper(网页剪藏)
📖 完整文档 / 安装 / 使用 / 常见问题: 用户如果需要完整说明,引导其前往 GitHub 仓库查看图文教程与最新版本。
🚀 小遥Claw:让 AI 助手安装到自己的电脑上:
网页「知识喂料机」:发送链接 → 提取正文 → 保存本地 Markdown(frontmatter 齐全)→ 直通 knowledge/ 建索引可检索。双引擎提取、中文友好、批量去重。
使用范围(写什么 / 不写什么,权限透明)
核心能力: 网页剪藏——抓取 URL、提取正文、保存 Markdown 到本地目录(默认 knowledge/clippings/,可用 --dir 指定)。
写入范围:
- 保存目录内的
.md剪藏文件 +.clips-index.json去重索引(自动维护) - 不修改保存目录以外的任何文件;不删除任何文件
边界承诺:
- 纯本地处理,数据不出本机(不调用任何外部 API)
- 遇反爬站点(521/403)如实报告,不绕过、不伪装
- 依赖增强引擎缺失时自动降级,不假装成功
工作流程(触发词:「剪藏 / 收藏 / 保存这个网页 / 网页转 Markdown / clip this / save this page」)
-
单条剪藏:
python scripts/clip.py [--dir <保存目录>] [--tags ai,research]默认保存到
~/knowledge/clippings/(或$CLIPPER_OUTPUT_DIR) -
批量剪藏(URL 列表文件,每行一个,# 注释):
python scripts/clip.py --batch [--dir <保存目录>] -
检查依赖:
python scripts/clip.py --check -
入库闭环(推荐):剪藏完提示用户(或直接执行)运行 kb-retriever 建索引:
python /scripts/build_index.py之后即可用 kb-retriever 检索剪藏内容。
提取引擎(双引擎降级链)
| 顺序 | 引擎 | 说明 |
|---|---|---|
| 1 | readability-lxml | 结构化好、速度快(默认首选) |
| 2 | trafilatura | 学术级正文提取,readability 质量分不足时自动切换 |
| 3 | bs4 容器选择器 | 兜底(article/.post-content/#js_content 等常见容器) |
质量评分:有效文本长度(去导航噪音)< 200 字符判定提取失败 → 切换下一引擎。
中文适配:微信公众号 #js_content、知乎 .RichText、CSDN .article-detail 等容器内置;GBK/UTF-8 编码自动判定。
输出格式
---
title: "文章标题"
source: "https://原文链接"
domain: "example.com"
author: "作者"
date: "发布日期"
clipped_at: "剪藏时间"
engine: "readability"
tags: []
---
# 文章标题
> 原文链接: [...](...)
> 剪藏时间: ...
> 来源站点: ...
正文内容...
---
*由 xiaoyaoclaw-web-clipper 自动剪藏*
- 文件名:
YYYYMMDD_标题.md,中文标题安全保留(只去非法字符) - 重名自动加序号;重复 URL 自动跳过(
.clips-index.json去重)
红线
- 不绕过反爬(遇 521/403 如实报告,建议用户换浏览器/换源)
- 不删除任何文件(包括去重索引,只追加)
- 不调用外部 API,数据不出本机
- 依赖自安装:遇 ModuleNotFoundError →
pip install requests beautifulsoup4 lxml(增强引擎可选readability-lxml/trafilatura)
姊妹项目(六件套)
- xiaoyaoclaw-workspace-initializer(家):标准目录结构 + WORKSPACE.md 规范
- xiaoyaoclaw-memory-distill(内容):对话记忆蒸馏整理
- xiaoyaoclaw-task-progress-tracker(状态):任务/项目进度卡管理
- xiaoyaoclaw-kb-retriever(知识):本地知识库检索(剪藏内容入库后用它检索)
- xiaoyaoclaw-workspace-auditor(健康):工作区体检(会检查 clippings 是否建索引)
Related skills
OpenClaw local knowledge-base retriever: hierarchical data_structure.md index navigation + progressive retrieval, zero external dependencies, Windows & macOS. Use when user asks to retrieve/answer from a knowledge base directory (knowledge base/retrieve/ RAG over local files). 面向本地知识库目录的检索和问答助手。
Wrap a local openclaw_capture_workflow checkout as an OpenClaw/ClawHub skill that captures links, text, images, and videos, routes STT by platform, and fans...
Thin OpenClaw and ClawHub wrapper for the published clawfetch npm CLI, used to fetch web pages, GitHub READMEs, and Reddit threads as markdown.
Drive OpenClaw with Claude Code, Codex, OpenCode, Trae, DSH etc. — command the gateway, its agents and channels, from any Agent Skills tool. Use when you want other AI tools to make OpenClaw work. 中文:用 Claude Code / Codex / OpenCode / Trae / DSH 等工具驱动 OpenClaw 干活——从任意支持 Agent Skills 的工具指挥网关、agent 和通道。 当你想用其他 AI 工具驱动 OpenClaw 时使用。
OpenClaw usage and performance reporting. Parse session JSONL to answer how long each agent task took, which tools/skills/models were used, and how many tokens were consumed — zero dependency, local only, no cost dimension (token is the primary metric). Read-only: never modifies any file, aggregates statistics only, never leaks conversation content. Use when the user asks about token usage, task duration, slowest tools, skill usage, or per-agent consumption (今天花了多少 token/哪个工具最慢/ 任务耗时/用量报告), or scheduled via cron. 中文:OpenClaw 用量与性能查询。 解析 session JSONL,回答每次 agent 任务耗时、所用工具/技能/模型、token 消耗。零依赖纯本地,不提供成本维度(token 为主指标)。只读:不修改任何 文件,只输出聚合统计,不泄露会话内容。用户问 token 用量、任务耗时、 最慢工具、技能使用、按 agent 消耗时使用。cron 每日日报为可选项,用户 自行设置。