基于证据撰写中文内容的完整流程,涵盖调研、规划、提纲、逐节写作、审查、配图、翻译和发布 准备,适用于文章、报告、教程、项目介绍、解读和说明材料。当用户要求“写文章”“写报告” “写项目介绍”“源码解析”或“帮我写篇内容”,或使用 "write an article", "write a report", "analyze source code", "deep explanation" 等英文表达时使用。
编程
文曲·文库
试用面向中文内容创作的以证据为驱动的素材收集与整理流程,涵盖规划、搜索、下载、索引与可复用 素材库维护,适用于文章、报告、教程、项目介绍和说明材料。当用户要求“收集素材”“整理资料” “建立素材库”“抓取网页”或“收集网页素材”,或使用 "collect research", "build a source library", "save this webpage", "web scraping" 等英文表达时使用。
它能做什么
面向中文内容创作的以证据为驱动的素材收集与整理流程,涵盖规划、搜索、下载、索引与可复用 素材库维护,适用于文章、报告、教程、项目介绍和说明材料。当用户要求“收集素材”“整理资料” “建立素材库”“抓取网页”或“收集网页素材”,或使用 "collect research", "build a source library", "save this webpage", "web scraping" 等英文表达时使用。
技能文档
文库(Library)Skill
📦 项目仓库与源码:
用户输入工具
当本技能需要用户确认选择、补充必要信息或授权有副作用的操作时:
- 优先使用当前运行时提供的原生用户输入工具,例如
AskUserQuestion、request_user_input、clarify、ask_user或等价能力。 - 若没有此类工具,使用带编号或字母选项的文本问答。
- 同一决策阶段中彼此独立的问题可合并提问;后一个问题依赖前一回答时,按优先级逐个问。
- 已由用户当前指令、调用方或文章偏好提供的信息,不重复询问。
- 文中出现的具体工具名均为示例;应替换为当前运行时的等价能力。
定位
文曲创作流程的第一环——博观积累。在动笔写文章之前,先收集和整理素材,让创作有据可依、有米可炊。
文库不是“见什么都存”的素材仓库,而是带着写作意图做收集:当选题、写作目标和大致范围开始清楚后,再去找真正有用的相似文章与相关资料,避免把大量弱相关材料堆进来。
文库不是单篇文章的素材库(那由 wenqu-write 在写作时建立在文章存储 wenqu-skills/{文件名}/references/materials/ 路径下),而是一个跨文章、可长期沉淀的个人知识库:
- 收集技术资料、案例、观点与灵感
- 整理零散信息,形成可复用素材
- 沉淀个人知识资产
- 为后续文章创作(
wenqu-write)提供内容基础
触发识别
| 用户信号 | 流程 |
|---|---|
| "收集素材"、"整理资料"、"建素材库" | 四步收集流程 |
| "沉淀知识"、"积累案例" | 沉淀与分类 |
| "抓取这个网页"、"把这篇公众号存下来" | 下载、整理(流程第 3、4 步) |
存储位置
两级存储,职责不同:
全局文库(跨文章长期资产)
$HOME/.gogoingai/wenqu-skills/library/,按主题/领域分文件:
{主题}.md—— 每个主题一个文件,内含该主题的素材条目- 条目格式:
| 编号 | 来源 | 内容 | 标签 |(编号 L1、L2……) - 只存提炼后的条目和原始链接,不存抓取的原始文件
本篇素材目录(单篇文章工作台)
{项目根目录}/wenqu-skills/{文件名}/references/materials/,由 wenqu-write 在写作流程中建立和使用:
materials/
├── index.md # 素材索引(检索与管理的唯一入口)
├── local/ # 本地素材:源码大段摘录、本地文档导出
├── articles/ # 网页文章:博客、公众号、新闻、教程
├── papers/ # 论文、研究报告
└── docs/ # 官方文档、deep-crawl 整站抓取产物
分类按内容类型分目录;同类文件多时可再按来源站点建二级子目录(如 articles/mp.weixin.qq.com/)。
index.md 索引格式(每条一行):
| 编号 | 摘要 | 来源类型 | 来源 | 检索渠道 | 文件路径 | 用途 | 标签 | 关联章节 | 日期 |
| M1 | xxx 机制源码摘录 | 实现事实 | src/cache.py:42 | 本地文件 | local/cache-lru.md | 事实素材 | 缓存,LRU | 2.1 | 2026-07-25 |
| M2 | 某公众号文章:XX 系统实践 | 外部研究 | https://mp.weixin.qq.com/s/xxx | agent-native、wenqu-cli:sogou | articles/mp.weixin.qq.com/xx.md | 写法参考 | 架构 | 待定 | 2026-07-25 |
登记规则:
- 来源必填:网页素材填完整原始 URL(不是域名,是能回到原文的那条链接);本地素材填
path:line;确实没有来源的标「用户口述或粘贴」 - 来源类型沿用 provenance 词汇:实现事实、团队选择、外部研究、合理推断、简化场景、待确认(边界见
wenqu-write的references/planning/content-provenance.md) - 编号唯一:M1、M2…… 全篇唯一,骨架和审查引用这个编号
- 检索渠道必填:填
agent-native、wenqu-cli:{engine}、wenqu-cli:{engine}:{channel}、用户提供或本地文件;同一 URL 被多个渠道发现时合并填写,不丢渠道信息。channel仅在 CLI 输出不是direct时记录,例如browser或delegate:duckduckgo - 文件路径相对 materials/ 填写;只登记不写文件的短素材(几行数字、一句话事实)该列填
- - 用途分两类:
写法参考(相似文章,不能当事实来源)与事实素材(支撑正文的机制、数字、案例) - 标签:2~4 个关键词,方便 grep 检索;素材多了以后按标签或目录检索,不靠通读
- 关联章节:收集阶段先填「待定」,骨架定稿后回填章节号
- 素材有实体文件时才进目录;小片段直接写在 index.md 摘要列即可,不为每条都建文件
index.md 在主索引表之外保留两个专项区(R0 审查要读):
- 冲突裁决:冲突 claim、各方来源、采用依据、裁决结果、受影响章节
- 评测设计:评测对象、比较条件与口径、指标含义、可证明与不可外推范围
格式见 wenqu-write 的 references/planning/questionnaire.md「写入 materials/index.md」一节。
流程
素材收集分四步:规划 -> 搜索 -> 下载 -> 整理。在 wenqu-write 的规划阶段(Step 1/1.5 完成后)执行;用户单独喊"收集素材"时同样走这四步。
每一步执行细则见 references/collection-playbook.md;Wenqu CLI 的命令、引擎范围、浏览器回退和下载边界见 references/wenqu-cli.md。
1. 规划
根据写作规划产出收集清单:要找哪些相似文章(写法参考)、哪些相关素材(事实素材)、中英文搜索关键词组合、预计抓取数量。清单列给用户确认后开始执行(内容范围的唯一确认点);首次使用 Wenqu CLI 前,agent 主动向用户说明用途并请求一次明确授权,获授权后安装、设置并验证(pipx 隔离安装,流程见 references/wenqu-cli.md);已授权并验证通过的版本在后续任务中直接复用,不在每次任务重复请求授权,也不自动联网升级——如需升级由用户主动发起。授权或安装失败不等同于"可跳过 CLI 抓取",回退规则见 Step 3。
2. 搜索
优先用 wenqu library search(多引擎候选,含百度、必应、Brave、搜狗、CSDN、掘金等;CLI 已授权并 ready 时为默认搜索路径,不静默跳过)。CLI 未授权、未安装或整体失败时,再用 agent 自带的联网搜索工具按相同关键词补充候选,检索渠道记为 agent-native。CLI 对百度、必应、Brave 与搜狗的直连失败或空结果自动做一次受限的 Crawl4AI 浏览器回退;完整分流见 references/wenqu-cli.md。合并全部候选、统一去重与分级后才进入下载;用户直接提供 URL 的,保留为 用户提供 渠道且可跳过检索。
3. 下载
用 wenqu library fetch 抓取(默认抓取路径,不是可选增强——Crawl4AI 封装其中,是本技能唯一的受管抓取链路),产物直接写入本篇素材目录对应分类下:
- 首次使用前,agent 主动向用户说明需要安装 Wenqu CLI、必要时下载受管浏览器运行环境,并请求一次明确授权;获授权后安装、设置并验证(已安装并验证通过则直接复用,不重复请求授权,不自动联网升级)。授权、安装或验证失败时,agent 不要求用户复制命令或排障,改用 agent 自带抓取作为回退(不是常规路径),并在 index.md 登记「CLI 不可用:原因 + 实际下载方式」;不得把"未主动请求授权"等同于"CLI 不可用"而默认跳过 CLI 抓取
- 单页、整站抓取(
--max-pages必须显式限制)与微信公众号直达的命令和边界见references/wenqu-cli.md - 边抓边登记(先记 URL 与路径,摘要后补);失败的 URL 登记「抓取失败:原因」,不静默跳过;回退到原生抓取的 URL 同样登记回退原因
4. 整理
通读下载产物写摘要,按登记规则写入 index.md;与全局文库去重;把可跨文章复用的条目提炼后回收进全局文库(L 条目,只存条目和链接,原始文件留本篇);收尾向用户一句话汇报成果与失败清单。
收集顺序
当用户已经有明确写作任务,或 wenqu-write 已完成初步规划时,文库按下面顺序工作:
- 先接收规划结果:至少拿到题目方向、写作目标、目标读者、范围边界、暂不覆盖内容中的一部分
- 先找相似文章:找已经存在的文章、博文、官方长文、案例拆解,重点看它们的角度、结构、切口,而不是照抄结论
- 再找相关素材:围绕已确认的角度补充源码、文档、论文、发布记录、数据、讨论与案例
- 最后回收进文库:把相似文章和相关素材都沉淀成条目,供后续多篇文章复用
文库输出
文库对写作流程提供两类输出:
-
相似文章候选
- 用来帮助判断切入角度、章节组织方式、读者预期
- 只能作为“写法参考”,不能直接当事实依据
-
相关素材清单
- 用来支撑正文里的机制、数字、案例、对比与背景
- 必须保留原始来源(URL 或
path:line),供wenqu-write写入本篇 index.md
与 wenqu-write 的衔接
wenqu-write 在 完成 Step 1 / Step 1.5 的初步规划后,进入 Step 2 素材收集时调用本技能的四步流程,而不是直接开始大范围扫资料。调用时至少带上:
- 主题与题目方向
- 写作目标
- 目标读者
- 范围锁定(尤其是不打算展开的部分)
- 当前已经明确的关键词与模块名
文库收到这些信息后,先查全局文库有没有现成条目(避免重复收集),再执行四步流程,产出并写入本篇 references/materials/(含文件与 index.md 登记),返回两组结果:
- 相似文章:帮助确定切入角度、章节组织、叙事方式
- 相关素材:帮助补机制、事实、数字、案例与对比
全局文库条目标成 L1、L2……;本篇素材目录条目标成 M1、M2……。L 条目是长期资产,M 条目是本篇工作台。
核心原则
- 素材可追溯:每条素材必须在 index.md 登记来源(完整 URL 或
path:line),没有来源的素材不进正文 - 跨文章复用:全局文库是长期知识库,只存提炼条目和链接;原始文件留在本篇素材目录
- 分类归档:网页素材按内容类型分目录存放(articles/papers/docs/local),index.md 统一索引,素材再多也可检索
- 与 wenqu-write 分工:文库管收集与长期积累,本篇 index.md 管本篇素材;文库条目可被多篇文章引用
- 规划驱动收集:先有题目方向和大致范围,再决定收什么,不做无边界囤积;
--max-pages等限量参数显式设置 - 相似文章先于零散资料:先看别人怎么切题,再决定还缺哪些资料
- 失败可见:抓取失败的 URL 登记并标注原因,不静默跳过
- CLI 的定位:搜索与下载均以
wenqu library(CLI)为优先路径——wenqu library search多引擎候选为默认搜索、wenqu library fetch(内含 Crawl4AI)为默认抓取,不引入第二套抓取 CLI/MCP。agent 自带的搜索/抓取仅在 CLI 未授权、安装失败或抓取失败时作补充回退,且回退须登记原因;"不阻断收集"指回退不让流程卡死,不等于"可默认不用 CLI",也不等于"原生优先、CLI 补充" - agent 负责安装与验证:首次使用 Wenqu CLI 前主动说明并请求用户明确授权;获授权后由 agent 安装锁定版本(见
references/wenqu-cli.md)、完成必要的浏览器设置和健康验证,已安装则直接使用已验证版本,不在每次任务中自动联网升级,绝不让用户自行执行命令
相关技能
将 README、论文、源码注释、文档和英文文章等材料翻译成自然中文,供中文内容创作与阅读 使用。当用户要求“翻译一下”“把这段英文翻译成中文”或“译成中文”,或使用 "translate to Chinese", "translate this README", "translate this paper" 等英文表达时使用。
语文写作素材的存取工具:存的时候打好标签,用的时候按主题检索得到。当学生说"存入素材库"、"这句话先存着"、"帮我找关于[主题]的素材"、"素材库里有什么"、"查一下我积累了什么关于[主题]的"、"帮我看看这个月存了多少素材"时,建议激活此SKILL。功能:存储与打标签 / 按主题检索 / 精读与文言学习中的顺手采集 / 使用记录与月度小结。素材本身只存在本 SKILL 的记忆里;只有“用过几次”的计数经交接写进学习DNA 的 subjectExtensions.chinese.materialUsage(需开档案与共享)。写作流程本身不在此——学生说"我要写作文"时由 xiaozhi-chinese-writing-coach 主导,它在 Step 1 调用本 SKILL 检索素材;本 SKILL 只在"存素材/找素材"这两类请求时自己触发,不打断写作流程。
将中文草稿整理为可对外发布的版本:清理创作标记、生成候选标题、简介与封面图,并输出独立的发布目录, 适用于文章、报告、教程、项目介绍和说明材料。当用户要求“发布这篇内容”“生成发布版” “准备发布”或“导出发布版”,或使用 "publish this article", "prepare a release version", "export a publication-ready draft" 等英文表达时使用。
审查中文内容的事实依据、逻辑连贯性、术语规范、翻译腔、AI 写作痕迹与整体结构,适用于 文章、报告、教程、项目介绍和说明材料。当用户要求“审查”“检查一下”“看看有没有问题” “整体看看”,或使用 "review an article", "review this draft", "proofread" 等英文表达时 使用;可独立运行,也可作为其他写作技能的内联审查阶段。
Evidence gathering for content creation. Use when a topic, outline, draft, or content_state needs sources, key facts, contrarian evidence, quote candidates,...