IMA 知识库自动分类整理与 RAG 检索增强生成技能。扫描 IMA 知识库内容,按自定义规则自动分类,生成分类索引文档(Word + Markdown),支持定期自动整理,以及基于分类索引的精准 RAG 文档生成。当用户需要整理 IMA 知识库、定期分类知识库内容、使用 IMA 知识库资料辅助撰写文档、或设置知识库自动分类整理流程时触发此技能。关键词:IMA、知识库整理、分类索引、RAG、定期扫描、检索增强生成。
编程
老兵知识采集器
试用教发老兵实测沉淀的 IMA 知识库补料流水线:按主题检索搜狗微信文章→筛选编码→分批导入 IMA 知识库。仅在你显式要求时运行,导入幂等(不重复)、尊重站点限流,适合给指定知识库文件夹批量补充文章素材。
它能做什么
教发老兵实测沉淀的 IMA 知识库补料流水线:按主题检索搜狗微信文章→筛选编码→分批导入 IMA 知识库。仅在你显式要求时运行,导入幂等(不重复)、尊重站点限流,适合给指定知识库文件夹批量补充文章素材。
技能文档
老兵知识采集器(caiji-for-ima)
Overview
教发老兵(李琰辉)经过大量实测,把"按主题批量给知识库某文件夹补文章素材"这件事固化成一条高速流水线:检索 → 筛选 → 编码 → 拆波并行直导 → 核验 → 噪声清理。默认目标"至少 100 篇、越多越好",全程幂等、不空转。目前实现基于 IMA 知识库(ima.qq.com)+ 搜狗微信检索通道,可直接复用。
适用场景(用户说类似以下即触发):
- "给【XX 知识库】的【YY 区】补一些关于『主题』的文章,至少 100 篇"
- "把科研误区/方法论/课题申报这类文章转存到我的知识库"
- 任何"按主题给知识库灌文章素材"的需求
核心原则(效率优先,来自实测)
- 先搜齐筛好落盘,再并行直导——绝不反复重搜、绝不串行 sleep 傻等。
- 检索收窄词数:40 词 × 2 页 ≈ 3 分钟拿 757 条候选、全程无反爬阻塞;广撒网(50 词)曾卡 39 分钟+,勿取。
- 导入拆波并行:把批次拆成每波 13 批,每波并行起 1 个子代理各导其波;远优于串行或主 agent 手抄长 URL。
- 核验以 import_urls 回执 ret_code=0 + media_id 为准,不以 get_knowledge_list 的 total_size 差值(受并发写入干扰、且幂等折叠会让差值偏小)。
Workflow
Step 0 定位目标(必须最先做)
- 用
get_knowledge_base_list遍历KBT_MINE_KB/KBT_SHARED_KB/KBT_SUBSCRIBED_JOIN_KB/KBT_SUBSCRIBED_CREATE_KB四种类型,找到目标知识库(固定 KB 报 222001/222000 时不要止步,可能已改名重建为共享库)。 - 用
get_knowledge_list(knowledge_base_id + folder_id,limit≤50 不带 filter)定位目标文件夹 folder_id。 - 常用基线见
references/ima_kb_api.md。
Step 1 检索(搜狗微信通道)
- 运行
scripts/batch_search.js:把关键词写进一个 txt(一行一词),后台跑。脚本已含反爬换 cookie、增量落盘、2 次重试、每词默认 2 页。 - 关键词策略:每个主题拆 3–5 个同义变体(如"科研误区 / 科研踩坑 / 论文写作常见错误 / 学术写作痛点"),总词数控制在 40 左右。
- 输出:
out/all_articles.json(去重后的候选,含 url/title/source/date)。
Step 2 筛选 + 编码 + 分批
- 运行
scripts/filter_topic.py [保留篇数]:- 强制标题命中主题词(理论/模型/方法/模板/工具/误区/痛点等,按本次主题调 THEME 表);
- 排除广告/中小学/育儿等噪声(JUNK 表);
- 内部去重(URL + 标题近似 >0.72);
- URL 统一
quote()编码——这一步挡掉 220001 的裸空格坑; - 输出
batches.json(每批 ≤10 条,已编码)。
Step 3 拆波
- 运行
scripts/make_waves.py batches.json waves:拆成waves/wave_1..N.json,每波 13 批。
Step 4 并行直导(关键提速步)
- 并行起 N 个后台子代理,每个子代理只读自己的
waves/wave_K.json,顺序调用import_urls:{"knowledge_base_id":"","folder_id":"","urls":[该波 urls]},URL 原样传。 - 子代理要点:每批间 sleep 0.5s;整批报 220001/429 原样重试一次(间隔 2s);导入幂等,重试安全。
- 不要在主上下文里手抄长 URL——子代理 Read 自己的波次文件不会截断。
- ⚠️ folder_id 务必逐字节核对(曾因手滑把
...7754写成...7554报 222000,浪费一轮)。
Step 5 核验 + 噪声清理
- 用
get_knowledge_list翻目标文件夹前几页,确认 total_size 增长、create_time 为本轮、标题主题命中。 - 混入的"搜狗搜索"验证码页 / 广告软文:IMA 无删除 API,只能枚举其 media_id(按 parent_folder_id + 导入时间窗锁定)交用户在 IMA 界面手动清。噪声清理清单模板见
references/pitfalls.md。
坑点速查
- 220001:先查 URL 是否含裸空格 → 替换
%20重试;瞬时失败概率也不低,单条重试常成功。 - 幂等:同 URL 重复导同一文件夹折叠为同一条,不产生重复项——去重可放宽,重试安全。
- search_knowledge 的 folder_id 不生效:返回全库命中,需按 parent_folder_id 二次过滤。
- get_knowledge_list limit≤50:传 100/200 报错;folder 的 media_type=99,别用 filter 过滤。
- IMA 无删除/移动接口:放错库或脏数据只能用户在 UI 手动处理。
详细工具签名与 ID 基线见 references/ima_kb_api.md;反爬与效率复盘见 references/pitfalls.md。
相关技能
腾讯IMA知识库技能。封装IMA智能知识库的完整接口,支持OpenAPI和Cookie两种认证方式。功能包括知识库管理、笔记CRUD、RAG问答、文件夹操作、订阅知识库管理等。
IMA.plus 技能(V1.0.8)——凭证来源于改成了环境变量需要重新设置,同时加入了自然语言目录和kb_id的缓存减少调用api的次数开销,缓存保存位置需要在安装skill后配置,否则无法正常使用。同时有任何skill的问题或建议,请到QQ频道:pd86156007。笔记管理与知识库操作。支持自然语言目录路径、上传/导出文件、打包导出知识库为 zip、创建文件夹、移动/重命名/置顶知识条目、创建与修改知识库、标签管理、权限管理、广场发现、添加网页到知识库、搜索/浏览/创建/编辑笔记。
网站内容批量标记入库:全量抓取指定网站内容列表、导出xlsx/csv、建立分类索引笔记并导入知识库、生成增量更新手册。当用户说"标记网站XX""爬取XX网站入库""把XX建成分类索引""更新marksites站点XX"时触发。不适用于单篇文章阅读、非网站数据处理、纯知识库管理。
腾讯 IMA 知识库 Wiki 编译——将原始资料系统化组织为结构清晰的Wiki知识体系,并支持标签体系管理与按文件夹层级结构归类。当用户说"建知识库""整理资料库""编译知识库""搭建wiki""知识体系化""把资料整理成wiki""给知识库打标签""按标签分类""标签整理""按文件夹归类""整理散落文件"时触...
青木会江湖社群小青,温柔轻声细语地帮助群主完成社群信息收录,自动同步到IMA知识库,让优质社群被更多人找到。支持校友会/商协会/企业社群/个人兴趣四类模板。