PDF 全文翻译、重排与可检索交付
Documents
professional-pdf-translator
Try it通用长篇文献/小说多页PDF逐页自动提取、匹配用户提供的本地术语表并翻译追加至DOCX的自动化工作流。适用于任何具有特定受众、包含大量专有名词的长文献、小众长篇小说、学术论文、技术白皮书等PDF翻译场景。用户自行提供原文PDF、专业术语对照表及输出路径。
What it does
通用长篇文献/小说多页PDF逐页自动提取、匹配用户提供的本地术语表并翻译追加至DOCX的自动化工作流。适用于任何具有特定受众、包含大量专有名词的长文献、小众长篇小说、学术论文、技术白皮书等PDF翻译场景。用户自行提供原文PDF、专业术语对照表及输出路径。
The skill document
PDF Batch Translator — 通用长篇文献逐页翻译工作流
致谢:本 Skill 的 DOCX 写入模块参考了 tiangong-wps-word-automation-cn (作者: tiangong) 的 Windows COM 自动化思路。如果你还需要 Word/WPS 的批量自动化操作(合并、拆分、导出 PDF 等),推荐安装原 Skill:
clawhub install tiangong-wps-word-automation-cn。
概述
本 Skill 提供一套标准化的长文献 PDF 逐页翻译自动化流水线,核心能力:
- 逐页提取:从多页 PDF 中按页码逐一提取文本,智能处理双栏排版
- 术语匹配:根据用户提供的专业术语对照表(支持多个文件),自动识别当前页出现的术语并向翻译模型提供参考
- 动态词库:每页翻译完成后,自动提取新出现的专有名词(人名、地名、特有概念),追加至专属词表,确保跨页译名一致性
- 富文本写入:将翻译结果以 Markdown 格式写入 DOCX,自动转换标题层级、粗体、斜体,并支持用户自定义高亮规则
适用场景
- 小众长篇小说(如特定圈层的同人/原创作品)
- 学术论文与技术白皮书
- 小众游戏/桌游规则书
- 行业协会标准文档
- 任何以 PDF 流通、包含大量专有术语的长篇文献
前置环境要求
- Python 环境需安装依赖:
python -m pip install pymupdf python-docx
用户需要提供的内容
在启动工作流前,请向用户确认以下信息:
| 必需项 | 说明 |
|---|---|
| PDF 路径 | 待翻译的源 PDF 文件绝对路径 |
| 输出 DOCX 路径 | 翻译结果目标 DOCX 文件的绝对路径 |
| 翻译范围 | 起止页码(如第 5 页到第 120 页) |
| 术语对照表 | 一个或多个 .md 格式的术语表文件路径,格式为 English Term: 中文译名(每行一条) |
| 可选项 | 说明 |
|---|---|
| 自定义高亮规则 | 一组正则表达式 + 颜色,用于在 DOCX 中对特定文本模式(如数字、公式、代码标识符)进行高亮染色 |
| 翻译风格指令 | 额外的自然语言指令,指导翻译模型的语气、措辞风格(如"学术严谨风格"、"保留口语化表达"、"武侠小说风格"等) |
| 动态专属词表路径 | 如需在特定目录维护动态词表,请提供路径;默认将创建在 PDF 同目录下,文件名为 {PDF文件名}_专属词表.md |
术语对照表格式要求
术语表应为 Markdown 文件(UTF-8 编码),每行一条术语:
# 可选注释行以 # 开头
Ability Score: 属性值
Armor Class: 护甲级
Dexterity Saving Throw: 敏捷豁免
Fireball: 火球术
- 以
#开头的行视为注释,不会被匹配 - 匹配逻辑:脚本会提取术语行中的英文单词片段(长度 > 3),若该片段出现在当前页文本中,则整条术语被标记为"匹配"
- 支持多个术语表文件同时使用——适合将"基础通用术语"和"特定章节术语"分开管理
执行流程
当用户提供了上述必需信息后,在一个循环中逐页执行以下步骤:
步骤 1:提取单页文本与匹配术语
使用本 Skill 内置的 extract_page.py:
python "{baseDir}/scripts/extract_page.py" --pdf "/path/to/document.pdf" --page {page_num} --terms "/path/to/glossary.md" "/path/to/glossary2.md"
脚本输出 JSON:
is_empty(布尔值):是否为空白页或纯图片页text(字符串):提取出的本页原文文本matched_terms(列表):本页匹配到的术语条目
步骤 2:执行大模型翻译
- 纯图片页 (
is_empty: true):跳过翻译,直接写入【第 {page_num} 页】:纯图片页 - 有文本:将原文
text、匹配术语matched_terms、当前专属词表、以及用户提供的翻译风格指令一并提交给模型翻译
强制输出格式要求:
- 仅输出纯中文译文(不附带英文原文)
- 使用 Markdown 标题(
#、##、###等)还原原文层级结构 - 使用
**粗体**和*斜体*还原原文强调 - 列表项使用
-或1.还原
动态词库提取:翻译完成后,要求模型识别本页新出现的专有名词(人名、地名、独特概念、特殊物品等),并使用以下脚本追加:
python "{baseDir}/scripts/append_terms.py" --file "/path/to/dynamic_glossary.md" --terms "English Name: 中文名" "Another Term: 另一个译名"
这确保新词以 UTF-8 编码追加,供下一页翻译时作为上下文参考。
步骤 3:富文本写入 DOCX
- 使用
write工具将翻译好的 Markdown 文本存入临时文件(如{workdir}/temp_translate.txt) - 执行写入命令:
python "{baseDir}/scripts/append_docx.py" --docx "/path/to/output.docx" --textfile "{workdir}/temp_translate.txt" --page {page_num}
若用户提供了自定义高亮规则,添加 --highlights 参数:
python "{baseDir}/scripts/append_docx.py" --docx "..." --textfile "..." --page {page_num} --highlights "regex1:#RRGGBB" "regex2:#RRGGBB"
步骤 4:推进下一页
page_num + 1,重复上述步骤,直至完成所有页面。完成后向用户报告总页数、跳过的纯图片页数、以及专属词表的最终路径。
自定义高亮规则
append_docx.py 支持通过 --highlights 参数传入自定义高亮规则。每条规则格式为 正则表达式:颜色HEX:
--highlights "DC\s*\d+:#8B0000" "[0-9]+d[0-9]+:#006400"
- 正则表达式需符合 Python
re语法 - 颜色为 6 位十六进制 RGB(不含
#前缀的格式也可,脚本会自动处理) - 匹配到的文本将在 DOCX 中被加粗并以指定颜色渲染
不指定 --highlights 时,脚本仅处理 Markdown 标准格式(标题、粗体、斜体),不做额外染色。
脚本说明
extract_page.py — 单页文本提取
- 输入:PDF 路径、页码(从 1 开始)、术语表路径列表
- 智能处理双栏排版:检测页面中轴线,分别按垂直位置排序左右栏文本
- 横跨页面宽度 > 65% 的文本块识别为标题/跨栏段落
- 输出:JSON 格式的提取结果与匹配术语
append_docx.py — Markdown 转 DOCX 追加写入
- 输入:目标 DOCX 路径、包含 Markdown 译文的临时 TXT 文件、页码
- 自动解析
#标题、**粗体**、*斜体* - 可选自定义高亮规则
- 每页以灰色斜体分隔线标注原文页码
append_terms.py — 动态词表追加
- 输入:词表文件路径、要追加的术语列表
- 以 UTF-8 编码追加,避免 GBK 乱码
- 自动创建不存在的目录
Related skills
使用本地llama.cpp模型(如Hy-MT2-7B)批量翻译PDF文档,结合学术翻译三步法(直译→反思→雅化),支持中/英/日/韩/法/德/西/俄八大主要语言任意互译,逐页提取+翻译,按目标语言输出.md文件(Windows 平台)
使用本地llama.cpp模型(如Hy-MT2-7B)批量翻译PDF文档,结合学术翻译三步法(直译→反思→雅化),支持中/英/日/韩/法/德/西/俄八大主要语言任意互译,逐页提取+翻译,按目标语言输出.md文件(Ubuntu/Linux 平台)
长篇外文(德/英/法/日等)学术专著、古籍、档案、译著的全文高质量中译流水线:解析→清洗切片→建体例与术语表→并行分批翻译→多维质检→合并交付带目录的阅读版。适用于 300 页以上、需要术语全书统一、脚注保留、存疑可追溯的长篇翻译任务。Triggers: 全文翻译 / 翻译全书 / 翻译整本 / 德译中 / 学术翻译 / 长篇翻译 / 译著 / 逐段翻译 / 把这本书译成中文 / translate a whole book / full-text translation of a scholarly monograph.
专业翻译工具 — 支持文本和 PDF 输入,PDF 输出双语对照 HTML + Markdown。触发关键词:翻译、术语保护、更新术语、词典、glossary、保留特定词。
Framework for translating Word, PDF, Excel, PowerPoint, HTML, Markdown, TXT documents. Provides document parsing code — the AI agent's own LLM performs the a...