文档

文件OCR解析

试用

当用户需要将扫描版 PDF、图片、OFD、票据、合同扫描件、法院文书扫描件或其他 Agent 无法直接读取的文件解析为文本/Markdown 时使用。适用于 OCR 识别、扫描件识别、图片转文字、图片转 Markdown、PDF 转 Markdown、文件解析失败、文档无法读取、提取结果为空、乱码、扫描版文件解析不了、agent 解析不了文件、平台无法解析文件、需要调用得理 OCR 接口等场景。优先使用当前 Agent/平台原生解析能力;只有原生解析失败、结果明显不可用,或用户明确要求使用得理 OCR 时才调用接口。

它能做什么

当用户需要将扫描版 PDF、图片、OFD、票据、合同扫描件、法院文书扫描件或其他 Agent 无法直接读取的文件解析为文本/Markdown 时使用。适用于 OCR 识别、扫描件识别、图片转文字、图片转 Markdown、PDF 转 Markdown、文件解析失败、文档无法读取、提取结果为空、乱码、扫描版文件解析不了、agent 解析不了文件、平台无法解析文件、需要调用得理 OCR 接口等场景。优先使用当前 Agent/平台原生解析能力;只有原生解析失败、结果明显不可用,或用户明确要求使用得理 OCR 时才调用接口。

技能文档

得理 OCR 文件解析

Instructions

将文件转换为可继续分析的 Markdown 或文本。默认把当前 Agent 或平台的原生文件解析能力放在第一优先级;得理 OCR 只作为兜底能力。

前置工作

命中本 skill 后,如需要调用得理 OCR、文件解析、PDF 转 Markdown、图片 OCR、OFD 解析或后端能力,必须先执行 deli-cli 通用前置

完成 CLI 前置检查后,通过当前 skill scope 发现命令,并以当次返回的 RUN id、命令名和参数形态执行;不得假设固定命令或固定参数存在。

如果 CLI 未配置、不可用或未返回覆盖当前任务的命令,应先说明“命令不可用”或“解析受限”,并给出需要用户补充的文件、格式转换或重新扫描建议,不得改用旧本地脚本或直接请求接口。

1. 先尝试原生解析

对每个文件先使用当前 Agent 或平台已有能力解析:

  • PDF:先尝试平台 PDF 解析、pdfplumberPyMuPDF 或同类本地解析。
  • 图片或扫描件:先尝试平台视觉模型、多模态识别或内置 OCR 工具。
  • Office 或表格:先尝试平台能力或 python-docxopenpyxl、CSV/JSON 解析。
  • 文本、HTML、Markdown:直接读取或转换,不调用 OCR。

满足以下条件时,视为原生解析成功,不要调用得理 OCR:

  • 提取文本非空,且不是大量乱码、重复页眉页脚或无意义字符。
  • 扫描版 PDF 的关键页已经得到可读文字。
  • 用户没有明确要求改用得理 OCR。

2. 失败时再调用得理 OCR

只有出现以下情况才使用 deli-cli OCR 命令:

  • 扫描版 PDF、图片、OFD 或票据图片无法被当前 Agent 解析。
  • 原生解析结果为空、缺页、乱码,或表格、票据关键信息无法识别。
  • 用户明确说“用得理 OCR”“调用 OCR”“这个文件 agent 解析不了”“扫描版识别一下”。

调用前先阅读 OCR 文件解析 CLI 场景指南,按当次 cmds 返回的命令和参数组织输入文件、输出目录、语言、任务类型和是否保存原始响应。

3. 批量文件处理

对目录中的多个文件逐个判断,避免对已经能解析的文件重复调用 OCR。

建议输出到单独目录:

parsed/
├── 01_合同扫描件.md
├── 02_付款回单.md
└── raw_response/

后续证据整理、合同审查、法律意见书等任务应直接使用已解析的 Markdown 或文本结果。

支持格式

得理 OCR 常见支持格式如下;实际以当次 cmds 返回能力为准:

类型扩展名
文档.pdf.docx.doc.docm.dotm.rtf.txt.ofd
表格.xlsx.xls
图片.png.jpeg.jpg.gif.bmp.img
网页.html

如果文件格式不支持,先提示用户转换格式,不要调用 OCR。

输出要求

OCR 或文件解析完成后,至少说明:

  • 原始文件名
  • 输出 Markdown 或文本文件路径
  • 是否保存原始响应
  • 是否存在缺页、乱码、表格错位、印章或手写识别不确定
  • 后续可交给哪个 skill 或分析流程继续处理

使用注意

  1. 不要因为 CLI 已配置 API Key 就自动调用得理 OCR;必须先判断原生解析是否失败或用户是否明确要求。
  2. 不要把大段解析文本通过命令行参数传给其他脚本;先写入 .md.txt 文件。
  3. 始终保留原始文件,不要原地覆盖。
  4. OCR 结果必须提醒用户复核,尤其是金额、日期、姓名、案号、发票号码和银行账号。
  5. 处理敏感材料时,只输出任务所需的解析结果,不在对话中粘贴完整隐私内容。

参考资源

  • deli-cli 通用前置
  • OCR 文件解析 CLI 场景指南

相关技能

通用文档解析工具,支持PDF、图片、扫描件的结构化信息提取与OCR识别。Use when 需要文件处理、文档转换、格式互转、内容提取时使用。不适用于加密文件破解。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。

1 次安装

调用百度 Unlimited-OCR API 解析文档,基于 Unlimited-OCR 开源方案的标准化服务,开箱即用免部署,直接返回 Markdown 结构化结果。支持 PDF、Word、PPT、图片等格式,适合复杂表格、多段落、多结构文档解析。触发词:文档解析、Unlimited-OCR、大模型 OCR、Markdown 解析、免部署 OCR、复杂表格、结构化文档。

1 次安装

调用百度文档解析API解析文档。支持PDF、Word、Excel、PPT、图片等18+格式。提取文本、表格、版面分析、OCR识别及RAG文档分块。当用户需要解析文档、提取文本/表格、分析文档结构、处理扫描件时使用。触发词:文档解析、PDF解析、Word解析、表格提取、OCR、文档分析、提取文本、文档结构、扫描识别。

15 次安装

调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型,支持PDF、Word、PPT、图片等格式,精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素,支持100+种语言,可处理不规则布局和长文档跨页解析。触发词:文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。

13 次安装

云启智联AI智能文档解析服务 — 业界领先的金融票据OCR识别引擎,已在企业生产环境沉淀多年,准确率高达99.5%,毫秒级响应。支持银行回单解析(每页多张回单自动裁剪)、对账单解析、发票识别、通用文件解析、异步结果查询及智能记账凭证生成。可将解析结果自动转换为记账凭证(含科目匹配、置信度评分和人工复核建议)。免费体验:https://www.yunqi-zhilian.com/AIService/experience/page 。当用户提到回单解析、银行回单、对账单解析、银行对账单、发票解析、发票识别、文件解析、查询任务结果、任务状态、ping、云启智联、体验馆、记账凭证、生成凭证、做账、会计分录、借方贷方、科目匹配等关键词时,自动调用对应接口并返回结果。

10 次安装1 星标

国际汇票 OCR 技能:仅在用户明确同意后,读取本地票据图像/PDF,上传至 Scnet OCR 服务并提取收付方信息、币种金额、到期日、付款银行及票据号码。