文档

百度文档解析vlm-parser

试用

调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型,支持PDF、Word、PPT、图片等格式,精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素,支持100+种语言,可处理不规则布局和长文档跨页解析。触发词:文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。

它能做什么

调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型,支持PDF、Word、PPT、图片等格式,精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素,支持100+种语言,可处理不规则布局和长文档跨页解析。触发词:文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。

技能文档

百度文档解析(PaddleOCR-VL)Skill

基于 PaddleOCR-VL-1.6 多模态大模型,提供开箱即用的文档智能解析能力。

功能概述

PaddleOCR-VL-1.6-0.9B 是多模态文档解析领域的 SOTA 方案,具备:

  • 全要素精准解析:高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素
  • 智能阅读顺序:基于人类阅读习惯推断内容排列顺序,将零散页面信息转化为有序带标签的结构化元素序列
  • 行级别坐标:支持精准的行级别坐标输出
  • 100+ 种语言:覆盖中、英、日、韩、拉丁文等全球化多语种文档
  • 不规则布局定位:攻克复杂版面解析难点
  • 长文档跨页解析:支持跨页表格合并等企业级场景
  • 直接 Markdown/JSON 输出:无需额外处理

与文档解析(标准版)的区别

特性PaddleOCR-VL(本 Skill)标准版(pipeline-parser)
底层模型多模态大模型 VLM传统 Pipeline
语言支持100+ 种20+ 种
公式/图片识别默认开启,无需配置需手动开启参数
语种识别自动识别,无需指定需指定 language_type
版面类型24 种细粒度类型8 种基础类型
行坐标支持不支持
多边形坐标支持(polygon)仅矩形框
文件大小版式 ≤100M,PDF ≤500 页PDF ≤300M,≤2000 页

适用场景

当用户需要:

  • 解析复杂版面文档(多栏、不规则布局)
  • 精准识别手写文本、数学公式、图表
  • 处理多语种混合文档
  • 获取行级别坐标信息
  • 长文档跨页表格合并
  • 免配置自动识别文档内容

免费资源领取和计费说明

百度智能文档分析平台 领取免费测试资源

百度智能文档分析平台计费与购买方式

用户类型免费额度
个人实名认证用户200 页
企业实名认证用户1000 页

API 配置

额度获取方式

您可通过百度智能云平台获取免费额度购买调用资源

环境变量(必须)

使用前请设置以下环境变量:

export BAIDU_DOC_AI_API_KEY="your_api_key"
export BAIDU_DOC_AI_SECRET_KEY="your_secret_key"

认证方式

通过 API Key 和 Secret Key 获取 access_token,有效期 30 天。所有接口请求需以 URL 参数 access_token 携带。

支持格式

版式文档:pdf, jpg, jpeg, png, bmp, tif, tiff, ofd(图片最长边不大于 8192px)

流式文档:doc, docx, txt, wps, ppt, pptx

支持语言

100+ 种语言,包括中文、英文、日文、韩文、拉丁文等,无需手动指定,大模型自动识别

使用方式

python3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name "test.pdf"
python3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name "test.pdf"

API 接口

文档解析(PaddleOCR-VL)API 服务为异步接口,需要先调用提交请求接口获取 task_id,然后调用获取结果接口进行结果轮询。

提交请求接口

  • HTTP 方法:POST
  • 请求 URLhttps://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}
  • Content-Typeapplication/x-www-form-urlencoded

Python 示例

import requests, os, base64

def create_task(url, file_path, file_url):
    with open(file_path, "rb") as f:
        file_data = base64.b64encode(f.read())
    data = {
        "file_data": file_data,
        "file_url": file_url,
        "file_name": os.path.basename(file_path)
    }
    headers = {'Content-Type': 'application/x-www-form-urlencoded'}
    return requests.post(url, headers=headers, data=data)

request_host = "https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}"
response = create_task(request_host, "./test.pdf", "")
print(response.json())

成功响应示例:

{
  "error_code": 0,
  "error_msg": "",
  "log_id": "10138598131137362685273505665433",
  "result": { "task_id": "task-3zy9Bg8CHt1M4pPOcX2q5bg28j26801S" }
}

获取结果接口

  • HTTP 方法:POST
  • 请求 URLhttps://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={token}
  • Content-Typeapplication/x-www-form-urlencoded
  • 请求参数task_id(必填,提交请求时返回的 task_id)

Python 示例

import requests

def query_task(url, task_id):
    data = {"task_id": task_id}
    headers = {'Content-Type': 'application/x-www-form-urlencoded'}
    return requests.post(url, headers=headers, data=data)

request_host = "https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}"
resp = query_task(request_host, "task_id")
print(resp.json())

请求参数

文件参数(必选,二选一)

参数必选类型说明
file_data和 file_url 二选一string文件 Base64 编码数据。版式文档:pdf, jpg, jpeg, png, bmp, tif, tiff, ofd(图片最长边不大于 8192px);流式文档:doc, docx, txt, wps, ppt, pptx。图片不超过 10M,版式文档不超过 100M,流式文档不超过 50M,PDF 最大 500 页。超过 50M 须使用 file_url。优先级:file_data > file_url
file_url和 file_data 二选一string文件数据 URL,长度不超过 1024 字节。PDF 文档不超过 100M,最大 500 页。请注意关闭 URL 防盗链
file_namestring文件名,请保证文件名后缀正确,例如 "1.pdf"

功能参数

参数必选类型说明
recognize_formula-bool无需开启,大模型默认对版式类型文档进行公式识别
analysis_chartbool是否对统计图表进行解析
parse_image_layout-bool无需开启,大模型默认解析文档中的所有图片
language_type-string无需开启,大模型默认识别语种类型
merge_tablesbool是否将跨页表格合并输出,开启后 tables 内返回跨页表格合并标识
relevel_titlesbool是否对段落标题(paragraph_title)进行分级,开启后在 sub_type 中输出标题级别
recognize_sealbool是否识别印章内容
return_span_boxesbool是否返回行坐标

返回结构

提交请求返回

字段类型说明
log_iduint64唯一的 log id,用于问题定位
error_codeint错误码
error_msgstring错误描述信息
result.task_idstring该请求生成的 task_id

获取结果返回

字段类型说明
result.task_idstring任务 ID
result.statusstring任务状态:pending(排队中)、processing(运行中)、success(成功)、failed(失败)
result.task_errorstring解析报错信息(任务失败、额度耗尽等)
result.markdown_urlstringMarkdown 格式结果链接,有效期 30 天
result.parse_result_urlstringJSON 格式结果 BOS 链接,有效期 30 天

解析结果 JSON 结构(parse_result_url)

顶层字段:file_namefile_idpages[]

页面对象(pages[])

字段类型说明
page_idstring页码 ID
page_numint页码数
textstring当前页所有纯文字内容
layoutslist版式分析结果
tableslist表格解析结果
imageslist图片解析结果
metadict页面元信息(page_width, page_height)

版面元素(layouts[])

字段类型说明
layout_idstring唯一标志,格式 "xxxxx-layout-{global_layout_index}"
textstring文本内容(type 为 table/image 时为空)
positionlist位置 [x, y, w, h]
polygonlist顶点坐标列表,可围合成多边形
span_boxeslist行信息(开启 return_span_boxes 后生效),含 text 和 location
typestring版面元素类型(见下表)
sub_typestring标题层级(开启 relevel_titles 后生效)

版面类型(type)— 24 种细粒度类型

类型说明类型说明
text文本table表格
image图片chart图表
doc_title文档标题paragraph_title段落标题
figure_title图片标题display_formula公式
inline_formula行内公式formula_number公式编号
header页眉footer页脚
header_image页眉图片footer_image页脚图片
number页码abstract摘要
algorithm算法aside_text旁注文本
content目录footnote脚注
reference参考文献reference_content参考文献内容
seal印章vertical_text竖排文本

表格对象(tables[])

字段类型说明
layout_idstring对应 layouts 中 type 为 table 的 layout ID
markdownstring表格 Markdown 形式
positionlist边框数据 [x, y, w, h]
cellslist单元格内版面信息(扁平列表)
matrixlist2D 单元格索引矩阵,元素为 cells 数组下标;相同下标重复出现表示合并单元格
merge_tablestring合并标识(开启 merge_tables 后):begin(开始)、end(结束)

图片对象(images[])

字段类型说明
layout_idstring对应 layouts 中 type 为 image 的 layout ID
positionlist边框数据 [x, y, w, h]
data_urlstring图片存储链接
image_descriptionstring统计图表内容解析(JSON 字符串,需 json.loads 解析)

API 特性

异步处理流程

  1. 调用提交请求接口 → 获取 task_id
  2. 通过 task_id 调用获取结果接口轮询

轮询建议

  • 提交请求后 5~10 秒开始轮询
  • 轮询间隔:5 秒
  • 最大轮询时间:300 秒

QPS 限制

  • 提交请求接口:2 QPS
  • 获取结果接口:5 QPS

文件限制

限制项说明
图片大小≤ 10M,最长边 ≤ 8192px
版式文档大小≤ 100M
流式文档大小≤ 50M
PDF 页数≤ 500 页
URL 长度≤ 1024 字节
优先级file_data > file_url

错误处理

常见错误码示例:

错误码说明
282003missing parameters(缺少必要参数)
282007task not exist, please check task id(任务不存在)

完整错误码参见 references/error_codes.mdOCR 错误码文档

失败响应示例:

{
  "log_id": "13665091038742503867108513247608",
  "error_code": "282007",
  "error_msg": "task not exist, please check task id",
  "result": "null"
}

产品计费与购买方式

数据来源:百度智能云 OCR 计费说明

免费额度

登录文字识别控制台自动领取:

用户类型免费额度
个人实名认证用户200 页
企业实名认证用户1000 页

新人优惠

限时活动价 9 元/千页,面向新用户。

预付费资源包

有效期 1 年,到期未抵扣额度作废。购买后 7 天内若未产生调用可自助退订。

规格(页)原价(元)优惠价(元)
1,00018090
5,000850425
10,0001,600800
50,0007,5003,750
100,00014,0007,700
200,00026,00014,300
500,00055,00033,000
1,000,00090,00054,000
5,000,000350,000210,000

按量后付费

  • 不限月调用量
  • 原价 0.18 元/页,优惠价 0.09 元/页
  • 仅成功调用计费,调用失败不计费

购买入口

  • 购买资源包 / 开通后付费:均通过百度智能云控制台 文字识别产品页面进行
  • 退订:资源包购买后 7 天内未产生调用可前往"退订管理页面"自助退订

脚本

  • scripts/baidu_doc_vlm_parser.py:文档解析主程序,支持命令行快速调用

参考文档

  • references/parameters.md:完整 API 参数与返回结构详解
  • references/error_codes.md:完整错误码参考
  • references/apikey-fetch.md:API Key 配置指南

相关链接

相关技能

调用百度文档解析API解析文档。支持PDF、Word、Excel、PPT、图片等18+格式。提取文本、表格、版面分析、OCR识别及RAG文档分块。当用户需要解析文档、提取文本/表格、分析文档结构、处理扫描件时使用。触发词:文档解析、PDF解析、Word解析、表格提取、OCR、文档分析、提取文本、文档结构、扫描识别。

15 次安装

调用百度 Unlimited-OCR API 解析文档,基于 Unlimited-OCR 开源方案的标准化服务,开箱即用免部署,直接返回 Markdown 结构化结果。支持 PDF、Word、PPT、图片等格式,适合复杂表格、多段落、多结构文档解析。触发词:文档解析、Unlimited-OCR、大模型 OCR、Markdown 解析、免部署 OCR、复杂表格、结构化文档。

1 次安装

百度智能文档分析(基于百度「智能文档分析」,官网入口:https://ai.baidu.com/tech/nlp/Textanalysis)的 API 调用技能。支持文档抽取、文档解析、文档解析(PaddleOCR-VL)、文档比对、合同审查、文档格式转换等功能。当用户需要:(1) 从文档中提取特定字段信息,(2) 解析文档内容,(3) 比对两份文档差异,(4) 审查合同风险,(5) 转换文档格式时使用此技能。触发词:文档抽取、文档解析、PaddleOCR、文档比对、合同审查、格式转换、智能文档分析、百度智能文档分析、百度文档AI。

17 次安装

通用文档解析工具,支持PDF、图片、扫描件的结构化信息提取与OCR识别。Use when 需要文件处理、文档转换、格式互转、内容提取时使用。不适用于加密文件破解。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。

1 次安装

Alibaba Cloud DocMind intelligent document parsing tool. Supports PDF, Word, PPT, Excel, images and more, outputting structured Markdown/JSON/HTML. Offers tw...

1 次安装

云启智联AI智能文档解析服务 — 业界领先的金融票据OCR识别引擎,已在企业生产环境沉淀多年,准确率高达99.5%,毫秒级响应。支持银行回单解析(每页多张回单自动裁剪)、对账单解析、发票识别、通用文件解析、异步结果查询及智能记账凭证生成。可将解析结果自动转换为记账凭证(含科目匹配、置信度评分和人工复核建议)。免费体验:https://www.yunqi-zhilian.com/AIService/experience/page 。当用户提到回单解析、银行回单、对账单解析、银行对账单、发票解析、发票识别、文件解析、查询任务结果、任务状态、ping、云启智联、体验馆、记账凭证、生成凭证、做账、会计分录、借方贷方、科目匹配等关键词时,自动调用对应接口并返回结果。

10 次安装1 星标