Documents

图纸解析

Try it

建筑图纸解析引擎。支持 DWG/DXF/PDF/图片格式的图纸解析,提取文字、段落、材料表、尺寸标注等结构化数据。用户提及'解析图纸''读图''CAD解析''PDF解析'时触发。

What it does

建筑图纸解析引擎。支持 DWG/DXF/PDF/图片格式的图纸解析,提取文字、段落、材料表、尺寸标注等结构化数据。用户提及'解析图纸''读图''CAD解析''PDF解析'时触发。

The skill document

Drawing Parser — 建筑图纸解析引擎

自动识别图纸格式(DWG/DXF/PDF/图片),调度对应解析管线,输出结构化数据供方案编制和审核使用。

支持的格式

格式子引擎技术方案精度
.dwgCAD管线ODA转换→DXF→ezdxf
.dxfCAD管线ezdxf 直接读取
.pdfPDF管线PyMuPDF + 多模式OCR
.png/.jpgPDF管线同上,三种OCR可选

OCR 模式对比(PDF/图片)

模式技术栈精度速度依赖
v6(推荐)PP-OCRv6 rapidocr最高较快pip install rapidocr
dldeepdoc ONNX较慢onnxruntime, opencv
rapidRapidOCR-json.exe较快仅需exe
fastPaddleOCR-json.exe够用仅需exe

快速开始

Python API

import sys
sys.path.insert(0, 'path/to/scripts')

# CAD 图纸解析
from cad_parser import parse_cad_drawing
result = parse_cad_drawing('图纸.dwg', output_dir='./output')

# PDF 图纸解析
from pdf_parser import parse_pdf_drawing
result = parse_pdf_drawing('图纸.pdf', ocr_mode='v6', output_dir='./output')

命令行

# CAD 解析
python scripts/cad_parser.py 图纸.dwg ./output --mode v4

# PDF 解析(自动降级 v6→dl→rapid→fast)
python scripts/pdf_parser.py 图纸.pdf ./output --mode v6

输出结构

所有解析结果写入 {项目}/_drawing_parser/project_data.json

{
  "project_name": "示例项目",
  "source_file": "图纸.dwg",
  "parse_time": "2026-08-18T18:00:00Z",
  "texts": [
    {
      "content": "钢筋混凝土",
      "bbox": [x1, y1, x2, y2],
      "layer": "TEXT",
      "confidence": 0.95
    }
  ],
  "paragraphs": [
    {
      "type": "title",
      "content": "结构设计说明",
      "position": 1
    }
  ],
  "tables": [
    {
      "header": ["材料", "规格", "数量"],
      "rows": [["钢筋", "HRB400", "120"]]
    }
  ],
  "dimensions": [
    {
      "value": 3600,
      "unit": "mm",
      "position": [x, y]
    }
  ]
}

依赖安装

基础依赖(所有模式)

pip install pymupdf ezdxf openpyxl numpy matplotlib

CAD 管线(v4主力)

# ODA File Converter(免费,需手动下载安装)
# 下载地址:https://www.opendesign.com/guestfiles/oda_file_converter

# 或 AutoCAD(v3备用管线)
# 需要安装 AutoCAD 2026+

PDF 管线

# v6 模式(推荐)
pip install rapidocr

# dl 模式
pip install onnxruntime opencv-python-headless
# 模型文件:models/deepdoc/(已内置)

# rapid / fast 模式
# exe 文件已内置在 scripts/ocr_service/

故障排查

问题解决方案
ODA 路径异常更新 config.json 中的 ODA_PATH
ezdxf 版本冲突pip install ezdxf==1.4.4
LISP 脚本失效检查 dwg_extract_v2.lsp 路径配置
v4 管线失败切 v3(accoreconsole+LISP)
OCR 模型缺失从 hf-mirror.com 下载 PP-OCRv6 模型
内存不足降低 max_pages 参数

版本历史

  • v1.0.0(2026-08-18):初始开源版本
    • 支持 DWG/DXF/PDF/图片四种格式
    • 四模式OCR自动降级
    • 结构化JSON输出

许可证

MIT License - 可自由使用、修改、分发

贡献

欢迎提 Issue 和 PR。请确保:

  1. 代码符合 PEP 8 规范
  2. 新增功能附带测试用例
  3. 更新 CHANGELOG.md

Related skills

调用百度文档解析API解析文档。支持PDF、Word、Excel、PPT、图片等18+格式。提取文本、表格、版面分析、OCR识别及RAG文档分块。当用户需要解析文档、提取文本/表格、分析文档结构、处理扫描件时使用。触发词:文档解析、PDF解析、Word解析、表格提取、OCR、文档分析、提取文本、文档结构、扫描识别。

15 installs

EN: Extract structured data from EPLAN/CAD vector PDF electrical drawings — component list (位号/型号/数量), wire/pin topology (导线连接、串并联、电能流向), terminal table, and title-block metadata. Uses PDF vector geometry (100% accurate, no OCR) instead of visual models. Use when the user provides an EPLAN or vector PDF electrical schematic and asks "解析EPLAN图 / 抽元件清单 / 看导线怎么连 / 提取位号型号 / parse EPLAN drawing / extract components / wire topology". 中文:从 EPLAN / CAD 矢量 PDF 电气图纸中抽取结构化数据 —— 元件清单(位号/型号/数量)、导线连接拓扑(串并联、电能流向)、端子表、标题栏。基于 PDF 矢量几何直接提取(100%准确,无OCR误差),不依赖视觉模型。当用户提供 EPLAN 或矢量 PDF 电气原理图并要求"解析EPLAN图/抽元件清单/看导线怎么连/提取位号型号"时触发。

通用文档解析工具,支持PDF、图片、扫描件的结构化信息提取与OCR识别。Use when 需要文件处理、文档转换、格式互转、内容提取时使用。不适用于加密文件破解。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。

1 installs

自动对比2D图纸与3D模型的尺寸、轮廓差异;输出JSON和Markdown格式差异报告;支持直径符号和几何公差识别;适用于设计评审阶段快速发现图纸不一致问题

1 installs

从图片或 PDF 文档中识别并提取文字内容,支持多种图片格式和 PDF 文件,自动判断是否包含文字并保留原始格式输出结构化结果;当用户需要从图片或 PDF 提取文字、进行 OCR 识别、处理含文字的文档或转换为可编辑文本时使用

24 installs

从图片或 PDF 文档中识别并提取文字内容,支持多种图片格式和 PDF 文件,自动判断是否包含文字并保留原始格式输出结构化结果;当用户需要从图片或 PDF 提取文字、进行 OCR 识别、处理含文字的文档或转换为可编辑文本时使用

16 installs1 stars