PaddleOCR PP-Structure 模型体系全解析版面分析、表格识别与 KIE 关键信息抽取模型选型与实战指南【免费下载链接】PaddleOCR飞桨多语言OCR工具包实用超轻量OCR系统支持80种语言识别提供数据标注与合成工具支持服务器、移动端、嵌入式及IoT设备端的训练与部署 Awesome multilingual OCR toolkits based on PaddlePaddle (practical ultra lightweight OCR system, support 80 languages recognition, provide data annotation and synthesis tools, support training and deployment among server, mobile, embedded and IoT devices)项目地址: https://gitcode.com/paddlepaddle/PaddleOCR导读本文基于 PaddleOCR 仓库中 PP-Structure 模型列表文档 展开系统梳理 PP-Structure 文档结构化分析工具链的三大能力——版面分析Layout Analysis、OCR 与表格识别Table Recognition、关键信息抽取KIE的官方模型矩阵。你将掌握各模型的适用数据集、识别区域类别、推理模型体积与精度对比并学会如何结合 ppstructure 目录下的推理脚本与PPStructure高层 API将这些模型接入实际文档解析管线。1. PP-Structure 模型体系概览PP-Structure 是 PaddleOCR 面向文档版面结构化推出的工具链其模型按功能划分为三组能力模块核心任务代表模型对应仓库代码版面分析识别文档中的文本、标题、表格、图片等区域PicoDet 系列、PP-YOLOv2 系列ppstructure/layout/predict_layout.pyOCR 表格识别表格场景文字检测/识别、表格结构还原MobileNetV2 系列、SLANetppstructure/tableKIE从文档中抽取关键字段实体/关系VI-LayoutXLM、LayoutXLM、SDMGRppstructure/kie从源码结构看版面分析由LayoutPredictorppstructure/layout/predict_layout.py负责其前后处理分别复用ppocr.data的操作符工厂与ppocr.postprocess的后处理工厂说明整个 PP-Structure 模型体系与 PP-OCR 共享同一套推理基础设施。2. 版面分析Layout Analysis模型2.1 官方模型总览下表完整继承自模型列表文档列出 6 个官方版面分析模型覆盖英文通用版面PubLayNet、中文文档CDLA与表格定位TableBank三类场景模型名称说明推理模型大小下载字典路径picodet_lcnet_x1_0_fgd_layout基于 PicoDet LCNet_x1_0 与 FGD 蒸馏训练在 PubLayNet 数据集上训练的英文版面分析模型可识别Text、Title、Table、Picture、List共 5 类区域9.7Minference modelppyolov2_r50vd_dcn_365e_publaynet基于 PP-YOLOv2 在 PubLayNet 数据集上训练的英文版面分析模型221.0Minference model / trained model同上picodet_lcnet_x1_0_fgd_layout_cdla在 CDLA 数据集上训练的中文版面分析模型可识别Table、Figure、Figure caption、Table caption、Header、Footer、Reference、Equation等 10 类区域9.7Minference modelpicodet_lcnet_x1_0_fgd_layout_table在表格数据集上训练的版面分析模型可检测中英文文档中的表格9.7Minference modelppyolov2_r50vd_dcn_365e_tableBank_word基于 PP-YOLOv2 在 TableBank Word 数据集上训练的英文文档表格检测模型221.0Minference model同上ppyolov2_r50vd_dcn_365e_tableBank_latex基于 PP-YOLOv2 在 TableBank Latex 数据集上训练的英文文档表格检测模型221.0Minference model同上选型要点PicoDet 系列推理模型仅 9.7M适合服务端与端侧轻量部署PP-YOLOv2 系列达 221M通常用于对精度要求更高的离线批处理场景。2.2 数据集与区域类别字典版面分析模型的输出类别由字典文件定义模型在推理时通过layout_dict_path参数加载PubLayNet英文学术文档5 类内容见 layout_publaynet_dict.txt依次为text、title、list、table、figureCDLA中文文档10 类内容见 layout_cdla_dict.txt包含text、title、figure、figure_caption、table、table_caption、header、footer、reference、equation表格专用1 类内容见 layout_table_dict.txt仅含table专用于只找表格的定位任务。2.3 源码侧的版面分析参数在 ppstructure/layout/predict_layout.py 中LayoutPredictor的构建逻辑印证了上述模型-字典的绑定关系postprocess_params { name: PicoDetPostProcess, layout_dict_path: args.layout_dict_path, score_threshold: args.layout_score_threshold, nms_threshold: args.layout_nms_threshold, }三个关键参数的含义与默认值见 ppstructure/utility.py参数默认值作用layout_dict_path../ppocr/utils/dict/layout_dict/layout_publaynet_dict.txt版面类别字典路径决定模型输出的类别名称集合layout_score_threshold0.5检测框置信度阈值低于该分数的区域被过滤layout_nms_threshold0.5非极大值抑制NMS阈值控制重叠框的去重力度同时推理前图像会被 Resize 到[800, 608]并采用 ImageNet 的 mean/std[0.485, 0.456, 0.406]/[0.229, 0.224, 0.225]归一化这正是 PicoDet 系列的标准输入约定。3. OCR 与表格识别Table Recognition模型3.1 表格场景 OCR 模型表格结构化依赖检测文字 → 识别文字两条模型链路官方提供在 PubTabNet 数据集上训练的英文表格场景 OCR 模型模型名称说明推理模型大小下载en_ppocr_mobile_v2.0_table_det基于 PubTabNet 训练的英文表格场景文本检测模型4.7Minference model / trained modelen_ppocr_mobile_v2.0_table_rec基于 PubTabNet 训练的英文表格场景文本识别模型6.9Minference model / trained model如果表格场景需要更通用的 OCR 能力官方文档建议直接使用 PP-OCR 模型列表 中的模型或将自训模型的路径配置到det_model_dir、rec_model_dir字段实现任意 OCR 模型 表格结构识别的自由组合。3.2 表格结构识别模型表格结构识别用于还原单元格布局与行列关系官方提供两代模型模型说明推理模型大小下载en_ppocr_mobile_v2.0_table_structure基于 TableRec-RARE 算法、在 PubTabNet 上训练的英文表格识别模型6.8Minference model / trained modelen_ppstructure_mobile_v2.0_SLANet基于 SLANet 算法、在 PubTabNet 上训练的英文表格识别模型9.2Minference model / trained modelch_ppstructure_mobile_v2.0_SLANet基于 SLANet 的中文表格识别模型9.3Minference model / trained model其中SLANetStructure Location Alignment Network是 PP-Structure 推出的新一代表格结构识别方案中英文模型体积均控制在 10M 以内是当前官方推荐的主力模型。表格识别结果以 HTML 结构串输出对应res字段中的html键便于后续转 Excel 或 Markdown。4. KIE 关键信息抽取模型KIEKey Information Extraction用于从版面中抽取实体与实体间关系是票据、合同、证件类文档解析的核心环节。PP-Structure 官方在 XFUND_zh 与 wildreceipt 两个数据集上给出了多模型对比结果。4.1 XFUND_zh 数据集上的 SER/RE 效果以下数据来自官方模型列表文档测试环境为V100 GPU CUDA 10.2 CUDNN 8.1.1 TRT 7.2.3.4时间成本仅统计推理耗时不含预处理与后处理模型Backbone任务配置Hmean耗时(ms)下载VI-LayoutXLMVI-LayoutXLM-baseSERser_vi_layoutxlm_xfund_zh_udml.yml93.19%15.49trained modelLayoutXLMLayoutXLM-baseSERser_layoutxlm_xfund_zh.yml90.38%19.49trained modelLayoutLMLayoutLM-baseSERser_layoutlm_xfund_zh.yml77.31%-trained modelLayoutLMv2LayoutLMv2-baseSERser_layoutlmv2_xfund_zh.yml85.44%31.46trained modelVI-LayoutXLMVI-LayoutXLM-baseREre_vi_layoutxlm_xfund_zh_udml.yml83.92%15.49trained modelLayoutXLMLayoutXLM-baseREre_layoutxlm_xfund_zh.yml74.83%19.49trained modelLayoutLMv2LayoutLMv2-baseREre_layoutlmv2_xfund_zh.yml67.77%31.46trained model其中SERSemantic Entity Recognition是语义实体识别RERelation Extraction是实体关系抽取。从官方数据看VI-LayoutXLM 在 SER/RE 双任务上 Hmean 均最高93.19% / 83.92%且推理耗时15.49ms低于 LayoutXLM 与 LayoutLMv2体现了视觉骨干替换带来的精度-速度双重收益。4.2 wildreceipt 数据集上的 SDMGR模型Backbone配置Hmean下载SDMGRVGG6kie_unet_sdmgr.yml86.70%trained modelSDMGRSpatial Dual-Modality Graph Reasoning基于图推理建模文本与空间关系适用于小票等非版式化文档的字段抽取。4.3 配置与训练UDML 蒸馏方案VI-LayoutXLM 系列采用UDMLUnified Deep Mutual Learning联合深度互学习训练策略其配置位于 configs/kie/vi_layoutxlm 目录SER 配置ser_vi_layoutxlm_xfund_zh_udml.ymlArchitecture段定义DistillationModelTeacher 与 Student 均为LayoutXLMForSermode: vi7 类实体Loss 组合了DistillationVQASerTokenLayoutLMLoss、DistillationSERDMLLosssoftmax log与两个基于hidden_states_5、hidden_states_8的DistillationVQADistanceLossl2权重 0.5RE 配置re_vi_layoutxlm_xfund_zh_udml.yml使用LayoutXLMForRecontains_re: True训练侧需额外启用VQAReTokenRelation、TensorizeEntitiesRelations等变换构建实体关系张量非蒸馏对照配置ser_vi_layoutxlm_xfund_zh.yml、re_vi_layoutxlm_xfund_zh.yml位于同目录。两份蒸馏配置的公共超参数包括Optimizer采用AdamWlearning_rate: 0.00005、warmup_epoch: 10、输入 Resize 到[224, 224]、max_seq_len: 512、序列排序方式order_method: tb-yx自上而下、自左而右指标以hmean为main_indicator。5. 模型接入与使用方式5.1 命令行快速使用安装paddleocr3.0版本后可通过PPStructure命令行按需组合各模型详见 PP-Structure 快速开始# 图像方向分类 版面分析 表格识别完整管线 paddleocr --image_dirppstructure/docs/table/1.png --typestructure --image_orientationtrue # 仅版面分析关闭表格与 OCR paddleocr --image_dirppstructure/docs/table/1.png --typestructure --tablefalse --ocrfalse # 仅表格识别关闭版面分析 paddleocr --image_dirppstructure/docs/table/table.jpg --typestructure --layoutfalse5.2 Python APIimport os import cv2 from paddleocr import PPStructure, save_structure_res table_engine PPStructure(show_logTrue) # 默认启用版面分析 OCR 表格识别 img cv2.imread(ppstructure/docs/table/1.png) result table_engine(img) save_structure_res(result, ./output, os.path.basename(1.png).split(.)[0]) for line in result: line.pop(img) print(line)返回结果为 dict 列表每个 dict 包含type区域类型、bbox[左上x, 左上y, 右下x, 右下y]、res表格区为含html键的 dict文本区为检测框与识别结果的元组。5.3 与模型相关的关键参数结合 ppstructure/utility.py 与快速开始文档与本文模型矩阵直接相关的参数如下参数默认值说明layout_model_dirNone版面分析模型推理目录未指定时自动下载官方模型layout_dict_path../ppocr/utils/dict/layout_dict/layout_publaynet_dict.txt版面类别字典切换 CDLA/Table 模型时需同步更换table_model_dirNone表格结构模型推理目录如 SLANettable_char_dict_path../ppocr/utils/dict/table_structure_dict_ch.txt表格结构模型字典ser_model_dir/ser_dict_pathNone /../train_data/XFUND/class_list_xfun.txtSER 模型推理目录与实体类别字典kie_algorithmLayoutXLMKIE 算法选择modestructurestructure或kie两种运行模式6. 选型建议与总结综合官方模型矩阵与源码实现可以得出以下选型思路通用文档版面分析默认选择picodet_lcnet_x1_0_fgd_layoutPubLayNet5 类处理中文科技文献时切换picodet_lcnet_x1_0_fgd_layout_cdlaCDLA10 类两者推理模型均仅 9.7M且需同步更换 layout_dict_path纯表格定位使用picodet_lcnet_x1_0_fgd_layout_table或 TableBank 系列字典仅含table一类表格内容还原优先选用 SLANet 中英文模型约 9.2–9.3M并搭配表格场景的 det/rec OCR 模型或直接复用 PP-OCR 模型列表 中的通用 OCR 模型票据/证件关键信息抽取首选 VI-LayoutXLMSER 93.19%、RE 83.92%15.49ms其 UDML 蒸馏配置可直接参考 configs/kie/vi_layoutxlm 下的四个 YAML 文件复现训练。通过本文你可以依据任务场景、精度要求与部署资源在 PaddleOCR 的 PP-Structure 模型体系中快速锁定合适的模型并借助PPStructureAPI 与 ppstructure 目录下的脚本完成从版面分析、表格结构化到关键信息抽取的完整文档解析流程。【免费下载链接】PaddleOCR飞桨多语言OCR工具包实用超轻量OCR系统支持80种语言识别提供数据标注与合成工具支持服务器、移动端、嵌入式及IoT设备端的训练与部署 Awesome multilingual OCR toolkits based on PaddlePaddle (practical ultra lightweight OCR system, support 80 languages recognition, provide data annotation and synthesis tools, support training and deployment among server, mobile, embedded and IoT devices)项目地址: https://gitcode.com/paddlepaddle/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考