PaddleOCR 完全教程:如何把图片和 PDF 变成大模型能用的结构化数据
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
如果你正在搭 RAG 检索或文档问答系统,第一个绕不开的问题往往是:成堆的扫描版 PDF 和照片,怎么变成干净、结构化的数据喂给模型?手动复制粘贴慢且易错,商业 OCR 接口又贵还有数据合规顾虑。PaddleOCR 是一个开源 OCR 工具包,一条命令就能把图像和文档转成 Markdown、JSON 这类结构化数据,支持 100 多种语言,装在自己的机器或服务器上就能跑。
项目速览 🚀
PaddleOCR 是产业级 OCR 工具包,定位是图像/PDF 与大模型之间的"数据转换层"。核心由三套系统组成:PP-OCR(通用文字识别)、PP-Structure(文档分析)、PP-ChatOCR(基于 LLM 的信息抽取)。常用的能力有:
- 通用文字识别:一条命令输出图片里的文字和位置框;最新 PP-OCRv6 用单一模型覆盖中、英、日等 50 种语言
- 文档解析:把复杂 PDF、图片直接转成 Markdown/JSON,保留原有版式,输出可直接喂给大模型
- 表格识别:识别文档中的表格,支持导出 Excel
- 关键信息抽取:从发票、证件类文档里抽出姓名、日期、金额等结构化字段
- 轻量部署:最小模型仅几 MB,CPU、移动端都能跑
最快上手路径 ⚡
1. 安装两个依赖
前置条件:Python 3.9 以上。先装 PaddlePaddle 推理引擎(下面给的是 CPU 版,GPU 按你的 CUDA 版本选对应包),再装 PaddleOCR 本体:
python -m pip install paddlepaddle==3.2.0 -i https://www.paddlepaddle.org.cn/packages/stable/cpu/ python -m pip install "paddleocr[all]"如果只要基础文字检测和识别,装paddleocr不带[all]也可以;[all]会带上文档解析、信息抽取等可选能力。其他平台和 CUDA 版本的选择,见官方安装文档。
2. 命令行首次运行
把待识别图片放到当前目录,执行:
paddleocr ocr -i ./general_ocr_002.png \ --use_doc_orientation_classify False \ --use_doc_unwarping False \ --use_textline_orientation False首次运行会自动下载预训练模型,稍等片刻。上面三个参数关闭了文档方向分类、矫正和行方向分类——对正常横放的文档,关掉它们能省不少时间。跑完后,终端会打印识别结果,输出目录里还有带标注框的图。
3. 用脚本查看识别结果
要把结果用到程序里,比如批量转完写进向量库,脚本更短:
from paddleocr import PaddleOCR ocr = PaddleOCR(use_doc_orientation_classify=False, use_doc_unwarping=False, use_textline_orientation=False) for res in ocr.predict("./general_ocr_002.png"): res.print() # 打印文字与置信度 res.save_to_img("output") # 保存标注框结果图 res.save_to_json("output") # 保存结构化 JSONJSON 里包含每个文本块的文字、置信度和坐标位置,这就是"给大模型用的结构化数据"的具体形态。
实际效果 📷
这是一个数字仪表盘的识别示例,左为原图,右为识别结果。仪表读数、车牌这类"场景文字"是它传统强项——你可以拿它给电力、设备监控系统做自动抄表,把巡检从人工读数变成数据入库。
这份长英文文档识别后,不仅文字与原稿一致,段落、列表、标题结构也基本保留。这正是 RAG 场景最需要的:把一整批文档转完,大模型回答时能引用原文,而不是丢失结构的纯文本。
适合谁
- 搭 RAG / 文档问答:把 PDF 和扫描件批量转成 Markdown,再进向量库
- 多语言文档处理:中、英、日等语种的公文、报表直接混着识别,不用切模型
- 工业、财务自动化:仪表、票据、单据里的关键字段抽出来,直接落进结构化字段
- 边界说明:很特殊的字体、潦草手写的少量文字,开箱模型不一定够用,需要用自有数据训练,训练入口在仓库 tools 目录的 train.py
继续探索 🧭
- 官方安装文档:全部依赖组、GPU 环境与推理引擎的选择
- 快速开始:检测、识别、文档解析各模块的命令示例
- 示例测试图片:第一次试跑可以直接从这里拿图
环境装好后,找一份你业务里的真实文档跑一遍,单张的输出质量基本就是批量处理的底线。
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考