OCRmyPDF:一条命令免费把扫描 PDF 变成可搜索文档
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
OCRmyPDF 是一款免费的命令行工具,它为扫描 PDF 添加 OCR 文本层,让原本只是图片的文档变得可搜索、可复制,同时保留原始分辨率。下面以"你会遇到哪些问题"为主线,把安装、中文识别、图像修复、批量处理和输出格式一次讲清楚。
先跑通这一条命令
整个工具的核心动作就是"输入一个 PDF,输出一个能搜索的 PDF",中间的识别交给 Tesseract(一个开源 OCR 引擎)完成:
ocrmypdf scanned.pdf searchable.pdf它不是把整页重新压成一张图再拼回去,而是只把识别出的文字"垫"在原图下方,版式和字体不动。所以复制粘贴出来的是真实文本,位置也和页面一致。
如果你手上还没有装,各平台都是一行命令的事:Debian/Ubuntu 用apt install ocrmypdf,macOS 用brew install ocrmypdf,Windows 在 WSL 里同样走apt。装完敲ocrmypdf --help能列出全部参数,比翻网页快。
它和"手动抠图再识别"差在哪
很多人会想到用 Ghostscript 或 ImageMagick 把 PDF 转成图片,再丢给 OCR 引擎,最后合并回 PDF。这条路有两个坑:一是图片被重新采样,细节丢失、体积反而变大;二是原 PDF 里的元数据、矢量内容、多色分区都可能被丢掉。
OCRmyPDF 的处理是"最小改动"——它先把页面栅格化给引擎识别,再把文本层塞回原文件,原图分辨率、已有文字、旋转信息都尽量原样保留。默认输出还是 PDF/A(一个 ISO 归档标准,专门保证文件多年后仍能正常打开),对需要长期存档的场景更稳妥。
中文、日文等多语言识别如何配置
识别哪种语言,取决于 Tesseract 的语言包有没有装、以及你告诉它去找哪些语言。Linux 上先装对应语言包,比如简体中文:
apt install tesseract-ocr-chi_sim然后在命令里用-l提示它。中英混排的文档可以同时指定两种:
ocrmypdf -l eng+chi_sim 扫描件.pdf 可搜索.pdf它依赖 Tesseract 4.1.1 及以上版本,会自动在PATH里找到的第一个可用版本,不用手动指定。
页面歪了、有污渍、方向不对怎么办
扫描件的常见问题都能用开关直接处理,加在命令里即可:
--deskew校正倾斜--clean在识别前清理噪点污渍--rotate-pages把方向识别错乱的页面自动转回正确朝向
这些开关只在识别前生效,不会改动最终输出的图像质量;如果你希望清理后的版本也写进输出文件,可再加--clean-final。
大文件和一堆文件怎么处理
三个维度能明显提速或省事:
- 多核:加
--jobs 4让四个核心并行处理页面,默认就会尽量用满 CPU。 - 只处理部分页:
--pages 1-50只跑前 50 页,适合先抽样或分段处理上百页的文档,也顺带缓解内存压力。 - 批量:对目录里所有 PDF 循环处理即可;若文件多,官方 docs/batch.md 推荐用 GNU Parallel 做并发,比单文件循环更快。
for f in *.pdf; do ocrmypdf "$f" "out_$f"; done输出格式与体积怎么调
默认输出 PDF/A-2b。如果你只想要普通 PDF(比如某些阅读器会弹 PDF/A 提示),加--output-type pdf即可。
体积方面,--optimize控制压缩强度,级别从 0 到 3:默认是 1(安全压缩),调到 3 压缩更狠、文件更小,但处理时间更长、且部分图像会转成有损 JPEG。具体各档的取舍可以看 docs/optimizer.md。
去哪里查更细的内容
仓库里的 docs/ 目录是完整文档,docs/introduction.md讲了它为什么不建议手动识别、docs/advanced.md收录了--unpaper-args这类精细控制、docs/plugins.md则是插件扩展的入口。遇到个别报错时,docs/errors.md能帮你快速定位。
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考