Umi-OCR离线OCR教程:3步把扫描PDF转可搜索文档
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
你拿到一份两百页的扫描版制度文件,Ctrl+F 搜一个日期,结果"未找到"——因为那只是像素,不是文字。Umi-OCR 是一款面向办公人员和学生的免费离线 OCR 工具:截图取字、批量处理图片,还能把扫描 PDF 转成可搜索的双层 PDF,全程不上传网络。
看懂它:项目速览
- 是什么 / 收费:开源免费的 OCR(光学字符识别,即把图片里的文字转成可编辑文本)桌面软件,代码全部公开,无账号、不限识别次数。
- 怎么运行:解压即用,无需安装,识别过程完全离线。
- 系统:Windows 7 x64 与 Linux x64。
- 格式:图片支持 jpg、png、webp、bmp、tif 等;文档支持 pdf、xps、epub、mobi、fb2、cbz。
- 引擎与语言:内置 Rapid-OCR 与 Paddle-OCR 两套引擎,自带多语言识别库,换语言不用另下模型。
- 获取:从发行版页面下载
.7z包,或克隆仓库源码;版本变化见 更新日志。
第一次运行
- 拿软件:下载
.7z发行包(没有压缩软件就用.7z.exe自解压包)并解压;要改源码则执行git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。 - 启动:Windows 双击
Umi-OCR.exe,Linux 运行umi-ocr.sh,没有安装向导。 - 出第一次结果:打开截图OCR标签页,按快捷键截屏,识别出的文字会直接进剪贴板——这就是"从 0 到成功"的最短路径。
- 界面语言首次打开会跟随系统自动切换,之后可在全局设置里改。
按任务来用
从屏幕上取出复制不了的文字
能得到:网页、PPT、远程桌面等选不中的文字,变成可复制的文本。
操作:
- 打开截图OCR标签页,用快捷键唤起截图,按 Esc 可中止。
- 左侧图片预览里直接划选原文复制;或在右侧识别记录里编辑、跨多条记录划选复制。
- 在别处复制过图片的,直接粘贴进来也能识别。
输出之后:结果在剪贴板,粘到哪都行;识别记录支持多次截图累加,最后一次性全选复制。
小技巧:识别代码截图时,把文本后处理切到单栏-保留缩进,行首空格和缩进都保得住。
几百张图片一次转成文本文件
能得到:每张图的识别结果单独存成文件,格式可选 txt、jsonl、md、csv(Excel)。
操作:
- 把图片拖进批量OCR标签页,数量不设限,几百张一次导入没问题。
- 软件自动排队识别,页面上能看到进度。
- 选好保存格式与位置,等任务跑完。
输出之后:csv 直接进 Excel 做汇总,md、txt 留作归档或再加工。
小技巧:跑长任务想挂着过夜,打开任务完成后的自动关机/待机。
扫描 PDF 变成能搜索的文档
能得到:双层可搜索 PDF——原扫描外观原样保留,上面叠一层透明文字,全文检索、Ctrl+F 定位、划选复制都可用。
操作:
- 打开文档识别标签页,导入 PDF(xps、epub、mobi、fb2、cbz 也收)。
- 文档若自带文本层,可以直接提取而不必重新识别。
- 启动任务,完成后下载生成的文件。
输出之后:用任意 PDF 阅读器打开,搜、划、复制都正常。
小技巧:页眉页脚固定的话,先设忽略区域,成品更干净。
读码与生成二维码
能得到:解码图片里的二维码、条形码;反向也能从文本生成码图片。
操作:
- 截图、粘贴或拖图进二维码标签页即可读取,一图多码一次全读出。
- 要生成时输入文本,选协议(QRCode、DataMatrix、PDF417 等 19 种)、设纠错等级,码图即刻生成。
输出之后:读出的内容进识别结果区;生成的码图保存下来直接用。
小技巧:命令行同样支持读码与生成,写脚本时可以省掉界面。
参数调优速查
- 文本后处理→ 识别顺序乱、多栏混排,或要保留代码缩进时 → 选"多栏"或"单栏"系列方案,竖排版面也能自动处理。
- 忽略区域→ 结果里总有水印、页眉页脚时 → 进编辑器按住右键画矩形框,框内整个文本块会被剔除。
- 限制图像边长→ 长图、大图识别不全时 → 调高数值,避免大图在识别前被压缩。
- OCR引擎→ 更在意兼容性选 Rapid-OCR、更在意速度选 Paddle-OCR → 在全局设置里切换插件。
- 识别语言→ 识别非中文文档时 → 按文档主要语言切换,多语种混排按占比大的语言来。
- 渲染器→ 截图闪烁、界面错位时 → 在界面和外观里换渲染方案,或关掉硬件加速。
常见问题
多栏排版的识别结果顺序全乱了怎么办?把文本后处理换成"多栏"系列方案,比如"多栏-按自然段换行",软件会先分栏再按阅读顺序重排。
大图识别不全,漏字?默认超限图片会被压缩。调高限制图像边长,或先把长图拆成几张小图再批量导入。
水印怎么也去不掉?打开忽略区域编辑器,按住右键画框,尽量包住水印可能出现的全部位置;注意只有框内整个文本块会被忽略,框要画得包住目标文字。
截图时屏幕闪烁、界面错位?进全局设置→界面和外观→渲染器,换一个渲染方案,或关闭硬件加速再试。
界面语言能换吗?能。全局设置→语言,支持繁中、英语、日语等;首次启动按系统语言自动匹配,翻译协作走 Weblate 平台。
进阶扩展:命令行与 HTTP 接口
想把识别能力挂进自己的脚本或自动化流程,可以绕过界面,用软件内置的两条通道:
- 命令行:见命令行手册。支持截屏、读剪贴板、按路径识别,结果可复制或直接写文件,例如:
umi-ocr --path "D:/xxx.png"(可传文件夹,会递归搜索其中所有图片)。 - HTTP 接口:见HTTP 接口手册。图片以 Base64 送入即可 OCR,文档识别、二维码读取与生成同样走接口,服务默认开启。
配置文件是UmiOCR-data/.settings(ini 格式),手动改完后用--reload指令即可重新加载。
结尾
Umi-OCR 把截图、批量、文档识别收进一个免费离线的工具箱里,解压就能跑。现在去下载发行版试用,遇到问题或想提建议,直接向项目仓库提 Issue。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考