Umi-OCR 免费本地OCR:扫描件变可搜索,三分钟从解压到第一次识别
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
扫描的论文复制不出文字,屏幕上的英文段落鼠标拖不动,想把它变成能编辑的文本。Umi-OCR 是一款免费开源的离线文字识别工具,识别全部在你的电脑本地运行,不需要联网,也不会上传任何图片。截图本地OCR、批量转文本、PDF 文档识别都支持,从解压到看到第一个识别结果,只需要三分钟。
📦 快速上手:从解压到第一次识别
- 下载发布包。支持 Windows 7 x64 及以上、Linux x64;包是
.7z压缩格式或.7z.exe自解压格式,后者在没有压缩软件的电脑上也能直接用。 - 解压到任意目录,双击
Umi-OCR.exe。没有安装向导,不需要注册,解压即用。 - 等模型加载。第一次启动要加载 OCR 模型,会明显偏慢,之后每次启动就快了。
- 按默认键位
Ctrl+Alt+Z,框选屏幕上的文字区域,Esc取消。 - 把结果从剪贴板粘出来用;右侧记录栏里还能再编辑、划选复制。
除了解压安装,Windows 用户也可以用 Scoop 命令行工具一键安装,开发者则可以从源码构建运行。首次运行会按系统语言自动匹配界面,想换繁体中文、英语、日语等,进全局设置→语言/Language随时改。
引擎选择现在不用纠结:Rapid-OCR 兼容性更好,Paddle-OCR 速度稍快,全局设置里随时能切。
装好之后,先抓一段屏幕上的文字试试。
🎯 按任务实战:四个常用场景
随时框选屏幕上的文字
会议字幕、教程截图、终端输出,屏幕上复制不到的文字都用截图页处理。
- 打开"截图 OCR"标签页。
- 按
Ctrl+Alt+Z框选区域,Esc取消。 - 查看右侧记录栏的结果,错了直接改,也可以跨多条记录划选复制。
- 粘贴别处复制来的图片进软件识别,或重复上一次截图的位置,连续处理相邻内容。
快捷键换成自己顺手的组合就行,改完立即生效。
几百张图片一次转成文本文件
一文件夹的票据照片、扫描的档案页、批量截的小说图,都丢给批量页。
- 打开"批量 OCR"标签页,拖入文件夹或多张图片,jpg、png、webp、bmp、tiff 等格式都能识别。
- 选择输出格式:txt、jsonl、md、csv,最后一种用 Excel 就能直接打开。
- 点击开始任务,没有数量上限,几百张一次跑完。
- 勾选"完成后自动关机",夜里挂机跑,早上起来收结果。
图上带着水印、页码时,打开右栏的"忽略区域"编辑器,按住右键把水印可能出现的位置框住,可以画多个矩形。框内完整的文本块会被跳过,框外内容照常保留,框画得稍大一点更稳。
扫描版 PDF 转成可搜索的电子文档
拿到扫描的论文、合同,最想要的就是在 PDF 里直接搜字、选字。
- 打开"文档识别"标签页,拖入文件。支持 pdf、xps、epub、mobi、fb2、cbz 六类格式。
- 扫描页走 OCR,电子 PDF 直接提取原有文本,不用额外处理。
- 输出选"双层可搜索 PDF",版式保留,关键词搜索可用。
- 页眉页脚碍眼就同样设置忽略区域,把上下边距框掉。
- 文档多就排队批量处理,完成后也能自动关机。
从图片里读出条形码和二维码
二维码标签页同时管扫码和生成码。
- 截图、粘贴或拖入本地图片,读出图中的码,一张图里多个码全部识别。
- 协议覆盖 19 种,QRCode、DataMatrix、EAN13、Code128、PDF417、Aztec 等常用码都在里面。
- 生成码时输入文本,调整纠错等级等参数,输出一张码图片。
⚙️ 调优与自动化:让结果更好用
上面四个任务覆盖了最常用的场景。想让结果更准有地方可调,想接进自动化有命令行入口。
先调识别语言:文档里中英混杂时,选包含中英文的组合模型,识别率比只选单语明显好。再调排版解析:引擎输出的文本块顺序不一定顺,多栏-按自然段换行预设自动处理双栏版式,论文、报告选它就够;识别代码截图时选单栏-保留缩进,行首缩进和行内空格都保留,结果能直接粘进 IDE。还有忽略区域,前面去水印、页眉提过,思路一样。这些预设都能处理从右到左的竖排文字,前提是引擎本身支持竖排。
界面语言本身也不受限,内置多国语言库,繁中、英语、日语等都能用。
命令行与脚本调用
入口就是Umi-OCR.exe(多数情况可直接写umi-ocr),前提是全局设置里的本地 HTTP 服务开着,默认就是开的,主机保持"仅本地"即可。
识别文件夹内所有图片,结果写入文本文件:
umi-ocr --path "D:/images" --output "result.txt"框选屏幕识别,结果复制到剪贴板:
umi-ocr --screenshot --clip其余参数按需组合:--clipboard读剪贴板里的图片,--output_append追加写入已有文件,--qrcode_read扫图片里的码,--qrcode_create由文本生成二维码,--help查看完整说明。写脚本时可以走 HTTP 接口文档 里的/argv接口,效果等价于拼一条命令行。
💡 经验与常见问题
硬件要求多高?4GB 内存起步,CPU 越强识别越快。内存紧张时别一次塞太多任务。
模糊的图怎么调都不准?图片质量优先,扫描文档建议 300dpi 以上。超长图识别不全时,进页面设置 → 文字识别,调高"限制图像边长"的数值。
输出格式怎么挑?TXT 方便人工阅读编辑,JSONL 方便程序处理,CSV 方便导入 Excel 统计,MD 适合写进笔记。
几百张图一次跑行不行?行,但量大时按每批 50~100 张分次跑更稳。遇到单张超大图卡住,先切图再识别。
截图时闪屏、界面错位?去全局设置 → 界面和外观,换一个渲染器或关掉硬件加速。
离线 OCR 的意义,就是数据始终留在你自己的电脑上:文档不离开手,断网照常跑,没有次数额度。把压缩包解压到任意目录,运行Umi-OCR.exe,第一个识别任务三分钟之内跑完。
常用资源:命令行手册 · HTTP 接口文档 · 更新日志
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考