Umi-OCR 免费本地OCR:扫描件变可搜索,三分钟从解压到第一次识别
2026/9/19 5:38:31 网站建设 项目流程

Umi-OCR 免费本地OCR:扫描件变可搜索,三分钟从解压到第一次识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

扫描的论文复制不出文字,屏幕上的英文段落鼠标拖不动,想把它变成能编辑的文本。Umi-OCR 是一款免费开源的离线文字识别工具,识别全部在你的电脑本地运行,不需要联网,也不会上传任何图片。截图本地OCR、批量转文本、PDF 文档识别都支持,从解压到看到第一个识别结果,只需要三分钟。

📦 快速上手:从解压到第一次识别

  1. 下载发布包。支持 Windows 7 x64 及以上、Linux x64;包是.7z压缩格式或.7z.exe自解压格式,后者在没有压缩软件的电脑上也能直接用。
  2. 解压到任意目录,双击Umi-OCR.exe。没有安装向导,不需要注册,解压即用。
  3. 等模型加载。第一次启动要加载 OCR 模型,会明显偏慢,之后每次启动就快了。
  4. 按默认键位Ctrl+Alt+Z,框选屏幕上的文字区域,Esc取消。
  5. 把结果从剪贴板粘出来用;右侧记录栏里还能再编辑、划选复制。

除了解压安装,Windows 用户也可以用 Scoop 命令行工具一键安装,开发者则可以从源码构建运行。首次运行会按系统语言自动匹配界面,想换繁体中文、英语、日语等,进全局设置语言/Language随时改。

引擎选择现在不用纠结:Rapid-OCR 兼容性更好,Paddle-OCR 速度稍快,全局设置里随时能切。

装好之后,先抓一段屏幕上的文字试试。

🎯 按任务实战:四个常用场景

随时框选屏幕上的文字

会议字幕、教程截图、终端输出,屏幕上复制不到的文字都用截图页处理。

  1. 打开"截图 OCR"标签页。
  2. Ctrl+Alt+Z框选区域,Esc取消。
  3. 查看右侧记录栏的结果,错了直接改,也可以跨多条记录划选复制。
  4. 粘贴别处复制来的图片进软件识别,或重复上一次截图的位置,连续处理相邻内容。

快捷键换成自己顺手的组合就行,改完立即生效。

几百张图片一次转成文本文件

一文件夹的票据照片、扫描的档案页、批量截的小说图,都丢给批量页。

  1. 打开"批量 OCR"标签页,拖入文件夹或多张图片,jpg、png、webp、bmp、tiff 等格式都能识别。
  2. 选择输出格式:txt、jsonl、md、csv,最后一种用 Excel 就能直接打开。
  3. 点击开始任务,没有数量上限,几百张一次跑完。
  4. 勾选"完成后自动关机",夜里挂机跑,早上起来收结果。

图上带着水印、页码时,打开右栏的"忽略区域"编辑器,按住右键把水印可能出现的位置框住,可以画多个矩形。框内完整的文本块会被跳过,框外内容照常保留,框画得稍大一点更稳。

扫描版 PDF 转成可搜索的电子文档

拿到扫描的论文、合同,最想要的就是在 PDF 里直接搜字、选字。

  1. 打开"文档识别"标签页,拖入文件。支持 pdf、xps、epub、mobi、fb2、cbz 六类格式。
  2. 扫描页走 OCR,电子 PDF 直接提取原有文本,不用额外处理。
  3. 输出选"双层可搜索 PDF",版式保留,关键词搜索可用。
  4. 页眉页脚碍眼就同样设置忽略区域,把上下边距框掉。
  5. 文档多就排队批量处理,完成后也能自动关机。

从图片里读出条形码和二维码

二维码标签页同时管扫码和生成码。

  1. 截图、粘贴或拖入本地图片,读出图中的码,一张图里多个码全部识别。
  2. 协议覆盖 19 种,QRCode、DataMatrix、EAN13、Code128、PDF417、Aztec 等常用码都在里面。
  3. 生成码时输入文本,调整纠错等级等参数,输出一张码图片。

⚙️ 调优与自动化:让结果更好用

上面四个任务覆盖了最常用的场景。想让结果更准有地方可调,想接进自动化有命令行入口。

先调识别语言:文档里中英混杂时,选包含中英文的组合模型,识别率比只选单语明显好。再调排版解析:引擎输出的文本块顺序不一定顺,多栏-按自然段换行预设自动处理双栏版式,论文、报告选它就够;识别代码截图时选单栏-保留缩进,行首缩进和行内空格都保留,结果能直接粘进 IDE。还有忽略区域,前面去水印、页眉提过,思路一样。这些预设都能处理从右到左的竖排文字,前提是引擎本身支持竖排。

界面语言本身也不受限,内置多国语言库,繁中、英语、日语等都能用。

命令行与脚本调用

入口就是Umi-OCR.exe(多数情况可直接写umi-ocr),前提是全局设置里的本地 HTTP 服务开着,默认就是开的,主机保持"仅本地"即可。

识别文件夹内所有图片,结果写入文本文件:

umi-ocr --path "D:/images" --output "result.txt"

框选屏幕识别,结果复制到剪贴板:

umi-ocr --screenshot --clip

其余参数按需组合:--clipboard读剪贴板里的图片,--output_append追加写入已有文件,--qrcode_read扫图片里的码,--qrcode_create由文本生成二维码,--help查看完整说明。写脚本时可以走 HTTP 接口文档 里的/argv接口,效果等价于拼一条命令行。

💡 经验与常见问题

硬件要求多高?4GB 内存起步,CPU 越强识别越快。内存紧张时别一次塞太多任务。

模糊的图怎么调都不准?图片质量优先,扫描文档建议 300dpi 以上。超长图识别不全时,进页面设置 → 文字识别,调高"限制图像边长"的数值。

输出格式怎么挑?TXT 方便人工阅读编辑,JSONL 方便程序处理,CSV 方便导入 Excel 统计,MD 适合写进笔记。

几百张图一次跑行不行?行,但量大时按每批 50~100 张分次跑更稳。遇到单张超大图卡住,先切图再识别。

截图时闪屏、界面错位?去全局设置 → 界面和外观,换一个渲染器或关掉硬件加速。

离线 OCR 的意义,就是数据始终留在你自己的电脑上:文档不离开手,断网照常跑,没有次数额度。把压缩包解压到任意目录,运行Umi-OCR.exe,第一个识别任务三分钟之内跑完。

常用资源:命令行手册 · HTTP 接口文档 · 更新日志

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询