☰
Umi-OCR:免费开源的离线OCR工具,截图、批量图片与PDF转文本一站完成
2026/9/25 9:57:15 网站建设 项目流程

Umi-OCR:免费开源的离线OCR工具,截图、批量图片与PDF转文本一站完成

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款开源、免费的离线 OCR 软件,全部识别在本地完成,不联网、不上传、无收费功能。它面向三类用户:日常需要截图转文字的办公族、需要批量识别图片的开发者,以及要处理扫描版 PDF 的人。支持 Windows 7 x64 与 Linux x64,解压后运行Umi-OCR.exe即可使用,核心能力覆盖离线OCR、批量识别图片、PDF转文本、二维码扫描与生成,并内置中、英、日、韩等多国语言识别库。

为什么选它

和常见的替代方案放在一起看,差异比较直观:

方案网络依赖费用部署成本
云端 OCR 服务必须上传图片按量计费,有免费额度需申请密钥、写请求
收费桌面软件多数需联网激活买断或订阅安装激活流程
自行部署开源模型可离线免费装依赖、调环境,门槛高
Umi-OCR完全离线完全免费解压即用
  • 隐私:敏感文档(合同、病历、内部资料)从不出本机,断网环境也能正常工作。
  • 成本:代码全部开源,识别张数无上限,没有会员和验证码。
  • 省事:内置 RapidOCR / PaddleOCR 离线引擎,多语言模型库随包携带,不需要自己配模型文件。

功能一览

功能适用场景上手成本
截图OCR随手截取屏幕文字、代码、聊天记录转文本低,快捷键唤起即可
批量OCR一次性识别几百张本地图片低,拖入图片点"开始任务"
文档识别扫描版 PDF 转文本,或输出双层可搜索 PDF中,支持 pdf/xps/epub/mobi 等格式
二维码图片中扫码(支持一图多码、19种码制);文本生成二维码图片低
排版解析多栏文档、代码截图按正确顺序输出文本中,在识别页选择预设方案
忽略区域排除水印、页眉页脚干扰中,用矩形框圈定忽略范围
命令行 / HTTP 接口接入脚本与自动化流程中,需读一遍接口文档

主界面一览:左侧是截取的图片预览,右侧是识别出的文本,方便当场核对识别效果。

场景实测

随手截图识别

  • 输入:屏幕上任意一段文字(代码、文档、聊天记录)。
  • 操作:打开"截图OCR"标签页,按快捷键框选区域;也可以直接在别处复制图片后粘贴进来。
  • 输出:文字出现在右侧记录栏,可直接编辑、划选复制。识别排版不理想时,在页面设置里切换"排版解析"方案即可:多栏文档选"多栏-按自然段换行",代码截图选"单栏-保留缩进"。

右侧"设置/记录"面板中,识别结果逐条列出,右键可复制、全选,多条记录也能合并复制。

批量识别图片

  • 输入:一个文件夹里几百张 jpg / png / webp / tif 图片。
  • 操作:在"批量OCR"页添加文件夹,顶部进度条开始跑;结果可保存为 txt、jsonl、md、csv(Excel);任务完成后可自动关机或待机,适合挂机处理。
  • 输出:每张图对应一份识别文本。

左侧为待识别图片列表,右侧显示各图片的识别状态与结果,顶部进度条实时反映批量任务进度。

两个批量场景的实用技巧:

  • 图片自带水印或 LOGO:在批量页右栏打开"忽略区域"编辑器,用右键画矩形框把水印位置包进去。注意只有整个文本块落在框内才会被忽略,框画得尽量大一些。
  • 超长图、超大图识别不全:把"设置→文字识别→限制图像边长"的数值调高,默认压缩边长会牺牲细节。

扫描件转可编辑文本

  • 输入:扫描版 PDF(也支持 xps、epub、mobi、fb2、cbz)。
  • 操作:进入"文档识别"页添加文件,勾选输出格式;页眉页脚干扰同样用忽略区域排除。
  • 输出:纯文本,或"双层可搜索 PDF"——原文层保留,底下叠加一层 OCR 文本,能直接 Ctrl+F 搜索。

Umi-OCR 支持多国界面语言,首次启动会跟随系统自动切换;识别引擎内置简体中文、English、繁體中文、日本語、한국어、Русский 等语言库,处理外文扫描件前先在识别设置里选对语言模型。

进阶玩法

命令行

入口就是主程序Umi-OCR.exe,前提是全局设置里允许 HTTP 服务(默认开启,主机保持"仅本地"即可,通信走本机回环,不出网卡)。最小示例:

umi-ocr --path "D:/photo.png"

其他常用指令:--screenshot(鼠标截屏识别)、--clipboard(识别剪贴板图片)、--show/--quit(显示主窗口 / 关闭软件)。完整参数见 docs/README_CLI.md。

HTTP 接口

适合把 OCR 嵌进自己的脚本。默认端口1224,把图片转成 Base64 后 POST 即可:

curl -X POST http://127.0.0.1:1224/api/ocr -H "Content-Type: application/json" -d '{"image": "<base64图片>"}'

接口还支持文档识别与二维码识别/生成。两点提醒:后端并发能力弱,不要并发调用;长时间连续调用偶发ECONNREFUSED时重试即可。详见 docs/http/README.md。

避坑清单

  1. 识别结果缺字、错字 → 图片本身模糊或边长被压缩→ 换清晰图源;"限制图像边长"调高数值。
  2. 水印、页眉页脚混进结果 → 干扰文字被当成正文→ 用"忽略区域"框掉,且框要完整包住整个文本块。
  3. 多栏文章输出顺序混乱 → 引擎按视觉位置而非阅读顺序输出→ 切换"排版解析"预设方案(多栏/单栏、换行策略按文档类型选)。
  4. 外文识别效果差 → 语言模型没选对→ 在识别设置中把语言/模型库切到对应语言。
  5. 命令行或 HTTP 调用无响应 → 全局设置里 HTTP 服务被关掉→ 重新勾选允许 HTTP 服务,主机设"仅本地"。
  6. 截图时界面闪烁、UI 错位 → 显卡硬件加速冲突(Windows 常见)→ 全局设置→界面和外观→渲染器,换渲染方案或关闭硬件加速。

资源

Umi-OCR 用"离线 + 免费 + 可脚本化"三件事把 OCR 的门槛压到很低,日常识别到批量自动化都能覆盖。

  • 仓库克隆:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR
  • 发行版下载(含 v2.1.5):仓库根目录Umi-OCR_Rapid_v2.1.5.7z
  • 更新日志:CHANGE_LOG.md
  • 命令行手册:docs/README_CLI.md
  • HTTP 接口手册:docs/http/README.md

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询