Umi-OCR:免费开源的离线OCR工具,截图、批量图片与PDF转文本一站完成
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款开源、免费的离线 OCR 软件,全部识别在本地完成,不联网、不上传、无收费功能。它面向三类用户:日常需要截图转文字的办公族、需要批量识别图片的开发者,以及要处理扫描版 PDF 的人。支持 Windows 7 x64 与 Linux x64,解压后运行Umi-OCR.exe即可使用,核心能力覆盖离线OCR、批量识别图片、PDF转文本、二维码扫描与生成,并内置中、英、日、韩等多国语言识别库。
为什么选它
和常见的替代方案放在一起看,差异比较直观:
| 方案 | 网络依赖 | 费用 | 部署成本 |
|---|---|---|---|
| 云端 OCR 服务 | 必须上传图片 | 按量计费,有免费额度 | 需申请密钥、写请求 |
| 收费桌面软件 | 多数需联网激活 | 买断或订阅 | 安装激活流程 |
| 自行部署开源模型 | 可离线 | 免费 | 装依赖、调环境,门槛高 |
| Umi-OCR | 完全离线 | 完全免费 | 解压即用 |
- 隐私:敏感文档(合同、病历、内部资料)从不出本机,断网环境也能正常工作。
- 成本:代码全部开源,识别张数无上限,没有会员和验证码。
- 省事:内置 RapidOCR / PaddleOCR 离线引擎,多语言模型库随包携带,不需要自己配模型文件。
功能一览
| 功能 | 适用场景 | 上手成本 |
|---|---|---|
| 截图OCR | 随手截取屏幕文字、代码、聊天记录转文本 | 低,快捷键唤起即可 |
| 批量OCR | 一次性识别几百张本地图片 | 低,拖入图片点"开始任务" |
| 文档识别 | 扫描版 PDF 转文本,或输出双层可搜索 PDF | 中,支持 pdf/xps/epub/mobi 等格式 |
| 二维码 | 图片中扫码(支持一图多码、19种码制);文本生成二维码图片 | 低 |
| 排版解析 | 多栏文档、代码截图按正确顺序输出文本 | 中,在识别页选择预设方案 |
| 忽略区域 | 排除水印、页眉页脚干扰 | 中,用矩形框圈定忽略范围 |
| 命令行 / HTTP 接口 | 接入脚本与自动化流程 | 中,需读一遍接口文档 |
主界面一览:左侧是截取的图片预览,右侧是识别出的文本,方便当场核对识别效果。
场景实测
随手截图识别
- 输入:屏幕上任意一段文字(代码、文档、聊天记录)。
- 操作:打开"截图OCR"标签页,按快捷键框选区域;也可以直接在别处复制图片后粘贴进来。
- 输出:文字出现在右侧记录栏,可直接编辑、划选复制。识别排版不理想时,在页面设置里切换"排版解析"方案即可:多栏文档选"多栏-按自然段换行",代码截图选"单栏-保留缩进"。
右侧"设置/记录"面板中,识别结果逐条列出,右键可复制、全选,多条记录也能合并复制。
批量识别图片
- 输入:一个文件夹里几百张 jpg / png / webp / tif 图片。
- 操作:在"批量OCR"页添加文件夹,顶部进度条开始跑;结果可保存为 txt、jsonl、md、csv(Excel);任务完成后可自动关机或待机,适合挂机处理。
- 输出:每张图对应一份识别文本。
左侧为待识别图片列表,右侧显示各图片的识别状态与结果,顶部进度条实时反映批量任务进度。
两个批量场景的实用技巧:
- 图片自带水印或 LOGO:在批量页右栏打开"忽略区域"编辑器,用右键画矩形框把水印位置包进去。注意只有整个文本块落在框内才会被忽略,框画得尽量大一些。
- 超长图、超大图识别不全:把"设置→文字识别→限制图像边长"的数值调高,默认压缩边长会牺牲细节。
扫描件转可编辑文本
- 输入:扫描版 PDF(也支持 xps、epub、mobi、fb2、cbz)。
- 操作:进入"文档识别"页添加文件,勾选输出格式;页眉页脚干扰同样用忽略区域排除。
- 输出:纯文本,或"双层可搜索 PDF"——原文层保留,底下叠加一层 OCR 文本,能直接 Ctrl+F 搜索。
Umi-OCR 支持多国界面语言,首次启动会跟随系统自动切换;识别引擎内置简体中文、English、繁體中文、日本語、한국어、Русский 等语言库,处理外文扫描件前先在识别设置里选对语言模型。
进阶玩法
命令行
入口就是主程序Umi-OCR.exe,前提是全局设置里允许 HTTP 服务(默认开启,主机保持"仅本地"即可,通信走本机回环,不出网卡)。最小示例:
umi-ocr --path "D:/photo.png"其他常用指令:--screenshot(鼠标截屏识别)、--clipboard(识别剪贴板图片)、--show/--quit(显示主窗口 / 关闭软件)。完整参数见 docs/README_CLI.md。
HTTP 接口
适合把 OCR 嵌进自己的脚本。默认端口1224,把图片转成 Base64 后 POST 即可:
curl -X POST http://127.0.0.1:1224/api/ocr -H "Content-Type: application/json" -d '{"image": "<base64图片>"}'接口还支持文档识别与二维码识别/生成。两点提醒:后端并发能力弱,不要并发调用;长时间连续调用偶发ECONNREFUSED时重试即可。详见 docs/http/README.md。
避坑清单
- 识别结果缺字、错字 → 图片本身模糊或边长被压缩→ 换清晰图源;"限制图像边长"调高数值。
- 水印、页眉页脚混进结果 → 干扰文字被当成正文→ 用"忽略区域"框掉,且框要完整包住整个文本块。
- 多栏文章输出顺序混乱 → 引擎按视觉位置而非阅读顺序输出→ 切换"排版解析"预设方案(多栏/单栏、换行策略按文档类型选)。
- 外文识别效果差 → 语言模型没选对→ 在识别设置中把语言/模型库切到对应语言。
- 命令行或 HTTP 调用无响应 → 全局设置里 HTTP 服务被关掉→ 重新勾选允许 HTTP 服务,主机设"仅本地"。
- 截图时界面闪烁、UI 错位 → 显卡硬件加速冲突(Windows 常见)→ 全局设置→界面和外观→渲染器,换渲染方案或关闭硬件加速。
资源
Umi-OCR 用"离线 + 免费 + 可脚本化"三件事把 OCR 的门槛压到很低,日常识别到批量自动化都能覆盖。
- 仓库克隆:
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR - 发行版下载(含 v2.1.5):仓库根目录
Umi-OCR_Rapid_v2.1.5.7z - 更新日志:
CHANGE_LOG.md - 命令行手册:
docs/README_CLI.md - HTTP 接口手册:
docs/http/README.md
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考