4步跑通Umi-OCR:免费离线OCR从截图到批量PDF识别实战教程
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是免费开源的离线OCR工具,截图取字、批量识别、扫描版PDF转可搜索文档,全程不联网、图片不上传。读完你能跑通截图识别,把一整个文件夹的扫描图批量出结果。
Umi-OCR 离线OCR主界面:左侧截图预览可直接划选文字,右侧按时间保存识别记录
4 步跑通:从安装到第一次出结果
- 解压发布包。发布版是
.7z压缩包,Windows 7 x64 和 Linux x64 都能用,没有安装器。你会看到一个解压出的完整目录,里面就是全部文件。 - 启动程序。Windows 双击
Umi-OCR.exe,Linux 运行umi-ocr.sh。你会看到主窗口弹出,界面语言跟随系统设置。 - 唤起截图。打开"截图 OCR"标签页,按快捷键(可在该页设置里改),鼠标框选一块文字区域。你会看到屏幕变暗、出现选框,随时可按
Esc取消。 - 复制文字。识别完成后,右侧"记录"面板会出现一段文本。点一下记录就能复制,左侧预览栏也能直接用鼠标划选。
全局设置页:切换界面语言与主题,或添加桌面快捷方式、开机自启
最短路径到此就通了:截图 → 识别 → 复制。
从截图里抠出带缩进的代码
谁会用:文档截图、视频帧里的代码想贴进 IDE,手敲太慢,普通 OCR 还会吞掉缩进。
操作:
- 在"截图 OCR"标签页框选代码区域。
- 右侧"设置"面板里,把排版解析选成单栏-保留缩进。
- 等识别完成,在记录里选中这条结果复制。你会看到记录面板新增一条结果。
验收:把结果贴进 IDE 或 Markdown 预览。缩进层级、行内空格与原图一致,就算过关。
避坑:
- 缩进被拍平成一段 → 默认排版解析"多栏-按自然段换行"面向普通文档 → 代码截图一律改选"单栏-保留缩进"。
- 想改错字却只能整段复制 → 记录默认是识别原文 → 选中记录先编辑再复制。
截图 OCR 页面:右侧设置里切换排版解析方案,左侧预览栏可划选文字
记录面板还支持划选多条记录批量复制:
识别记录面板:右键菜单可复制、删除单条记录或清空全部
一文件夹扫描件批量转文本和Excel
谁会用:手里一堆扫描文档或票据图片,一张一张点不现实。
操作:
- 切到"批量 OCR"标签页,点"选择图片"或直接拖入文件夹。你会看到左侧文件列表逐张列出,几百张也能一次导入。
- 核对输出格式勾选:
txt / jsonl / md / csv (Excel)。 - 点"开始任务"。你会看到左侧列表逐张显示耗时和置信度。
- PDF 扫描件切到"文档识别"标签页(v2.1.4 及以上支持),拖入
pdf / xps / epub / mobi / fb2 / cbz。产物是双层可搜索 PDF:原图在底下,识别出的文字藏在上层。
验收:随机抽 3 张图,对比左侧预览和右侧记录。置信度(0~1)低于0.8的几张重点人工核对。PDF 产物用Ctrl+F搜一个只有正文里才出现的词,能跳到对应页就对了。
避坑:
- 每张图固定位置都有水印文字 → 水印的文本块被一起识别 → 右侧设置进入忽略区域编辑器,按住右键画矩形框住水印,框画得稍大更安全。
- 像素超大的长图、小字多的大图认错字 → 默认边长限制先把大图压缩了 → 到"设置 → 文字识别 → 限制图像边长"把数值从960调高到 2880 或 4320。
批量 OCR 页面:左侧文件列表含耗时与置信度,右侧是识别记录
把识别接口挂进自己的脚本和流水线
谁会用:想把 OCR 放进定时任务、打包脚本或自己的 Web 服务里。
操作:
- 在"全局设置"确认 HTTP 服务已开启,主机保持"仅本地"即可,默认端口1224。
- 命令行走法(
umi-ocr是Umi-OCR.exe的简写),完整用法见 docs/README_CLI.md:
umi-ocr --screenshot --clip umi-ocr --path "D:/docs" --output "结果.txt"- HTTP 走法:先
GET http://127.0.0.1:1224/api/ocr/get_options查参数定义,再POST http://127.0.0.1:1224/api/ocr提交 base64 图片。请求体里base64字段放图片编码,options字段放语言模型、排版解析等选项,完整参数表见 docs/http/api_ocr.md,以官方文档为准。
验收:命令行跑完,文本出现在剪贴板或你指定的文件里。浏览器访问get_options能看到 JSON 参数定义,看到就说明服务通了。
避坑:
- 命令行 / HTTP 没反应 → 九成是 HTTP 服务没开 → 回"全局设置"允许 HTTP 服务,主机选"仅本地"。
- 跑命令行任务时主窗口弹出来 → 命令行沿用"截图 OCR"标签页的参数设定 → 在那个标签页里关掉"弹出主窗口"选项。
关键参数速查
| 参数 | 默认值 | 什么时候需要改 | 改成什么 |
|---|---|---|---|
| 排版解析 | 多栏-按自然段换行 | 识别代码截图 | 单栏-保留缩进 |
| 限制图像边长 | 960 | 大图、小字多 | 2880 或 4320 |
| 语言/模型库 | 简体中文 | 纯英文、纯代码内容 | models/config_en.txt |
| OCR 引擎插件 | Rapid-OCR(自带) | 速度或精度不够用 | 全局设置里切换其他引擎插件 |
所有界面改动会自动存进UmiOCR-data/.settings(ini 格式),也可以手动改,改完执行umi-ocr --reload重新加载。
排障速查
| 现象 | 大概率原因 | 一句话解法 |
|---|---|---|
| 识别顺序错乱、读不通 | 默认排版解析不适合该图排版 | 换排版解析方案,代码选"单栏-保留缩进" |
| 大图里的小字认错 | 边长限制 960 先压缩了图片 | "限制图像边长"调到 2880 以上 |
| 水印、LOGO 文字混进结果 | 水印里的文本块被一起识别 | 批量页忽略区域编辑器里把水印整块框住 |
| 命令行 / HTTP 没反应 | 九成是 HTTP 服务没开 | 全局设置里允许 HTTP 服务,主机选"仅本地" |
| 界面语言不对 | 首次启动没跟随上系统语言 | 全局设置里手动切换语言 |
Umi-OCR 像个放在本地的 OCR 工具箱:免费、不联网,截图、批量、PDF 一次做完,还留了命令行和 HTTP 两个口子给你接自动化。建议先在截图页练熟排版解析,再去批量页处理文件夹,最后把接口挂进脚本。完整参考见 docs/README_CLI.md 与 docs/http/README.md。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考