☰
4步跑通Umi-OCR:免费离线OCR从截图到批量PDF识别实战教程
2026/10/3 8:29:41 网站建设 项目流程

4步跑通Umi-OCR:免费离线OCR从截图到批量PDF识别实战教程

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是免费开源的离线OCR工具,截图取字、批量识别、扫描版PDF转可搜索文档,全程不联网、图片不上传。读完你能跑通截图识别,把一整个文件夹的扫描图批量出结果。

Umi-OCR 离线OCR主界面:左侧截图预览可直接划选文字,右侧按时间保存识别记录

4 步跑通:从安装到第一次出结果

  1. 解压发布包。发布版是.7z压缩包,Windows 7 x64 和 Linux x64 都能用,没有安装器。你会看到一个解压出的完整目录,里面就是全部文件。
  2. 启动程序。Windows 双击Umi-OCR.exe,Linux 运行umi-ocr.sh。你会看到主窗口弹出,界面语言跟随系统设置。
  3. 唤起截图。打开"截图 OCR"标签页,按快捷键(可在该页设置里改),鼠标框选一块文字区域。你会看到屏幕变暗、出现选框,随时可按Esc取消。
  4. 复制文字。识别完成后,右侧"记录"面板会出现一段文本。点一下记录就能复制,左侧预览栏也能直接用鼠标划选。

全局设置页:切换界面语言与主题,或添加桌面快捷方式、开机自启

最短路径到此就通了:截图 → 识别 → 复制。

从截图里抠出带缩进的代码

谁会用:文档截图、视频帧里的代码想贴进 IDE,手敲太慢,普通 OCR 还会吞掉缩进。

操作:

  1. 在"截图 OCR"标签页框选代码区域。
  2. 右侧"设置"面板里,把排版解析选成单栏-保留缩进。
  3. 等识别完成,在记录里选中这条结果复制。你会看到记录面板新增一条结果。

验收:把结果贴进 IDE 或 Markdown 预览。缩进层级、行内空格与原图一致,就算过关。

避坑:

  • 缩进被拍平成一段 → 默认排版解析"多栏-按自然段换行"面向普通文档 → 代码截图一律改选"单栏-保留缩进"。
  • 想改错字却只能整段复制 → 记录默认是识别原文 → 选中记录先编辑再复制。

截图 OCR 页面:右侧设置里切换排版解析方案,左侧预览栏可划选文字

记录面板还支持划选多条记录批量复制:

识别记录面板:右键菜单可复制、删除单条记录或清空全部

一文件夹扫描件批量转文本和Excel

谁会用:手里一堆扫描文档或票据图片,一张一张点不现实。

操作:

  1. 切到"批量 OCR"标签页,点"选择图片"或直接拖入文件夹。你会看到左侧文件列表逐张列出,几百张也能一次导入。
  2. 核对输出格式勾选:txt / jsonl / md / csv (Excel)。
  3. 点"开始任务"。你会看到左侧列表逐张显示耗时和置信度。
  4. PDF 扫描件切到"文档识别"标签页(v2.1.4 及以上支持),拖入pdf / xps / epub / mobi / fb2 / cbz。产物是双层可搜索 PDF:原图在底下,识别出的文字藏在上层。

验收:随机抽 3 张图,对比左侧预览和右侧记录。置信度(0~1)低于0.8的几张重点人工核对。PDF 产物用Ctrl+F搜一个只有正文里才出现的词,能跳到对应页就对了。

避坑:

  • 每张图固定位置都有水印文字 → 水印的文本块被一起识别 → 右侧设置进入忽略区域编辑器,按住右键画矩形框住水印,框画得稍大更安全。
  • 像素超大的长图、小字多的大图认错字 → 默认边长限制先把大图压缩了 → 到"设置 → 文字识别 → 限制图像边长"把数值从960调高到 2880 或 4320。

批量 OCR 页面:左侧文件列表含耗时与置信度,右侧是识别记录

把识别接口挂进自己的脚本和流水线

谁会用:想把 OCR 放进定时任务、打包脚本或自己的 Web 服务里。

操作:

  1. 在"全局设置"确认 HTTP 服务已开启,主机保持"仅本地"即可,默认端口1224。
  2. 命令行走法(umi-ocr是Umi-OCR.exe的简写),完整用法见 docs/README_CLI.md:
umi-ocr --screenshot --clip umi-ocr --path "D:/docs" --output "结果.txt"
  1. HTTP 走法:先GET http://127.0.0.1:1224/api/ocr/get_options查参数定义,再POST http://127.0.0.1:1224/api/ocr提交 base64 图片。请求体里base64字段放图片编码,options字段放语言模型、排版解析等选项,完整参数表见 docs/http/api_ocr.md,以官方文档为准。

验收:命令行跑完,文本出现在剪贴板或你指定的文件里。浏览器访问get_options能看到 JSON 参数定义,看到就说明服务通了。

避坑:

  • 命令行 / HTTP 没反应 → 九成是 HTTP 服务没开 → 回"全局设置"允许 HTTP 服务,主机选"仅本地"。
  • 跑命令行任务时主窗口弹出来 → 命令行沿用"截图 OCR"标签页的参数设定 → 在那个标签页里关掉"弹出主窗口"选项。

关键参数速查

参数默认值什么时候需要改改成什么
排版解析多栏-按自然段换行识别代码截图单栏-保留缩进
限制图像边长960大图、小字多2880 或 4320
语言/模型库简体中文纯英文、纯代码内容models/config_en.txt
OCR 引擎插件Rapid-OCR(自带)速度或精度不够用全局设置里切换其他引擎插件

所有界面改动会自动存进UmiOCR-data/.settings(ini 格式),也可以手动改,改完执行umi-ocr --reload重新加载。

排障速查

现象大概率原因一句话解法
识别顺序错乱、读不通默认排版解析不适合该图排版换排版解析方案,代码选"单栏-保留缩进"
大图里的小字认错边长限制 960 先压缩了图片"限制图像边长"调到 2880 以上
水印、LOGO 文字混进结果水印里的文本块被一起识别批量页忽略区域编辑器里把水印整块框住
命令行 / HTTP 没反应九成是 HTTP 服务没开全局设置里允许 HTTP 服务,主机选"仅本地"
界面语言不对首次启动没跟随上系统语言全局设置里手动切换语言

Umi-OCR 像个放在本地的 OCR 工具箱:免费、不联网,截图、批量、PDF 一次做完,还留了命令行和 HTTP 两个口子给你接自动化。建议先在截图页练熟排版解析,再去批量页处理文件夹,最后把接口挂进脚本。完整参考见 docs/README_CLI.md 与 docs/http/README.md。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询