Umi-OCR 实战指南:免费离线 OCR,快速搞定截图、批量图片与 PDF 文字提取
Umi-OCR 实战指南:免费离线 OCR,快速搞定截图、批量图片与 PDF 文字提取
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源、离线运行的 OCR 软件:识别全程在本地完成,不上传数据、不依赖网络。它覆盖截图识别、批量图片识别、PDF 文档提取和二维码扫描,支持 Windows 与 Linux,适合偶尔取字的日常用户,也适合需要整批处理扫描件、图片的办公场景。
一分钟速览:Umi-OCR 是什么、适合谁
| 维度 | 说明 |
|---|---|
| 定位 | 离线 OCR 工具,覆盖截图、批量图片、PDF、二维码四类任务 |
| 费用 | 完全免费,代码开源,无订阅、无次数限制 |
| 隐私 | 识别全部本地完成,离线可用 |
| 系统 | Windows(含 Win7 x64)、Linux x64 |
| 形态 | 解压即用,无需安装,方便在不同电脑间迁移 |
| 引擎 | 内置 RapidOCR / PaddleOCR,可随时切换 |
| 调用方式 | 图形界面、命令行、HTTP 接口三种 |
从零到一:下载、启动与验证首次识别
- 从项目仓库的发行版(Release)中下载发布包:
.7z压缩包适合已有压缩软件的电脑,.7z.exe自解压包适合没有解压工具的电脑。 - 解压到任意目录(路径建议不含中文和空格),双击
Umi-OCR.exe启动,全程无需安装。 - 首次启动会按系统语言自动选择界面;如需切换,进入
全局设置 → 语言即可,内置中文、繁体、英文、日文等语言。
验证是否跑通:打开截图OCR标签页,按快捷键(默认 F9)划选屏幕上任意一段文字,右侧记录栏出现识别结果,能直接划选复制,即说明环境正常。这一步同时完成了"获取 → 启动 → 出结果"的完整闭环。
实战走查:四个高频任务的照做步骤
任务一:如何从屏幕截图里快速取出文字
- 打开截图OCR标签页,按 F9 唤起截图,框选目标区域(按 Esc 可取消)。
- 左侧图片预览栏显示识别到的文字位置,可直接用鼠标划选复制;右侧识别记录栏支持编辑文字、跨多条记录划选后一次性复制。
- 不想截图也行:在别处复制一张图片后,回到本页直接粘贴即可识别。
- 在页面设置中选择"文本后处理 - 排版解析方案":多栏文档选
多栏-按自然段换行,解析代码截图选单栏-保留缩进,横排竖排都能自动处理。
任务二:如何批量识别几十上百张图片并导出结果
- 打开批量OCR标签页,把图片文件或整个文件夹拖入窗口,没有数量上限,几百张也可以排队处理。
- 支持
jpg / png / webp / bmp / tif等常见格式;识别进度和每张图片的置信度实时显示,任务可随时暂停、休眠后恢复。 - 勾选输出格式:
txt / jsonl / md / csv(Excel),一次处理可同时导出多种格式。 - 遇到带水印、LOGO 的图片:在右栏进入"忽略区域"编辑器,按住右键画出若干矩形框住水印位置。只有完全落在框内的文本块会被忽略,框尽量画大一点,包住房印可能出现的全部位置。
- 长图、超大图识别不全时,把
页面的设置 → 文字识别 → 限制图像边长的数值调高再提交任务。
任务三:如何把扫描版 PDF 转成可搜索、可复制的文档
- 打开文档识别标签页,拖入文档,支持
pdf / xps / epub / mobi / fb2 / cbz。 - 软件会先尝试提取文档自带文本;扫描版图片页则走 OCR 流程,也可输出双层可搜索 PDF——原样保留视觉排版,同时叠加一层可复制、可全文检索的文本。
- 用"忽略区域"框住页眉页脚位置,避免页码、公司抬头混进正文。
- 多个文档可批量提交;如果任务要跑一整夜,还可以设置完成后自动关机/休眠。
任务四:如何扫码或生成二维码
打开二维码标签页即可,截图、粘贴或拖入本地图片均可识别,支持一图多码,覆盖 QR、DataMatrix、PDF417 等 19 种协议。反过来,输入一段文本可生成二维码图片,并支持调节纠错等级等参数——线下物料、文档里嵌入二维码时都能用到。
效率调优:OCR 引擎、排版解析与参数怎么选
- 引擎取舍:全局设置中可切换 OCR 插件。PaddleOCR 精度表现更好,适合对准确率要求高的场景;RapidOCR 处理速度更快、兼容性好,适合大批量简单文档。不确定的话先用默认,同一类任务各试一次再固定下来。
- 排版解析:识别顺序乱、换行奇怪,多半是方案没选对。多栏文档优先
多栏-按自然段换行;要求逐行输出的选总是换行;代码截图选单栏-保留缩进,能保住行首空格。 - 图像参数:大图、长图先调高"限制图像边长";模糊、倾斜严重的图片,先裁剪放大到文字清晰再识别,比任何参数都有效。
- 界面参数:全局设置页还能调整主题、字体大小、渲染器(出现截图闪烁、UI 错位时切换渲染方案通常能解决),详见 README 的全局设置说明。
集成与扩展(简版):命令行与 HTTP 接口
面向脚本和自动化的同学,Umi-OCR 提供两种外部调用方式:
命令行:入口就是
Umi-OCR.exe,例如对指定目录做识别并导出文件:umi-ocr --path "D:/images" --output "result.txt"完整指令(截屏、剪贴板、二维码、结果输出控制)见 命令行手册。
HTTP 接口:在全局设置中允许 HTTP 服务(默认开启,主机选"仅本地"即可)后,就能通过 RESTful 接口发送图片识别、文档识别、二维码请求,参数与流程详见 HTTP 接口手册 和 接口文档。
排障手册:高频问题与对策
- 识别结果错字多、顺序乱→ 先确认原图文字是否清晰可辨;再换排版解析方案或引擎;外文识别注意选择对应语言库。
- 批量任务耗时太长→ 改用 RapidOCR 引擎;大图先调高"限制图像边长";把任务排到空闲时段,并开启完成后自动关机。
- 截图或粘贴识别后没有结果→ 检查截图区域是否真的包含文字;粘贴方式需要剪贴板里是图片而非文本;识别记录栏支持划选复制,别漏看右侧面板。
- 命令行执行
umi-ocr无响应→ 确认全局设置中已允许 HTTP 服务(默认开启);命令行依赖本地回环通信,主机保持"仅本地"即可。 - Linux 上截图位置偏移或界面错位→ 到
全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速。
写在最后
Umi-OCR 把"截图取字、批量导文、PDF 数字化"这几件高频事收进了一个免费离线的工具里,按需取用即可。更多功能细节、更新计划可查阅 CHANGE_LOG.md;遇到问题或想参与界面翻译,欢迎到项目 Issue 和 Weblate 协作页面反馈。
核心关键词:离线OCR、免费OCR软件、Umi-OCR长尾关键词:截图文字识别、批量图片OCR、PDF转可搜索文档、PDF文字提取、开源OCR项目、二维码识别生成
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
