如何用Umi-OCR免费离线OCR快速提取文字:从截图识别到批量文档处理的完整指南
如何用Umi-OCR免费离线OCR快速提取文字:从截图识别到批量文档处理的完整指南
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
你有没有遇到过这样的时刻:网课PPT上的重点、扫描版合同里的条款、PDF里复制不出来的报错代码——屏幕上明明有字,却怎么都拿不到手。手动敲一遍?费时费力还容易出错。改用在线OCR?要么收费限次,要么上传后等半天,更关键的是你的文件被送去了别人的服务器,隐私毫无保障。
Umi-OCR就是为这个场景而生的。它是一款完全免费、开源的离线OCR软件,支持截图识别、批量图片识别、PDF文档识别、二维码扫描与生成,解压即用、全程断网运行,识别引擎和语言模型全部内置在本地。下面这份完整指南会带你从零上手,把它的每一个实用功能都变成你日常工作的趁手工具。
三步完成Umi-OCR安装与首次截图识别
很多人以为这种"本地OCR引擎"的软件安装起来会很折腾,其实恰恰相反。Umi-OCR贯彻了"解压即用"的原则,从下载到第一次识别,你只需要三步。
第一步:下载并解压。从项目发布页拿到.7z或.7z.exe自解压包(比如仓库根目录的Umi-OCR_Rapid_v2.1.5.7z)。自解压包的好处是,哪怕电脑上没装任何压缩软件,双击也能解压。Windows用户也可以用 Scoop 一行命令装好:scoop install extras/umi-ocr。
第二步:启动程序。解压后进入文件夹,双击Umi-OCR.exe,软件即启动。不需要安装向导,不需要配置环境变量,更不需要注册账号。
第三步:按下快捷键,框选屏幕。软件默认自带全局截图快捷键,你也可以在"全局设置"里改成顺手的组合键。按下快捷键后,屏幕上会出现一个选框,拖拽框住你想识别的区域,松手,识别结果就出现在界面里了,文本已经自动复制到剪贴板,直接Ctrl+V粘贴即可。
图为Umi-OCR截图识别界面:左侧保留原始截图,右侧实时给出识别文本,全程离线完成。
这里有个小细节:如果你正在看一篇网页文章或聊天记录,也可以直接选中内容截图复制到剪贴板,然后在Umi-OCR界面里按Ctrl+V粘贴图片,同样能触发识别。软件不限制文字必须来自截图,任何能进剪贴板的图片都行。
离线OCR原理拆解:不联网也能读字的秘密
你可能会好奇:不联网,它凭什么认字?这里要先解释一个概念。OCR全称"光学字符识别"(Optical Character Recognition),说白了就是教电脑"看"图片里的字形,再"念"成可编辑的文本。
在线OCR的思路是把图片传到云端服务器去"念",结果再传回来;而Umi-OCR反其道而行——它把"念字"的模型直接装在你自己的电脑里,所有计算都在本地完成。所以它不依赖网络、不产生流量、更不会把你的文件泄露出去。
为了保证不同电脑上都能跑得顺,Umi-OCR内置了两套可以自由切换的离线OCR引擎,你可以把它们理解成两个风格不同的"阅读员":
| 引擎 | 特点 | 适合场景 |
|---|---|---|
| PaddleOCR-json | 识别速度较快 | 追求效率、硬件性能较好的电脑 |
| RapidOCR-json | 兼容性好、更省资源 | 低配置电脑、老旧系统 |
切换方式很简单:在"全局设置"的插件区域选择引擎即可,无需重启。两个引擎都支持简体中文、繁体中文、英文、日文等多语言识别库,识别时还能混合识别中英文混排内容。
除了引擎,另一个容易被忽视但极其重要的组件是排版解析。OCR引擎识别出的其实是一个个带坐标的"文字块",如果直接按识别顺序输出,多栏报纸、杂志、代码截图这类排版就会乱成一团。Umi-OCR内置了一套文本块后处理模块,会根据文字块的位置关系智能判断阅读顺序,就像人工排版一样把段落理顺。
截图OCR实战:把屏幕文字变成可复制的文本
截图识别是Umi-OCR使用频率最高的功能,也是它最拿手的场景。完成首次识别后,你会发现右侧记录面板里不仅能看到文本,还能对历史记录做各种操作。
- 鼠标划选任意识别结果,直接拖出即复制;
- 在结果上右键,可以复制单条、复制全部、清空记录;
- 预览区可以一键隐藏文本,方便对照原图检查识别质量。
更关键的是"设置"面板里的排版解析方案,它决定了识别结果以什么形式输出。针对不同内容,选择也不同:
| 方案 | 适用场景 |
|---|---|
| 多栏-按自然段换行 | 报纸、论文、杂志等多栏排版(最常用) |
| 单栏-保留缩进 | 代码截图,保留行首缩进和空格 |
| 单栏-总是换行 | 普通单栏文章、聊天记录 |
| 不做处理 | 需要引擎原始输出时 |
举个例子:你截了一张Python代码图,如果默认方案把缩进全丢了,代码就没法直接用了;切换到"单栏-保留缩进",识别结果就能基本还原代码结构。切换后无需重新截图,软件会立即用新方案重新整理已有结果,方便你对比效果。
批量OCR实战:几百张图片一次识别,水印干扰这样排除
截图识别适合"零星作战",但当你手头有几百张图片需要处理时,就该批量OCR登场了。这个页面支持把整个文件夹拖进来,甚至能递归扫描子文件夹,任务数量没有上限,一次导入上千张也没问题。
导入后点"开始任务",右侧会实时显示每张图片的处理状态和识别置信度。全部完成后,你可以一键把结果保存为txt、jsonl、md或csv(Excel可直接打开)格式,还能设置任务完成后自动关机或休眠——晚上挂机批量处理,第二天早上直接收结果。
图为Umi-OCR批量OCR界面:左侧任务列表实时显示进度与置信度,右侧汇总识别结果。
批量识别最头疼的问题是什么?水印和页眉页脚。比如你要识别一批带网站水印的截图,水印文字会被当成正文识别出来,污染结果。Umi-OCR为此提供了"忽略区域"功能:在编辑器里用鼠标右键拖出矩形框,框住水印可能出现的位置,这些区域内的文字块就会在识别时被跳过。注意,框要画得比水印大一些,因为只有完全位于框内的整个文字块才会被忽略,框小了反而放跑了水印。
PDF文档识别进阶:扫描件秒变可搜索的双层PDF
如果说前两个功能是"常规操作",那么PDF文档识别就是Umi-OCR的进阶大招。它支持pdf、xps、epub、mobi、fb2、cbz等多种文档格式,能对付两种截然不同的场景:
场景一:提取电子书原有文本。某些PDF虽然自带文字层,但出于加密或格式原因无法复制,Umi-OCR可以直接把内嵌文本提取出来,速度飞快。
场景二:OCR扫描件,输出双层PDF。这才是重头戏。扫描版PDF本质上就是一张张图片,普通工具只能识别成纯文本,排版信息全丢了。Umi-OCR会生成一种"双层可搜索PDF":底层保留原始扫描图像,保证观感和版面不变;顶层叠放一层透明不可见的文本,让你能搜索、复制、选中。你可以把它想象成一块"三明治"——图像是面包,透明文本是夹心,两个图层按像素坐标精确对齐。
转换时同样支持"忽略区域",你可以框选掉每一页的页眉页脚,让生成的文本层干净整洁。相关细节在官方更新日志 CHANGE_LOG.md 中有完整记录,从v2.1.0引入文档识别到后续的坐标旋转修复、单层PDF支持,功能一直在持续打磨。
Umi-OCR命令行与HTTP接口:把离线OCR嵌入工作流
如果你以为Umi-OCR只是个人工操作的工具,那就低估它了。它还开放了命令行和HTTP接口,这意味着你可以把它接进自己的脚本和工作流,实现真正的自动化。命令行调用入口就是主程序本身,所有指令都支持缩写:
# 鼠标框选截图并识别 umi-ocr --screenshot # 识别指定图片或文件夹,结果输出到文件 umi-ocr --path "D:/扫描件" --output "结果.txt" # 识别剪贴板里的二维码 umi-ocr --qrcode_read # 生成一个二维码图片 umi-ocr --qrcode_create "https://example.com" "D:/码.png"底层机制很有意思:命令行指令其实是借助HTTP接口,在系统内部的本地环回地址(不经过物理网卡)把请求传给后台的Umi-OCR进程,所以通信不会泄露到外部,可以放心使用。HTTP接口的完整参数说明见 docs/http/api_doc.md,支持OCR、二维码识别/生成、文档识别等能力,用Python或Node写个几十行的脚本,就能把它变成你自己的离线OCR服务。
另外,二维码页还支持一图多码识别,兼容Code128、DataMatrix、PDF417等19种协议,配合生成功能,可以做很多有意思的小工具。
Umi-OCR使用避坑指南:识别不准、闪屏的解决办法
用了一段时间,你可能会遇到下面这些问题。别慌,大多数都有标准解法:
| 问题 | 最快解决办法 |
|---|---|
| 超大长图识别失败或报错 | 在页面"设置→文字识别→限制图像边长"里调高数值 |
| 识别准确率不理想 | 切换另一套OCR引擎;检查识别语言是否包含目标语种;换用更合适的排版解析方案 |
| 截屏时画面闪烁、UI错位 | "全局设置→界面和外观→渲染器"切换渲染方案,或关闭硬件加速 |
| 批量任务处理到一半被中断 | v2.1.2起支持暂停任务,不退出软件,休眠后也能恢复 |
| 想排查某个Bug | 用命令行启动可看实时日志,ERROR级别日志保存在UmiOCR-data/logs目录 |
图为Umi-OCR全局设置界面:语言、主题、字体、渲染器等基础参数都可以在这里一次性配好。
软件启动时会根据系统语言自动切换界面语言,也支持手动在全局设置里改为简体中文、繁体中文、英语、日语、俄语等。如果你用的是Linux系统,从v2.1.3开始Umi-OCR也已官方支持,还提供了Docker部署方案。
总结:免费离线OCR,从今天开始解放双手
回顾一下,我们完成了从"三步上手"到"原理拆解",再到"截图、批量、PDF三大实战",最后打通"命令行与HTTP自动化"的完整闭环。Umi-OCR的价值其实就一句话:把文字识别这件事,彻底变成你本地电脑上随叫随到的免费服务——不花钱、不上传、不联网,还保留了从截图到批量文档处理的完整能力。
下一步,你可以这样做:
- 下载Umi-OCR解压运行,先用截图识别处理一份真实资料,感受一下速度;
- 阅读 docs/README_CLI.md 和 docs/http/api_doc.md,尝试把接口接进自己的脚本;
- 翻翻 CHANGE_LOG.md,了解每个版本的演进脉络;
- 如果遇到问题,带上日志去项目仓库提Issue,或者参与界面翻译,给开源社区添一把火。
扫描件、截图、论文、合同——从今天起,它们都会变成你随时可以搜索和复制的文字。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
