Umi-OCR 完全上手指南:快速完成离线批量图片识别
Umi-OCR 完全上手指南:快速完成离线批量图片识别
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源的离线 OCR 软件,支持截图识别、批量导入图片、PDF 文档识别和二维码扫描,所有处理都在本地完成、不依赖网络。它适合需要把大量图片或文档转成文字,又希望数据不出自己电脑的办公用户和新手。
快速开始
- 拿到发布包:仓库根目录自带
Umi-OCR_Rapid_v2.1.5.7z发行版压缩包,解压即可使用。 - 直接启动:软件无需安装,解压后双击
Umi-OCR.exe启动,支持 Windows 7 x64 与 Linux x64。 - 检查界面:首次打开会跟随系统语言;需要切换时进入「全局设置 → 语言」,支持简中、英语、日语等。
- 第一次体验:打开「截图OCR」标签页,按快捷键划选屏幕上一块文字,识别结果会出现在右侧记录栏,也可以从别处复制图片直接粘贴进来识别。
核心功能解读
截图OCR:划选即识别
它做什么:用快捷键截图,选区内的文字立即被识别成可编辑文本。
怎么用:左侧图片预览栏支持鼠标划选复制,右侧记录栏保留历史结果,可编辑、可多选复制。
什么时候用:从屏幕、PDF 阅读器或网页中快速抠一段文字,或核对单条信息时最顺手。
批量OCR:一次处理几十张图片
它做什么:把多张图片导入后按顺序识别,并把结果保存为文件。
怎么用:在「批量OCR」标签页选择图片导入,支持 jpg、png、webp、tiff 等格式;右侧设置面板里调整识别语言、后处理方案和保存格式(txt、jsonl、md、csv/Excel),图片数量没有上限。
什么时候用:手头有一批照片、截图需要批量提取文字时;也可以在任务设置里开启完成后自动关机或休眠,挂机跑长任务。
文本后处理:把文字排成对的顺序
它做什么:OCR 引擎输出的原始文本块顺序经常是乱的,后处理负责按阅读顺序重新整理排版。
怎么用:在后处理设置中选择排版解析方案,如「多栏-按自然段换行」「单栏-保留缩进」「不做处理」等,所有方案都能自动处理横排和竖排文字。
什么时候用:论文、多栏文档选多栏方案;解析代码截图选「单栏-保留缩进」,能保留行首缩进和行中空格;普通单栏文档用「多栏-按自然段换行」基本够用。
一个完整实战案例:识别 30 页带页眉的书页
任务:一批扫描的书页图片,每页顶部有固定页眉文字,目标是把正文转成 Markdown 文件。
- 把 30 张图片放进同一个文件夹,打开「批量OCR」标签页导入该文件夹。
- 右侧设置中选择识别语言,进入「忽略区域」编辑器,按住右键在页面上部画一个矩形框,把页眉区域包起来——注意框要足够大,覆盖水印可能出现的所有位置。
- 后处理方案选「多栏-按自然段换行」,保存格式选 Markdown。
- 点击开始任务,等进度条走完,每页的识别结果就会按图片名保存,正文中不再混入页眉文字。
场景配置速查
| 场景 | 推荐设置 | 输出格式 |
|---|---|---|
| 多栏学术论文 | 批量OCR,多栏-按自然段换行 | md |
| 代码截图 | 单栏-保留缩进,英文识别 | txt |
| 带水印截图 | 批量OCR + 忽略区域包住水印 | txt / jsonl |
| 扫描件 PDF | 「文档识别」标签页,设忽略区域排除页眉页脚 | 双层可搜索 PDF |
常见问题
识别结果排版混乱、顺序不对原因:默认「不做处理」输出的是引擎原始顺序,多栏和竖排版面没有被整理。 解决:在后处理里切换成「多栏-按自然段换行」等方案重新跑任务。
大尺寸图片识别很慢原因:像素超大的长图会占用较多计算资源。 解决:在「批量OCR → 文字识别 → 限制图像边长」中调高数值,并把图片分成几批处理。
截图时界面闪烁、UI 错位原因:默认的显卡加速渲染与当前机器不兼容。 解决:在「全局设置 → 界面和外观 → 渲染器」中切换渲染方案,或关闭硬件加速。
水印或页脚文字混进结果原因:干扰区域没有被排除,整个文本块落在识别范围内。 解决:用忽略区域编辑器画矩形包住干扰区域;注意只有完整落在框内的文本块才会被忽略,框太小无效。
进阶
需要自动化时,Umi-OCR 也支持命令行调用,例如批量识别一个文件夹并写入文件:umi-ocr --path "D:/图片文件夹" --output result.txt。命令行与 HTTP 接口都走本地环回通信,数据不会离开机器。更多参数详见命令行手册,HTTP 集成方式见HTTP接口手册。
从解压到跑通第一次批量识别大约十分钟,完整功能说明可参考仓库内的 README.md。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
