当前位置: 首页 > news >正文

Umi-OCR 离线OCR新手指南:从下载到第一次批量跑通

Umi-OCR 离线OCR新手指南:从下载到第一次批量跑通

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

开篇速览

Umi-OCR 是一款免费、开源的离线文字识别(OCR)工具,能把截图、图片、PDF 里的文字转成可编辑文本,支持二维码识别与批量处理,全程不联网、在本地完成。

它解决的是图片转文字的痛点:走在线工具要一张张上传,免费额度有限制,敏感内容还不敢传;用付费软件则按月掏钱。Umi-OCR 把离线引擎打包在软件里,不登录账号、不依赖网络、不限识别数量,解压就能用。

它和同类工具的差别也很明显:不是大而全的按钮堆叠,而是"标签页"形态——截图OCR、批量OCR、文档识别、二维码各占一个页签,用到哪个开哪个;OCR 引擎本身也是插件,随时能换另一套,不用重装软件。

从下载到跑通

先拿包。从项目官方发布渠道下载最新的发行包;仓库根目录里也放了一份现成的 Umi-OCR_Rapid_v2.1.5.7z,自带 Rapid-OCR 引擎,可直接使用。包是.7z.7z.exe格式,后者是自解压包,在没有装压缩软件的电脑上也能直接运行。

解压路径建议放简单一点:不放中文、空格和特殊字符,比如D:\Tools\Umi-OCR。这一个习惯能省下后面大部分稀奇古怪的麻烦。

Windows 启动:解压完双击即可

  1. 双击解压目录根部的Umi-OCR.exe。首次启动需要几秒钟,界面语言会按你的系统语言自动选。
  2. 双击没反应的话,进入UmiOCR-data目录,改用备用启动器RUN_GUI.bat
  3. 遇到 SmartScreen 提示时,点"更多信息"再选"仍要运行"。

Linux 启动:多敲一条命令

Linux 版面向 x64 系统,需要 glibc 2.31 及以上(Ubuntu 20.04+、Debian 11+ 的主流版本都满足,终端执行ldd --version可查看)。解压后进入包目录:

chmod +x umi-ocr.sh ./umi-ocr.sh

Linux 下默认不请求管理员权限,配置文件都放在用户目录里。

跑起来之后,你看到的就是标签页主界面。先不用管太多,记住四个页签就够:截图OCR、批量OCR、文档识别、二维码,正好对应下面四个任务。

划重点:免安装、解压即用;Windows 双击 exe,Linux 跑 sh 脚本;路径放纯英文目录能挡掉大部分怪问题。

场景实战

别记功能,记任务。下面四个是最常干的活。

把一张截图变成可编辑文本

目标:圈选屏幕上想转的文字区域,拿到剪贴板里。

操作路径:打开"截图OCR"页签 → 按你设好的快捷键,或点页面里的截图按钮 → 鼠标框选区域后松手。左栏是图片预览,可直接用鼠标划选复制;右栏是识别记录,能编辑文字,还能划选多条记录一起复制。

关键配置开关:页面下方的"文本后处理"。默认方案"多栏-按自然段换行"适合大多数文字;代码截图换成"单栏-保留缩进",行首缩进才会留下来。

省时间小技巧:在"全局设置"里给截图OCR设一个全局快捷键(比如 Ctrl+Alt+O),之后一个键就进截图模式,Esc 取消;剪贴板里已有的图片也可以直接粘贴到这一页识别,不用先存盘。

💡 单张图走截图识别最快,一目录的图请换下一页。

一次性处理整目录图片

目标:几百张图片一次识别完,输出成文本文件,方便后续处理。

操作路径:打开"批量OCR"页签 → 点"添加图片"选文件,或直接把图片、文件夹拖进窗口(支持 jpg、png、webp、bmp、tif 等格式)→ 选输出格式和目录 → 开始任务。输出支持txtjsonlmdcsv(Excel)四种格式。

关键配置开关:两个大概率会用到。一是"忽略区域":图片里有水印、LOGO 时,在批量识别右栏打开编辑器,按住右键画矩形框,框内文字不会出现在结果里。二是"页面设置 → 文字识别 → 限制图像边长":遇到超大图、长图识别不了时把数值调高。

省时间小技巧:勾上"任务完成后自动关机/待机",睡前丢一批文件进去,早上起来结果已经躺在那了。

把扫描件 PDF 变成可搜索的文档

目标:从纯扫描版 PDF 里提取文字,或输出"双层可搜索PDF"——文字在上、图片在下,文档既能搜又能选。

操作路径:打开"文档识别"页签 → 添加pdfxpsepubmobi等文件 → 开始任务。

关键配置开关:输出端选双层可搜索PDF或纯文本;也可以设置任务完成后自动关机。

省时间小技巧:带页眉页脚、页码的书,用"忽略区域"把固定位置框掉再跑,结果比事后手动清理干净得多。

读一张图里的二维码

目标:从照片里的二维码、条形码提取链接或文字;反过来,把一段文本生成二维码图片。

操作路径:打开"二维码"页签 → "扫码"一栏,截图、粘贴或拖入本地图片 → 结果直接显示在页面上。支持一图多码,覆盖 QRCode、EAN13、DataMatrix 等 19 种码制;"生成码"一栏输入文本、选纠错等级即可生成图片。

关键配置开关:识别端没有开关;生成端真正有影响的只有"纠错等级",码要打印且可能磨损时选高一级。

省时间小技巧:单个码截图扫就行;要扫一批图,用命令行umi-ocr --qrcode_read "文件夹路径"整目录扫,参数细节见命令行手册。

划重点:四个页签对应四件事——截图管快、批量管多、文档管PDF、二维码管码,每页的设置互不干扰。

按你的习惯调

设置都集中在"全局设置"页签。这里只说"想达到什么效果 → 去哪改 → 改哪个值":

  • 想换界面语言:全局设置 → 语言,可选简中、繁中、英语、日语等。首次启动是按系统语言自动匹配的,想换就改这里。
  • 想一键唤起截图识别:全局设置里的快捷键入口,给"截图OCR"设一个组合键保存。
  • 想让结果的换行排版不一样:这不在全局设置,而在每个识别页的"文本后处理"。多栏文档用"按自然段换行",代码截图用"保留缩进",要引擎原始输出就选"不做处理"。
  • 想换暗色主题、调大字号:全局设置 → 界面和外观,主题、文字大小、字体都能改。
  • 运行时画面闪烁、UI 错位:同一处 → 渲染器,换一个渲染方案,或关闭硬件加速。

划重点:语言、快捷键、主题在全局设置;排版方案在各识别页;画面怪就先动渲染器。

装插件:给它加新能力

Umi-OCR 的设计逻辑一句话就能说清:包括 OCR 引擎在内的所有功能都是"插件",一个插件就是一个文件夹,统一放在UmiOCR-data/plugins/目录下。

安装流程

  1. 拿到插件(文件夹或压缩包形式)。
  2. 把整个插件文件夹放进UmiOCR-data/plugins/
  3. 重启 Umi-OCR,新插件就会出现在列表里。

切换与管理:在"全局设置"里选择当前使用的 OCR 引擎插件。可以同时装好几个引擎,用哪个切哪个,不用卸载重装。

引擎怎么选,参考这张对比:

引擎特点什么时候选
Rapid-OCR兼容性好,发行包默认引擎大多数机器,装好直接用
Paddle-OCR识别速度稍快以批量识别为主、在意速度

划重点:插件机制就是"往 plugins 目录丢文件夹";引擎可以多装随时切换,求稳选 Rapid,求快选 Paddle。

卡住了看这里

实际跑起来,会碰上的问题基本就这几类:

症状解决
双击 exe 无反应或闪退1. 换备用启动器UmiOCR-data/RUN_GUI.bat;2. 把程序挪到纯英文路径如D:\Tools;3. 解压到非系统盘并确认有读写权限
截图时闪烁、界面错位1. 全局设置 → 界面和外观 → 渲染器;2. 换一个渲染方案;3. 或关闭硬件加速
大图/长图识别失败1. 批量页的页面设置 → 文字识别;2. 找到"限制图像边长";3. 调高数值后重试
结果里混进水印文字1. 批量识别中打开"忽略区域"编辑器;2. 按住右键画矩形包住水印;3. 框要画大,包住水印所有可能出现的位置
识别文字换行混乱1. 识别页切换"文本后处理"的排版解析方案;2. 试"多栏-按自然段换行"或"单栏-无换行";3. 仍不对就换个 OCR 引擎重识别

划重点:八成问题集中在启动、渲染、排版方案三处,对着表格一条条改就行。

收尾

项目处于活跃迭代中(当前 v2.1.5)。提 issue、参与翻译、贡献代码都欢迎。会用了就打开试试吧。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4335466.html

相关文章:

  • C#读写NFC NDEF智能海报:从文本、URI到小程序跳转的完整实现
  • MATLAB人脸关键点检测与曲线拟合实战:从传统方法到深度学习
  • 基于STM32的楼道声控灯设计与实现全解析
  • MyBatis中表和实体类的映射
  • 网易Android校招笔试题解析:从Handler到Binder的核心考点
  • FPGA双游戏系统设计实战:VGA显示与碰撞检测的Verilog实现
  • 网易有道校招笔试题解析:算法、系统设计与备考策略
  • 基于EDS安检X光数据集的目标检测实战:从数据解析到YOLOv8模型部署
  • iPad零电脑零越狱运行MC Java版:Fabric与Iris完整接入指南
  • AI代理0Day漏洞入侵实战复盘:沙箱逃逸与奖励黑客防御方案
  • 基于YOLOV5的细胞检测:医疗AI目标检测模型训练全流程
  • 大数据实训项目全链路实战:从Flume采集到Spark分析再到可视化展示
  • 开源工具选型指南:免费资源、AI编程与项目管理实战
  • 全新16合一美团代付系统源码
  • 2026论文神级降AIGC软件大曝光:一键改写直达人工原创!
  • Android禁用OTA更新指南:ADB脚本清除系统更新弹窗与红点
  • 我的世界AI建筑生成模组:从安装部署到批量生成实践指南
  • 2026实测报告:毕业论文AI论文软件横向测评,千笔AI凭三大硬指标登顶
  • C++实现B站直播场控机器人:从弹幕协议到可编程架构全解析
  • 网易2018校招C++开发笔试题全解析:核心考点、编程题与避坑指南
  • STM32F407气压计定高四轴实战:从滤波到串级PID完整解析
  • 三参数叠前反演核心逻辑与实操避坑指南
  • 基于Java+SSM的农家乐预约系统设计与实现(源码+文档+部署讲解等)
  • 2024年中国50个生态功能保护区空间数据:三件套格式与GIS应用指南
  • 基于JavaWeb的在线学习系统毕设:源码+数据库+部署全攻略
  • 2026年7月上饶市新房价格深度分析报告
  • 中兴交换机配置总结
  • LangChain1.2学习第三章—— LangSmith、提示词模板、历史对话、消息
  • Harness三道防线:门禁、白名单、循环上限如何堵住线上bug
  • SpringBoot+Vue+微信小程序游戏攻略分享系统毕设开发全攻略