当前位置: 首页 > news >正文

Umi-OCR 完全上手指南:快速完成离线批量图片识别

Umi-OCR 完全上手指南:快速完成离线批量图片识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源的离线 OCR 软件,支持截图识别、批量导入图片、PDF 文档识别和二维码扫描,所有处理都在本地完成、不依赖网络。它适合需要把大量图片或文档转成文字,又希望数据不出自己电脑的办公用户和新手。

快速开始

  1. 拿到发布包:仓库根目录自带Umi-OCR_Rapid_v2.1.5.7z发行版压缩包,解压即可使用。
  2. 直接启动:软件无需安装,解压后双击Umi-OCR.exe启动,支持 Windows 7 x64 与 Linux x64。
  3. 检查界面:首次打开会跟随系统语言;需要切换时进入「全局设置 → 语言」,支持简中、英语、日语等。
  4. 第一次体验:打开「截图OCR」标签页,按快捷键划选屏幕上一块文字,识别结果会出现在右侧记录栏,也可以从别处复制图片直接粘贴进来识别。

核心功能解读

截图OCR:划选即识别

它做什么:用快捷键截图,选区内的文字立即被识别成可编辑文本。

怎么用:左侧图片预览栏支持鼠标划选复制,右侧记录栏保留历史结果,可编辑、可多选复制。

什么时候用:从屏幕、PDF 阅读器或网页中快速抠一段文字,或核对单条信息时最顺手。

批量OCR:一次处理几十张图片

它做什么:把多张图片导入后按顺序识别,并把结果保存为文件。

怎么用:在「批量OCR」标签页选择图片导入,支持 jpg、png、webp、tiff 等格式;右侧设置面板里调整识别语言、后处理方案和保存格式(txt、jsonl、md、csv/Excel),图片数量没有上限。

什么时候用:手头有一批照片、截图需要批量提取文字时;也可以在任务设置里开启完成后自动关机或休眠,挂机跑长任务。

文本后处理:把文字排成对的顺序

它做什么:OCR 引擎输出的原始文本块顺序经常是乱的,后处理负责按阅读顺序重新整理排版。

怎么用:在后处理设置中选择排版解析方案,如「多栏-按自然段换行」「单栏-保留缩进」「不做处理」等,所有方案都能自动处理横排和竖排文字。

什么时候用:论文、多栏文档选多栏方案;解析代码截图选「单栏-保留缩进」,能保留行首缩进和行中空格;普通单栏文档用「多栏-按自然段换行」基本够用。

一个完整实战案例:识别 30 页带页眉的书页

任务:一批扫描的书页图片,每页顶部有固定页眉文字,目标是把正文转成 Markdown 文件。

  1. 把 30 张图片放进同一个文件夹,打开「批量OCR」标签页导入该文件夹。
  2. 右侧设置中选择识别语言,进入「忽略区域」编辑器,按住右键在页面上部画一个矩形框,把页眉区域包起来——注意框要足够大,覆盖水印可能出现的所有位置。
  3. 后处理方案选「多栏-按自然段换行」,保存格式选 Markdown。
  4. 点击开始任务,等进度条走完,每页的识别结果就会按图片名保存,正文中不再混入页眉文字。

场景配置速查

场景推荐设置输出格式
多栏学术论文批量OCR,多栏-按自然段换行md
代码截图单栏-保留缩进,英文识别txt
带水印截图批量OCR + 忽略区域包住水印txt / jsonl
扫描件 PDF「文档识别」标签页,设忽略区域排除页眉页脚双层可搜索 PDF

常见问题

识别结果排版混乱、顺序不对原因:默认「不做处理」输出的是引擎原始顺序,多栏和竖排版面没有被整理。 解决:在后处理里切换成「多栏-按自然段换行」等方案重新跑任务。

大尺寸图片识别很慢原因:像素超大的长图会占用较多计算资源。 解决:在「批量OCR → 文字识别 → 限制图像边长」中调高数值,并把图片分成几批处理。

截图时界面闪烁、UI 错位原因:默认的显卡加速渲染与当前机器不兼容。 解决:在「全局设置 → 界面和外观 → 渲染器」中切换渲染方案,或关闭硬件加速。

水印或页脚文字混进结果原因:干扰区域没有被排除,整个文本块落在识别范围内。 解决:用忽略区域编辑器画矩形包住干扰区域;注意只有完整落在框内的文本块才会被忽略,框太小无效。

进阶

需要自动化时,Umi-OCR 也支持命令行调用,例如批量识别一个文件夹并写入文件:umi-ocr --path "D:/图片文件夹" --output result.txt。命令行与 HTTP 接口都走本地环回通信,数据不会离开机器。更多参数详见命令行手册,HTTP 集成方式见HTTP接口手册。

从解压到跑通第一次批量识别大约十分钟,完整功能说明可参考仓库内的 README.md。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4335691.html

相关文章:

  • 基于MAVSDK与MQTT的飞控数据采集传输系统设计
  • exo:把多块设备组成本地AI集群的完整指南,4台Mac跑通671B参数分布式推理
  • 4台Mac Studio跑通Qwen3-235B:exo分布式AI集群从0到4节点RDMA实战
  • 计算机视觉算法实习生笔试题全解析:核心考点与备赛攻略
  • 百度研发岗笔试复盘:HashMap、TCP与算法设计题解析
  • Google 2011笔试卷复盘:算法、系统设计与工程思维
  • AI图像增强免费指南:Upscayl 一键把老照片截图放大4倍
  • 基于Matlab的Sobol全局敏感性分析:原理、实现与工程应用
  • Umi-OCR 离线OCR新手指南:从下载到第一次批量跑通
  • C#读写NFC NDEF智能海报:从文本、URI到小程序跳转的完整实现
  • MATLAB人脸关键点检测与曲线拟合实战:从传统方法到深度学习
  • 基于STM32的楼道声控灯设计与实现全解析
  • MyBatis中表和实体类的映射
  • 网易Android校招笔试题解析:从Handler到Binder的核心考点
  • FPGA双游戏系统设计实战:VGA显示与碰撞检测的Verilog实现
  • 网易有道校招笔试题解析:算法、系统设计与备考策略
  • 基于EDS安检X光数据集的目标检测实战:从数据解析到YOLOv8模型部署
  • iPad零电脑零越狱运行MC Java版:Fabric与Iris完整接入指南
  • AI代理0Day漏洞入侵实战复盘:沙箱逃逸与奖励黑客防御方案
  • 基于YOLOV5的细胞检测:医疗AI目标检测模型训练全流程
  • 大数据实训项目全链路实战:从Flume采集到Spark分析再到可视化展示
  • 开源工具选型指南:免费资源、AI编程与项目管理实战
  • 全新16合一美团代付系统源码
  • 2026论文神级降AIGC软件大曝光:一键改写直达人工原创!
  • Android禁用OTA更新指南:ADB脚本清除系统更新弹窗与红点
  • 我的世界AI建筑生成模组:从安装部署到批量生成实践指南
  • 2026实测报告:毕业论文AI论文软件横向测评,千笔AI凭三大硬指标登顶
  • C++实现B站直播场控机器人:从弹幕协议到可编程架构全解析
  • 网易2018校招C++开发笔试题全解析:核心考点、编程题与避坑指南
  • STM32F407气压计定高四轴实战:从滤波到串级PID完整解析