当前位置: 首页 > news >正文

Umi-OCR离线OCR快速指南:5分钟完成图片文字识别与批量导出

Umi-OCR离线OCR快速指南:5分钟完成图片文字识别与批量导出

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR是一款免费、开源的离线OCR软件,能从屏幕截图、本地图片和PDF文档中提取文字,结果可导出为txt、csv等格式,全程不联网。适合需要批量处理扫描件、截图和文档的办公人员、学生与开发者。

项目速览

Umi-OCR的主窗口以标签页组织,截图OCR、批量OCR、文档识别、二维码、全局设置五个页面按需打开。发行包内置Rapid-OCR与Paddle-OCR两套离线OCR引擎,并带有中、英、日等多国语言库,识别在本地完成,图片不会上传到任何服务器。下图是截图OCR页:左栏是截图预览,可以直接用鼠标划选文字;右栏是识别记录,支持编辑和划选多条记录复制。

顶部标签栏可切换"截图OCR"与"全局设置",点击"+"还能新建标签页。

安装与准备

发行包提供.7z压缩包或.7z.exe自解压包,无需安装,解压即用。解压后双击Umi-OCR.exe即可启动,支持Windows 7 x64与Linux x64。

Windows下也可以用Scoop从命令行安装,只需两行:

scoop bucket add extras scoop install extras/umi-ocr

首次启动时,界面语言会按系统设置自动切换;需要手动更改时,进入"全局设置"→"语言/Language"即可。

上手实操:四步完成一次批量图片识别

以"识别一个文件夹里的全部图片,并导出txt"为例:

  1. 打开"批量OCR"标签页,点击"选择图片"添加图片。支持jpg、jpeg、png、webp、bmp、tif、tiff等格式,没有数量上限。
  2. 在右栏设置里选择保存格式(txt、jsonl、md、csv)与保存位置。
  3. 点击"开始任务"。顶部会显示进度条与总耗时,右栏记录区可以逐张查看每张图的识别结果。
  4. 任务结束后,指定文件夹中生成与图片同名的txt文件。

如果只想识别屏幕上的一小块文字,打开"截图OCR"标签页,按快捷键(Windows下默认Win+Alt+C)框选区域,识别完成后在右栏记录区直接复制文字即可。

上图是一次已完成的批量任务:13张图片识别完毕,列表里能看到每张图片的耗时与状态。

进阶用法

排版解析方案。截图OCR和批量OCR页都有"OCR文本后处理"选项,可切换预设排版方案:多栏-按自然段换行能自动识别双栏版式,适合报纸、论文;单栏-保留缩进面向代码截图,保留行首缩进和行中空格。

忽略区域。带水印、LOGO或页眉页脚的图片,可以在批量页右栏设置中进入忽略区域编辑器,按住右键绘制多个矩形框住水印位置,框内的文本块会在任务中被跳过。文档识别页同样支持设置忽略区域,用来排除页眉页脚,还能把扫描件输出为双层可搜索PDF。

命令行与HTTP接口。主程序本身就是命令行入口,例如识别一张图片并写入文件:

umi-ocr --path "D:/img.png" --output out.txt

--path也可以传文件夹路径,递归识别其中所有图片;--screenshot执行截图识别,--clipboard识别剪贴板里的图片。需要让其他程序调用OCR时,可改用HTTP接口。

常见问题

问:系统要求是什么?必须联网吗?答:Windows 7 x64或Linux x64均可运行。OCR引擎和语言库都打包在发行包里,完全离线可用,无需安装依赖。

问:识别出来的排版混乱,或超大图片识别效果差,怎么调?答:先更换排版解析方案,比如改用"单栏-按自然段换行"。超大的长图要调高批量页"设置→文字识别→限制图像边长"的数值。另外,图片分辨率越高,识别效果越好。

问:识别结果到底存在哪里?答:三个去向:截图页在"识图后的操作"里勾选"复制结果"后,文字会进剪贴板;批量页会把结果保存为设置里指定的txt、jsonl、md或csv文件;命令行则用--output写文件、用--clip复制到剪贴板。


如果你只需要一个把文字留在本地、不上传图片的识别工具,Umi-OCR解压即用:先跑一次批量识别,再按自己的工作流调整输出格式。延伸阅读:命令行手册、HTTP接口手册、更新日志。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4329579.html

相关文章:

  • SSM框架从零搭建图书管理系统:Spring+SpringMVC+MyBatis整合实战
  • Python漫画爬虫实战:接口解析、并发下载与zip打包全攻略
  • 2026深圳工程建筑材料检测排名 TOP5 CMA 资质提供钢材检测、水泥检测、砂石检测 全覆盖联系方式推荐
  • 2026沈阳工程建筑材料检测排名 TOP5 CMA 资质提供钢材检测、水泥检测、砂石检测 全覆盖联系方式推荐
  • go-zero电商后台脚手架Zero-Admin:从框架原理到二次开发实践
  • Python+分布式架构:基于CARLA的自动驾驶仿真系统解析
  • aigc率检测和论文查重有什么区别?看懂报告后再决定怎样AI降重?
  • ops-nn Tiling策略详解:张量切分与并行调度的核心机制和3大交付件
  • 幻影防务 MPX 3.0 安装全指南:从环境检查到启动验证
  • AI生成内容加水印:技术原理、落地挑战与可信互联网的基石
  • 从1946到2023:zip压缩包解压与数据修复全记录
  • Kronos:基于预训练+微调的金融K线时序预测模型实战指南
  • 植物叶片分割数据集构建与模型调优实战:从0.62到0.87
  • 垃圾分类运输路径优化:从VRP建模到遗传算法实战
  • Claude Code编排机械臂实现物理拦截:从风控决策到仿真执行
  • VMware Workstation 16.1.2 安装、虚拟机创建、去虚拟化与彻底卸载指南
  • Umi-OCR 快速上手:免费离线OCR软件,3步搞定截图、批量与PDF识别
  • 为什么值得试试 Ghostty:一款快速、跨平台、GPU 加速终端的实践指南
  • FBG反射谱与透射谱的Matlab仿真:从传输矩阵到调参避坑
  • ai-memory用Copilot和OpenAI OAuth:零API Key配置订阅账号指南
  • 3分钟部署Shannon:Docker跑通AI渗透测试环境
  • RMA距离徙动算法详解:从原理到Matlab成像实现
  • 51单片机节日彩灯控制器设计与Proteus仿真实战
  • stitch-skills stitch-loop完全指南:一个提示词构建多页网站
  • YOLOv8-Pose驾驶员疲劳检测系统实战:从数据标注到UI界面
  • 国内B2C电商脱敏数据集:设计思路、脱敏方案与实战场景
  • STM32+MAX30102实现心率血氧检测与OLED显示实战
  • Matlab调用SBDART做辐射传输计算:从原理到实战全解析
  • MATLAB调用SBDART辐射传输模型:从解压到批量跑通
  • Zabbix与Prometheus监控体系实战:从部署到告警全解析