当前位置: 首页 > news >正文

MinerU:3 条命令把 PDF 和 Office 文档解析成 Markdown/JSON

MinerU:3 条命令把 PDF 和 Office 文档解析成 Markdown/JSON

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

MinerU 是一个开源文档解析引擎,把 PDF、图片、DOCX、PPTX、XLSX 转成带阅读顺序的 Markdown 与 JSON,供大模型和 RAG 系统直接消费。默认的 pipeline 后端在纯 CPU 上就能运行,GPU 场景最低 4GB 显存。

能力速览

  • 5 种格式原生进:PDF、图片、DOCX、PPTX、XLSX 直接解析,Word 和 Excel 不再需要先转成 PDF。
  • 公式转 LaTeX、表格转 HTML:公式和表格自动识别成可编辑的结构化内容,支持跨页表格合并。
  • 109 种语言 OCR:自动检测扫描件和乱码 PDF,并启动 OCR。
  • 4GB 显存或纯 CPU 可用:pipeline 后端支持纯 CPU 环境,官方文档标注 OmniDocBench v1.6 综合分为 86.47。

3 条命令跑起解析:零配置上手

安装

pip install --upgrade pip pip install uv uv pip install -U "mineru[all]"

mineru[all]包含全部核心功能,兼容 Windows / Linux / macOS,要求 Python 3.10–3.13。首次运行会自动下载模型;无法访问 HuggingFace 时执行一行export MINERU_MODEL_SOURCE=modelscope切到国内模型源即可。

跑第一个文件

mineru -p ./demo/pdfs/demo1.pdf -o ./output

输入路径也可以是目录,批量文件会按文件名分别输出。每个文件会生成主.md文件、images/图片目录、含坐标与阅读顺序的.json,以及用于质检的layout.pdf布局可视化文件。没有 GPU 时加-b pipeline强制走 CPU 后端。

后端按硬件和精度需求选择:

后端资源要求适用场景
pipeline纯 CPU 或 4GB 显存通用 PDF 解析
hybrid / vlm8GB 显存复杂版式、更高精度
*-http-client2GB 显存对接已有 OpenAI 兼容服务

引擎室:流水线如何解析一页

pipeline 后端是一条模块化流水线,每个环节由专门的小模型负责,主流程编排在 mineru/backend/pipeline/,数据流向如下:

布局检测先定位每一块内容

布局模型(如mineru/model/layout/pp_doclayoutv2.py)输出每个内容块的位置、类型和阅读顺序,页眉、页脚、页码在这一步被剥离,多栏版式按人类阅读顺序重排。

公式与表格各走专属模型

文本块再分流给专用模型:公式模型把数学符号转成 LaTeX,表格恢复模块 mineru/model/table/rec/ 支持有线和无线表格,输出 HTML;扫描件则走 OCR 通道完成 109 语言识别。

精度不够时切换 hybrid 或 vlm 后端

对复杂文档,可选 1.2B 参数的 MinerU2.5-Pro VLM 做端到端解析。官方标注其 OmniDocBench v1.6 综合分为 95.39,明显高于 pipeline 的 86.47,代价是 8GB 显存起步。

进阶玩法:从单文件到流水线

批量目录解析:把-p指向目录(如./demo/pdfs),批量推理采用流式写盘,解析完成的文件即时落盘,适合整本论文或整批报告的转换。

接入 API 与多卡调度:启动mineru-api --host 0.0.0.0 --port 8000后,POST /tasks提交任务并返回task_idGET /tasks/{task_id}/result取结果,服务实现见 mineru/cli/fast_api.py;再加一层mineru-router即可做统一入口和多 GPU 负载均衡。

精度与速度二选一:hybrid 后端提供effort参数,两档实测对比如下:

effort相对 high 的分数损失解析提速
medium0.13 分35%~220%

官方默认使用medium,需要图像分析或最高精度时切回high

如果你手头有一批格式诡异的 PDF,不妨先跑一遍仓库里的demo1.pdf,生成的layout.pdf会把每页的块位置和阅读顺序标出来,解析质量一眼可查。

  • 完整使用指南
  • FAQ 常见问题
  • 源码入口

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4294348.html

相关文章:

  • 什么是claude-obsidian?开源AI第二大脑完全入门指南
  • Godot 3D 模型材质切换指南:3 步实现完整换装与状态替换
  • 2019前端校招笔试全解析:JavaScript/ES6与工程化考点拆解
  • 从机器人税看AI自动化:开发者如何守住人类决策边界
  • 基于ROS 2 Jazzy的端到端机械臂抓取系统实战:从选型到调试全解析
  • 欢聚时代2018校招前端A卷深度解析:从JS基础到工程化实战
  • 数据中心延期与能源瓶颈:AI开发者如何应对算力不确定性
  • 蓝桥杯国赛Java真题解析:从算法思维到工程实践的深度破局
  • 蓝桥杯嵌入式国赛DHT11驱动实战:STM32单总线通信与避坑指南
  • 网易游戏客户端笔试核心考点:C++、算法与网络同步解析
  • 浩鲸科技数据开发笔试C卷解析:SQL、Hive与数仓建模核心考点
  • Hermes Agent 多智能体协作指南:如何组一支能交付的队
  • 从蓝桥杯算式问题看全排列算法:next_permutation与DFS深度解析
  • ROS通信核心:roscpp实现Topic与Service的C++编程实战
  • Flutter for OpenHarmony 实战:HarmonyOS ArkTS API 24 MD5/SHA1 生成器
  • Coze多Agent协作:从单智能体到AI团队的工作流编排
  • 单片机波形发生器设计:从51到STM32,软硬件实现与Proteus仿真全解析
  • 数学建模竞赛排队论实战:从M/M/c模型到Matlab仿真工具箱
  • 2026年国内数字人OEM贴牌服务商TOP10榜单:品牌合作选型实用参考
  • 动态规划核心思想与解题框架:从爬楼梯到背包问题实战解析
  • Elasticsearch 高频面试题及详细答案
  • 数学建模实战:无线网络功率分配优化问题建模与线性规划求解
  • 基于YOLOv5与PyQt的行为识别实战:从数据标注到桌面应用开发
  • 分布式锁与 CAP 理论:底层机制、CP/AP 权衡与选型破局之道
  • 两年经验前端字节面试复盘:基础扎实比炫技更重要
  • 前端校招大厂面经:字节阿里腾讯美团四家offer全复盘
  • 前端暑期实习面试全攻略:从基础原理到实战复盘
  • 单片机模块化编程实战:从蓝桥杯竞赛到嵌入式开发的工程思维
  • JavaWeb全栈实战:从SSM整合到电商系统开发核心解析
  • 企业如何做好AI搜索获客?拓氪科技三层工程体系助力长效获客?