当前位置: 首页 > news >正文

MinerU 文档解析工具上手指南:PDF/Office 转 LLM 可用 Markdown

MinerU 文档解析工具上手指南:PDF/Office 转 LLM 可用 Markdown

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

MinerU 是一款文档解析工具,可将 PDF、图片以及 DOCX、PPTX、XLSX 转化为 Markdown、JSON 等机器可读格式,适合 RAG 检索、Agent 知识库构建与论文整理等场景,安装后一条命令即可完成解析。

快速上手

先用uv安装完整版,mineru[all]包含全部核心功能,兼容 Windows / Linux / macOS:

uv pip install "mineru[all]"

安装完成后直接运行命令行即可开始解析。首次使用会自动下载所需模型文件,之后加载本地缓存:

mineru -p <input_path> -o <output_path>

<input_path>支持本地 PDF / 图片 / DOCX / PPTX / XLSX 文件或目录,<output_path>为输出目录;未传--api-url时,CLI 会自动拉起本地临时服务。默认后端需要 GPU(Volta 及以后架构、约 8GB 显存)或 Apple Silicon,纯 CPU 环境请参考下面第一个场景。

典型使用场景

纯 CPU 环境解析文档

没有 GPU 时,指定pipeline后端即可运行。该后端支持纯 CPU 推理,在 OmniDocBench v1.6 评测中取得 86.47 分:

mineru -p <input_path> -o <output_path> -b pipeline

输出的文本按人类阅读顺序排列,自动去除页眉、页脚、页码,支持扫描件与多栏版面。

启动 MinerU API 服务

如果你的程序需要以接口方式调用解析能力,可以先部署mineru-api。启动后在浏览器访问http://127.0.0.1:8000/docs即可查看 API 文档:

mineru-api --host 0.0.0.0 --port 8000

服务提供健康检查、任务提交与结果获取接口,任务默认保留 24 小时后自动清理,适合嵌入批量处理流水线。

用 http-client 远程推理

GPU 服务器与客户端不在同一台机器时,在服务端启动 OpenAI 兼容推理服务,本地用 http-client 后端连接即可:

mineru -p <input_path> -o <output_path> -b hybrid-http-client -u http://127.0.0.1:30000

其中vlm-http-client是轻量远程客户端,本地不需要安装torch,适合边缘设备;hybrid-http-client则需要本地具备 pipeline 相关依赖。

常用配置速查

下面这些环境变量用于控制模型来源、解析开关与渲染并发,优先级高于命令行参数,在所有命令行工具中都生效:

配置项作用推荐值
MINERU_MODEL_SOURCE模型下载源无法访问 HuggingFace 时设为modelscope
MINERU_FORMULA_ENABLE是否启用公式解析true(默认开启)
MINERU_TABLE_ENABLE是否启用表格解析true(默认开启)
MINERU_TABLE_MERGE_ENABLE是否合并跨页表格true(默认开启)
MINERU_PDF_RENDER_THREADSPDF 渲染 worker 并发数4(默认)
MINERU_PROCESSING_WINDOW_SIZE大文档单次处理窗口大小64(默认)

更细的配置可以编辑用户目录下的mineru.json文件,模型源部分可参考模型源说明。

常见问题

  • 模型下载失败、网络超时:设置export MINERU_MODEL_SOURCE=modelscope切换到 ModelScope 镜像源,详见模型源说明。
  • 没有 GPU 能运行吗:可以,命令后追加-b pipeline即可在纯 CPU 环境解析。
  • 解析结果不符合预期:先查常见问题,仍未解决时提交 issue 并附上样例文件,便于复现排查。

完整参数列表见命令行工具使用说明。

MinerU 用一条命令行就能把复杂文档变成结构化 Markdown/JSON,管线全部开源、可自由扩展。去仓库看完整文档,把文档转换跑起来吧。

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4289472.html

相关文章:

  • Zed 安装配置实战:从一行命令安装到多人协作
  • STM32F746上基于CubeMX和TouchGFX的GUI移植实战指南
  • AI Chatbox与Dashboard:别用聊天框替换仪表盘
  • 2026 新闻事件 AI 传导分析:一键生成因果树看懂地缘与市场连锁反应
  • 数学建模竞赛:用Matplotlib打造专业图表的高效实战指南
  • Crawl4AI 实战手册:从安装到并发爬取、动态页面与结构化提取的完整路径
  • Dify实战:从部署到API发布,搭建简历筛选Agent工作流
  • 电子商务服装产品分类数据集
  • Hermes Agent 文献检索与论文写作实战指南
  • AI编程与工程实践:从AI Agent到团队效能重构的完整指南
  • 3D打印积木全攻略:FDM公差控制与参数调优实战指南
  • PowerToys文本提取器:3步提取屏幕任意文字
  • 用Nucleo板载ST-LINK V3调试外部STM32芯片全攻略
  • PaddleOCR 设备铭牌识别实战指南:从三步上手到结构化提取与调优
  • 如何本地运行 Prompt Engineering Guide:新手完整上手指南
  • Scrapling 网络爬虫:从零安装到首次成功抓取只要 5 分钟
  • Python飞机大战游戏开发全解析:从Pygame入门到项目实战
  • DeerFlow 2.0完整上手指南:能深度研究、写代码、出图图的开源Agent框架一次讲清
  • 预训练阶段剪枝新思路:IDEA Prune的集成放大与稀疏化实践
  • MySQL+SQLAlchemy+PyTorch:构建数据科学项目从存储到建模的工程化流水线
  • Opus 5 能“手搓 3A”吗?拆解 AI 游戏开发的真实边界
  • Taste-Skill完全指南:如何让AI生成的前端摆脱模板感
  • no-mistakes ask-user机制完整指南:哪些判断永远留在你手里
  • 前端性能优化从指标到实战:面试官真正想听的逻辑与排查思路
  • 3 条指令出图:用 Hermes Agent 做数据可视化要多久
  • 四端子卡扣式铝电解电容:电压等级扩展如何重塑DC-Link选型
  • Code Stitcher:如何把LLM输出安全、可回滚地应用到本地代码库
  • PayloadsAllTheThings 实战指南:渗透测试 payload 库如何用在 3 个真实测试场景
  • 论文降重和降AI别硬扛,我按三类工具搭配着来
  • GICv3 ITS 翻译表实战:搞懂 MSI 中断路由的 5 个关键点