1B 参数跑赢 72B VLM:MinerU PDF 转 Markdown 低显存完整指南
1B 参数跑赢 72B VLM:MinerU PDF 转 Markdown 低显存完整指南
【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU
把带公式和表格的 PDF 喂给 RAG,最怕转出来的 Markdown 排版散架、表格丢失,而大模型方案又常被显存劝退。MinerU 走的是另一条路:用 1B 级小模型配合模块化流水线做 PDF 转 Markdown 文档解析,最低 6G 显存、纯 CPU 也能跑,单页约 0.8 秒。下面从一条命令跑通讲起,顺带说清它为何能逼近 72B 大模型的效果,以及显存怎么选。
一条命令,先把 PDF 跑通
安装与环境准备
MinerU 提供全平台支持(Windows / Linux / macOS),用 uv 安装最省事:
uv pip install -U "mineru[core]" export MINERU_MODEL_SOURCE=modelscope第二行是给国内用户的建议:把模型源切到 ModelScope,首次运行时会自动下载所需模型并走本地缓存,后续直接用缓存。模型源机制详见 docs/zh/usage/model_source.md。
解析一条命令,产出三种文件
mineru -p ./demo/pdfs/demo1.pdf -o ./output输入可以是单个 PDF,也可以是目录。输出遵循标准化目录结构(详见 docs/zh/reference/output_files.md):
*.md:按阅读顺序排好版的 Markdown,公式转 LaTeX、表格转 HTML*.json:带坐标和语义信息的结构化数据,方便二次开发images/:从文档中提取出的图片资源
示例文件可直接用仓库里的 demo/pdfs/demo1.pdf,一篇典型的学术论文,公式、跨页表格、图表都齐全。
1B 小模型凭什么打过大模型
答案不在"模型更大",而在"分工更细"。72B 视觉大模型要靠一个模型端到端硬扛所有环节,而 MinerU 把解析拆成流水线,每个小模型只负责自己最擅长的一段。整体架构见 mineru/backend/pipeline/:
模块化流水线:每环节只干一件事
每个环节都能单独优化、单独升级,互不影响:布局检测模型在 mineru/model/layout/pp_doclayoutv2.py 中区分 25 类版面元素(页眉页脚、公式、表格、竖排文本、印章等),先框清楚"这是什么、在哪、按什么顺序读";文字识别由 mineru/model/ocr/ 下的 PaddleOCR 系模型承担,OCR 支持 109 种语言;公式交给 mineru/model/mfr/unimernet/ 里的 Unimernet 转成 LaTeX;表格走 mineru/model/table/,针对无线表格的恢复准确率达 98.7%。
先看检测效果,再看识别结果
下面这张图就是真实检测输出:不同色块代表不同版面类型,右上角数字是阅读顺序,公式和表格被单独框出并转成 LaTeX。
跑 pipeline 后端还会额外产出 span 级别的可视化文件,方便排查文字丢失、行内公式识别等细节问题:
显存与效果:拿数据对照
后端怎么选,显存差多少
| 解析后端 | 硬件要求 | 适用场景 |
|---|---|---|
| pipeline | 纯 CPU 或 6G 显存 GPU | 通用文档解析 |
| vlm-transformers | 8G 显存 GPU | 复杂版式解析 |
| vlm-vllm | 10G 显存 GPU | 批量处理任务 |
大多数普通用户用默认的 pipeline 后端就够了,消费级显卡甚至纯 CPU 都能驱动;文档量大、版式复杂时再上 VLM 后端。Docker 方式的一键部署见 docs/zh/quick_start/docker_deployment.md,Linux / WSL2 都支持。
速度、公式、表格的硬指标
- 单页 PDF 处理约 0.8 秒,传统 VLM 方案约 2.3 秒/页,整体快约 30 倍
- 复杂公式保留率 99.1%(传统工具约 92%)
- 跨页表格完整性 97.3%(传统工具约 68%),被截断的表格会自动拼接
- 最低 6G 显存即可运行
进阶玩法与生态
不想敲命令?起个网页界面
mineru-gradio --server-port 7860启动 Gradio 可视化界面,浏览器里拖文件、看结果,适合先试效果再决定是否上生产,更多交互方式见 docs/zh/usage/quick_usage.md。
接入 RAG 与工作流
解析出的 Markdown/JSON 可以直接喂给 Dify、RAGFlow、FastGPT 这类知识库框架,仓库文档里按工具整理了接入步骤:
批量任务还可以走 vllm 后端做分布式推理:张量并行突破单卡显存限制、PagedAttention 管 KV 缓存,服务端实现在 mineru/cli/vlm_server.py,配合 docs/zh/usage/advanced_cli_parameters.md 里的--max-num-batched-tokens等参数在速度和精度之间做取舍。
换模型、改输出、多卡扩展
- 新增 OCR 模型:继承 mineru/model/utils/pytorchocr/base_ocr_v20.py 基类,扩展流程参考 docs/zh/quick_start/extension_modules.md
- 自定义输出格式:改 mineru/backend/pipeline/pipeline_middle_json_mkcontent.py 这一处
- 多卡 / 多服务部署:仓库内置
mineru-router,接口与mineru-api兼容,支持任务自动负载均衡,入口在 mineru/cli/router.py
延伸资料
从一条命令到多卡集群,MinerU 的完整解析链路都摆在上面这些路径里,按自己的显存和文档量挑一个后端跑起来就行。
- 快速上手:docs/zh/usage/quick_usage.md
- 进阶 CLI 参数:docs/zh/usage/advanced_cli_parameters.md
- Docker 部署:docs/zh/quick_start/docker_deployment.md
- 输出文件说明:docs/zh/reference/output_files.md
- 常见问题:docs/zh/faq/index.md
- 源码入口:mineru/
【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
