MinerU
高精度文档解析引擎,将PDF、Office文档、图片等转换为结构化的Markdown/JSON,专为LLM RAG和Agent工作流设计。亮点:原生支持DOCX/PPTX/XLSX解析,提供pipeline和VLM双引擎,准确率在OmniDocBench上达95%+;集成LangChain、Dify等主流框架,支持国产芯片离线部署。采用MinerU开源许可证(基于Apache 2.0)。
README
🚀立即使用 MinerU → ✅ 零安装网页版 ✅ 全功能桌面客户端 ✅ 即时 API 访问;跳过部署繁琐,一键获取全部产品格式。开发者,快来体验!
MinerU — 面向 LLM · RAG · Agent 工作流的高精度文档解析引擎 将 PDF · DOCX · PPTX · XLSX · 图片 · 网页转换为结构化 Markdown / JSON · VLM+OCR 双引擎 · 109 种语言MCP Server · LangChain / Dify / FastGPT 原生集成 · 支持 10+ 国产 AI 芯片
🔍 核心解析能力
- 原生支持
DOCX、PPTX和XLSX解析 - 公式 → LaTeX · 表格 → HTML,精确的布局重建
- 支持扫描件、手写内容、多栏布局、跨页表格合并
- 输出遵循人类阅读顺序,自动移除页眉/页脚
- VLM + OCR 双引擎,109 种语言的 OCR 识别
🔌 集成方式
| 使用场景 | 解决方案 |
|---|---|
| AI 编程工具 | MCP Server — Cursor · Claude Desktop · Windsurf |
| RAG 框架 | LangChain · LlamaIndex · RAGFlow · RAG-Anything · Flowise · Dify · FastGPT |
| 开发集成 | Python / Go / TypeScript SDK · CLI · REST API · Docker |
| 零代码 | mineru.net 在线 · Gradio WebUI · 桌面客户端 |
🖥️ 部署方式(私有 · 完全离线)
| 推理后端 | 最佳适用场景 |
|---|---|
| pipeline | 快速稳定,无幻觉,可运行于 CPU 或 GPU |
| vlm-engine | 高精度,支持 vLLM / LMDeploy / mlx 生态 |
| hybrid-engine | 高精度,原生文本提取,低幻觉 |
国产 AI 芯片:昇腾 · 寒武纪 · 燧原 · 沐曦 · 摩尔线程 · 昆仑芯 · 天数智芯 · 海光 · 壁仞 · 平头哥
更新日志
2026/06/18 v3.4 发布
本次发布专注于 pipeline 后端的 OCR 能力升级、OCR 处理流程优化以及模型下载体验改进。主要更新包括:
OCR 模型升级与处理加速
pipeline后端的 OCR 模型升级为PP-OCRv6,在 OmniDocBench v1.6 上 OCR 准确率提升约11%。- 移除了 OCR 语言选择中的日语、繁体中文、英语和拉丁语选项,这些场景将自动路由到
chOCR 模型,简化了模型配置和语言选择。 - 优化了 OCR 推理和处理流水线,OCR 处理速度提升约
100%,显著提高批量文档和 OCR 密集型文档的解析效率。
模型下载逻辑优化
- 新增模型源自动选择功能,首次安装时可依据当前网络环境选择更优的模型源。
- 下载模型前,MinerU 会优先检查本地已下载的模型缓存文件,命中缓存可重复使用,减少重复下载和不必要的远程请求。
- 更多关于模型源配置、自动源选择以及本地模型使用的详细信息,请参考模型源文档。
随着 v3.4 发布,MinerU 进一步提升了
pipeline后端在 OCR 场景下的解析准确率和处理效率,同时优化了模型下载、缓存复用和本地配置回写,使得首次安装、模型更新和多环境部署更加稳定和自动化。2026/06/11 v3.3 发布
本次发布专注于 Hybrid 解析性能优化和 VLM 模型能力升级。主要更新包括:
Hybrid 后端新增
effort解析强度参数- 新增
medium和high两种解析强度级别,允许用户在解析速度、解析精度和功能需求之间进行平衡。 - 在 OmniDocBench v1.6 上,
medium相比high总体准确率仅下降0.13点,但在不同设备和场景下带来35%~220%的解析速度提升:- Linux:文本 PDF 场景提升约
80%,OCR 场景提升约35% - Windows:文本 PDF 场景提升约
90%,OCR 场景提升约45% - macOS:文本 PDF 场景提升约
220%,OCR 场景提升约50%
- Linux:文本 PDF 场景提升约
- Hybrid 后端默认使用
effort=medium,在保持高解析精度的同时显著提升整体解析效率。 medium级别不支持image analysis(图像分析);如需最大解析精度或image analysis支持,请切换到effort=high高强度解析模式,这可能会影响解析速度。
- 新增
VLM 模型升级为
MinerU2.5-Pro-2605-1.2B- 修复了
2604版本的多个模型问题,进一步提升了复杂文档的解析稳定性。 - 新增原生多语言 OCR 支持,减少了额外语言参数配置的需求,提升了多语言文档的开箱即用体验。
- 修复了
随着 v3.3 发布,MinerU 进一步提升了 Hybrid 后端在不同平台和场景下的效率,同时保持高精度解析。默认的
medium强度更适合大多数日常文档处理任务,而high专为需要最大解析精度或image analysis能力的场景设计。2026/04/18 v3.1.0 发布
本次发布专注于许可证开放、解析精度和全格式原生支持。主要更新包括:
- 许可证升级
- MinerU 已正式从
AGPLv3迁移至 MinerU 开源许可证,这是基于Apache 2.0的自定义许可证。 - 这一变更显著降低了社区用户和商业部署的采用门槛,使 MinerU 更易于集成到实际工作流中。
- MinerU 已正式从
- VLM 主模型升级
- 主 VLM 模型升级为
MinerU2.5-Pro-2604-1.2B,整体解析精度达到业界领先水平。 - 新模型现已支持图片和图表解析、截断段落合并、跨页表格合并以及表格内图片识别,进一步强化了复杂文档布局下的性能。
- 主 VLM 模型升级为
- 全格式原生解析支持
- 原生解析支持现已扩展到
PPTX和XLSX。 - MinerU 现在全面支持图片、
PDF、DOCX、PPTX和XLSX的解析,提供更完整的多格式文档理解工作流。
- 原生解析支持现已扩展到
随着 v3.1.0 发布,MinerU 变得更加开放、准确且易于在生产环境中采用。新许可证降低了社区和商业使用的门槛,
MinerU2.5-Pro-2604-1.2B改善了复杂内容的解析质量,原生PPTX/XLSX支持实现了主流文档格式的端到端覆盖。- 许可证升级
2026/03/29 v3.0.0 发布
本次发布围绕解析能力、系统架构和工程可用性进行了系统性升级。主要更新包括:
- 原生
DOCX解析- 正式支持原生
DOCX解析,提供高精度且无幻觉的结果。 - 与传统的先将
DOCX转换为PDF再解析的工作流相比,端到端速度提升了几十倍,更适合对准确率和吞吐量都有要求的场景。
- 正式支持原生
pipeline后端升级pipeline后端在 OmniDocBench(v1.5)上获得86.2分,超过了上一代主流 VLMMinerU2.0-2505-0.9B的准确率。- 新增支持表格内图片/公式解析、印章文本识别、竖排文字支持以及行间公式编号识别,持续提升复杂文档场景的解析质量。
- 在保持高精度的同时,资源占用极低,并继续支持纯 CPU 环境推理。
API / CLI / Router编排升级mineru现在作为基于mineru-api的编排客户端运行;当未提供--api-url时,会自动启动本地临时服务。mineru-api新增异步任务端点POST /tasks,支持任务提交、状态查询和结果获取;同时保留同步解析端点POST /file_parse,用于兼容旧版插件。- 新增
mineru-router,专为统一入口部署和多服务、多 GPU 的任务路由设计;其接口与mineru-api完全兼容,并支持任务自动负载均衡。
- 部署和可用性改进
- 解决了
torch >= 2.8的兼容性问题;基础镜像已升级到vllm0.11.2 + torch2.9.0,统一了不同 Compute Capability 下的安装路径。 - 优化了解析流水线,引入滑动窗口机制,显著降低了长文档场景下的峰值内存使用,使得上万页文档无需再手动拆分。
pipeline中的批量推理现在支持流式写入磁盘,使得完成的解析结果能及时写出,进一步改善了长时间运行任务的体验。- 完成了线程安全优化,现已全面支持多线程并发推理;结合
mineru-router,实现一键多 GPU 部署,轻松构建高并发、高吞吐的解析系统。 - 彻底移除了两个 AGPLv3 模型(
doclayoutyolo和mfd_yolov8)和一个 CC-BY-NC-SA 4.0 模型(layoutreader)的使用。
- 解决了
本次更新不仅是一系列功能增强,更是 MinerU 整体系统能力的关键飞跃。我们特别解决了长文档解析中的峰值内存问题。通过滑动窗口和流式写入磁盘等优化,超长文档解析从“需要手动拆分、小心处理”转变为“稳定、可扩展、开箱即用于生产环境”。同时,我们完成了线程安全优化并全面开启了多线程并发推理,进一步提高了单机资源利用率和高并发负载下的运行稳定性。在此基础上,借助
mineru-router和新的API / CLI编排框架,MinerU 现在支持一键多 GPU 部署、多服务统一接入和任务自动负载均衡,显著降低了大规模部署的难度。因此,MinerU 正从单机数据生产工具演变为面向高并发和高吞吐场景的大规模文档解析基础设施,为企业级文档数据处理提供更稳定、更高效、更易扩展的基础架构。- 原生
📝 查看完整的更新日志,了解更早版本信息
MinerU
项目简介
MinerU 是一款文档解析工具,能够将 PDF、图片、DOCX、PPTX 和 XLSX 输入转换为机器可读的格式(如 Markdown 和 JSON),用于下游的检索、提取和处理。
MinerU 诞生于 InternLM 的预训练过程中。我们专注于解决科学文献中的符号转换问题,希望为大模型时代的技术发展贡献力量。
与成熟的商业产品相比,MinerU 还很年轻。如果您遇到任何问题或结果不符合预期,请在 issue 中提交 issue,并 附上相关文档或示例文件。
https://github.com/user-attachments/assets/4bea02c9-6d54-4cd6-97ed-dff14340982c
主要特性
- 支持
PDF、图片、DOCX、PPTX和XLSX输入。 - 去除页眉、页脚、脚注、页码等,确保语义连贯。
- 按人类可读顺序输出文本,适用于单栏、多栏及复杂布局。
- 保留原始文档结构,包括标题、段落、列表等。
- 提取图片、图片描述、表格、表格标题和脚注。
- 自动识别并转换文档中的公式为 LaTeX 格式。
- 自动识别并转换文档中的表格为 HTML 格式。
- 自动检测扫描版 PDF 和乱码 PDF 并启用 OCR 功能。
- OCR 支持 109 种语言的检测和识别。
- 支持多种输出格式,如多模态和 NLP 的 Markdown、按阅读顺序排序的 JSON,以及丰富的中间格式。
- 支持多种可视化结果,包括布局可视化和跨度可视化,便于高效确认输出质量。
- 内置 CLI、FastAPI、Gradio WebUI,支持本地编排和多服务部署。
- 支持纯 CPU 环境运行,也支持 GPU/MPS 加速。
- 兼容 Windows、Linux 和 Mac 平台。
快速开始
文档解析是一项困难且复杂的任务。在复杂布局、扫描页面和手写内容等场景下,解析结果可能不尽如人意。我们建议先试用在线 demo 来评估 MinerU 的解析质量和适用性,然后根据实际需求选择合适的部署方式。 如果您有解析效果不佳的文档样本,欢迎通过 issue 分享。我们将持续改进解析能力。 如果您遇到任何安装问题,请先查阅 FAQ。
在线体验
官方在线网页应用
官方在线版本与客户端功能相同,界面美观、功能丰富,需要登录使用。
基于 Gradio 的在线 demo
基于 Gradio 开发的 WebUI,界面简洁,仅包含核心解析功能,无需登录。
本地部署
[!WARNING] 安装前注意事项——硬件和软件环境支持
为确保项目的稳定性和可靠性,我们在开发过程中只针对特定硬件和软件环境进行优化和测试。这样可以确保用户在推荐系统配置上部署和运行项目时,获得最佳性能和最少的兼容性问题。
通过将资源集中于主流环境,我们的团队能够更高效地解决潜在 bug 并开发新功能。
在非主流环境中,由于硬件和软件配置的多样性以及第三方依赖的兼容性问题,我们无法保证项目的 100% 可用性。因此,对于希望在非推荐环境中使用该项目的用户,我们建议仔细阅读文档和 FAQ。大多数问题已在 FAQ 中提供了相应的解决方案。我们也鼓励社区反馈,以帮助我们逐步扩大支持范围。
| 解析后端 | pipeline | *-engine | *-http-client | ||
|---|---|---|---|---|---|
| hybrid | vlm | hybrid | vlm | ||
| 后端特性 | 兼容性好 | 硬件要求高 | 适用于兼容 OpenAI 的服务器2 | ||
| 准确率1 | 86.47 | 95.39 (high) 95.26 (medium) |
95.30 | 95.39 (high) 95.26 (medium) |
95.30 |
| 操作系统 | Linux3 / Windows4 / macOS5 | ||||
| 纯 CPU 支持 | ✅ | ❌ | ✅ | ||
| GPU 加速 | Volta 及之后架构的 GPU 或 Apple Silicon | 不需要 | |||
| 最小显存 | 4GB | 8GB | 2GB | ||
| 内存 | 最低 16GB,推荐 32GB 或以上 | 最低 16GB | |||
| 磁盘空间 | 最低 20GB,推荐 SSD | 最低 2GB | |||
| Python 版本 | 3.10-3.13 | ||||
1 准确率指标来自 OmniDocBench(v1.6)的端到端评估总体分数,基于最新版本 MinerU。
2 兼容 OpenAI API 的服务器,例如通过推理框架 vLLM/SGLang/LMDeploy 部署的本地模型服务器或远程模型服务。
3 Linux 仅支持 2019 年及之后发布的发行版。
4 由于关键依赖 ray 在 Windows 上不支持 Python 3.13,因此仅支持 3.10~3.12 版本。
5 macOS 需要 14.0 或更高版本。
安装 MinerU
使用 pip 或 uv 安装 MinerU
pip install --upgrade pip
pip install uv
uv pip install -U "mineru[all]"
从源码安装 MinerU
git clone https://github.com/opendatalab/MinerU.git
cd MinerU
uv pip install -e .[all]
[!TIP]
mineru[all]包含所有核心功能,兼容 Windows / Linux / macOS 系统,适合大多数用户。- 如果在 Windows 上安装后发现 CUDA 加速不可用,请查看 Windows CUDA 加速 FAQ。
- 如果您需要指定 VLM 模型的推理框架,或者计划在边缘设备上仅安装轻量客户端,请参考文档扩展模块安装指南。
使用 Docker 部署 MinerU
MinerU 提供了便捷的 Docker 部署方式,有助于快速搭建环境并解决一些棘手的环境兼容问题。
[!TIP]
- Docker 部署仅在 Linux 和支持 WSL2 的 Windows 环境中受支持;
- macOS 用户请参考上述两种安装方式进行安装,而非使用 Docker 部署。
您可以在文档中获取 Docker 部署说明。
使用 MinerU
如果您的设备满足上表中的 GPU 加速要求,可以使用简单的命令行进行文档解析:
mineru -p <输入路径> -o <输出路径>
如果您的设备不满足 GPU 加速要求,可以指定后端为 pipeline 以在纯 CPU 环境下运行:
mineru -p <输入路径> -o <输出路径> -b pipeline
mineru 目前支持本地 PDF、图片、DOCX、PPTX 和 XLSX 文件或目录输入,并可通过 CLI、API、WebUI 及 mineru-router 进行文档解析。详细说明请参考使用指南。
FAQ
- 如果在使用过程中遇到任何问题,可以首先查阅 FAQ 寻找解决方案。
- 如果问题仍未解决,也可以使用 DeepWiki 与 AI 助手交互,它可以解决大多数常见问题。
- 如果仍无法解决问题,欢迎通过 Discord 或 微信 加入我们的社区,与其他用户和开发者交流。
感谢所有贡献者
许可证信息
本仓库采用 MinerU 开源许可证 进行许可,该许可证基于 Apache 2.0 并附加了额外条件。
致谢
- UniMERNet
- TableStructureRec
- PaddleOCR
- PaddleOCR2Pytorch
- fast-langdetect
- pypdfium2
- pdftext
- pypdf
- magika
- vLLM
- LMDeploy
引用
@article{wang2026mineru2,
title={MinerU2. 5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale},
author={Wang, Bin and He, Tianyao and Ouyang, Linke and Wu, Fan and Zhao, Zhiyuan and Chu, Tao and Qu, Yuan and Jin, Zhenjiang and Zeng, Weijun and Miao, Ziyang and others},
journal={arXiv preprint arXiv:2604.04771},
year={2026}
}
@article{dong2026minerudiffusion,
title={MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding},
author={Dong, Hejun and Niu, Junbo and Wang, Bin and Zeng, Weijun and Zhang, Wentao and He, Conghui},
journal={arXiv preprint arXiv:2603.22458},
year={2026}
}
@article{niu2025mineru2,
title={Mineru2. 5: A decoupled vision-language model for efficient high-resolution document parsing},
author={Niu, Junbo and Liu, Zheng and Gu, Zhuangcheng and Wang, Bin and Ouyang, Linke and Zhao, Zhiyuan and Chu, Tao and He, Tianyao and Wu, Fan and Zhang, Qintong and others},
journal={arXiv preprint arXiv:2509.22186},
year={2025}
}
@article{wang2024mineru,
title={Mineru: An open-source solution for precise document content extraction},
author={Wang, Bin and Xu, Chao and Zhao, Xiaomeng and Ouyang, Linke and Wu, Fan and Zhao, Zhiyuan and Xu, Rui and Liu, Kaiwen and Qu, Yuan and Shang, Fukai and others},
journal={arXiv preprint arXiv:2409.18839},
year={2024}
}
@article{he2024opendatalab,
title={Opendatalab: Empowering general artificial intelligence with open datasets},
author={He, Conghui and Li, Wei and Jin, Zhenjiang and Xu, Chao and Wang, Bin and Lin, Dahua},
journal={arXiv preprint arXiv:2407.13773},
year={2024}
}