
MinerUPDF 解析与 Markdown 转换引擎——5 分钟跑通首次解析【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 是一个开源免费的 PDF 解析引擎把 PDF、Office 文档和图片转成结构化 Markdown 与 JSON。适合需要搭建 RAG 知识库、提取公式表格、做文档归档的用户。核心能力速览PDF 解析能力清单下面列出 MinerU 的主要输入与输出能力PDF 解析输入 PDF 或图片按正文、公式、表格、图片拆分页面上的内容块保留阅读顺序公式转 LaTeX文档中的数学公式区转成 LaTeX 源码可编辑、可重新排版表格转 HTML识别表格结构并转成 HTML支持跨页表格合并Office 文档解析原生支持 DOCX、PPTX、XLSX 输入输出格式与 PDF 一致结构化 JSON 输出同步生成带 bbox 与阅读顺序的中间 JSON供二次开发和质检多语言 OCR支持中、英、日、韩、阿拉伯文等 100 多种语言的识别下图是项目整体结构展示了各模块在解析链路中的位置最小安装与首次 PDF 解析用 uv 安装两行完成。网络较慢时可改用 pip 加国内镜像源也提供 Docker 与源码安装方式pip install uv uv pip install -U mineru[all]执行完成后终端会提示安装成功mineru命令即可使用。再指向一份本地 PDF 做首次解析mineru -p demo.pdf -o output执行后output/目录会生成以输入文件命名的文件夹里面有demo.md、demo_middle.json、demo_layout.pdf和存放提取图片的images/子目录。md 是最终结果JSON 是结构化中间数据layout.pdf用于可视化检查版面切分。未传--api-url时CLI 会自动拉起一个本地临时的mineru-api服务不需要额外部署。首次运行会自动从模型源下载模型所以第一次解析明显慢于后续。完整参数列表见命令行工具使用说明。内部流程从 PDF 输入到 Markdown 输出默认后端是hybrid-engine先取 PDF 自带文本层再用视觉语言模型VLM能同时看图和读文字的 AI 模型补齐版面、公式与表格。纯 CPU 环境可换-b pipeline只依赖 OCR 和版面检测模型。每一页先按类型拆成内容块标注 bbox 与阅读顺序再转换成 Markdown 与中间 JSON。下图是一页的版面检测结果每个色块对应一个内容块场景化配置建议后端与参数选择学术文献批量解析公式转 LaTeX如果需要批量解析带数学公式的论文推荐pipeline后端CPU 即可稳定运行mineru -p ./papers -o ./out -b pipeline -l ch指定-l ch会提升中文文档的识别准确率公式统一以 LaTeX 格式输出。企业文档归档目录输入批量文档解析如果需要定期归档一批技术文档直接把目录传给-pCLI 会逐个解析其中所有受支持的文件。多机、多 GPU 场景可以改用mineru-api以服务形式启动通过接口调用。个人快速提取按页码区间解析如果只需要其中几页用-s和-e限定页码区间从 0 开始。不需要表格时用-t false关闭不需要公式时用-f false关闭都能缩短耗时。三种场景的配置对比场景推荐配置预期效果学术文献批量解析-b pipeline-l chCPU 可跑公式输出 LaTeX企业文档归档目录输入 mineru-api服务整目录一次解析可接口调用个人快速提取-s 0 -e 9-t false只解析目标页减少耗时常见坑位与快速排错模型下载与大文件模型下载超时默认模型源是 HuggingFace国内网络经常不通 →export MINERU_MODEL_SOURCEmodelscope切换模型源再用mineru-models-download预先下载。大 PDF 解析慢或内存吃紧默认整份文档一次解析 → 用-s、-e按页码区间分段跑例如-s 0 -e 99一批。特定语言识别率低未指定 OCR 语言 → 中文文档加-l ch仅对 pipeline 后端生效。更多输出文件的字段说明可以看输出文件说明。结尾MinerU 覆盖了 PDF 解析从版面检测到 Markdown 与结构化 JSON 输出的主链路并提供多个后端适配不同硬件。从手头一份小 PDF 开始试一次再打开layout.pdf核对分块结果即可。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考