
免费把 200 页扫描件 PDF 转成可编辑 MarkdownMinerU 只需几分钟【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU一份 200 页的扫描版采购合同附件里还有十几张价格表。你需要它变成可搜索、可编辑的 Markdown交给团队做条款比对。把文件拖进 MinerU 这个开源 PDF 转 Markdown 工具几分钟后正文、表格和公式都已经按原版面排好放在输出目录里等你取用。拿到手就能做的五件事复杂版面 PDF 转 Markdown / JSON扫描件自动识别走 OCR 提取文字表格自动检测输出 HTML 格式数学公式转成 LaTeX 文本支持中英混排等 84 种语言200 页扫描合同从上传到拿结果安装开源 PDF 工具 MinerU 后快速开始指南里写了在线体验、命令行、本地部署三种方式可以先用在线版评估效果。把合同拖进解析界面的上传区界面上方列出了支持的文档类型PDF、Word、PPT、Excel、图片合同原件直接上传即可。任务完成后输出目录里会生成 Markdown 与 JSON 两种格式图片单独存图。正文里章条标题变成 Markdown 标题结构价格表转成带行列的 HTML 表格公式变成 LaTeX阅读顺序和原文件一致。50 份合规文档批量转换批量入口在哪命令行工具直接吃目录在终端输入mineru -p 输入目录 -o 输出目录整个文件夹一次跑完每份文件各生成一套结果。场景一法务合同批量结构化之前逐份复制付款条款、责任条款到 Excel每份耗时数小时难免漏行之后整批转换每份合同得到结构化 Markdown直接归档入库、全文检索场景二技术报告与论文表格提取之前手动把论文里 10 张表格重新录入表格软件公式只能截图之后表格自动转 HTML公式转 LaTeX数据直接进表格软件复用扫描件转 MarkdownOCR 如何参与MinerU 会自动判断 PDF 是纯文本还是扫描版扫描件自动进入 OCR 流程无需你手动指定。解析管线按文档分类、版面检测、公式检测、文字识别分阶段处理OCR 只是其中一环输出不理想时也能顺着这个流程定位问题出在哪一段。解析后端怎么选不同后端对结果的精度有明显差异据官方文档解析后端硬件要求精度指标pipeline低纯 CPU 可用86.47vlm / hybrid需要 GPU95.3 左右同一份文档换后端往往比反复调参数见效更快。后端源码见 mineru/backend/。上手入口文档、API 与 MCP从快速开始文档挑一种部署方式在线体验免安装命令行一条命令完成 PDF 转 Markdown本地部署适合长期跑批。需要接入自己的系统或 AI 工具时MinerU 提供 API 服务和 MCP 插件可挂进现有工作流。MinerU 把转换这件重复劳动接过去你只需要处理文档本身。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考