ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

MinerU 文档解析:离线部署 实战手册

MinerU 文档解析:离线部署 实战手册 MinerU 文档解析离线部署 实战手册【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU处理一份 40 页的扫描版合同传统 OCR 管线平均要跑 6 分钟公式和表格还容易丢失。MinerU 文档解析工具将 PDF、扫描件与 Office 文档转为结构化的 Markdown 与 JSON。读完本文你可以在 GPU 机器、纯 CPU 机器或远程推理环境中独立完成安装并跑通首次文档转换。安装并跑通首个文档转换MinerU 文档解析在任意机器上都能走通最小路径步骤如下。uv pip install mineru[all] mineru -p ./demo.pdf -o ./output-p指输入文件或目录-o指输出目录。首次运行会自动下载所需模型国内网络访问 huggingface 不稳定时将MINERU_MODEL_SOURCE设为modelscope切换到国内镜像源。运行结束后输出目录中按文档名生成子目录内含 Markdown、content_list.json与提取的图片。按使用场景选择解析配置GPU 机器启用高精度解析适用条件拥有 NVIDIA GPU显存 8GB 起步或 Apple Silicon本机直接推理。启用方式默认后端即hybrid-engine安装mineru[all]后无需额外配置。效果指标按官方快速入门给出的 OmniDocBench v1.6 基准端到端 Overall 得分从 86.47 升至 95.39high 强度。纯 CPU 机器启用离线解析适用条件服务器或内网终端没有可用显卡。启用方式在命令中追加-b pipeline走纯 CPU 的小模型组合。效果指标完全离线即可产出结果首次运行配置MINERU_MODEL_SOURCE后模型来自国内源完成 MinerU 离线部署。边缘设备连接远程推理服务适用条件本机显存不足2GB 以下但网络可达一台 OpenAI 兼容的推理服务如 vLLM、SGLang 部署的端点。启用方式安装轻量客户端包mineru用vlm-http-client或hybrid-http-client后端并通过--url传入服务地址。效果指标本机不再加载大模型显存需求从 8GB 降到 2GB 量级。速查解析关键参数参数名控制什么推荐起始值一句话注意事项MINERU_MODEL_SOURCEMinerU 文档解析的模型来源决定首次运行的下载渠道modelscope仅影响下载改后需重新拉模型MINERU_FORMULA_ENABLE公式解析开关false无公式文档纯文本场景关闭可明显加快处理MINERU_TABLE_ENABLE表格结构识别开关true表格密集的报表类文档勿关MINERU_PROCESSING_WINDOW_SIZE单次处理窗口大小64调大会抬高大文档的内存占用MINERU_TASK_RESULT_TIMEOUT_SECONDS客户端等待服务端任务完成的超时秒3600大文档解析需调大否则客户端提前报超时排查部署与运行故障症状大概率原因一步解法CUDA 相关报错、任务初始化失败本机没有满足条件的 GPU命令追加-b pipeline切到纯 CPU 后端中文文本识别成乱码或错字未指定文档语言追加-l ch首次运行长时间卡在模型下载无法访问 huggingface设置MINERU_MODEL_SOURCEmodelscope客户端长时间无结果后退出服务端任务超过默认等待窗口调大MINERU_TASK_RESULT_TIMEOUT_SECONDS延伸阅读快速入门 —— 安装方式、软硬件支持矩阵与后端精度基准命令行工具环境变量说明 —— 全部环境变量与 CLI 参数定义常见问题 FAQ —— 安装与运行期高频故障的处理方案【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表