ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

如何快速把文档解析成 AI 可用格式:docling 预处理完整指南

如何快速把文档解析成 AI 可用格式:docling 预处理完整指南 如何快速把文档解析成 AI 可用格式docling 预处理完整指南【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling你手里一堆扫描件、老 Word、合同 PDF想直接喂给 RAG结果表格全散架、公式变乱码、标题层级也没了。docling 文档解析工具包就是冲着这个痛点来的把各种格式的文档统一解析成带结构的中间文档再导出成 Markdown、JSON 或纯文本直接对接生成式 AI。30 秒搞清楚 docling 是干嘛的一句话它是一条文档预处理流水线。输入端接 PDF、DOCX、HTML、扫描件图片等格式完整列表见 supported_formats.md中间由版面分析模型把页面切开——哪些是标题、哪些是表格、哪些是图——统一整理成一个叫 DoclingDocument 的结构化对象输出端再导出成 Markdown、JSON、纯文本或 Doctags 等你要的样子。整个过程本地跑完不调任何远程服务。它和 pdfplumber 这类纯文本抽取工具最大的区别后者给你一坨没有结构的字docling 给你的是带标题层级、表格行列关系、阅读顺序的文档骨架而这部分恰恰是喂给 RAG 和 LLM 时最值钱的东西。解析后的文档长这样标题、正文、表格各归各位层级关系清清楚楚装好并跑通第一个例子一行装好macOS、Linux、Windows 都支持pip install docling✅ 装完直接写几行代码from docling.document_converter import DocumentConverter source https://arxiv.org/pdf/2408.09869 # 换成你的文件路径 converter DocumentConverter() result converter.convert(source) print(result.document.export_to_markdown())跑完你会看到终端里直接打印出那篇 arXiv 论文的 Markdown——标题带着 ###表格是标准 Markdown 表格语法公式也还原出来了。注意第一次运行会自动下载版面模型权重模型只下载一次并缓存在本地之后就不用再等不想写代码的话命令行docling 文件路径效果一样。按你的需求往下加默认配置已经能处理常规 PDF遇到下面几种情况加几行配置就行扫描件多、没有文字层OCR 默认就是开的换语言包时改ocr_options.lang论文公式多默认不开公式识别打开后公式会被转成 LaTeX文档自带干净文字层、嫌慢设force_backend_text True跳过版面模型直接读内嵌文本离线环境跑把模型权重提前下好给PdfPipelineOptions传artifacts_path指过去即可批量处理一个目录不用写循环命令行一行docling ./docs_dir --to markdownfrom docling.datamodel.base_models import InputFormat from docling.datamodel.pipeline_options import PdfPipelineOptions from docling.document_converter import DocumentConverter, PdfFormatOption opts PdfPipelineOptions() opts.do_ocr True # 扫描件必开 opts.do_formula_enrichment True # 公式转 LaTeX opts.do_code_enrichment True # 代码块识别 opts.force_backend_text False # 有干净文字层时改 True 提速 opts.ocr_options.lang [chi_sim, en] converter DocumentConverter( format_options{InputFormat.PDF: PdfFormatOption(pipeline_optionsopts)} )提醒一句每多开一个功能耗时都会明显增加只开你真正需要的。容易踩的几个坑下面三个坑基本覆盖了社区的高频问题先对照这里再上网搜能省不少时间。坑一报 ImportError: libGL.so.1现象转第一份 PDF 时直接崩。原因opencv-python 依赖系统 OpenGLDocker 容器和远程服务器默认没装这个库。解法换成 headless 版 opencv下方命令第 1 行或装系统库libgl1。坑二下载模型时 SSL 报 CERTIFICATE_VERIFY_FAILED现象第一次转换 PDF 卡在模型下载抛 URLError。原因环境里的 certifi 证书列表太旧不信任 Hugging Face 的证书。解法升级一下就好命令第 3 行。坑三Intel Mac 装完一跑就崩现象pip 装得干干净净运行时却在 torch 上报错。原因新版 PyTorch 不再提供 Intel Mac 的 wheel能跑的旧版只兼容 numpy 1.x。解法安装时顺手钉住 numpy 版本命令第 5 行。# 坑一换 headless opencv pip uninstall -y opencv-python pip install opencv-python-headless # 坑二刷新证书 pip install --upgrade certifi # 坑三Intel Mac 钉住 numpy pip install docling numpy2.0.0下一步想继续深入按顺序看这三处就够快速开始、支持格式、示例代码。把第一个例子跑通之后剩下的就是按需调优的事了。【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表