ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Dolphin:3步跑通轻量级文档解析

Dolphin:3步跑通轻量级文档解析 Dolphin3步跑通轻量级文档解析【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin你是做文档数字化的同学每周要处理几百份合同PDF文字、表格、公式搅在一起OCR完还得手动拼阅读顺序经常错。Dolphin是字节跳动推出的轻量级文档解析模型能把文档图片和PDF解析成结构化的Markdown和JSON文字、表格、公式、代码块按自然阅读顺序逐个拆出来。关键是不挑显卡Dolphin-1.5只有0.3B参数代码同时支持GPUbfloat16和CPUfloat推理普通工作站先跑通流程没问题。本文只讲一条推荐路径用Hugging Face Transformers跑起来把第一份PDF解析成Markdown。认识Dolphin两阶段架构怎么拆文档DolphinDocument Image Parsing via Heterogeneous Anchor Prompting由字节跳动发布论文被ACL 2025接收。它最核心的技术是异构锚点提示模型先做页面级布局分析按自然阅读顺序生成元素序列再给不同元素配上各自的任务提示词并行解析表格、公式、代码各有提示比整页当一段文本硬翻要稳得多。版本上从0.3B的Dolphin-1.5升级到3B的Dolphin-v2新增了21类元素检测、属性字段提取和拍照文档的专门处理。手把手跑通Dolphin文档解析从装环境到第一页 本节只讲一条推荐路径HF Transformers直接推理想用vLLM或TensorRT-LLM进一步提速的话参考官方仓库更新日志里的部署说明即可。三步装好运行环境克隆仓库、安装固定版本依赖、下载预训练模型一次做完。# 克隆仓库并安装依赖 git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin pip install -r requirements.txt # 下载预训练模型 Dolphin-v2 pip install huggingface_hub huggingface-cli download ByteDance/Dolphin-v2 --local-dir ./hf_model跑完你应该看到./hf_model目录下是完整的模型权重依赖固定在torch 2.6.0、transformers 4.51.0不用操心版本冲突。用demo图片跑通第一页先用仓库自带的样例图验证链路。这张是仓库附带的文档页公式和正文混排挺能说明问题python demo_page.py \ --model_path ./hf_model \ --save_dir ./results \ --input_path ./demo/page_imgs/page_1.png跑完你应该看到results下出现page_1.json元素坐标文本、page_1.md可直接阅读的Markdown和一张带框的布局可视化图。接入自己的PDF做批量解析页面级解析直接收PDF多页文档自动逐页拆分再按页码合并成一份组合JSON和完整Markdown。# 单份PDF python demo_page.py --model_path ./hf_model --save_dir ./results \ --input_path ./my_docs/contract.pdf # 整目录批量8个元素并行解码 python demo_page.py --model_path ./hf_model --save_dir ./results \ --input_path ./my_docs --max_batch_size 8跑完你应该看到目录里的图片和PDF被依次处理--max_batch_size控制一次并行解码的元素数默认4显存紧就调小富余就调大提速。只解析单张表格或公式的话改用demo_element.py并指定--element_type可以跳过布局阶段。看看解析效果官方基准成绩一览官方OmniDocBenchv1.5基准上三个版本并排Text Edit越低越好Table TEDS越高越好模型参数Overall↑Text Edit↓Table TEDS↑Dolphin0.3B74.670.12568.70Dolphin-1.50.3B85.060.08584.25Dolphin-v23B89.780.05487.02说点实话1.5到v2文本错误率降了三成多表格提升两个点以上但v2参数翻了10倍显存门槛跟着上去具体以官方benchmark和你自己的机器为准。实际用起来布局和阅读顺序很稳Markdown输出基本能直接读上生产前建议拿自己业务的页面跑20页重点人工核对公式和表格。踩坑速查Dolphin常见问题一行解法 显存不够调小--max_batch_size默认4试2或1吃显存的是并行元素解码不是模型本身下载模型失败或机器无外网在能联网的机器上下载好整个目录拷贝到./hf_modelCPU上跑得很慢CPU只是兜底且走float32验证流程够用生产请用GPU的bfloat16歪斜页面解析成乱片代码检测到框重叠过高会自动降级整页解析distorted_page模式不必手动干预仓库就是你文首克隆的那个地址。按这三步走今天就能把第一份PDF变成Markdown。碰到模型解析翻车的case官方issue区欢迎你贴出来一起修。【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表