ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

0.3B Dolphin 文档解析模型量化部署指南:从 BF16 到 TensorRT-LLM 完整教程

0.3B Dolphin 文档解析模型量化部署指南:从 BF16 到 TensorRT-LLM 完整教程 0.3B Dolphin 文档解析模型量化部署指南从 BF16 到 TensorRT-LLM 完整教程【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin在单卡 GPU 上批量把扫描版报告转成结构化 Markdown 时Dolphin 这个 0.3B 文档解析模型是性价比最高的选择权重 BF16 下仅约 0.6GB再叠加 vLLM、TensorRT-LLM 等量化加速方案可进一步压低耗时与显存低配服务器也能跑批量文档解析。 项目速览一个模型干完两阶段文档解析DolphinDocument Image Parsing via Heterogeneous Anchor PromptingACL 2025是字节跳动开源的轻量文档解析模型第一阶段按自然阅读顺序生成整页元素序列布局分析第二阶段对文本、表格、公式、代码等元素用异构锚点提示做并行解码直接输出带 bbox 和阅读顺序的 JSON 与 Markdown。当前主线版本为 3B 的 Dolphin-v2低配场景推荐 0.3B 的 Dolphin-1.5OmniDocBench (v1.5) 总体得分 85.06。部署方案怎么选PyTorch、vLLM、TensorRT-LLM 对比结论先行开发调试和小批量用仓库原生 BF16 推理线上高并发选 vLLM单卡性能拉满选 TensorRT-LLM。方案精度/量化形式耗时特性显存特性适用场景原生 Transformers本仓库默认BF16GPU 自动启用基准速度权重约 0.6GB 激活缓存随批量线性增长开发调试、小批量试跑、低显存兜底vLLM官方已支持FP16/BF16可开启 vLLM 内置量化连续批处理批量吞吐显著提升略高于原生预留 KV cache在线服务、高并发文档解析流水线TensorRT-LLM官方已支持INT8/FP8 量化引擎单卡耗时最低占用最小极致单卡性能、大规模生产各方案的实测耗时与显存数字以仓库官方部署文档为准deployment/vllm/ReadMe.md与deployment/tensorrt_llm/ReadMe.md版本记录见 README_CN.md 更新日志。量化会损失少量精度选型时以精度是否满足验收基线为准不要只看速度。 快速上手4 步跑通 Dolphin 文档解析环境要求Linux NVIDIA GPUAmpere 及以上支持 BF16 更佳、Python 3.9匹配 requirements.txt 中 torch 2.6.0 / transformers 4.51.0 环境、约 6GB 可用显存可跑 0.3B 模型。克隆仓库并安装依赖# 克隆仓库并安装全部依赖 git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin pip install -r requirements.txt下载预训练模型Dolphin-1.50.3B# 用 Hugging Face CLI 下载 Dolphin-1.5 模型到本地 huggingface-cli download ByteDance/Dolphin-1.5 --local-dir ./hf_model单页试跑确认链路正常# 解析一页文档输出同名 JSON 与 Markdown 到 results python demo_page.py --model_path ./hf_model --input_path ./demo/page_imgs/page_1.png --save_dir ./results批量解析并开启并行元素解码# 批量解析 demo 目录全部样张8 个元素并行解码 python demo_page.py --model_path ./hf_model --input_path ./demo/page_imgs --save_dir ./results --max_batch_size 8仓库内置样例可直接验证输入页面级样例demo/page_imgs/page_1.png元素级脚本 demo_element.py 支持table/formula/text/code四类。⚡ 关键参数调优量化参数怎么选参数作用推荐值影响--max_batch_size第二阶段同类型元素的并行解码数demo_page.py 默认 4先 4显存余量足逐步提到 8越大吞吐越高、显存占用越高OOM 时第一个调它推理精度GPU 下自动走 BF16CPU 回退 FP32脚本内已处理保持 BF16 为量化起点量化引擎INT8/FP8均从 BF16 基线转换精度对比也以此为准模型版本0.3BDolphin-1.5与 3BDolphin-v2二选一显存 ≤8GB 选 0.3B追求精度上限选 3B0.3B 总体 85.06 / 3B 总体 89.78OmniDocBench v1.53B 显存与耗时成本约为前者数倍补充一点--post_process开关会对输出做后处理清洗接入下游管道前建议开一次对比效果PDF 输入会按页拆成图片逐页解析页码多时耗时线性叠加这是正常行为。 效果验证怎样算部署成功精度基线官方 OmniDocBench v1.5 实测量化部署不应显著低于此水平指标Dolphin 1.0Dolphin-1.5总体得分 ↑74.6785.06文本编辑距离 ↓0.1250.085公式 CDM ↑67.8579.44表格 TEDS ↑68.7084.25阅读顺序编辑距离 ↓0.1240.071用元素级脚本抽验结构恢复能力看输出是否完整# 元素级解析表格样例打印识别结果便于肉眼核对 python demo_element.py --model_path ./hf_model --input_path ./demo/element_imgs/table.jpg --element_type table --print_results验收标准满足全部才算部署成功save_dir下生成与输入同名的 JSON 和 Markdown 文件Markdown 阅读顺序与原页视觉顺序一致对照demo/page_imgs/page_1.png人工抽查表格、公式、代码块内容完整无缺行对照上方样图抽查批量跑demo/page_imgs全程无 OOM单页耗时稳定量化引擎与原生 BF16 对同一页抽样对比关键内容无丢失。️ 故障速查部署报错怎么办错误现象可能原因解决命令CUDA out of memory--max_batch_size过大或页面元素密集降为--max_batch_size 2或换 TensorRT-LLM 量化引擎模型全跑在 CPU 上、速度极慢驱动与 torch 版本不匹配按 requirements.txt 重装pip install -r requirements.txttorch 2.6.0模型目录文件只有几百字节git lfs 未启用下载到的是 LFS 指针文件git lfs install后重新下载或改用huggingface-cli download ByteDance/Dolphin-1.5 --local-dir ./hf_modelhuggingface-cli: command not found未安装 huggingface_hubpip install huggingface_hubPDF 报Failed to convert PDFPDF 加密或页面结构异常先用 pymupdf依赖已内置渲染为 PNG 再输入bad case 可在 issue 区提交vLLM 与 TensorRT-LLM 的完整部署命令、引擎构建流程见仓库deployment/vllm/ReadMe.md和deployment/tensorrt_llm/ReadMe.md官方 README 更新日志中有对应版本记录。建议先跑通上面的原生 BF16 流程确认输出无误再切换到量化方案遇到模型解析 bad case直接到项目 issue 区提交官方在持续优化。【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表