ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

ERNIE-Layout 文档智能 Benchmark 全解读:软硬件环境、数据集与超参调优实战指南

ERNIE-Layout 文档智能 Benchmark 全解读:软硬件环境、数据集与超参调优实战指南 人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载导读本文以飞桨产业级模型库PaddlePaddle Models中 modelcenter/ERNIE-Layout/benchmark_cn.md 为核心依据系统梳理文心多语言跨模态布局增强文档智能大模型 ERNIE-Layout 在文档理解四大主流任务上的评测环境、数据集构建、评测指标与完整超参搜索方案。通过本文你将掌握 FUNSD、XFUND-ZH、DocVQA-ZH、RVL-CDIP 四个基准的评测口径与 Grid Search 调参细节了解如何复现 LayoutXLM-Base 与 ERNIE-LayoutX-Base 的对比评测并理解各超参learning_rate、batch_size、warmup_ratio、max_steps、num_train_epochs对任务收敛与最终指标的影响规律为后续在飞桨PaddlePaddle生态中进行文档智能模型的训练与微调提供可直接对照的工程基准。一、模型与基准背景ERNIE-Layout 是百度开源的多语言跨模态布局增强文档智能大模型以文心文本大模型 ERNIE 为底座融合文本、图像、布局等多模态信息进行联合建模创新性引入布局知识增强提出阅读顺序预测、细粒度图文匹配等自监督预训练任务并升级空间解耦注意力机制。相关工作《ERNIE-Layout: Layout-Knowledge Enhanced Multi-modal Pre-training for Document Understanding》被 EMNLP 2022 Findings 收录模型在文档分类、信息抽取、文档问答等多项文档理解任务上效果显著提升相关论文与引用信息可在 modelcenter/ERNIE-Layout/introduction_cn.ipynb 中查看。在模型库中ERNIE-Layout 的模型元信息任务标签、数据集清单、许可协议、论文地址等统一记录在 modelcenter/ERNIE-Layout/info.yaml 中可看到其被归类为自然语言处理/文档分析、文心大模型、跨模态三类任务官方提供 Apache 2.0 开源许可。此外该模型在官方模型总览 docs/official/PP-Models.md 中被描述为多语言跨模态布局增强文档智能大模型。本文所有评测数据均来自模型库中 benchmark_cn.md英文版见 benchmark_en.md评测以两个模型的验证集表现为对比口径。二、评测软硬件环境Benchmark 文档明确给出了 ERNIE-Layout 训练与推理的统一软硬件环境作为复现评测结果的前提条件项目配置GPUTesla V100-SXM2-16GBCUDA10.2cuDNN7.5.1深度学习框架paddlepaddle-gpu 2.3.2该环境信息意味着模型训练与推理均基于16GB 显存的 V100 GPUbatch_size 的搜索范围FUNSD/XFUND-ZH 为 1/2/4与此显存容量直接相关——过大的 batch_size 会导致显存溢出使用Paddle 2.3.2 GPU 版本对应 PaddleNLP 中ernie-layout模型组的适配版本若在本仓库所在环境中复现需保证 Paddle 框架版本与 CUDA/cuDNN 版本匹配否则可能出现算子不兼容或性能回退。需要说明的是该环境为文档记录的评测基准环境实际训练时可结合自身 GPU 显存与驱动版本适当调整评测指标差异主要来自硬件算力与精度不影响调参方法论本身的参考价值。三、评测所用开源数据集Benchmark 共覆盖四个文档智能领域的主流开源数据集覆盖信息抽取、文档视觉问答、文档图像分类三种任务类型涉及中英两种语言数据集任务类型语言说明FUNSD文档信息抽取英文表单理解任务包含版面与键值对抽取XFUND-ZH文档信息抽取中文多语言表单理解数据集的中文子集DocVQA-ZH文档视觉问答中文见下方重新划分说明RVL-CDIP (sampled)文档图像分类英文原始 400K 图片降采样后的子集其中两个数据集需要特别关注其数据构建口径这直接影响评测结果的可比性DocVQA-ZH 的重新划分原始 DocVQA-ZH 榜单原链接为竞赛榜单现已停止提交采用官方训练/测试划分由于无法继续提交榜单评测方将原始训练集重新划分为三部分训练集4,187 张图片验证集500 张图片测试集500 张图片RVL-CDIP 的降采样RVL-CDIP 原始数据集共包含400,000 张图片直接全量训练耗时过长。为验证文档图像分类能力评测方进行降采样得到训练集6,400 张图片验证集800 张图片测试集800 张图片提示上述两个数据集均属于重新划分/降采样版本与原始公开数据集的官方划分不完全一致。复现评测时务必使用与本文相同的划分方式否则指标无法对齐。四、验证集评测结果在文档智能领域主流开源数据集的验证集上LayoutXLM-Base 与 ERNIE-LayoutX-Base 的评测指标如下ModelFUNSDRVL-CDIP (sampled)XFUND-ZHDocVQA-ZHLayoutXLM-Base86.7290.8886.2466.01ERNIE-LayoutX-Base89.3190.2988.5869.57四个任务对应的评价指标分别为FUNSD / XFUND-ZHF1-Score信息抽取的实体/关系识别质量RVL-CDIP (sampled)Accuracy文档分类准确率DocVQA-ZHANLSAverage Normalized Levenshtein Similarity平均归一化编辑距离相似度计算方法参考 ICDAR 2019 Scene Text Visual Question Answering 竞赛论文。从结果可以看出与 LayoutXLM-Base 相比ERNIE-LayoutX-Base 在 FUNSD86.72 → 89.31、XFUND-ZH86.24 → 88.58和 DocVQA-ZH66.01 → 69.57上均有明显提升仅在 RVL-CDIP (sampled) 上略低90.88 → 90.29差距 0.59。这印证了布局知识增强与多模态预训练对信息抽取和文档问答类任务的增益更为显著。五、具体评测方式Grid Search 与训练配置5.1 评测流程所有下游任务均基于Grid Search网格搜索方式进行超参寻优验证集评估节奏与汇报口径如下任务验证集评估间隔评价指标汇报口径FUNSD每 100 stepsF1-Score验证集最优XFUND-ZH每 100 stepsF1-Score验证集最优RVL-CDIP (sampled)每 2000 stepsAccuracy验证集最优DocVQA-ZH每 10000 stepsANLS验证集最优取验证集最优效果作为表中汇报指标5.2 超参搜索范围每个下游任务的超参搜索范围如下表Hyper ParametersFUNSDRVL-CDIP (sampled)XFUND-ZHDocVQA-ZHlearning_rate5e-6, 1e-5, 2e-5, 5e-55e-6, 1e-5, 2e-5, 5e-55e-6, 1e-5, 2e-5, 5e-55e-6, 1e-5, 2e-5, 5e-5batch_size1, 2, 48, 16, 241, 2, 48, 16, 24warmup_ratio-0, 0.05, 0.1-0, 0.05, 0.1两点关键说明FUNSD 与 XFUND-ZH 不搜索 warmup_ratio这两个任务使用的lr_scheduler_type策略是constant常数学习率不涉及预热warmup阶段因此表中 warmup_ratio 一栏为-。这也解释了为何 batch_size 搜索范围较小1/2/4——信息抽取任务在 16GB 显存下批次受限。learning_rate 四个任务使用同一搜索集合5e-6 ~ 5e-5覆盖了文档理解微调常见的量级区间。5.3 训练步数 / epoch 配置不同任务采用不同的收敛控制方式文档信息抽取FUNSD、XFUND-ZH采用**最大步数max_steps**微调方式分别设为10,000 steps与20,000 steps文档视觉问答DocVQA-ZHnum_train_epochs为6文档图像分类RVL-CDIPnum_train_epochs为20。这种差异反映了任务数据规模与收敛速度的差别RVL-CDIP (sampled) 只有 6,400 张训练图片且分类任务相对简单需要更多 epoch 来充分收敛DocVQA-ZH 问答任务训练集约 4,187 张6 个 epoch 已足够而信息抽取任务显存限制下 batch 较小采用固定 max_steps 控制总训练量更为稳定。5.4 最优超参Grid Search 结果不同预训练模型在各下游任务上做 Grid Search 之后的最优超参learning_rate、batch_size、warmup_ratio 三元组如下ModelFUNSDRVL-CDIP (sampled)XFUND-ZHDocVQA-ZHLayoutXLM-Base1e-5, 2, _1e-5, 8, 0.11e-5, 2, _2e-5, 8, 0.1ERNIE-LayoutX-Base2e-5, 4, _1e-5, 8, 0.1e-5, 4, _2e-5, 8, 0.05阅读该表可以得到几条实用的调参规律信息抽取任务FUNSD/XFUND-ZHERNIE-LayoutX-Base 的最优 batch_size 从 2 提升到 4learning_rate 在 FUNSD 上从 1e-5 提升到 2e-5说明更强的预训练模型可以承受更大的批次与更高的学习率RVL-CDIP (sampled)两模型最优学习率均为 1e-5、batch_size 均为 8warmup_ratio 上 LayoutXLM-Base 为 0.1、ERNIE-LayoutX-Base 为 0即不预热说明分类任务上 LayoutXLM 更依赖 warmup 稳定早期训练DocVQA-ZH两模型最优均为 2e-5 与 batch_size 8区别仅在 warmup_ratio0.1 vs 0.05问答任务上二者都偏好较高学习率表中_表示该项不参与搜索对应 constant scheduler无 warmup。六、模型下载与使用入口评测基于模型库提供的预训练模型权重相关文件在 modelcenter/ERNIE-Layout/download_cn.md 中列出模型名称模型简介模型大小下载地址ERNIE-LayoutX-Base原始预训练模型1.13GB预训练模型pdparams 权重文件Docprompt基于 ERNIE-Layout 在文档视觉问答任务上微调后的文档抽取问答模型2.16GB推理模型tar 包其中ERNIE-LayoutX-Base 预训练权重即上表评测中ERNIE-LayoutX-Base一行的模型基座可直接用于下游微调复现DocPrompt是基于 ERNIE-Layout 微调得到的开放域文档抽取问答模型支持发票、海报、网页、表格、试卷等多种文档的抽取问答可通过paddlenlp.Taskflow(document_intelligence)三行代码调用详见 introduction_cn.ipynb。七、下游微调与生产落地的延伸参考本文 Benchmark 面向的四个任务信息抽取、文档问答、文档分类正是 ERNIE-Layout 在下游微调中的核心场景。从本仓库可以找到对应的工程化佐证文档信息抽取SER/RE的生产化示例在飞桨 PP-CV 套件中paddlecv/configs/system/PP-Structure-re.yml展示了基于 LayoutXLM 系列VQATokenLabelEncodealgorithm 为LayoutXLM的键值对抽取RE全流程包括 PP-OCRv3 检测/识别、SER 语义实体识别与 RE 关系抽取三个 Op 的串联max_seq_len设为 512并提供class_list_xfun.txt类别字典——这正是 XFUND 系列数据集上信息抽取任务的落地形态与 Benchmark 中 XFUND-ZH 任务一脉相承模型调用与微调入口ERNIE-Layout 在 PaddleNLP 中以ernie-layout模型组形式维护introduction_cn.ipynb 中给出了 DocPrompt 的推理调用、可配置参数batch_size、lang、topn说明以及微调部署指引评测数据口径如需完整复现本文四个任务的 Grid Search可对照本文 5.2/5.3 节的超参范围、评估间隔与数据划分DocVQA-ZH 4,187/500/500、RVL-CDIP 6,400/800/800进行配置。八、复现注意事项与结论复现本文 Benchmark 时请重点关注以下几点环境对齐V100-16GB / CUDA 10.2 / cuDNN 7.5.1 / paddlepaddle-gpu 2.3.2显存决定了 batch_size 的可达范围数据划分对齐DocVQA-ZH 与 RVL-CDIP 使用重新划分/降采样的非官方划分务必按 4,187/500/500 与 6,400/800/800 构造数据集评测口径对齐信息抽取看 F1每 100 steps 评估、分类看 Accuracy每 2000 steps、问答看 ANLS每 10000 steps汇报指标均为验证集最优值超参策略对齐FUNSD/XFUND-ZH 用 constant scheduler不搜 warmup、max_steps 分别 10,000/20,000DocVQA-ZH 用 6 epochRVL-CDIP 用 20 epoch指标解读ERNIE-LayoutX-Base 相比 LayoutXLM-Base 在信息抽取与问答任务上提升明显FUNSD 2.59、XFUND-ZH 2.34、DocVQA-ZH 3.56分类任务基本持平-0.59调参时应针对不同任务类型选择合适的搜索侧重。综合来看本文档提供了一套完整的文档智能模型评测基准从环境、数据、指标到超参搜索方案全部给出了可复现的口径最优超参表也为后续在新任务上微调 ERNIE-LayoutX-Base 提供了高价值的起点配置。结合本仓库 download_cn.md 提供的预训练权重与 introduction_cn.ipynb 的调用示例开发者可以完整复现评测并在此基础上继续开展文档抽取、问答与分类任务的工程落地。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐PaddleNLP ERNIE-Layout 文档智能全流程实战跨模态预训练模型、微调与部署指南PaddleNLP ERNIE Layout 文档智能全流程实战跨模态预训练模型、微调与部署指南 导读 本文围绕 PaddleNLP 开源的多语言跨模态文档预人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLP超参数调优与环境包装实战rl-baselines3-zoo完全配置指南超参数调优与环境包装实战rl baselines3 zoo完全配置指南 引言你还在为强化学习训练效果不佳而困扰吗 在强化学习Reinforcement人工智能强化学习机器学习Sonic 配置文件完全指南config.cfg 全部参数解析与生产环境调优实战Sonic 配置文件完全指南config.cfg 全部参数解析与生产环境调优实战 Sonic 是一个基于 Rust 编写、运行在几 MB 内存中的轻量级无模式搜索引擎后端全文检索上一篇为 GraphQL 服务集成 Auth0 认证基于 Envelop、GraphQL-Helix 与 Fastify 的完整实战指南下一篇免费工具 G-Helper华硕笔记本性能模式与风扇曲线快速设置方法创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表