
文档元素智能提取NVIDIA-Nemotron-Parse-v1.1-TC实现表格与公式精准识别【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TCNVIDIA Nemotron Parse v1.1 TC是一款基于Transformer的视觉编码器-解码器模型专为文档语义理解和文本表格元素提取而设计。它能够将非结构化文档转换为可操作的机器可用表示克服了传统OCR技术在处理复杂文档布局时的局限性。核心功能与优势文档结构智能解析该模型能够对文档进行全面的文本理解和结构分析可识别标题、章节、图表标题、索引、脚注、列表、表格、参考文献和图片等多种元素并提供带坐标的边界框。这种精准的元素识别为后续的文档处理和分析奠定了坚实基础。高效的表格提取能力NVIDIA Nemotron Parse v1.1 TC擅长提取复杂表格支持多行列和多列合并的格式并以LaTeX格式输出。这一功能大大简化了从文档中提取和利用表格数据的过程提高了工作效率。公式与格式提取支持除了表格该模型还能提取文本样式和数学公式通过markdown和LaTeX格式的组合来呈现。这使得学术论文、技术文档等包含大量公式的文档能够被准确解析和处理。速度与准确性的平衡作为NVIDIA Nemotron Parse v1.1的增强版本v1.1-TC通过在视觉编码器表示之上应用额外的4倍视觉令牌长度压缩TC实现了20%的速度提升。同时它还能保留表格、标题、图片、脚注等无序元素的页面顺序确保了处理结果的准确性和可用性。快速上手指南环境准备首先克隆仓库并安装所需依赖git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC cd NVIDIA-Nemotron-Parse-v1.1-TC pip install -r requirements.txt基本使用示例以下是一个简单的使用示例展示如何加载模型并处理图片import torch from PIL import Image from transformers import AutoModel, AutoProcessor # 加载模型和处理器 model_path nvidia/NVIDIA-Nemotron-Parse-v1.1-TC # 或使用本地路径 device cuda:0 model AutoModel.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch.bfloat16 ).to(device).eval() processor AutoProcessor.from_pretrained(model_path, trust_remote_codeTrue) # 加载图片 image Image.open(path/to/your/image.jpg) task_prompt /sspredict_bboxpredict_classesoutput_markdown # 处理图片 inputs processor(images[image], texttask_prompt, return_tensorspt).to(device) # 生成结果 outputs model.generate(**inputs) generated_text processor.batch_decode(outputs, skip_special_tokensTrue)[0]结果后处理生成的文本可以通过后处理提取出元素类别、边界框和文本内容from postprocessing import extract_classes_bboxes, transform_bbox_to_original, postprocess_text classes, bboxes, texts extract_classes_bboxes(generated_text) bboxes [transform_bbox_to_original(bbox, image.width, image.height) for bbox in bboxes] # 指定后处理的输出格式 table_format latex # latex | HTML | markdown text_format markdown # markdown | plain texts [postprocess_text(text, clscls, table_formattable_format, text_formattext_format) for text, cls in zip(texts, classes)]模型架构与技术细节网络架构NVIDIA Nemotron Parse v1.1 TC采用了先进的Transformer架构主要包括视觉编码器ViT-H模型适配器层1D卷积和规范化层用于压缩潜在空间的维度和序列长度解码器mBart 10个块令牌器遵循CC-BY-4.0许可证模型参数数量小于10亿在保证性能的同时保持了较高的运行效率。输入输出规格输入类型图像RGB 提示字符串最大输入分辨率1664×2048最小输入分辨率1024×1280输出类型文本以字符串形式编码文本内容、边界框和类属性部署与兼容性该模型可以在多种环境中部署包括运行时引擎TensorRT-LLM支持的硬件微架构NVIDIA Hopper/NVIDIA Ampere/NVIDIA Turing支持的操作系统Linux应用场景与价值数据提取与处理NVIDIA Nemotron Parse v1.1 TC可用于从PDF和PPT文档中提取文本为数据挖掘、信息检索等应用提供高质量的输入数据。文档理解与分析通过对文档结构的深入理解该模型可以提高检索器和管理器解决方案的效率增强文档理解流程。模型训练支持其文本提取数据集和能力有助于LLM和VLM的训练同时提高VLM的运行时推理准确性。总结NVIDIA Nemotron Parse v1.1 TC为文档处理提供了强大的智能解决方案通过精准的元素识别和提取将非结构化文档转换为结构化数据。无论是学术研究、商业分析还是日常办公这款工具都能显著提高文档处理的效率和准确性是处理复杂文档的理想选择。参考资料模型架构细节hf_nemotron_parse_modeling.py处理器配置hf_nemotron_parse_processor.py后处理脚本postprocessing.py【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考