ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

如何精准解析任意文档的版面结构:TeleOCR Layout分析完全指南

如何精准解析任意文档的版面结构:TeleOCR Layout分析完全指南 如何精准解析任意文档的版面结构TeleOCR Layout分析完全指南【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCRTeleOCR 是一款约 1.2B 参数的开源文档解析视觉语言模型能够直接对文档图片进行版面分析Layout 分析自动识别文字、表格、公式、代码等区块的位置坐标与阅读顺序并且无需矫正即可解析相机拍摄的扭曲文档是新手也能快速上手的文档解析利器。什么是文档版面分析版面分析Layout Analysis就是让模型看懂文档的结构这一页上哪里是标题、哪里是正文、哪里是表格、哪里是插图以及这些区块在页面上的坐标位置bbox和阅读顺序。它是 OCR、RAG 知识库、电子书数字化等场景的第一步也是最关键的一步。大多数传统工具只能处理规规矩矩的数字文档而 TeleOCR 的核心突破在于同一套模型同时覆盖数字文档和相机拍摄的弯曲、倾斜、透视变形的文档并且不需要额外的矫正dewarping预处理或专门的矫正模型。 简单理解你随手拍一张弯曲的书页照片TeleOCR 也能直接输出结构化的版面结果。快速上手3 步部署 TeleOCR 文档解析模型第一步一键安装依赖pip install transformers torch pillow第二步加载模型TeleOCR 基于 Hugging Face Transformers 生态通过trust_remote_codeTrue自动加载仓库内的自定义模型定义 modeling_naviocr.py模型权重为 model.safetensors。核心加载代码非常简洁from transformers import AutoProcessor, AutoModel import torch processor AutoProcessor.from_pretrained(StarDoc-AI/TeleOCR, trust_remote_codeTrue, use_fastTrue) model AutoModel.from_pretrained(StarDoc-AI/TeleOCR, trust_remote_codeTrue, torch_dtypetorch.bfloat16).cuda().eval()模型架构细节可查看 config.jsonQwen2.5-VL 架构、28 层文本编码器、bfloat16 精度、支持 128K 上下文足够轻量单卡即可运行。第三步选择正确的提示词关键TeleOCR 的布局解析能力由提示词Prompt激活这也是新手最容易踩坑的地方。仓库 README.md 中给出了两种官方用法场景提示词适用对象标准版面分析Analyze the image layout.扫描件、PDF 截图等平面文档扭曲文档多点版面分析Multi-point Layout Segmentation Analysis.相机拍摄的书页、卷曲纸张一个典型调用只需几行from PIL import Image image Image.open(./assets/layout.jpg).convert(RGB) image image.resize((1036, 1036), Image.Resampling.BICUBIC) # 建议归一化尺寸 raw_layout infer(image, Analyze the image layout.) print(raw_layout.strip())⚠️小技巧官方示例中将图片统一缩放到 1036×1036 再送入模型这一步对版面坐标的稳定性有明显帮助建议保留。解析输出包含哪些版面信息TeleOCR 的版面输出以结构化的内容块ContentBlock组织每个区块包含三类信息type区块类型如text正文、table表格、equation公式、code代码、标题、图片等bbox区块在图中的边界框坐标 [x, y, w, h]方便做高亮标注、区域裁剪angle区块的倾斜角度专门服务于相机拍摄的歪斜文档。除了版面TeleOCR 还能对识别出的区块做深度解析表格输出为可合并单元格的 OTSL/HTML 格式公式直接输出 LaTeX。上面这张图就是 TeleOCR 处理数学公式推导时的识别结果一行行公式被完整还原为 LaTeX 表达式——这正是版面分析之后内容解析环节的体现。性能实测TeleOCR 文档解析能力有多强在公开的文档解析基准测试中TeleOCR 以 1.2B 的小模型体量取得了领先成绩详见 README.md 实验结果章节基准测试TeleOCR说明OmniDocBench v1.696.87OverallSOTA综合数字文档解析能力Wild_OmniDocBench88.53OverallSOTA真实复杂场景文档Dr.DocBench Challenge67.96overall第一超过 MinerU 2.5 Pro、PaddleOCR-VL 1.6 等方案ICDAR2026 Sci-ImageMiner综合加权41.81第一科学图表解析竞赛尤其在扭曲文档版面可视化评测中TeleOCR 直接在弯曲页面上完成版面与内容解析展现出对复杂几何变形的鲁棒性——这正是相机拍照场景最实用的能力。模型文件与参考资料如果你想深入了解模型内部结构或复现细节仓库中的关键文件如下模型定义与自定义逻辑modeling_naviocr.py模型配置架构、精度、上下文长度config.json推理参数配置generation_config.json图像预处理参数preprocessor_config.json分词器与特殊标记tokenizer.json、added_tokens.json、special_tokens_map.json完整示例与评测数据README.md 若需完整的端到端文档解析流程多页合并、阅读顺序整合等可参考项目方在 News 与 Community Contributions 部分提到的社区转换版本GGUF 等方便在 CPU 与边缘设备上部署。常见问题 FAQQ1相机拍的照片很歪需要先矫正吗不需要。直接使用提示词Multi-point Layout Segmentation Analysis.TeleOCR 内置了几何感知的文档建模可原生处理弯曲与倾斜。Q2输出坐标的参考系是什么bbox 基于输入图片坐标系。官方示例统一将输入缩放到 1036×1036因此建议保持一致的处理流程方便后续做页面级标注与拼接。Q3显存不够能跑吗模型仅约 1.2B 参数、bfloat16 精度单张消费级显卡即可推理社区还分享了 GGUF 量化版本可在更低资源环境下部署。Q4如何评估自己的解析效果可参考 README 中 OmniDocBench、PureDocBench 的指标口径文本编辑距离、表格 TEDS、公式 CDM、阅读顺序编辑距离对自有数据做对比评测。总结TeleOCR 用一套轻量模型打通了平面扫描件与相机实拍文档两大场景版面分析 内容解析一体化几行代码即可完成部署。无论你是做 RAG 知识库、电子书数字化还是学术研究它都能成为你文档智能工具链中可靠的第一环。【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表