ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

DeepSeek-OCR-2基准评测实战:如何在OmniDocBench v1.5上复现文档OCR性能

DeepSeek-OCR-2基准评测实战:如何在OmniDocBench v1.5上复现文档OCR性能 DeepSeek-OCR-2基准评测实战如何在OmniDocBench v1.5上复现文档OCR性能【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2本文带你完整走一遍DeepSeek-OCR-2的基准评测流程在主流文档理解基准OmniDocBench v1.5上批量运行文档 OCR 推理输出可评测的 Markdown 结果。无论你是想复现论文性能还是评估自己的文档解析链路都能按这份指南快速上手。一、30秒认识DeepSeek-OCR-2文档OCRDeepSeek-OCR-2论文主题Visual Causal Flow的核心思路很直观不再依赖 CLIP 类视觉编码器而是把语言模型本身当作视觉编码器LM as Vision Encoder探索更接近人类阅读方式的视觉编码图像先被 80M 的 Tokenizer 切块压缩再由 Qwen2500M按因果阅读顺序编码输出高压缩比的视觉 token推理时支持动态分辨率默认(0-6)×768×768 1×1024×1024对应(0-6)×144 256个视觉 token兼顾小图速度与大图细节。一句话它是面向文档转 Markdown场景的高性能 OCR 模型也是 OmniDocBench v1.5 上的标杆选手。相关原理细节可查阅项目附带的论文 DeepSeek_OCR2_paper.pdf。二、一键安装3步搭好评测环境 ️官方环境基线CUDA 11.8 PyTorch 2.6.0第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2 cd DeepSeek-OCR-2第 2 步创建 Conda 环境conda create -n deepseek-ocr2 python3.12.9 -y conda activate deepseek-ocr2第 3 步安装依赖pip install torch2.6.0 torchvision0.21.0 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu118 pip install vllm-0.8.5cu118-cp38-abi3-manylinux1_x86_64.whl pip install -r requirements.txt pip install flash-attn2.7.3 --no-build-isolation 小贴士vLLM 与 Transformers 混装时若提示vllm 0.8.5cu118 requires transformers4.51.1之类冲突可忽略不影响推理运行。核心依赖清单见 requirements.txt。三、OmniDocBench v1.5 批量评测关键配置详解评测入口只有一个脚本run_dpsk_ocr2_eval_batch.py所有可调参数集中在 config.py。只需修改这几项配置项说明默认值MODEL_PATH模型路径Hugging Face 或本地权重deepseek-ai/DeepSeek-OCR-2INPUT_PATHOmniDocBench v1.5 图片目录需自行填写OUTPUT_PATHMarkdown 结果输出目录需自行填写MAX_CONCURRENCY并发数显存不足时调小100NUM_WORKERS图像预处理线程数64PROMPT文档转 Markdown 的评测提示词已配好评测脚本内置了几个关键细节直接影响成绩EXIF 方向校正correct_image_orientation()会根据 EXIF 标签自动旋转图片避免评测数据方向错误导致性能虚低N-gram 去重解码通过 ngram_norepeat.py 中的NoRepeatNGramLogitsProcessorngram40、window90抑制生成卡顿重复td等 token 已加白名单保护结果后处理自动清理公式冗余标记、剥离检测坐标片段输出干净的.md文件。四、跑通评测从图片到Markdown 确认config.py后只需一条命令cd DeepSeek-OCR2-master/DeepSeek-OCR2-vllm python run_dpsk_ocr2_eval_batch.py脚本执行流程读取INPUT_PATH下全部图片 → 多线程动态分辨率预处理 → vLLM 批量并发推理gpu_memory_utilization0.7→ 在OUTPUT_PATH生成与图片同名的 Markdown 文件。随后把OUTPUT_PATH交给 OmniDocBench 官方评测工具即可得到文本编辑距离、公式、表格、阅读顺序等指标。同一目录下还有两个姊妹脚本按需切换单图流式输出run_dpsk_ocr2_image.pyPDF 并发处理run_dpsk_ocr2_pdf.py五、常见问题快速排查 ✅显存不够 / OOM调小MAX_CONCURRENCY或降低gpu_memory_utilizationCUDA 11.8 下 Triton 报错脚本已自动设置TRITON_PTXAS_PATH确认 CUDA 路径为/usr/local/cuda-11.8即可没有 vLLM 环境可改用 Transformers 路线直接运行 run_dpsk_ocr2.py单图精度一致但速度较慢结果含坐标标记这是 grounding 模式的检测片段批量评测脚本已自动剥离单图模式可参考re_match()的实现。六、写在最后DeepSeek-OCR-2 用LM 当视觉编码器的 Visual Causal Flow 架构把文档 OCR 推向了新的压缩比与精度平衡点。按照本文流程你可以在一台 GPU 上完整复现它在 OmniDocBench v1.5 上的评测成绩并以此为基线对比自己的解析方案。动手跑起来才是理解这个模型最快的方式 【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表