ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

扫描PDF怎么变成可搜索文档:OCRmyPDF 免费批量加 OCR 文本层

扫描PDF怎么变成可搜索文档:OCRmyPDF 免费批量加 OCR 文本层 扫描PDF怎么变成可搜索文档OCRmyPDF 免费批量加 OCR 文本层【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF手里一份 217 页的扫描版年报CtrlF 搜不到一个词选中文字全是空的。OCRmyPDF 做的事很直接给扫描件加一层看不见的可搜索文本文件免费处理、外观不变之后就能搜索、复制、导出文字。一句话定位它是干嘛的OCRmyPDF 是一个开源命令行工具把扫描型 PDF 里的图片变成带文字层的 PDF。它不动原始扫描件只在页面底下叠加一层透明文本所以处理完的文档既能正常显示也能被搜索引擎和复制操作读到。最快上手路径装完就能跑先看你的系统在不在下面这张表里不在就翻 docs/installation.md里面把从 Homebrew 到 Docker 的路子都写全了系统命令Debian / Ubuntuapt install ocrmypdfmacOS / LinuxHomebrewbrew install ocrmypdfPython 环境pip install ocrmypdf装好后第一条命令就这么短ocrmypdf 简历扫描件.pdf 简历可搜索版.pdf跑完打开输出文件试着选中第一段文字——如果之前只能整页复制图片现在能拖拽选中了说明文本层已经加上了。上面这种老式打字机扫描件最考验 OCR字体是等宽衬线、扫描对比度偏低正好拿来检验效果。截图里能看到它的完整工作流先逐页扫描内容再跑 OCR 生成文本层最后做 PDF/A 转换和图像优化进度条按页汇报。核心功能深挖三个最常用的能力给扫描件加 OCR 文本层原件结构原样保留用之前页面是图片搜索框输入什么都白搭PDF 属性里看不到任何文字信息。用之后同一份文档能按关键词跳到具体页复制出来的是真正可用的文字而不是乱码或空白。更关键的是它不重排文档。很多先转图片再拼回去的做法会丢字体、丢注释、改变版面OCRmyPDF 把 OCR 结果作为透明层嵌回原页面元数据和版面结构都还在。默认还会输出 PDF/A-2b这是为长期存档设计的格式若只想要普通 PDF加--output-type pdf即可。多语言识别与批量加文本层中文扫描件最典型的失败是识别结果里全是方框或可搜索三个字只出来两个。原因通常是语言包没装。Debian/Ubuntu 上装tesseract-ocr-chi_sim然后指定语言ocrmypdf -l chi_sim 合同扫描件.pdf 合同可搜索版.pdf英文、中文混排就写成-l engchi_sim加号分隔。批量处理一份份手动敲太累写个循环让多核一起跑for f in 扫描/*.pdf; do ocrmypdf --jobs 4 $f 可搜索/$(basename $f) done wait--jobs 4让每个文件内部用 4 个核心做并行 OCR循环外层的和wait则是让多个文件同时排队。速度基本随核心数线性上涨。扫描件倾斜、污渍怎么处理扫描件经常歪、有阴影、有黑边。OCRmyPDF 内置了三个开关可以组合使用--deskew校正几度的小倾斜--rotate-pages把整页转 90/180 度归位--clean去噪点依赖 unpaper装了对应包就自动启用。ocrmypdf --deskew --rotate-pages 旧扫描档案.pdf 旧扫描档案_校正.pdf处理完再看效果歪斜的标题回到水平线被污渍糊住的字符大多能正常识别OCR 准确率会明显抬升——因为引擎拿到的是干净版面。前后效果对比处理前处理后CtrlF 搜不到任何词关键词能跳到具体页选中文字全是空白可复制、可导出真正文字版面靠图片撑搜索工具读不懂加了透明文本层搜索引擎和复制都能工作文件格式普通长期存档有隐患默认 PDF/A-2b适合归档批量处理要手动一个个来一条循环命令 多核并行容易踩的坑症状解法中文识别出来是方框或乱码装tesseract-ocr-chi_sim包命令加-l chi_sim几百页大文件跑到一半内存告急用--pages 1-100分批处理--jobs 4拉高并行识别结果一堆错字原文也看着糊加--oversample 300提升采样分辨率但前提是扫描本身清楚页面整体横过来或倒立--rotate-pages管整页方向--deskew只管轻微倾斜两者别混用手写体完全认不出来手写不是 OCR 的强项建议手动转录或找专门的手写识别工具延伸与收尾想查完整选项直接翻 docs/cookbook.md优化、安全、批处理这些章节都在这如果想在流程里加自定义步骤src/ocrmypdf/builtin_plugins/ 里有现成的插件写法可以参考。建议你先拿一份真实的扫描件跑一遍上面那条最短命令确认能选中、能搜索之后再叠加预处理参数——这是最省时间的路线。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表