ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

离线PDF OCR一步到位:OCRmyPDF快速完整指南

离线PDF OCR一步到位:OCRmyPDF快速完整指南 离线PDF OCR一步到位OCRmyPDF快速完整指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF周五下午四点半领导把一份 300 页的扫描合同甩给你下班前把违约责任那一条找出来。你打开文件CtrlF 一片空白——这PDF其实是一摞图片没有一个可检索的字符。这就是 OCRmyPDF 要解决的局它是一个完全离线的命令行工具能给扫描 PDF 补上一层隐藏的 OCR 文本层让 CtrlF 立刻起效全程不需要联网。左边这种纯图像扫描件就是 OCRmyPDF 的输入对象一句话定性先看看它干了什么把扫描 PDF 变成可搜索、可复制的文本 PDF仅此一事但它做得比较全给 PDF 叠加可检索文本层支持 100 种识别语言多核并行速度快顺手压缩优化图像输出可校验为 PDF/A 存档更多细节在 官方文档 里有完整说明本文只挑用得上的。按平台装好它离线环境提前备好语言包 LinuxDebian/Ubuntu最短路径是一行sudo apt install ocrmypdfmacOS用brew install ocrmypdfWindows建议在 WSL 里pip install ocrmypdf原生环境则装好 Python 后pip install ocrmypdf即可。三者的依赖Ghostscript、Tesseract都会随包带齐。离线部署时唯一要提前想好的是语言包Tesseract 默认只有英语中文、日语这些.traineddata文件要在一台联网机器上先下好拷过去。两条命令上手单文件和批量归档场景一单份扫描件转可搜索。输入scan.pdf纯图片输出scan_ocr.pdfocrmypdf scan.pdf scan_ocr.pdf输出文件和原文件长得一模一样但每个字现在都能被搜索、复制了。场景二中英混合文档存档级输出。指定语言、指定 PDF/A 格式并开启最强压缩ocrmypdf --language chi_simeng --output-type pdfa \ --optimize 3 report.pdf report_final.pdf跑完你会看到逐页进度条末尾给出优化压缩比——扫描件输出往往比输入还小。终端里的离线 OCR 全流程扫描、识别、优化、PDF/A 校验一次跑完识别率上不去、文件大到爆内存先看这里 如果扫描件有歪斜、页面转了方向识别率上不去就先加--deskew --rotate-pages让它在识别前把页面扶正。如果 PDF 里部分页已经有文本层担心重复识别加--skip-text它只会处理纯图片页已有文字的一律不动。如果几百页的大文件把内存吃满直接崩别硬跑用--pages 1-100切段处理跑完再手动合并。如果只在意输出体积--optimize 3是上限嫌原图太脏影响识别再叠一个--clean让 Ghostscript 先做图像清理。这些开关的组合逻辑都写在 源码目录 的参数定义里拿不准时可以翻一翻。塞进现有脚本一行 for 循环搞定把上面那条单文件命令包进循环收件箱目录就能整批消化退出码非零的页面还会自动记下来供你排查for f in ./inbox/*.pdf; do ocrmypdf $f done/${f##*/}; done项目里还附带了更完整的 批处理脚本带并发和失败隔离适合放进 CI 或定时任务里跑。回到周五的那份合同那份 300 页的扫描合同跑完 OCR 之后条款在第 142 页被 CtrlF 一秒揪出比领导预期的还早下班。任何手里有一堆扫描文档、又没网或不想把文件传上云的人——档案室、审计、法务、野外作业——都是它的目标用户。毕竟 OCR 这层文本就像给 PDF 加的字幕加上了观众才听得懂。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表