
Umi-OCR 离线 OCR 完全指南截图、批量图片、扫描版 PDF 识别从 0 到跑通自动化【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 文字识别工具截图识别、批量图片识别、扫描版 PDF 转可搜索文本、二维码扫码与生成全部在本机完成。图片不上传、不联网、不注册识别次数不设上限。这篇文章按任务带你走先拿到第一个识别结果再把量扩大到整批图片、整本 PDF最后把 Umi-OCR 接进你的自动化流程。能力全景先看这张地图能力典型场景在哪里操作截图 OCR划选屏幕文字、粘贴聊天记录截图直接识别截图OCR 标签页批量 OCR一次拖入几百张图片输出 txt / csv / md 等批量OCR 标签页文档识别扫描版 PDF 转双层可搜索 PDF 或纯文本文档识别 标签页二维码一图多码扫码或把文本生成码图片二维码 标签页命令行 / HTTP 接口写脚本自动截图识别、传图拿 JSON 结果主程序命令行 / 本地 1224 端口全局设置切换 OCR 引擎、界面语言、主题、开机自启全局设置 标签页最短路径上手3 步拿到第一个结果拿到发布包从项目 Release 页下载 v2.1.5 的.7z压缩包没有解压软件就用.7z.exe自解压包双击即可解开。想用源码的话执行git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。解压到纯英文路径例如D:\Tools\Umi-OCR避免中文和空格。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。无需安装首次启动会按系统语言自动切换界面。识别打开截图OCR标签页按页面提示的快捷键唤起截图框划出文字区域右侧记录栏立刻出现识别结果。要点说明杀毒误报软件内置 OCR 引擎与运行库部分杀软会误报启动前把目录加入白名单锁定标签页右上角锁形按钮可锁定常用标签防止日常误触关闭界面语言全局设置 → 语言/Language支持简中、繁中、英文、日文、俄语、葡萄牙语等场景实操一截图 OCR屏幕上的字直接拿走你遇到什么屏幕上一段文字想复制进文档但它是图片、网页截图或视频画面没法选中。怎么操作打开截图OCR 标签页按快捷键唤起截图框。划出文字区域松开鼠标结果出现在右侧记录栏。在记录栏直接编辑文字划选多条记录可一次复制。关键细节不截图也能识别。在别处复制一张图片比如聊天窗口里的图切回 Umi-OCR 直接粘贴效果相同。记录栏支持编辑省去识别完再开编辑器整理这一步。一个提醒识别出的文字默认经过排版解析——引擎吐出的是散装文本块一块块零散的文字由排版解析器决定谁先谁后横排、竖排从右到左都能按阅读顺序输出。方案怎么选后面参数调优一节细讲。场景实操二批量图片识别一次拖入几百张你遇到什么手头有几百张截图、拍照文件要转文字一张张手动识别不现实。怎么操作切到批量OCR标签页把图片直接拖进窗口没有数量上限。点开始任务右侧面板逐张显示耗时、置信度和识别结果。跑完按输出格式保存。项目支持范围输入格式jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff输出格式txt、jsonl、md、csvcsv 可直接用 Excel 打开长任务任务完成后自动关机/待机v2.1.2 起支持暂停任务不退出软件时待机/休眠后可恢复关键细节批量页右栏设置里可打开忽略区域编辑器——按住右键在图片上画多个矩形框框住水印、LOGO、页脚可能出现的位置识别时这些区域内的文字会被自动排除。一个提醒这里有一个必须记住的机制只有整个文本块完全落在框内才会被忽略按单个字符不算。所以框要画得足够大把水印所有可能落位都包住框小一号结果里就多一行杂音。场景实操三文档识别把扫描版 PDF 变成可搜索 PDF你遇到什么一柜扫描版 PDF、EPUB能看不能搜想归档或提取文字。怎么操作打开文档识别标签页拖入文档。支持pdf、xps、epub、mobi、fb2、cbz六种格式。选择提取方式跑任务。它的逻辑是先挑现成的再补缺的解析器底层依赖 PyMuPDF会区分 PDF 里自带的文本层和扫描图片层——自带文本的页面直接提取速度快且零识别误差只有纯扫描页才交给本地 OCR 引擎。你也可以反向操作整页强制 OCR或只提取原文本。选择输出成品。输出特点适合场景双层可搜索 PDF底层保留原图上层叠加透明文字层外观与扫描件一致但可搜索、可复制历史合同归档、论文数字化单层纯文本 PDFv2.1.2 起文件更小、方便后续编辑只要文字、不在乎原版外观关键细节文档识别同样支持按页码范围设置忽略区域——把统一位置的页眉页脚一次性排除掉再配合任务完成后自动关机/待机一整柜扫描旧书可以挂夜里跑完。一个提醒v2.1.5 修复了提取原文本层时未处理页面旋转的问题。如果你的 PDF 有旋转过方向的页面且识别位置错位先升级到最新版再下结论。场景实操四二维码扫码和生成一起搞定你遇到什么屏幕或图片里有二维码/条形码要读或者想把一段文本变成码图片。怎么操作打开二维码标签页用截图、粘贴、拖入图片三种方式之一输入扫码结果立刻显示一张图里多个码也能一次读出。覆盖 QRCode、EAN13、Code128 等 19 种码制。切到生成方向选码制和纠错等级把文本直接输出成二维码图片。关键细节命令行下还能指定尺寸批量生成见下文命令适合一个链接一个码的批量打印场景。一个提醒扫码用的输入方式和截图OCR 完全一致——复制图片后粘贴进来即可不用先存盘。参数调优四个设置决定识别质量现象 | 去哪调 | 怎么调现象去哪调怎么调长截图/大图识别不完整、缺头少尾页面设置 → 文字识别 → 限制图像边长调高数值默认 960 会压缩大图。别靠放大原图解决过度放大会引入噪声代码截图缩进全乱了各标签页文字识别 → 排版解析方案切到单栏-保留缩进行首缩进和行中空格原样保留两栏论文输出顺序混乱排版解析方案用多栏-按自然段换行默认值覆盖大多数场景内存占用偏高插件配置PaddleOCR调低线程数。v2.1.4 起 PaddleOCR 默认内存已限制在系统总内存一半以内截图时屏幕闪烁、界面错位全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速识别语言不对各标签页文字识别 → 识别语言库单独选择或下载对应语言的库排版解析方案全集方案适用场景多栏-按自然段换行两栏/三栏论文、书籍按段落断行不确定就选它多栏-总是换行 / 无换行每句独立成行 / 强制整段合并成一行单栏-按自然段换行 / 总是换行 / 无换行与多栏系列对应但不区分多栏布局单栏-保留缩进代码截图专用不做处理引擎原始输出两个容易混淆的概念界面语言 ≠ 识别语言库。前者管菜单按钮显示什么文字全局设置里改后者管 OCR 引擎认哪种文字各标签页单独选。界面用中文、日常识别日文书籍这种组合完全成立。OCR 引擎可随时切换。默认内置 Rapid-OCR兼容性好遇到报错先换它和 PaddleOCR速度稍快两套引擎全局设置里切。接入自动化命令行与 HTTP 接口软件运行期间本地 HTTP 服务默认监听127.0.0.1:1224仅本地环回不经过物理网卡端口可在全局设置中修改。所有命令行指令都通过这条通道发给后台进程所以命令行要求 HTTP 服务处于开启状态默认开启。命令行入口就是主程序Umi-OCR.exeLinux 为umi-ocr。所有指令支持前缀简写如--screenshot可写成--sc。# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 递归识别整个文件夹含子目录结果追加到 all.txt umi-ocr --path D:\scans -- all.txt # 生成 256x256 二维码图片末尾数字可单独指定宽和高 umi-ocr --qrcode_create https://example.com D:\qr.png 256 # 免鼠标划选截取第 2 块显示器 (50,100) 起点、300x200 区域并识别 umi-ocr --screenshot screen1 rect50,100,300,200 # 查看全部指令 umi-ocr --help其中--等价于--output_append追加写入--等价于--output覆盖写入。范围截图配合快捷键工具可以做成按一下 F10 就识别固定屏幕区域。完整参数见 docs/README_CLI.md。HTTP 接口需要程序化收结果时比如命令行管道重定向失效的场景直接用 HTTP图片识别接口接收 Base64 图片、返回 JSON 结果文档识别走上传 → 轮询状态 → 下载三步流程。# 最小示例传一张 Base64 编码的图片返回 JSON 识别结果 import requests, json r requests.post(http://127.0.0.1:1224/api/ocr, json{base64: b64_image, options: {data.format: text}}) print(json.loads(r.text)[data]) # 识别出的纯文本接口文档在 docs/http/api_doc.md可查的参数还包括排版解析方案、忽略区域坐标等几十行代码就能封装成传图 → 返回 JSON的小服务接进自己的自动化脚本里。排错现象 → 原因 → 解法命令行指令没有任何反应两个原因一是命令行依赖本地 HTTP 服务传递指令确认全局设置里 HTTP 服务处于开启状态默认开启二是入口必须用主程序Umi-OCR.exeRUN_GUI.bat这类备用启动器不支持命令行。忽略区域画了水印文字还在原因是忽略机制按整个文本块判定。检查两点矩形框是否把整个文本块完整包住只包住一半不算配置是否已保存。旋转方向的扫描件识别出的文字位置错位早期版本提取原文本层时未处理页面旋转v2.1.5 已修复。遇到此问题先升级到最新版。拖入几万个文件的文件夹界面卡死v2.1.5 改进了图片/文档的异步加载机制超大文件夹会显示加载进度。等进度跑完再操作不要在加载期间连续提交任务。长图识别结果缺头少尾原因是限制图像边长默认值 960 较低超大图片被压缩处理。到页面设置里调高该数值即可不要直接放大原图。识别报错或结果明显不准先在全局设置把引擎切到 Rapid-OCR 试试仍不行再检查识别语言库是否匹配图中文字。下一步下载最新版 v2.1.5完成两件事先做一次截图识别拿到第一个结果再把批量页的忽略区域画好。这两步走完你手头任何带水印的图片或扫描版 PDF都能直接产出干净的文本。之后如果想让它无人值守地干活从接入自动化一节的--screenshot --clip命令开始试。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考