ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Umi-OCR上手指南:用截图、批量与二维码识别搞定离线文字识别

Umi-OCR上手指南:用截图、批量与二维码识别搞定离线文字识别 Umi-OCR上手指南用截图、批量与二维码识别搞定离线文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源MIT 许可的离线 OCR 软件适用于 Windows 7 x64 与 Linux x64。它把图片、截图和 PDF 中的文字转成可编辑文本全程无需联网适合经常处理扫描件、截图文字和二维码的普通用户。项目速览Umi-OCR 的核心由四个标签页组成截图OCR、批量OCR、文档识别PDF 等、二维码。软件本身是一个壳具体识别能力由UmiOCR-data/plugins下的插件提供当前支持 RapidOCR、PaddleOCR 两类离线引擎可随时切换。文件/目录作用Umi-OCR.exeWindows 主程序双击启动兼作命令行入口umi-ocr.shLinux 启动脚本终端执行UmiOCR-data/plugins插件目录存放 OCR 引擎等扩展UmiOCR-data/.settingsini 格式配置文件界面设置都保存于此UmiOCR-data/i18n多国语言翻译文件本节要点离线运行无需网络和账号识别引擎以插件形式提供可切换支持命令行与 HTTP 两种外部调用第一次运行先确认系统Windows 需 7 及以上 64 位版本Linux 需 x64 架构glibc 依赖已降至 2.31兼容 Debian 11、Ubuntu 20.04 等发行版。获取方式二选一下载.7z压缩包或.7z.exe自解压包后者无需安装压缩软件即可解压。从源码仓库获取git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR最小化启动进入解压目录双击Umi-OCR.exe。Linux 用户打开终端执行chmod x umi-ocr.sh ./umi-ocr.sh看到由标签页组成的主窗口即启动成功。首次打开时软件会按系统语言自动切换界面。新手容易卡住的点弹窗报错Cannot find Py_Main()时多半是缺少 VC 运行库。安装 VC 运行库后重启电脑或改用UmiOCR-data/RUN_GUI.bat启动此方式下命令行功能受限。更多报错的处理方法见仓库内的 错误排查手册。本节要点解压即用安装过程为零启动报错优先装 VC 运行库RUN_GUI.bat可作为备用启动器场景实操用截图OCR把屏幕上的字变成文本这个场景解决眼前有个图想立刻拿到里面的文字。截图OCR 标签页打开后就能用快捷键唤起截图。打开「截图OCR」标签页点击截图按钮或按下快捷键。按住鼠标划选要识别的区域松开即开始识别按Esc可取消本次截图。左侧图片预览栏可直接划选文字复制右侧识别记录栏支持编辑可划选多条记录一起复制。做完后应该看到左侧出现截图预览右侧生成一条或多条识别记录文字可直接编辑、复制。识别结果杂乱时可在该页设置里选择「文本后处理」方案比如多栏-按自然段换行它会自动整理多栏排版的换行顺序。用批量OCR一次处理几百张图片这个场景解决一个文件夹里几百张图逐一截图太慢。批量OCR 没有数量上限适合集中处理扫描件、截图存档。打开「批量OCR」标签页拖入图片文件夹或单个图片。在设置里选择输出格式支持txt、jsonl、md、csv(Excel)四种。图片顶部水印总混进结果时进入「忽略区域」编辑器按住右键画矩形框包住水印框内的文本块会被整体忽略。点击开始任务。做完后应该看到指定目录里按图片名生成对应的文本文件若图片带水印结果中已不再出现水印文字。支持的图片格式为jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff。扫二维码或生成二维码这个场景解决图片里有个码想知道内容或想把一段文字变成码。二维码标签页同时支持扫码和生成。打开「二维码」标签页把含码图片拖入或截图、粘贴图片进来。程序识别其中的二维码、条形码一张图里有多个码也能全部读出来。生成方向在输入框填入文本选择协议和纠错等级即可生成二维码图片。做完后应该看到左侧列出识别出的码内容可直接复制生成的二维码图片可直接保存使用。目前支持 19 种码制包括QRCode、EAN13、PDF417等。本节要点截图OCR 支持划选复制与记录编辑批量OCR 可忽略区域排除水印二维码页支持一图多码与生成码个性化调优一键切换界面语言想改什么界面默认跟随系统语言想手动指定时使用。在哪里改进入「全局设置」→「语言/Language」选择目标语言后界面即时生效。软件内置简体中文、English、繁體中文、日本語、Português、Русский 等语言翻译文件在UmiOCR-data/i18n。改完如何验证重新打开任意标签页检查菜单与按钮文字是否变为所选语言。一键切换OCR引擎想改什么RapidOCR 兼容性好PaddleOCR 速度稍快想按机器情况换引擎。在哪里改进入「全局设置」→「OCR插件」在列表中选择对应引擎。两个引擎不能同时占用同一插件位切换前可先导入备用引擎插件到UmiOCR-data/plugins。改完如何验证打开「截图OCR」识别一张文字清晰的图片识别正常且无报错即为生效。调整大图边长限制想改什么识别像素超大的长图或大图时结果异常需要放宽限制。在哪里改进入对应标签页的设置 →「文字识别」→「限制图像边长」把数值调高。改完如何验证重新提交同一张大图任务能正常出结果且不再报错即说明数值足够。本节要点语言、引擎均在「全局设置」修改大图识别先调高图像边长限制引擎可换插件随时切换常见问题现象双击Umi-OCR.exe弹窗Cannot find Py_Main()程序无法启动。可能原因系统缺少 VC 运行库。解决办法下载安装 VC 运行库官网vc_redist.x64.exe重启电脑或双击UmiOCR-data/RUN_GUI.bat临时启动。现象截图时窗口闪烁、界面 UI 错位。可能原因显卡加速渲染方案与你的显卡不兼容。解决办法进入「全局设置」→「界面和外观」→「渲染器」切换到其他渲染方案或关闭硬件加速。现象执行umi-ocr --screenshot等命令行指令没有反应。可能原因HTTP 服务未开启命令行依赖它向后台进程传指令。解决办法打开「全局设置」勾选允许 HTTP 服务默认开启主机保持「仅本地」。详见 命令行手册。现象批量识别长图/大图结果被截断或报错。可能原因图像边长超过默认限制。解决办法进入页面设置 →「文字识别」→「限制图像边长」调高数值后重新提交任务。本节要点启动报错先看 VC 运行库命令行无反应先查 HTTP 服务渲染异常切渲染器即可解决写在最后到这里你已经能完成截图识别、批量处理、二维码收发和三处高频调优。想继续深入建议按顺序读三份仓库内文档命令行手册--path、--output等指令、HTTP接口手册把识别能力接进自己的脚本、更新日志了解每个版本改了什么。发现问题可直接在项目仓库提 Issue翻译工作也欢迎参与。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表