ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

快速上手 Umi-OCR:从截图OCR到批量导出,免费离线的3条路径

快速上手 Umi-OCR:从截图OCR到批量导出,免费离线的3条路径 快速上手 Umi-OCR从截图OCR到批量导出免费离线的3条路径【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、离线运行的 OCR 文字识别软件支持截图取词、批量图片识别、扫描版 PDF 转可搜索文档还能扫码和生成二维码。不联网、不注册Windows 或 Linux 解压即用。下面从手动认一张图到脚本里调它把最常用的路径走一遍。 一键截屏把屏幕上认不出的字抠出来最直接的用法是处理屏幕上复制不到的文字——PDF 阅读器里的段落、游戏界面、图片查看器里的图。打开截图OCR标签页用页面上的快捷键唤起截屏工具框选想要区域松手后识别结果自动输出再按一次快捷键就能继续框下一块直到框完为止。这一页左右两个面板各管一件事左侧是图片预览可以直接用鼠标划选、复制图中区域右侧是识别记录栏文字可编辑右键可以复制单条、选中多条或清空记录。在别处复制的图片也能直接粘贴进来识别。用文本后处理把排版理顺原始识别结果是一堆文本块顺序经常和原文对不上。Umi-OCR 提供一组文本后处理-排版解析方案帮你整理多栏-按自然段换行适合多栏排版的文档和网页自动识别多栏布局、按段落换行单栏-保留缩进适合代码截图保留行首缩进和行内空格不做处理输出引擎的原始结果。这些方案同时自动处理横排和竖排从右到左的排版。识别前先按图片类型选对方案结果会好整理得多。一次认完几百张批量OCR要认的不是单张图而是一整批图片时切到批量OCR标签页。拖入或选择图片后任务列表里能看到每张文件的耗时和置信度。批量处理没有图片数量上限一次丢进几百张也没问题。输入支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff等常见格式识别结果可导出为txt, jsonl, md, csv(Excel)四种想整理成表格就用 CSV。还有两个细节值得知道任务支持完成后自动关机/待机丢一批图片挂上任务就可以走人如果认的是像素超大的长图到页面的设置→文字识别→限制图像边长把数值调高避免大图被截断。用忽略区域去掉水印和页眉页脚批量图片如果都带同样的水印、页眉或 Logo识别结果会混进一堆噪音文字。忽略区域编辑器就是为此准备的从批量识别页右栏设置进入按住右键画出多个矩形框任务中这些区域内的文字会被直接跳过。注意一条规则只有完整落在框内的文本块才会被忽略跨在框边上的会保留。所以画框时宁大勿小把水印可能出现的位置整个包进去。把扫描版 PDF 变成能搜文字的文档文档识别手上有扫描件的话文档识别标签页是刚需。它支持pdf, xps, epub, mobi, fb2, cbz两种处理思路对纯扫描页做 OCR或对已有文字层的文档直接提取原有文本。最有价值的输出是双层可搜索 PDF——底层还是原来的扫描图上层多了一层文字可以直接在 PDF 里选中文字、搜索关键词、复制粘贴。对归档纸质合同和扫描资料的人来说等于把文件恢复成可编辑状态。文档识别同样支持设置忽略区域固定位置的页眉页脚可以一次性排除掉。二维码标签页扫码和生成在一个页面办完二维码标签页把两个方向合在一起扫码截图、粘贴或拖入本地图片读出里面的二维码、条形码支持一图多码覆盖 QRCode、DataMatrix、PDF417 在内的 19 种协议生成码输入文本生成码图可指定协议和纠错等级等参数。日常场景就是手机上的码截个图粘进来读。需要批量生成码图时交给下一章的命令行处理。在脚本里调 Umi-OCR命令行和 HTTP 接口两条路umi-ocr 常用三条指令命令行调用的入口就是主程序本身指令通过本地 HTTP 服务传递给后台进程默认开启只允许本地环回访问不经过物理网卡。最常用的三条umi-ocr --screenshot umi-ocr --path D:/images --clip umi-ocr --qrcode_create https://example.com D:/code.png 128第一条唤起截屏识别第二条批量识别整个文件夹含子文件夹里的图片结果复制到剪贴板第三条生成 128 像素的二维码图。想把结果写进文件在指令后追加--output file.txt--是它的别名。所有参数都支持前缀简写比如--screenshot可以写成--sc。范围截屏指定显示器和矩形区域、无需鼠标划选、可以调用任意页面函数的高级指令全表见 命令行手册。用 HTTP 接口接入你自己的程序调用方不是批处理脚本而是你自己写的程序时软件暴露了一个本地 HTTP 接口默认端口1224。图片识别/api/ocrBase64 传图、文档识别/api/doc、二维码识别/生成/api/qrcode都在里面还可以往/argv发请求来代替命令行。接口说明和示例代码在 HTTP 接口手册 里。有一条提醒后端对并发支持较弱请求别并行轰炸一条发完再发下一条。⚙️ 全局设置把软件调成自己的样子全局设置标签页负责把软件调成顺手的样子快捷方式桌面、开始菜单、开机自启勾选即生效语言默认跟随系统也可以手切繁中、英语、日语等外观多个亮/暗主题字体和界面大小比例都能改渲染器如果出现截屏闪烁、UI 错位换一种渲染方案或关闭硬件加速试试。引擎方面Umi-OCR 内置RapidOCR和PaddleOCR两套离线引擎本仓库里的发行包Umi-OCR_Rapid_v2.1.5.7z就是自带 Rapid 引擎、解压即用的版本想换引擎装对应插件后在设置里切换即可。界面翻译靠 Weblate 平台协作维护发现漏译、错译的词条也可以顺手贡献。解压后双击Umi-OCR.exe就能完成第一次识别从截图OCR标签页起步即可。要把识别接进自己的工作流先翻一遍 docs/README_CLI.md 的指令表每条指令都能在终端里当场试通。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表