ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

免费离线OCR完整上手:Umi-OCR 截图OCR、批量图片文字识别与扫描版PDF提取文字实测

免费离线OCR完整上手:Umi-OCR 截图OCR、批量图片文字识别与扫描版PDF提取文字实测 免费离线OCR完整上手Umi-OCR 截图OCR、批量图片文字识别与扫描版PDF提取文字实测【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费离线 OCR工具代码全开源识别全程在本机完成断网照跑没有登录和上传环节。我实测了大约两周用它处理完 300 多张书页照片和一本 500 多页的旧 PDF全程没有连过一次网。上手从解压发行包到出第一条识别结果免费 OCR 能不能信标准就一条代码摆不摆在明面上。Umi-OCR 全部代码开源你在意的细节都能翻源码核实图片从头到尾不离开本机不存在登录、上传环节中文、英文、日文等多语言识别库内置切换语言不用下载模型。 发行包分两种后缀.7z需要解压软件.7z.exe是自解压包没装压缩工具就双击后者。解压后双击Umi-OCR.exe启动全程零安装。首次打开界面跟随系统语言显示标签页共五个截图OCR、批量OCR、文档识别、二维码、全局设置。建议先点右上角的锁把标签页锁定防止误关。之后进截图OCR页框选一块屏幕文字就能拿到第一条结果——实测从解压到这一步不超过 5 分钟。场景一截图OCR把屏幕上的文字变成可复制文本任务很直接屏幕上有一段文字代码、论文、聊天记录要变成能复制的文本。截图OCR给三种输入方式按快捷键框选屏幕、把别处复制的图片粘贴进来、或把本地图直接拖进窗口。常规截图基本即时出结果。决定复制效果好不好用的是「排版解析方案」这个设置项识别代码截图时选单栏-保留缩进行首缩进和行内空格原样保留复制进编辑器不用重新排版读左右两栏的论文时选多栏-按自然段换行两栏文字按阅读顺序输出不会左右交错。右侧记录栏里划选多条记录可以一起复制或存成 txt。场景二批量图片文字识别几百张一次拖完任务升级一次要识别大量图片。我在批量OCR页把 300 多张书页照片一次性拖进任务列表点「开始任务」之后就不用管了。支持的常见格式有jpg / png / webp / bmp / tif数量没有上限。结果能存成txt、jsonl、md、csv四种格式其中 csv 直接进 Excel 就能看。有一批结果我导出成 csv 进了 Excel省去了逐条录入。素材里有重复干扰项的话先处理。我的照片右上角带拍摄时间水印、页脚有阴影打开「忽略区域」编辑器按住右键把水印可能出现的位置框出来执行时这些区域的文字会被整块跳过导出来的结果就干净了。场景三扫描版PDF提取文字输出双层可搜索PDF任务没有文字层的旧书 PDF翻起来等于翻照片。那本 500 多页的旧 PDF 就是这样。文档识别页支持pdf、xps、epub、mobi、fb2、cbz等格式对扫描件做完 OCR 后输出「双层可搜索 PDF」底层是原图保持原书排版上层是透明文字可以全文搜索、划词复制。在成品里搜一个术语几秒内就能列出所有相关段落。文档识别同样支持忽略区域那本几百页的书每页页眉页脚都印着书名和页码提前把忽略框画好正文里就不会混进这些重复的字。多个大文件可以排队处理再配合任务完成后的自动关机睡前把任务挂上机器跑完自己关机。避坑与边界先知道这三件事再开跑现象原因应对超长截图后半段文字丢失默认有边长保护过长的图会被截断识别到页面设置里把「限制图像边长」调高重跑一遍结果混进水印、时间戳、页码水印、页眉页脚被当成正文识别忽略区域编辑器里按住右键框住固定位置且框要完整包住文本块才生效手写体、低清老照片识别率明显下降离线本地引擎的固有极限没有设置可调改善拍摄与素材清晰度极限准确率需求只能走云端方案第三行没有配置能救。说句实话离线引擎对潦草手写体、低清老照片的识别率确实不如云端大厂的在线 OCR。我的素材以打印体和清晰截图为主这个取舍对我的用途够用了但如果你的素材以手写和低清为主下载前就把这条算进成本。⚠️从桌面工具到自动化接口二维码、命令行与 HTTP二维码页能干两件事识别19 种码制协议支持一图多码反向也行输入文本直接生成二维码图片纠错等级可调。想把 OCR 嵌进自己的工作流命令行和 HTTP 接口都开放了手册分别在 docs/README_CLI.md 和 docs/http/README.md命令行umi-ocr --path D:/imgs --output result.txt整个文件夹批量识别并输出到 txtHTTP向http://127.0.0.1:1224/argv发送 JSON 指令列表如[--screenshot]界面默认跟随系统语言内置简中、繁中、英、日等也可在「全局设置 → 语言/Language」手动切换。下载前自问三个问题资料能不能离开本机工作文档、论文扫描件、旧书 PDF隐私是刚需 → Umi-OCR 全程本机识别、解压即用零安装正好对路。工作量是几张清晰截图还是几百张批量任务要批量处理大量图片、把扫描件变成双层可搜索 PDF或计划用命令行、HTTP 做集成 → 都支持排队处理和自动关机也备着。素材是清晰打印体还是潦草手写、低清老照片以后者为主且追求极限识别率 → 本地引擎打不过云端换方案系统不是 Windows x64 / Linux x64比如 Mac或者想要云端那种传完即出、按量付费的模式 → 也不用选它。❓资料出不了本机现在把 Umi-OCR 解压起来框一块屏幕上的文字跑一遍试试。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表