Umi-OCR:免费离线文字识别,解压后三步跑完第一次识别
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
想让扫描件合同里的一行字能被选中,光标落下去却没反应;想把教程截图里的一段话复制走,只能对着屏幕手打一遍。Umi-OCR 就是干这个的:免费、开源、离线文字识别工具,截图、扫描件、PDF 都能变成可复制的文字,不联网,图片也留在你自己电脑上。
上手成本:解压后 3 步完成首次识别
全程没有安装步骤,也不联网,3 分钟以内可以走完:
- 从项目发布渠道拿到最新发布包,
.7z压缩包和.7z.exe自解压包都可以。 - 解压到任意目录(路径里避开中文),Windows 双击
Umi-OCR.exe启动,Linux 下运行umi-ocr.sh。 - 打开"截图OCR"标签页,按快捷键框选你要的文字,识别结果直接进入剪贴板。
到这里,第一次识别就完成了——出来的字是可以直接粘贴的文字,不是图片。
“截图OCR”标签页:左侧是框选的截图,右侧记录区逐条给出置信度和时间,可以划选多条一起复制。
🔍 能力地图:Umi-OCR 能替你干掉的 5 件事
截图与剪贴板识别
你手头正好有一段教程截图里的文字要搬到别处时,打开“截图OCR”,快捷键框选,结果直接进剪贴板,下一步就是 Ctrl+V。从别处复制的图像也能粘贴进识别区。右侧每条记录都标着置信度和时间,可以编辑,也能划选多条一起复制,不必一条条处理。
批量转换文件夹里的图片
你手头正好有一个装着几百页扫描件的文件夹、想一次变成文本文件时,“批量OCR”一次性导入,jpg、png、bmp、tiff、webp 都能读,数量不设上限。结果可以导出为 txt、md、jsonl、csv(Excel),还能勾选任务完成后自动关机,晚上挂上,睡醒收工。
批量 OCR 页:左侧列出每个文件的耗时与置信度,右侧显示每张图的识别结果,顶部是整体进度 3/13。
图片型 PDF 变双层可搜索 PDF
你手头正好有一份选不中字的图片型 PDF 合同或论文时,走“文档识别”,pdf、xps、epub、mobi 都能导入。它能抽出原有文本,也能对扫描件整体 OCR,产出是双层 PDF:底层保留原版式,顶层是可选择的文字层。再配合忽略区域,页眉页脚也能一并剔掉。
19 种码制的读取与生成
你手头正好有一张图片里的二维码死活扫不出来,或者想把一段文本做成二维码图片时,用“二维码”页:截图、粘贴、拖入图片都行,一张图里多个码也能一起读,覆盖 QR、EAN13、Code128 在内的 19 种码制。反过来输入文本生成二维码也可以,纠错等级能调。
把识别能力塞进你自己的脚本
如果你是开发者、想把文字识别写进自己的流程,主程序本身就是 CLI 入口,指向文件或文件夹即可识别,也能直接截图识别:
umi-ocr --path "D:\images" umi-ocr --screenshot umi-ocr --qrcode_create "文本内容" "D:\code.png"另外还有一组 HTTP 接口,别的程序发个请求就能拿到识别结果。
🩹 排障与调参:常见现象对照表
大部分识别效果问题不是引擎的错,是参数没选对:
| 现象 | 调整位置 | 效果 |
|---|---|---|
| 截图闪烁、界面错位 | 全局设置 → 界面和外观,切换渲染器或关闭硬件加速 | 换成更稳的软件渲染,界面不再闪 |
| 长图、超清大图只识别了一部分 | 批量 OCR 页设置里的“限制图像边长” | 调高上限,大图不再被截断 |
| 双栏论文的文字顺序读乱 | 排版解析方案选“多栏-按自然段换行” | 按栏顺序阅读,段落不再串位 |
| 代码截图的缩进丢了 | 排版解析方案选“单栏-保留缩进” | 缩进原样保留,粘进编辑器即可用 |
| 水印、页眉文字混进结果 | “忽略区域”编辑器,按住右键画矩形框 | 框内完整包含的文本块被剔除,框要画大些 |
| 命令行敲了没反应 | 全局设置里确认 HTTP 服务已开启 | 服务默认开启,通信只在本地环回 |
| 界面显示成英文 | 全局设置 → 语言 | 简中、繁中、英文、日文等可切换 |
| 某些语言漏字 | 全局设置里换另一套 OCR 引擎 | 确认语言包覆盖目标语言后重新识别 |
先想清楚再装:谁用它最划算
这类人用它最值
- 经常把合同、票据、扫描件数字化的人:图片和结果都留在本机磁盘,不上传任何云端
- 要从扫描版论文里抽正文、还要批量处理的人:批量 OCR 不设数量上限,还能跑完自动关机
- 想把文字识别编进脚本或工作流的人:主程序自带 CLI 入口,另有 HTTP 接口给别的程序调用
这些情况先别碰
- 用 Mac 的:官方只有 Windows 7 x64 和 Linux x64 版本,没有 Mac 原生包
- 期望识别完直接还原出 Word 排版的:它只输出文字,不做版面还原
- 严重模糊、畸变的低质量照片:任何离线 OCR 引擎在这类图上都会吃力
资源入口:仓库、文档与社区在哪找
- 仓库源码:
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR——想翻源码、核对行为或提代码时用 - 更新日志:CHANGE_LOG.md——升级新版本前后对照新特性和修复项
- 命令行手册:docs/README_CLI.md——写脚本时查参数和示例
- HTTP 接口手册:docs/http/README.md——其他程序要调识别服务时看请求格式
- 社区渠道:Bug 和建议在仓库提 Issue;界面翻译在 Weblate 平台协作,想补翻译就去那边
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考