news 2026/9/10 22:15:30

Umi-OCR:免费离线文字识别,解压后三步跑完第一次识别

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR:免费离线文字识别,解压后三步跑完第一次识别

Umi-OCR:免费离线文字识别,解压后三步跑完第一次识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

想让扫描件合同里的一行字能被选中,光标落下去却没反应;想把教程截图里的一段话复制走,只能对着屏幕手打一遍。Umi-OCR 就是干这个的:免费、开源、离线文字识别工具,截图、扫描件、PDF 都能变成可复制的文字,不联网,图片也留在你自己电脑上。

上手成本:解压后 3 步完成首次识别

全程没有安装步骤,也不联网,3 分钟以内可以走完:

  1. 从项目发布渠道拿到最新发布包,.7z压缩包和.7z.exe自解压包都可以。
  2. 解压到任意目录(路径里避开中文),Windows 双击Umi-OCR.exe启动,Linux 下运行umi-ocr.sh
  3. 打开"截图OCR"标签页,按快捷键框选你要的文字,识别结果直接进入剪贴板。

到这里,第一次识别就完成了——出来的字是可以直接粘贴的文字,不是图片。

“截图OCR”标签页:左侧是框选的截图,右侧记录区逐条给出置信度和时间,可以划选多条一起复制。

🔍 能力地图:Umi-OCR 能替你干掉的 5 件事

截图与剪贴板识别

你手头正好有一段教程截图里的文字要搬到别处时,打开“截图OCR”,快捷键框选,结果直接进剪贴板,下一步就是 Ctrl+V。从别处复制的图像也能粘贴进识别区。右侧每条记录都标着置信度和时间,可以编辑,也能划选多条一起复制,不必一条条处理。

批量转换文件夹里的图片

你手头正好有一个装着几百页扫描件的文件夹、想一次变成文本文件时,“批量OCR”一次性导入,jpg、png、bmp、tiff、webp 都能读,数量不设上限。结果可以导出为 txt、md、jsonl、csv(Excel),还能勾选任务完成后自动关机,晚上挂上,睡醒收工。

批量 OCR 页:左侧列出每个文件的耗时与置信度,右侧显示每张图的识别结果,顶部是整体进度 3/13。

图片型 PDF 变双层可搜索 PDF

你手头正好有一份选不中字的图片型 PDF 合同或论文时,走“文档识别”,pdf、xps、epub、mobi 都能导入。它能抽出原有文本,也能对扫描件整体 OCR,产出是双层 PDF:底层保留原版式,顶层是可选择的文字层。再配合忽略区域,页眉页脚也能一并剔掉。

19 种码制的读取与生成

你手头正好有一张图片里的二维码死活扫不出来,或者想把一段文本做成二维码图片时,用“二维码”页:截图、粘贴、拖入图片都行,一张图里多个码也能一起读,覆盖 QR、EAN13、Code128 在内的 19 种码制。反过来输入文本生成二维码也可以,纠错等级能调。

把识别能力塞进你自己的脚本

如果你是开发者、想把文字识别写进自己的流程,主程序本身就是 CLI 入口,指向文件或文件夹即可识别,也能直接截图识别:

umi-ocr --path "D:\images" umi-ocr --screenshot umi-ocr --qrcode_create "文本内容" "D:\code.png"

另外还有一组 HTTP 接口,别的程序发个请求就能拿到识别结果。

🩹 排障与调参:常见现象对照表

大部分识别效果问题不是引擎的错,是参数没选对:

现象调整位置效果
截图闪烁、界面错位全局设置 → 界面和外观,切换渲染器或关闭硬件加速换成更稳的软件渲染,界面不再闪
长图、超清大图只识别了一部分批量 OCR 页设置里的“限制图像边长”调高上限,大图不再被截断
双栏论文的文字顺序读乱排版解析方案选“多栏-按自然段换行”按栏顺序阅读,段落不再串位
代码截图的缩进丢了排版解析方案选“单栏-保留缩进”缩进原样保留,粘进编辑器即可用
水印、页眉文字混进结果“忽略区域”编辑器,按住右键画矩形框框内完整包含的文本块被剔除,框要画大些
命令行敲了没反应全局设置里确认 HTTP 服务已开启服务默认开启,通信只在本地环回
界面显示成英文全局设置 → 语言简中、繁中、英文、日文等可切换
某些语言漏字全局设置里换另一套 OCR 引擎确认语言包覆盖目标语言后重新识别

先想清楚再装:谁用它最划算

这类人用它最值

  • 经常把合同、票据、扫描件数字化的人:图片和结果都留在本机磁盘,不上传任何云端
  • 要从扫描版论文里抽正文、还要批量处理的人:批量 OCR 不设数量上限,还能跑完自动关机
  • 想把文字识别编进脚本或工作流的人:主程序自带 CLI 入口,另有 HTTP 接口给别的程序调用

这些情况先别碰

  • 用 Mac 的:官方只有 Windows 7 x64 和 Linux x64 版本,没有 Mac 原生包
  • 期望识别完直接还原出 Word 排版的:它只输出文字,不做版面还原
  • 严重模糊、畸变的低质量照片:任何离线 OCR 引擎在这类图上都会吃力

资源入口:仓库、文档与社区在哪找

  • 仓库源码:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR——想翻源码、核对行为或提代码时用
  • 更新日志:CHANGE_LOG.md——升级新版本前后对照新特性和修复项
  • 命令行手册:docs/README_CLI.md——写脚本时查参数和示例
  • HTTP 接口手册:docs/http/README.md——其他程序要调识别服务时看请求格式
  • 社区渠道:Bug 和建议在仓库提 Issue;界面翻译在 Weblate 平台协作,想补翻译就去那边

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 22:13:11

VTK观察者模式与事件回调机制详解

1. VTK回调事件与观察者模式解析 在可视化工具包VTK的开发中,事件回调机制是实现交互功能的核心基础设施。我第一次接触这个机制是在开发医学影像测量工具时,需要实时获取鼠标在三维视图中的位置坐标。传统的事件处理方式无法满足这种持续性的交互需求&a…

作者头像 李华
网站建设 2026/9/10 22:12:07

10 分钟把沉浸式翻译接上本地模型,断网也能双语翻译

10 分钟把沉浸式翻译接上本地模型,断网也能双语翻译 【免费下载链接】immersive-translate 沉浸式双语网页翻译扩展 , 支持输入框翻译, 鼠标悬停翻译, PDF, Epub, 字幕文件, TXT 文件翻译 - Immersive Dual Web Page Translation Extension …

作者头像 李华
网站建设 2026/9/10 22:10:51

怀化AI短视频怎么制作?小白也能轻松上手

来源:唐sirAI(www.tangsir.cc) | 电话:18874530691━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━很多怀化的商家在搜索怀化AI短视频怎么制作时,都会有各种各样的疑问。今天&…

作者头像 李华