news 2026/9/8 15:13:36

Umi-OCR 离线OCR文字识别实战指南:免费开源、截图与批量处理一步到位

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 离线OCR文字识别实战指南:免费开源、截图与批量处理一步到位

Umi-OCR 离线OCR文字识别实战指南:免费开源、截图与批量处理一步到位

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源且完全离线运行的 OCR 文字识别工具。它不需要联网、不上传任何图片,就能完成截图识别、批量图片处理、PDF 文档识别和二维码扫描生成四类任务,适合看重数据隐私的个人用户、需要批量数字化的办公人员,以及希望把文字识别集成进自动化流程的开发者。

为什么选择离线 OCR 软件

很多在线文字识别服务要求上传图片到云端,存在两个麻烦:

  • 隐私风险:合同、病历、内部文档截图等敏感内容不宜出网;
  • 使用限制:部分服务需要注册、有次数配额,批量处理时成本不可控。

Umi-OCR 的解决思路是把识别引擎完整内置在本地:

特性说明
完全离线识别过程不经过物理网卡,图片不离开本机
免费无限制代码开源,无次数、无会员、无广告
解压即用无需安装,双击主程序即可启动
引擎内置自带 OCR 引擎,内置多国语言识别库,支持中文、英文等
多种调用方式图形界面、命令行、HTTP 接口均可驱动

适用平台:Windows 7/8/10/11 x64 与 Linux x64。Windows 下建议保留 Visual C++ 2015-2022 运行库,以免主程序因缺少依赖而启动失败。

三步跑起来:获取、解压、启动

第 1 步:获取软件包

三种方式任选其一:

  1. 下载压缩包:从项目发布页获取.7z压缩包或.7z.exe自解压包(后者无需额外安装压缩软件);
  2. Scoop 安装:Windows 用户可添加extras桶后执行scoop install extras/umi-ocr,一步装好(另有 Paddle 引擎版本可选);
  3. 源码构建:适合开发者二次开发,构建步骤见 README 中的"构建项目"章节。

第 2 步:解压到固定目录

选择一条不含中文和空格的路径(例如D:\Umi-OCR\)解压。软件以"数据目录 + 程序"的方式组织,运行后会在同目录生成UmiOCR-data文件夹存放配置与缓存,建议整个目录一起备份。

第 3 步:启动并确认界面语言

双击Umi-OCR.exe启动。首次运行会按系统语言自动切换界面;如需手动调整,进入"全局设置 → 语言/Language"选择目标语言后重启即可。

任务一:截图识别——一键提取屏幕上的文字

这是使用频率最高的场景:网页、文档、聊天记录里的文字,框一下就能变成本地文本。

操作流程:

  1. 打开"截图OCR"标签页,按快捷键(可在设置中自定义)唤起截图;
  2. 鼠标划选要识别的区域,松开后结果自动出现在右侧识别记录栏;
  3. 在预览图上直接划选复制,或在记录栏中编辑、合并多条记录后复制。

让结果更可用的关键设置是"文本后处理",不同预设对应不同排版场景:

排版解析方案适用场景
多栏-按自然段换行报纸、双栏文档等大部分情况
单栏-保留缩进代码截图,保留行首缩进与行内空格
单栏-无换行需要把所有语句合并成一段时
不做处理保留引擎原始输出,逐行调试用

以上方案同时支持横排和竖排(从右到左)文字。识别代码时记得切到"保留缩进"方案,行距和空格才能被正确保留,方便直接粘进编辑器。

任务二:批量处理——一次识别几百张图片

需要把一整个文件夹的扫描件、票据截图转成文字时,用"批量OCR"标签页:

  • 支持格式:jpg、jpeg、jfif、png、webp、bmp、tif、tiff;
  • 无数量上限:一次性导入几百张图片排队处理;
  • 递归导入:传入文件夹路径时会包含嵌套子文件夹中的图片;
  • 结果输出:txt、jsonl、md、csv(Excel 可打开)四种格式,按后续用途选择——人工校对选 txt/md,程序处理选 jsonl,表格归档选 csv;
  • 附加能力:支持任务完成后自动关机/待机,适合夜间挂机跑大批量任务。

忽略区域是批量识别的实用技巧:如果每张图片的固定位置都有水印或 LOGO,可以在识别前用右击绘制多个矩形框,框内的文字块会被整体排除,避免水印污染识别结果。画框时尽量放大,把水印可能出现的位置全部包住。

另外,若图片像素特别大(长图、扫描大图),请在页面设置中调高"限制图像边长"的数值,否则超大图可能被截断识别。

任务三:文档识别——把扫描件变成可搜索 PDF

"文档识别"标签页面向 PDF 及电子书文件(pdf、xps、epub、mobi、fb2、cbz):

  • 扫描件做 OCR,对已有文本层的 PDF 直接提取文字;
  • 可输出双层可搜索 PDF——原图像不变,上面叠加一层不可见文字,之后就能用 PDF 阅读器直接搜索、复制;
  • 同样支持忽略区域,常用于排除每页重复出现的页眉、页脚。

典型流程:整本扫描书 → 导入文档识别 → 勾选输出双层 PDF → 得到一份可以 Ctrl+F 的电子书。

任务四:二维码——扫描与生成二合一

"二维码"标签页覆盖两个方向:

  • 扫码:截图、粘贴或拖入本地图片,读取其中的二维码和条形码,支持一图多码,覆盖 QRCode、EAN13、DataMatrix、PDF417 等 19 种协议;
  • 生成码:输入文本即可生成二维码图片,可选纠错等级等参数,输出为本地图片文件。

办公中"把一批表格截图里的码统一扫出来"这类需求,直接配合批量路径传入即可完成。

进阶:用命令行和 HTTP 接口驱动 Umi-OCR

图形界面之外,Umi-OCR 还有两条程序化调用路径,官方手册在 docs/README_CLI.md 与 docs/http/README.md。

命令行调用

入口就是主程序本身。几条高频指令:

# 识别单张图片或整个文件夹(含子文件夹) umi-ocr --path "D:/images/" # 截图识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别结果写入文件(覆盖 / 追加) umi-ocr --path "D:/a.png" --output "result.txt" umi-ocr --path "D:/a.png" --output_append "result.txt"

要点:

  • 指令支持前缀简写,如--screenshot可写成--sc
  • 命令行识别依赖软件内置的 HTTP 服务做跨进程通信(默认开启,仅本地环回),若提示无法调用,先去全局设置确认服务已允许;
  • 结果输出建议用--clip--output显式指定,系统管道重定向可能失效。

HTTP 接口调用

把 Umi-OCR 当作一台"本地识别服务器":

  1. 在"全局设置 → 服务"中确认允许 HTTP 服务(默认开启),需要局域网访问时把主机切到"任何可用地址";
  2. 接口覆盖图片 OCR(Base64 传图)、文档识别、二维码识别与生成、命令行转发五类能力,参数说明见 docs/http/api_ocr.md、docs/http/api_doc.md、docs/http/api_qrcode.md;
  3. 注意两点:后端对并发支持较弱,尽量串行调用;长时间大批量连续请求偶发ECONNREFUSED,重试即可恢复。

常见问题自查清单

遇到异常时,按此表从上到下排查:

症状可能原因处理办法
双击后程序不启动缺少 C++ 运行库安装 Visual C++ 2015-2022 运行库
界面显示异常、卡顿显卡驱动或硬件加速问题更新显卡驱动,或在全局设置中关闭相关加速选项
识别结果乱序、断行未选对排版解析方案按"任务一"的方案表切换,代码选"单栏-保留缩进"
水印文字混进结果未配置忽略区域批量页右栏进入忽略区域编辑器,框住水印位置
超大长图只识别了一半边长限制生效调高"限制图像边长"数值
命令行无响应HTTP 服务被禁用全局设置中允许 HTTP 服务
批量任务中途卡死内存不足或单张图过大减少单次导入数量、拆分任务

配置文件位于UmiOCR-data/.settings(ini 格式),可手动修改后执行umi-ocr --reload重新加载;运行日志在UmiOCR-data/logs/下,排查异常时先看最新日志。

下一步行动建议

  1. 今天就能做:下载压缩包,解压到无中文路径,双击启动,用快捷键截一张屏幕试试识别;
  2. 本周内:把日常最多的任务跑通一遍——网页文字用截图识别,文件归档用批量 OCR,扫描件用文档识别;
  3. 需要自动化时:先试命令行两条指令,再阅读 HTTP 接口文档,把识别能力接进自己的脚本或系统;
  4. 长期习惯:留意版本更新日志,及时获取引擎与功能修复。

相关资源入口

  • 命令行手册:docs/README_CLI.md
  • HTTP 接口手册:docs/http/README.md
  • 各接口参数详情:docs/http/api_ocr.md | docs/http/api_doc.md | docs/http/api_qrcode.md
  • 更新日志:CHANGE_LOG.md
  • 多语言翻译工具链(维护者用):dev-tools/i18n/
  • 配置位置:UmiOCR-data/.settings;日志位置:UmiOCR-data/logs/

Umi-OCR 的价值在于把"识别"这件事留在本机:不联网、不计费、不限量。从一张截图到一个装满扫描件的大文件夹,它都给出了可以直接落地的操作路径。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 1:13:10

DBeaver 数据比较实战:库对不上、库变慢,三步定位差异

DBeaver 数据比较实战:库对不上、库变慢,三步定位差异 【免费下载链接】dbeaver Free universal database tool and SQL client 项目地址: https://gitcode.com/GitHub_Trending/db/dbeaver 生产库和测试库对账,差了 37 行&#xff1b…

作者头像 李华
网站建设 2026/9/6 21:46:43

DBeaver XLSX 导出实战指南

DBeaver XLSX 导出实战指南 【免费下载链接】dbeaver Free universal database tool and SQL client 项目地址: https://gitcode.com/GitHub_Trending/db/dbeaver DBeaver 是一款免费开源的通用数据库工具,它的 XLSX 导出功能可以把任意查询结果直接落成能打…

作者头像 李华
网站建设 2026/9/6 3:03:58

北斗B1I扩频码Matlab生成原理与完整实现

简介:本资源是一份面向卫星导航信号处理初学者与MATLAB仿真实践者的北斗B1I路扩频码生成与基础接收链路仿真代码包,聚焦北斗系统核心调制技术,解决扩频码构造、BPSK调制、AWGN信道建模及粗同步(捕获)等关键环节的动手实…

作者头像 李华
网站建设 2026/9/7 0:02:25

Mage 工作流编排快速上手:10 分钟跑通第一条数据管道

Mage 工作流编排快速上手:10 分钟跑通第一条数据管道 【免费下载链接】data-engineer-handbook This is a repo with links to everything youd ever want to learn about data engineering 项目地址: https://gitcode.com/GitHub_Trending/da/data-engineer-handbook 还…

作者头像 李华
网站建设 2026/9/7 1:15:19

用FastAPI构建API包装SaaS:鉴权、限流与计量计费实战

如果你是一名后端开发者,大概率有过这样的想法:自己对接了不少第三方 API,翻译、OCR、内容审核、PDF 处理……如果把这些能力封装成一个统一接口,再卖给别人用,是不是就能“睡后收入”?这个想法方向没错&am…

作者头像 李华