Umi-OCR 离线OCR文字识别实战指南:免费开源、截图与批量处理一步到位
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源且完全离线运行的 OCR 文字识别工具。它不需要联网、不上传任何图片,就能完成截图识别、批量图片处理、PDF 文档识别和二维码扫描生成四类任务,适合看重数据隐私的个人用户、需要批量数字化的办公人员,以及希望把文字识别集成进自动化流程的开发者。
为什么选择离线 OCR 软件
很多在线文字识别服务要求上传图片到云端,存在两个麻烦:
- 隐私风险:合同、病历、内部文档截图等敏感内容不宜出网;
- 使用限制:部分服务需要注册、有次数配额,批量处理时成本不可控。
Umi-OCR 的解决思路是把识别引擎完整内置在本地:
| 特性 | 说明 |
|---|---|
| 完全离线 | 识别过程不经过物理网卡,图片不离开本机 |
| 免费无限制 | 代码开源,无次数、无会员、无广告 |
| 解压即用 | 无需安装,双击主程序即可启动 |
| 引擎内置 | 自带 OCR 引擎,内置多国语言识别库,支持中文、英文等 |
| 多种调用方式 | 图形界面、命令行、HTTP 接口均可驱动 |
适用平台:Windows 7/8/10/11 x64 与 Linux x64。Windows 下建议保留 Visual C++ 2015-2022 运行库,以免主程序因缺少依赖而启动失败。
三步跑起来:获取、解压、启动
第 1 步:获取软件包
三种方式任选其一:
- 下载压缩包:从项目发布页获取
.7z压缩包或.7z.exe自解压包(后者无需额外安装压缩软件); - Scoop 安装:Windows 用户可添加
extras桶后执行scoop install extras/umi-ocr,一步装好(另有 Paddle 引擎版本可选); - 源码构建:适合开发者二次开发,构建步骤见 README 中的"构建项目"章节。
第 2 步:解压到固定目录
选择一条不含中文和空格的路径(例如D:\Umi-OCR\)解压。软件以"数据目录 + 程序"的方式组织,运行后会在同目录生成UmiOCR-data文件夹存放配置与缓存,建议整个目录一起备份。
第 3 步:启动并确认界面语言
双击Umi-OCR.exe启动。首次运行会按系统语言自动切换界面;如需手动调整,进入"全局设置 → 语言/Language"选择目标语言后重启即可。
任务一:截图识别——一键提取屏幕上的文字
这是使用频率最高的场景:网页、文档、聊天记录里的文字,框一下就能变成本地文本。
操作流程:
- 打开"截图OCR"标签页,按快捷键(可在设置中自定义)唤起截图;
- 鼠标划选要识别的区域,松开后结果自动出现在右侧识别记录栏;
- 在预览图上直接划选复制,或在记录栏中编辑、合并多条记录后复制。
让结果更可用的关键设置是"文本后处理",不同预设对应不同排版场景:
| 排版解析方案 | 适用场景 |
|---|---|
| 多栏-按自然段换行 | 报纸、双栏文档等大部分情况 |
| 单栏-保留缩进 | 代码截图,保留行首缩进与行内空格 |
| 单栏-无换行 | 需要把所有语句合并成一段时 |
| 不做处理 | 保留引擎原始输出,逐行调试用 |
以上方案同时支持横排和竖排(从右到左)文字。识别代码时记得切到"保留缩进"方案,行距和空格才能被正确保留,方便直接粘进编辑器。
任务二:批量处理——一次识别几百张图片
需要把一整个文件夹的扫描件、票据截图转成文字时,用"批量OCR"标签页:
- 支持格式:jpg、jpeg、jfif、png、webp、bmp、tif、tiff;
- 无数量上限:一次性导入几百张图片排队处理;
- 递归导入:传入文件夹路径时会包含嵌套子文件夹中的图片;
- 结果输出:txt、jsonl、md、csv(Excel 可打开)四种格式,按后续用途选择——人工校对选 txt/md,程序处理选 jsonl,表格归档选 csv;
- 附加能力:支持任务完成后自动关机/待机,适合夜间挂机跑大批量任务。
忽略区域是批量识别的实用技巧:如果每张图片的固定位置都有水印或 LOGO,可以在识别前用右击绘制多个矩形框,框内的文字块会被整体排除,避免水印污染识别结果。画框时尽量放大,把水印可能出现的位置全部包住。
另外,若图片像素特别大(长图、扫描大图),请在页面设置中调高"限制图像边长"的数值,否则超大图可能被截断识别。
任务三:文档识别——把扫描件变成可搜索 PDF
"文档识别"标签页面向 PDF 及电子书文件(pdf、xps、epub、mobi、fb2、cbz):
- 对扫描件做 OCR,对已有文本层的 PDF 直接提取文字;
- 可输出双层可搜索 PDF——原图像不变,上面叠加一层不可见文字,之后就能用 PDF 阅读器直接搜索、复制;
- 同样支持忽略区域,常用于排除每页重复出现的页眉、页脚。
典型流程:整本扫描书 → 导入文档识别 → 勾选输出双层 PDF → 得到一份可以 Ctrl+F 的电子书。
任务四:二维码——扫描与生成二合一
"二维码"标签页覆盖两个方向:
- 扫码:截图、粘贴或拖入本地图片,读取其中的二维码和条形码,支持一图多码,覆盖 QRCode、EAN13、DataMatrix、PDF417 等 19 种协议;
- 生成码:输入文本即可生成二维码图片,可选纠错等级等参数,输出为本地图片文件。
办公中"把一批表格截图里的码统一扫出来"这类需求,直接配合批量路径传入即可完成。
进阶:用命令行和 HTTP 接口驱动 Umi-OCR
图形界面之外,Umi-OCR 还有两条程序化调用路径,官方手册在 docs/README_CLI.md 与 docs/http/README.md。
命令行调用
入口就是主程序本身。几条高频指令:
# 识别单张图片或整个文件夹(含子文件夹) umi-ocr --path "D:/images/" # 截图识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别结果写入文件(覆盖 / 追加) umi-ocr --path "D:/a.png" --output "result.txt" umi-ocr --path "D:/a.png" --output_append "result.txt"要点:
- 指令支持前缀简写,如
--screenshot可写成--sc; - 命令行识别依赖软件内置的 HTTP 服务做跨进程通信(默认开启,仅本地环回),若提示无法调用,先去全局设置确认服务已允许;
- 结果输出建议用
--clip或--output显式指定,系统管道重定向可能失效。
HTTP 接口调用
把 Umi-OCR 当作一台"本地识别服务器":
- 在"全局设置 → 服务"中确认允许 HTTP 服务(默认开启),需要局域网访问时把主机切到"任何可用地址";
- 接口覆盖图片 OCR(Base64 传图)、文档识别、二维码识别与生成、命令行转发五类能力,参数说明见 docs/http/api_ocr.md、docs/http/api_doc.md、docs/http/api_qrcode.md;
- 注意两点:后端对并发支持较弱,尽量串行调用;长时间大批量连续请求偶发
ECONNREFUSED,重试即可恢复。
常见问题自查清单
遇到异常时,按此表从上到下排查:
| 症状 | 可能原因 | 处理办法 |
|---|---|---|
| 双击后程序不启动 | 缺少 C++ 运行库 | 安装 Visual C++ 2015-2022 运行库 |
| 界面显示异常、卡顿 | 显卡驱动或硬件加速问题 | 更新显卡驱动,或在全局设置中关闭相关加速选项 |
| 识别结果乱序、断行 | 未选对排版解析方案 | 按"任务一"的方案表切换,代码选"单栏-保留缩进" |
| 水印文字混进结果 | 未配置忽略区域 | 批量页右栏进入忽略区域编辑器,框住水印位置 |
| 超大长图只识别了一半 | 边长限制生效 | 调高"限制图像边长"数值 |
| 命令行无响应 | HTTP 服务被禁用 | 全局设置中允许 HTTP 服务 |
| 批量任务中途卡死 | 内存不足或单张图过大 | 减少单次导入数量、拆分任务 |
配置文件位于UmiOCR-data/.settings(ini 格式),可手动修改后执行umi-ocr --reload重新加载;运行日志在UmiOCR-data/logs/下,排查异常时先看最新日志。
下一步行动建议
- 今天就能做:下载压缩包,解压到无中文路径,双击启动,用快捷键截一张屏幕试试识别;
- 本周内:把日常最多的任务跑通一遍——网页文字用截图识别,文件归档用批量 OCR,扫描件用文档识别;
- 需要自动化时:先试命令行两条指令,再阅读 HTTP 接口文档,把识别能力接进自己的脚本或系统;
- 长期习惯:留意版本更新日志,及时获取引擎与功能修复。
相关资源入口
- 命令行手册:docs/README_CLI.md
- HTTP 接口手册:docs/http/README.md
- 各接口参数详情:docs/http/api_ocr.md | docs/http/api_doc.md | docs/http/api_qrcode.md
- 更新日志:CHANGE_LOG.md
- 多语言翻译工具链(维护者用):dev-tools/i18n/
- 配置位置:
UmiOCR-data/.settings;日志位置:UmiOCR-data/logs/
Umi-OCR 的价值在于把"识别"这件事留在本机:不联网、不计费、不限量。从一张截图到一个装满扫描件的大文件夹,它都给出了可以直接落地的操作路径。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考