Umi-OCR:免费离线OCR文字识别工具完整使用指南
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR是一款免费、开源的离线OCR文字识别软件,支持 Windows 7/10/11 x64 与 Linux x64,提供截图OCR、批量图片识别、PDF文档识别三大功能,并内置二维码扫描与生成。所有识别都在本地完成,全程无需联网,适合办公文档数字化、截图取字等日常场景。
📌 把一张截图变成可编辑文字
最典型的使用场景是:网页、图片里有一段你没法直接选中的文字,复制粘贴都行不通,手动重敲又太慢。Umi-OCR 的截图OCR就是为这一步设计的——按下快捷键框选区域,文字会出现在左侧预览和右侧记录里,直接划选复制即可。
操作步骤:
- 从发行版下载
.7z或.7z.exe自解压包,解压后双击Umi-OCR.exe启动。软件无需安装,解压即用; - 首次启动时,软件会按系统语言自动切换界面;
- 打开「截图OCR」标签页,按下截图快捷键,在屏幕上框选要识别的区域;
- 在左侧图片预览栏用鼠标划选文字直接复制;在右侧记录栏也可以编辑文字,或划选多条记录批量复制。
结果与效果:识别结果带置信度和时间戳逐条存入记录栏,支持全选、按条删除、清空。除了快捷键截图,你还可以在其他地方复制图片后直接粘贴到 Umi-OCR 识别。
一个值得单独说明的配置是文本后处理(排版解析):Umi-OCR 会自动识别多栏布局,按自然段规则换行。如果你常识别代码截图,把排版方案切到「单栏-保留缩进」,可以保留行首缩进和行内空格,代码直接粘贴到编辑器里不用手动重排:
🖼️ 批量图片识别与水印排除
当你有一整文件夹扫描图、聊天截图需要转文字时,用「批量OCR」标签页比逐张截图高效得多。
操作步骤:
- 打开「批量OCR」标签页,点「选择图片」或直接拖入文件夹;
- 勾选要保存的输出格式,点击「开始任务」;
- 在右侧记录栏查看每张图的识别文本,逐条复制。
结果与效果:
- 支持输入格式:
jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff,且没有数量上限,一次导入几百张也可以; - 支持保存格式:
txt、jsonl、md、csv(Excel),按后续处理需求选一种即可; - 任务完成后可以自动关机/待机,适合晚上挂机跑大任务。
忽略区域是批量识别里很实用的功能:如果每张图片的固定位置都有水印或 LOGO,识别出来会污染文本。进入右栏的忽略区域编辑器,按住右键绘制多个矩形框把水印包住,之后落在框内的文本块会在任务中被跳过。注意框要画得足够大,完整覆盖水印可能出现的所有位置;被忽略的单位是整个文本块而非单个字符。
另外,如果要识别像素很大的长图或大图,请在「页面的设置 → 文字识别 → 限制图像边长」中调高数值,避免大图被压缩后丢失细节。
📄 PDF 扫描件识别为可搜索文档
适用场景:手里的 PDF 是扫描件,全是图片,搜索、复制文字都不行。文档识别功能支持pdf, xps, epub, mobi, fb2, cbz格式,可以把扫描件OCR后输出为双层可搜索PDF——视觉上是原图,但底下有一层可复制、可搜索的文本。
操作步骤:
- 打开「文档识别」标签页,导入文档文件;
- 如需排除页眉页脚,用忽略区域设定矩形范围,并可用页数范围限定它在第几页到第几页生效(负数表示倒数第X页);
- 启动任务,完成后选择保存类型。
结果与效果:得到双层可搜索PDF后,就能用搜索定位段落、鼠标直接复制文字。加密文档需要填写密码。注意该功能需要v2.1.4 及以上版本,批量文档任务同样支持完成后自动关机/休眠,以及任务暂停后在待机恢复。
🔗 二维码扫描与生成
「二维码」标签页同时解决读码和生码两件事:
- 扫码:截图、粘贴或拖入本地图片,读取其中的二维码、条形码;支持一图多码,覆盖 QRCode、EAN13、DataMatrix、PDF417 等 19 种协议;
- 生成码:输入文本即可生成二维码图片,同样支持 19 种协议,并可调整纠错等级等参数,生成参数变化后画面会自动刷新。
如果你的二维码图片偏小或对比度低导致识别失败,HTTP 接口的二维码识别还支持中值滤波、锐度、对比度、灰度、二值化等预处理参数,详见 docs/http/api_qrcode.md。
⚙️ 全局设置:语言、主题、OCR引擎与渲染器
「全局设置」标签页集中管理软件的通用参数。
常用配置:
- 快捷方式:一键添加桌面/开始菜单快捷方式,或设置开机自启,之后随时用快捷键唤起;
- 语言:支持简体中文、繁體中文、English、日本語、Русский、Português 等语言。首次启动按系统语言自动选择,手动切换在「全局设置 → 语言/Language」;
- 主题与字体:多个亮/暗主题可切换,字体和界面大小比例可调;
- OCR插件:内置 RapidOCR(兼容性好)和 PaddleOCR(速度稍快)两种引擎,可按需切换。若通过 Scoop 安装,注意
umi-ocr与umi-ocr-paddle两个包不要同时装,快捷方式会被覆盖; - 渲染器:界面默认使用显卡加速渲染。如果出现截屏闪烁、UI 错位,就在这里切换渲染方案或关闭硬件加速。
🖥️ 命令行与HTTP接口:让Umi-OCR进入自动化流程
除了图形界面,Umi-OCR 的命令行入口就是主程序Umi-OCR.exe,HTTP 服务默认开启(主机选「仅本地」即可),默认端口1224。命令行依赖这个本地回环服务跨进程通信,不经过物理网卡。
常用指令:
| 指令 | 作用 |
|---|---|
umi-ocr --help | 查看全部参数说明 |
umi-ocr --screenshot | 唤起鼠标截屏识别 |
umi-ocr --screenshot screen=0 rect=50,100,300,200 | 无需划选,直接截取指定显示器指定矩形区域 |
umi-ocr --clipboard | 识别剪贴板中的图片 |
umi-ocr --path "D:/xxx.png" | 识别指定文件;传文件夹路径会递归识别其中所有图片 |
umi-ocr --qrcode_read "D:/xxx.png"/--qrcode_create "文本" "D:/out.jpeg" | 识别二维码 / 生成二维码图片 |
umi-ocr --screenshot --clip | 识别结果复制到剪贴板 |
umi-ocr --screenshot --output test.txt | 识别结果写入文件(--output_append为追加,也可用"-->"、"-->>"简写) |
umi-ocr --show/--hide/--quit | 弹出 / 隐藏主窗口 / 关闭软件 |
两个实用提示:
- 指令支持前缀简写,
--screenshot可写成--sc; - 命令行任务的结果输出建议用
--output而不是管道重定向>、|——后者在部分环境下会失效。需要程序化获取回传时,可以改调 HTTP 的/argv接口(仅允许127.0.0.1本地调用)。
HTTP接口适合集成到自己的脚本或服务中:
- 图片OCR:
POST /api/ocr,请求体为 Base64 编码的图片(无需data:image/png;base64,前缀),可选参数里可指定识别语言、排版解析方案、忽略区域等;返回code=100表示成功,code=101表示图中无文本; - 文档识别:
/api/doc/upload上传文件获取任务ID →/api/doc/result轮询状态 →/api/doc/download取双层PDF/txt/csv等下载链接 →/api/doc/clear/<id>清理任务(不手动清理会在24小时后自动清理); - 写代码前建议先调
GET /api/ocr/get_options查询当前引擎的全部参数定义与默认值,避免引擎不同导致参数不匹配。
完整参数与示例代码见 docs/http/api_doc.md 和 docs/http/api_ocr.md。
🩹 常见坑与排查
| 现象 | 原因与处理 |
|---|---|
| 命令行没反应 | 命令行通过本地HTTP服务通信,确认全局设置中HTTP服务已允许且主机为「仅本地」(默认开启) |
| 截屏闪烁、UI错位 | 显卡加速渲染问题,到「全局设置 → 界面和外观 → 渲染器」换渲染方案或关闭硬件加速 |
| 识别结果里混入水印文字 | 用批量页的忽略区域画框包住水印;HTTP调用则传tbpu.ignoreArea参数 |
| 大图/长图识别不全 | 「文字识别 → 限制图像边长」默认 960,会把大图压缩;识别精度优先时调高该值 |
| 代码截图缩进丢失 | 排版解析方案改为「单栏-保留缩进」 |
| 界面语言不对 | 首次启动按系统语言自动选择,去「全局设置 → 语言」手动改 |
| 手动改了配置文件不生效 | 配置保存在UmiOCR-data/.settings(ini 格式),改完执行umi-ocr --reload重新加载(v2.1.5 起支持) |
其他提示:HTTP接口并发能力有限,尽量串行调用;长时间大批量连续调用偶尔出现ECONNREFUSED,重发一次即可,后台工作线程没崩就不会持续报错。
📚 小结与延伸资料
Umi-OCR 覆盖了一条完整的本地取字链路:临时需求用截图OCR,成批图片用批量OCR,扫描件用文档识别,另有二维码读写和命令行/HTTP两套自动化入口,全部免费开源、离线可用。
延伸阅读(仓库内文档):
- 命令行手册:docs/README_CLI.md
- HTTP接口手册:docs/http/README.md
- 更新日志:CHANGE_LOG.md(当前版本 v2.1.5)
- 多语言协作与翻译脚本:dev-tools/
- 配置文件位置:
UmiOCR-data/.settings;日志目录:UmiOCR-data/logs
如果需要在自己的脚本中调用,也可以先克隆仓库阅读接口文档与示例代码:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考