news 2026/9/7 18:23:00

Umi-OCR:免费离线OCR文字识别工具完整使用指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR:免费离线OCR文字识别工具完整使用指南

Umi-OCR:免费离线OCR文字识别工具完整使用指南

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR是一款免费、开源的离线OCR文字识别软件,支持 Windows 7/10/11 x64 与 Linux x64,提供截图OCR、批量图片识别、PDF文档识别三大功能,并内置二维码扫描与生成。所有识别都在本地完成,全程无需联网,适合办公文档数字化、截图取字等日常场景。

📌 把一张截图变成可编辑文字

最典型的使用场景是:网页、图片里有一段你没法直接选中的文字,复制粘贴都行不通,手动重敲又太慢。Umi-OCR 的截图OCR就是为这一步设计的——按下快捷键框选区域,文字会出现在左侧预览和右侧记录里,直接划选复制即可。

操作步骤:

  1. 从发行版下载.7z.7z.exe自解压包,解压后双击Umi-OCR.exe启动。软件无需安装,解压即用;
  2. 首次启动时,软件会按系统语言自动切换界面;
  3. 打开「截图OCR」标签页,按下截图快捷键,在屏幕上框选要识别的区域;
  4. 在左侧图片预览栏用鼠标划选文字直接复制;在右侧记录栏也可以编辑文字,或划选多条记录批量复制

结果与效果:识别结果带置信度和时间戳逐条存入记录栏,支持全选、按条删除、清空。除了快捷键截图,你还可以在其他地方复制图片后直接粘贴到 Umi-OCR 识别。

一个值得单独说明的配置是文本后处理(排版解析):Umi-OCR 会自动识别多栏布局,按自然段规则换行。如果你常识别代码截图,把排版方案切到「单栏-保留缩进」,可以保留行首缩进和行内空格,代码直接粘贴到编辑器里不用手动重排:

🖼️ 批量图片识别与水印排除

当你有一整文件夹扫描图、聊天截图需要转文字时,用「批量OCR」标签页比逐张截图高效得多。

操作步骤:

  1. 打开「批量OCR」标签页,点「选择图片」或直接拖入文件夹;
  2. 勾选要保存的输出格式,点击「开始任务」;
  3. 在右侧记录栏查看每张图的识别文本,逐条复制。

结果与效果:

  • 支持输入格式:jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff,且没有数量上限,一次导入几百张也可以;
  • 支持保存格式:txtjsonlmdcsv(Excel),按后续处理需求选一种即可;
  • 任务完成后可以自动关机/待机,适合晚上挂机跑大任务。

忽略区域是批量识别里很实用的功能:如果每张图片的固定位置都有水印或 LOGO,识别出来会污染文本。进入右栏的忽略区域编辑器,按住右键绘制多个矩形框把水印包住,之后落在框内的文本块会在任务中被跳过。注意框要画得足够大,完整覆盖水印可能出现的所有位置;被忽略的单位是整个文本块而非单个字符。

另外,如果要识别像素很大的长图或大图,请在「页面的设置 → 文字识别 → 限制图像边长」中调高数值,避免大图被压缩后丢失细节。

📄 PDF 扫描件识别为可搜索文档

适用场景:手里的 PDF 是扫描件,全是图片,搜索、复制文字都不行。文档识别功能支持pdf, xps, epub, mobi, fb2, cbz格式,可以把扫描件OCR后输出为双层可搜索PDF——视觉上是原图,但底下有一层可复制、可搜索的文本。

操作步骤:

  1. 打开「文档识别」标签页,导入文档文件;
  2. 如需排除页眉页脚,用忽略区域设定矩形范围,并可用页数范围限定它在第几页到第几页生效(负数表示倒数第X页);
  3. 启动任务,完成后选择保存类型。

结果与效果:得到双层可搜索PDF后,就能用搜索定位段落、鼠标直接复制文字。加密文档需要填写密码。注意该功能需要v2.1.4 及以上版本,批量文档任务同样支持完成后自动关机/休眠,以及任务暂停后在待机恢复。

🔗 二维码扫描与生成

「二维码」标签页同时解决读码和生码两件事:

  • 扫码:截图、粘贴或拖入本地图片,读取其中的二维码、条形码;支持一图多码,覆盖 QRCode、EAN13、DataMatrix、PDF417 等 19 种协议;
  • 生成码:输入文本即可生成二维码图片,同样支持 19 种协议,并可调整纠错等级等参数,生成参数变化后画面会自动刷新。

如果你的二维码图片偏小或对比度低导致识别失败,HTTP 接口的二维码识别还支持中值滤波、锐度、对比度、灰度、二值化等预处理参数,详见 docs/http/api_qrcode.md。

⚙️ 全局设置:语言、主题、OCR引擎与渲染器

「全局设置」标签页集中管理软件的通用参数。

常用配置:

  • 快捷方式:一键添加桌面/开始菜单快捷方式,或设置开机自启,之后随时用快捷键唤起;
  • 语言:支持简体中文、繁體中文、English、日本語、Русский、Português 等语言。首次启动按系统语言自动选择,手动切换在「全局设置 → 语言/Language」;
  • 主题与字体:多个亮/暗主题可切换,字体和界面大小比例可调;
  • OCR插件:内置 RapidOCR(兼容性好)和 PaddleOCR(速度稍快)两种引擎,可按需切换。若通过 Scoop 安装,注意umi-ocrumi-ocr-paddle两个包不要同时装,快捷方式会被覆盖;
  • 渲染器:界面默认使用显卡加速渲染。如果出现截屏闪烁、UI 错位,就在这里切换渲染方案或关闭硬件加速。

🖥️ 命令行与HTTP接口:让Umi-OCR进入自动化流程

除了图形界面,Umi-OCR 的命令行入口就是主程序Umi-OCR.exe,HTTP 服务默认开启(主机选「仅本地」即可),默认端口1224。命令行依赖这个本地回环服务跨进程通信,不经过物理网卡。

常用指令:

指令作用
umi-ocr --help查看全部参数说明
umi-ocr --screenshot唤起鼠标截屏识别
umi-ocr --screenshot screen=0 rect=50,100,300,200无需划选,直接截取指定显示器指定矩形区域
umi-ocr --clipboard识别剪贴板中的图片
umi-ocr --path "D:/xxx.png"识别指定文件;传文件夹路径会递归识别其中所有图片
umi-ocr --qrcode_read "D:/xxx.png"/--qrcode_create "文本" "D:/out.jpeg"识别二维码 / 生成二维码图片
umi-ocr --screenshot --clip识别结果复制到剪贴板
umi-ocr --screenshot --output test.txt识别结果写入文件(--output_append为追加,也可用"-->""-->>"简写)
umi-ocr --show/--hide/--quit弹出 / 隐藏主窗口 / 关闭软件

两个实用提示:

  1. 指令支持前缀简写,--screenshot可写成--sc
  2. 命令行任务的结果输出建议用--output而不是管道重定向>|——后者在部分环境下会失效。需要程序化获取回传时,可以改调 HTTP 的/argv接口(仅允许127.0.0.1本地调用)。

HTTP接口适合集成到自己的脚本或服务中:

  • 图片OCR:POST /api/ocr,请求体为 Base64 编码的图片(无需data:image/png;base64,前缀),可选参数里可指定识别语言、排版解析方案、忽略区域等;返回code=100表示成功,code=101表示图中无文本;
  • 文档识别:/api/doc/upload上传文件获取任务ID →/api/doc/result轮询状态 →/api/doc/download取双层PDF/txt/csv等下载链接 →/api/doc/clear/<id>清理任务(不手动清理会在24小时后自动清理);
  • 写代码前建议先调GET /api/ocr/get_options查询当前引擎的全部参数定义与默认值,避免引擎不同导致参数不匹配。

完整参数与示例代码见 docs/http/api_doc.md 和 docs/http/api_ocr.md。

🩹 常见坑与排查

现象原因与处理
命令行没反应命令行通过本地HTTP服务通信,确认全局设置中HTTP服务已允许且主机为「仅本地」(默认开启)
截屏闪烁、UI错位显卡加速渲染问题,到「全局设置 → 界面和外观 → 渲染器」换渲染方案或关闭硬件加速
识别结果里混入水印文字用批量页的忽略区域画框包住水印;HTTP调用则传tbpu.ignoreArea参数
大图/长图识别不全「文字识别 → 限制图像边长」默认 960,会把大图压缩;识别精度优先时调高该值
代码截图缩进丢失排版解析方案改为「单栏-保留缩进」
界面语言不对首次启动按系统语言自动选择,去「全局设置 → 语言」手动改
手动改了配置文件不生效配置保存在UmiOCR-data/.settings(ini 格式),改完执行umi-ocr --reload重新加载(v2.1.5 起支持)

其他提示:HTTP接口并发能力有限,尽量串行调用;长时间大批量连续调用偶尔出现ECONNREFUSED,重发一次即可,后台工作线程没崩就不会持续报错。

📚 小结与延伸资料

Umi-OCR 覆盖了一条完整的本地取字链路:临时需求用截图OCR,成批图片用批量OCR,扫描件用文档识别,另有二维码读写和命令行/HTTP两套自动化入口,全部免费开源、离线可用。

延伸阅读(仓库内文档):

  • 命令行手册:docs/README_CLI.md
  • HTTP接口手册:docs/http/README.md
  • 更新日志:CHANGE_LOG.md(当前版本 v2.1.5)
  • 多语言协作与翻译脚本:dev-tools/
  • 配置文件位置:UmiOCR-data/.settings;日志目录:UmiOCR-data/logs

如果需要在自己的脚本中调用,也可以先克隆仓库阅读接口文档与示例代码:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/8 0:14:14

Exo 分布式推理集群:从单台 Mac 到多节点加速的完整实操指南

Exo 分布式推理集群&#xff1a;从单台 Mac 到多节点加速的完整实操指南 【免费下载链接】exo Run frontier AI locally. 项目地址: https://gitcode.com/GitHub_Trending/exo8/exo Exo 是一个分布式推理集群工具&#xff1a;把多台设备自动组网成一个推理集群&#xff…

作者头像 李华
网站建设 2026/9/7 5:37:16

AI Agent 权限隔离与网关设计:从原理到最小实现

如果你所在团队已经开始认真使用 AI Agent&#xff0c;大概率会遇到这样的场景&#xff1a;代码审查 Agent 读不到 GitLab 权限之外的仓库&#xff0c;却被配置成了可以访问生产数据库&#xff1b;文档助手本来只需要写周报&#xff0c;结果因为它挂在了同一个共享账号下&#…

作者头像 李华
网站建设 2026/9/5 18:05:24

manzana源码解析:iOS与电脑之间局域网文件互传方案

简介&#xff1a;这是一份面向iOS开发者与跨平台通信学习者的实战型源码资源&#xff0c;聚焦于解决电脑&#xff08;Mac/Windows&#xff09;与iPhone在局域网或USB连接下的双向文件互传问题&#xff0c;涵盖Bonjour服务发现、MobileDevice框架调用、HTTP轻量服务搭建及iOS沙盒…

作者头像 李华
网站建设 2026/9/8 4:45:08

STM32C5A3R定时器PWM输出:从CubeMX配置到动态调频调占空比

在 STM32 嵌入式开发中&#xff0c;PWM&#xff08;脉冲宽度调制&#xff09;是最常用的输出方式之一&#xff0c;而 STM32C5A3R 的定时器 PWM 输出往往成为开发者第一个需要同时控制频率和占空比的外设。无论是控制电机转速、调节 LED 亮度、驱动蜂鸣器&#xff0c;还是给电源…

作者头像 李华
网站建设 2026/9/4 12:33:43

Umi-OCR:免费离线OCR文字识别工具,截图、批量、PDF一次搞定

Umi-OCR&#xff1a;免费离线OCR文字识别工具&#xff0c;截图、批量、PDF一次搞定 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片&#xff0c;PDF文档识别&#xff0c;排除水印/页眉页脚&#xff0c;扫描/生成二维…

作者头像 李华
网站建设 2026/9/8 7:00:47

DeepSeek V4 Pro与Grok 4.6实战对比:API接入、评测与踩坑指南

最近 “DeepSeek V4 Pro 对战 Grok 4.6” 的话题刷了不少技术群。标题里加 “突袭”“夯爆” 多少有点营销味&#xff0c;但抛开这些&#xff0c;技术圈确实在关心一件更实际的事&#xff1a;新模型已经进入开发工具链&#xff0c;被真实用户调用&#xff0c;也开始出现负载和稳…

作者头像 李华