Umi-OCR 快速上手指南:5分钟用免费离线OCR工具识别截图与PDF文字
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款开源、免费、离线的 OCR 文字识别工具,它能把截图、本地图片和 PDF 文档里的文字变成可编辑文本。整个识别过程在你自己的电脑上完成,不联网、不上传文件,适合快速又省钱地处理文档,尤其在意资料隐私的场景。
为什么值得给电脑装一个离线 OCR 工具
资料不离开本机,隐私没有后顾之忧
识别引擎和多语言模型库全部内置在发布包里,从截图到出结果不经过任何网络环节。处理内部合同、工作截图这类不想上传到在线识别服务的资料时,这一点尤其重要。
解压即用,还支持多国语言界面
发布包是一个.7z压缩包(或.7z.exe自解压包),解压后双击Umi-OCR.exe即可启动,无需安装,兼容 Windows 7 x64 与 Linux x64。首次启动会按系统语言自动切换界面,内置简中、繁中、英语、日语等多种语言,之后也能在"全局设置 → 语言"里随时改。
两套离线引擎,语言库够用
发布包内置 RapidOCR 和 PaddleOCR 两套离线识别引擎,以插件形式提供,可在全局设置中切换;识别语言库覆盖简体中文、English、繁體中文、日本語、한국어、Русский 等,日常中英文场景基本都能覆盖。
| 引擎 | 特点 | 适合场景 |
|---|---|---|
| RapidOCR | 兼容性好 | 日常使用、配置一般的电脑 |
| PaddleOCR | 速度稍快 | 高频批量任务 |
5分钟完成第一次截图识别
- (约1分钟)拿到软件:下载发布包并解压;如果想研究源码,也可以
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。 - (约30秒)启动程序:双击
Umi-OCR.exe,主窗口会按系统语言打开。 - (约1分钟)截图识别:打开"截图OCR"标签页,按默认快捷键在屏幕上框选区域(快捷键可在该页"设置"栏重新录制),稍等片刻即可得到识别结果。
- (约30秒)取走文字:识别记录栏里的文字可以直接划选复制,右键菜单支持选中多个记录批量复制、清空记录等;左侧图片预览栏也能直接划选文字。
能力地图:每个标签页能做什么
截图OCR:框选一下就能拿到文字
除了快捷键截图,还支持在别处复制图片后粘贴进来识别,以及重复上一次截图区域。识别完成后,"文本后处理"的排版解析方案会负责整理文字顺序,共 8 种预设:
| 方案 | 用途 |
|---|---|
| 多栏-按自然段换行 | 默认方案,自动识别多栏布局,按段落换行,适合大多数文档 |
| 单栏-保留缩进 | 解析代码截图,保留行首缩进和行内空格 |
| 多栏/单栏-总是换行、无换行 | 每句都换行或强制合并成一行 |
| 不做处理 | 直接输出引擎原始结果 |
以上方案都能处理横排与竖排(从右到左)文字,竖排还需要引擎本身支持。
批量OCR:一次导入几百张图片怎么配置
把图片拖进列表后点"开始任务"即可,没有数量上限,任务完成后还能自动关机或待机。输入格式支持jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff,识别结果可保存为以下格式:
| 输出格式 | 特点 |
|---|---|
| txt | 最通用,直接阅读 |
| jsonl | 每行一条结构化记录,方便程序处理 |
| md | 保留段落结构,适合归档文档 |
| csv | 可直接导入 Excel |
批量页还有一个特色功能"忽略区域":在右栏设置里进入编辑器,按住右键绘制多个矩形框,框内水印、LOGO 的文字会在任务中被忽略(只忽略完整落在框内的文本块,框外的文本块不受影响)。如果要识别像素超大的长图,请调整"页面设置 → 文字识别 → 限制图像边长"的数值,调高即可。
文档识别:把 PDF 扫描件变成可搜索文本
支持pdf、xps、epub、mobi、fb2、cbz六种格式。对扫描件执行 OCR,或直接提取文档原有的文本层;还可以输出"双层可搜索 PDF"——外观保持原样,但文字可以被选中、搜索。同样支持设定忽略区域排除页眉页脚,以及任务完成后自动关机/休眠,适合睡前丢一堆文件进去跑。
二维码标签页:识别与生成双向支持
扫码侧支持截图、粘贴或拖入本地图片,一张图里多个码也能同时读出,支持 19 种协议(QRCode、DataMatrix、EAN13、Code128 等,含条形码)。生成侧输入文本即可得到二维码图片,可调节纠错等级等参数。这两项功能命令行和 HTTP 接口也都能调用。
进阶玩法:命令行与 HTTP 接口
一条命令触发 OCR
命令行入口就是主程序Umi-OCR.exe(简写umi-ocr)。前提是在全局设置中允许 HTTP 服务(默认开启,主机选"仅本地"即可——它只用于本机进程间通信,不走物理网卡)。常用指令:
umi-ocr --screenshot --clip # 截图识别并复制到剪贴板 umi-ocr --clipboard # 识别剪贴板里的图片 umi-ocr --path "D:/img1.png" "D:/文件夹" # 指定图片或文件夹 umi-ocr --screenshot "-->" test.txt # 结果写入文件指令支持按前几个字母简写(如--sc);--output覆盖写文件、--output_append追加写文件;--show/--hide/--quit用于弹出、隐藏、关闭主窗口。完整用法见 docs/README_CLI.md。
用 HTTP API 搭自动化
默认端口1224(可在全局设置中修改),把主机切换为"任何可用地址"后允许局域网访问。核心接口:
GET /api/ocr/get_options:查询识别接口的全部参数、默认值与可选值;/api/ocr:传 Base64 图片做文字识别,可指定语言、排版解析方案、忽略区域等参数;- 另有文档识别(PDF)与二维码识别/生成接口。
两点注意:后端并发能力一般,尽量不要并发调用;长时间大批量连续调用有小概率出现ECONNREFUSED报错,重新发起请求即可。接口细节见 docs/http/README.md 和 docs/http/api_ocr.md。
避坑指南:常见问题与排查思路
界面闪烁、UI 错位或显示异常
软件默认用显卡加速渲染。如果你的机器上出现截屏闪烁、UI 错位,去"全局设置 → 界面和外观 → 渲染器"切换渲染方案或关闭硬件加速。另外注意:如果用的是备用启动器(如UmiOCR-data/RUN_GUI.bat),命令行指令会失效,请用主程序Umi-OCR.exe。
识别不准、漏字或大图解不了
- 大图默认会先压缩再识别("限制图像边长"缺省为 960),精度不够时把数值调高或设为无限制;
- 选对识别语言库,图片模糊时提高分辨率、调对比度;
- 水印、页眉页脚干扰结果时,用批量/文档页的忽略区域框掉;
- 仍不满意时换另一套引擎插件对比效果。
命令行或 HTTP 调用没反应、报错
- 确认全局设置中 HTTP 服务已允许(默认开启),主机选"仅本地";
- 避免并发调用,
ECONNREFUSED时直接重试; - 手动改过配置文件
UmiOCR-data/.settings(ini 格式)后,执行umi-ocr --reload重新加载; - 需要排查错误时,v2.1.5 起日志保存在
UmiOCR-data/logs目录,命令行启动程序也能看到实时日志。
写在最后
Umi-OCR 的定位很明确:一套免费、离线、解压即用的 OCR 工具箱——截图OCR管日常取字,批量OCR管成堆图片,文档识别管 PDF 扫描件,二维码标签页管扫码和生码,命令行与 HTTP 接口则把这一切接进自动化流程。
如果你今天就想试:解压发布包,双击Umi-OCR.exe,框一张截图,一分钟就能看到效果。想继续深入,可以翻一翻 docs/README_CLI.md、docs/http/README.md,以及 CHANGE_LOG.md 里的最新更新内容。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考