Umi-OCR 完整入门指南:免费离线批量 OCR,3 步完成首次识别
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源、可离线运行的 OCR(光学字符识别,即从图片中提取文字)软件。图片与结果全程不出本机,支持截图识别、批量导入图片、PDF 文档识别和二维码扫描/生成,内置中文、英文、日文等多国语言识别库。本文面向新手和普通办公用户,按安装、首次识别、核心场景与常用参数依次展开。
Umi-OCR 是什么:截图、批量、PDF 三种识别一体
Umi-OCR 的定位是"解压即用"的离线文字识别工具,解决从截图、扫描件、PDF 中提取文字的需求,且无需把图片上传到云端。适用于 Windows(含 Windows 7 x64)和 Linux x64。
功能清单,一行一项:
- 截图 OCR:快捷键截取屏幕任意区域识别,也支持粘贴图片识别,结果可划选复制
- 批量 OCR:一次导入几百张 jpg/png/bmp/tif 等图片,结果保存为 txt、md、csv(Excel)、jsonl
- 文档识别:识别 PDF 等扫描件,可输出双层可搜索 PDF
- 二维码:读取图片中的 19 种码制,也可输入文本生成二维码图片
- 全局设置:界面语言、主题、OCR 引擎切换
安装与首次运行:3 步完成第一次文字识别
📦 Umi-OCR 以.7z压缩包或自解压包发布,无需安装步骤。
- 获取发布包:从项目的发行版页面下载对应系统的压缩包,解压到一个固定目录。
- 启动程序:直接运行解压目录里的
Umi-OCR.exe(Linux 下为umi-ocr.sh)。界面语言会按系统设置自动切换,也可在"全局设置"里手动修改。 - 完成首次识别:打开"截图 OCR"页,按快捷键框选屏幕上的一段文字,识别结果立即显示在右侧记录栏,可划选复制。
若截图或界面出现闪烁、错位,到"全局设置"→"界面和外观"中切换渲染器,或关闭硬件加速即可。
核心场景实操:批量扫描件与代码截图两种任务
任务一:批量识别一文件夹的扫描件
任务背景:手头有几十张文档扫描图,需要把全部文字提取出来存档。
操作过程:
- 进入"批量 OCR"页,点导入按钮选择图片所在文件夹,左侧列表显示全部待处理图片。
- 在右侧设置列选择后处理方案"多栏-按自然段换行"——扫描件多为分栏排版,该方案能自动拆分栏并按自然段换行,比原始输出更接近原文结构。
- 设置输出格式(txt 或 csv),点"开始任务",列表实时显示每张图的进度。
结果说明:任务完成后每张图片对应一份结果文件。如果图片带水印或页码,可在设置列进入"忽略区域"编辑器,按住右键拖动画矩形框住水印位置,框内文字块会在任务中被排除。
任务二:识别一张代码截图并保留缩进
任务背景:代码是截图形式,需要把文字复制出来且保留缩进。
操作过程:进入"截图 OCR"页,快捷键框选代码区域;后处理方案选"单栏-保留缩进",该方案会保留行首缩进和行中空格,适合代码场景。
结果说明:识别结果直接粘贴进编辑器即可用。如果不是代码,"多栏-按自然段换行"是更通用的默认选择。
常用参数说明:排版解析方案与图像边长怎么配
影响识别效果的主要是两类参数:排版解析方案决定文字如何换行与排序,图像边长限制决定大图如何缩放处理。
| 参数 | 所在位置 | 什么时候调整 |
|---|---|---|
| 后处理方案 | 页面右栏-文字识别 | 代码截图选"单栏-保留缩进";分栏文献选"多栏-按自然段换行";拿不准就用默认 |
| 忽略区域 | 批量页-设置 | 图片有固定位置的水印、页眉页脚时,画框覆盖后排除 |
| 限制图像边长 | 页面设置-文字识别 | 识别像素很大的长图或大图时调高数值,避免默认限制把图缩小、损失细节 |
| 输出格式 | 批量页-设置 | txt 便于直接阅读,csv 可用 Excel 打开,md 保留段落结构 |
各方案都能自动处理横排和竖排(从右到左)排版,但竖排文字还需要 OCR 引擎本身支持对应语言。
常见问题速答
识别速度明显偏慢。原因是图片像素过大或列表过长。把大图先缩小分辨率,或把任务拆成几批分别运行,处理时不要再叠加新任务。
识别结果里混进水印和页眉。原因是忽略区域框没画够大——只有完整落入框内的整个文本块才会被忽略,框小了会漏。把矩形画得完全包住水印可能出现的所有位置即可。
截图时界面闪烁或 UI 错位。原因是显卡渲染兼容问题。到"全局设置"→"界面和外观"切换渲染器,或关闭硬件加速。
命令行输入后没有反应。原因是命令行依赖 HTTP 接口做跨进程通信,该服务默认开启,如果被手动关闭则指令无法送达。在"全局设置"中重新允许 HTTP 服务,主机选"仅本地"即可。
界面语言不是我想要的。首次启动按系统语言自动匹配,系统语言不在支持列表时会回退默认语言。在"全局设置"→"语言"手动切换即可,支持简中、繁中、英文、日文等。
深入使用:命令行与 HTTP 接口入口
需要自动化时,Umi-OCR 提供两种外部调用方式,都通过本机回环通信,不经过物理网卡:
- 命令行:入口仍是主程序,例如
umi-ocr --path "D:/img1.png" --output result.txt可识别指定图片并保存结果,还支持--screenshot、--clipboard等指令,详见 docs/README_CLI.md - HTTP 接口:向本地端口提交 Base64 图片即可获得识别结果,适合写脚本或接入其他工具,详见 docs/http/README.md
其他入口:更新日志见 CHANGE_LOG.md;想参与界面翻译,可看 dev-tools/README.md。
下一步建议:先在"截图 OCR"页认一张图,再在"批量 OCR"页跑一个图片文件夹,熟悉后处理方案与忽略区域这两项设置后,多数场景的结果就能直接可用。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考