news 2026/9/8 6:41:51

Umi-OCR 完整入门指南:免费离线批量 OCR,3 步完成首次识别

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 完整入门指南:免费离线批量 OCR,3 步完成首次识别

Umi-OCR 完整入门指南:免费离线批量 OCR,3 步完成首次识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、可离线运行的 OCR(光学字符识别,即从图片中提取文字)软件。图片与结果全程不出本机,支持截图识别、批量导入图片、PDF 文档识别和二维码扫描/生成,内置中文、英文、日文等多国语言识别库。本文面向新手和普通办公用户,按安装、首次识别、核心场景与常用参数依次展开。

Umi-OCR 是什么:截图、批量、PDF 三种识别一体

Umi-OCR 的定位是"解压即用"的离线文字识别工具,解决从截图、扫描件、PDF 中提取文字的需求,且无需把图片上传到云端。适用于 Windows(含 Windows 7 x64)和 Linux x64。

功能清单,一行一项:

  • 截图 OCR:快捷键截取屏幕任意区域识别,也支持粘贴图片识别,结果可划选复制
  • 批量 OCR:一次导入几百张 jpg/png/bmp/tif 等图片,结果保存为 txt、md、csv(Excel)、jsonl
  • 文档识别:识别 PDF 等扫描件,可输出双层可搜索 PDF
  • 二维码:读取图片中的 19 种码制,也可输入文本生成二维码图片
  • 全局设置:界面语言、主题、OCR 引擎切换

安装与首次运行:3 步完成第一次文字识别

📦 Umi-OCR 以.7z压缩包或自解压包发布,无需安装步骤。

  1. 获取发布包:从项目的发行版页面下载对应系统的压缩包,解压到一个固定目录。
  2. 启动程序:直接运行解压目录里的Umi-OCR.exe(Linux 下为umi-ocr.sh)。界面语言会按系统设置自动切换,也可在"全局设置"里手动修改。
  3. 完成首次识别:打开"截图 OCR"页,按快捷键框选屏幕上的一段文字,识别结果立即显示在右侧记录栏,可划选复制。

若截图或界面出现闪烁、错位,到"全局设置"→"界面和外观"中切换渲染器,或关闭硬件加速即可。

核心场景实操:批量扫描件与代码截图两种任务

任务一:批量识别一文件夹的扫描件

任务背景:手头有几十张文档扫描图,需要把全部文字提取出来存档。

操作过程

  1. 进入"批量 OCR"页,点导入按钮选择图片所在文件夹,左侧列表显示全部待处理图片。
  2. 在右侧设置列选择后处理方案"多栏-按自然段换行"——扫描件多为分栏排版,该方案能自动拆分栏并按自然段换行,比原始输出更接近原文结构。
  3. 设置输出格式(txt 或 csv),点"开始任务",列表实时显示每张图的进度。

结果说明:任务完成后每张图片对应一份结果文件。如果图片带水印或页码,可在设置列进入"忽略区域"编辑器,按住右键拖动画矩形框住水印位置,框内文字块会在任务中被排除。

任务二:识别一张代码截图并保留缩进

任务背景:代码是截图形式,需要把文字复制出来且保留缩进。

操作过程:进入"截图 OCR"页,快捷键框选代码区域;后处理方案选"单栏-保留缩进",该方案会保留行首缩进和行中空格,适合代码场景。

结果说明:识别结果直接粘贴进编辑器即可用。如果不是代码,"多栏-按自然段换行"是更通用的默认选择。

常用参数说明:排版解析方案与图像边长怎么配

影响识别效果的主要是两类参数:排版解析方案决定文字如何换行与排序,图像边长限制决定大图如何缩放处理。

参数所在位置什么时候调整
后处理方案页面右栏-文字识别代码截图选"单栏-保留缩进";分栏文献选"多栏-按自然段换行";拿不准就用默认
忽略区域批量页-设置图片有固定位置的水印、页眉页脚时,画框覆盖后排除
限制图像边长页面设置-文字识别识别像素很大的长图或大图时调高数值,避免默认限制把图缩小、损失细节
输出格式批量页-设置txt 便于直接阅读,csv 可用 Excel 打开,md 保留段落结构

各方案都能自动处理横排和竖排(从右到左)排版,但竖排文字还需要 OCR 引擎本身支持对应语言。

常见问题速答

识别速度明显偏慢。原因是图片像素过大或列表过长。把大图先缩小分辨率,或把任务拆成几批分别运行,处理时不要再叠加新任务。

识别结果里混进水印和页眉。原因是忽略区域框没画够大——只有完整落入框内的整个文本块才会被忽略,框小了会漏。把矩形画得完全包住水印可能出现的所有位置即可。

截图时界面闪烁或 UI 错位。原因是显卡渲染兼容问题。到"全局设置"→"界面和外观"切换渲染器,或关闭硬件加速。

命令行输入后没有反应。原因是命令行依赖 HTTP 接口做跨进程通信,该服务默认开启,如果被手动关闭则指令无法送达。在"全局设置"中重新允许 HTTP 服务,主机选"仅本地"即可。

界面语言不是我想要的。首次启动按系统语言自动匹配,系统语言不在支持列表时会回退默认语言。在"全局设置"→"语言"手动切换即可,支持简中、繁中、英文、日文等。

深入使用:命令行与 HTTP 接口入口

需要自动化时,Umi-OCR 提供两种外部调用方式,都通过本机回环通信,不经过物理网卡:

  • 命令行:入口仍是主程序,例如umi-ocr --path "D:/img1.png" --output result.txt可识别指定图片并保存结果,还支持--screenshot--clipboard等指令,详见 docs/README_CLI.md
  • HTTP 接口:向本地端口提交 Base64 图片即可获得识别结果,适合写脚本或接入其他工具,详见 docs/http/README.md

其他入口:更新日志见 CHANGE_LOG.md;想参与界面翻译,可看 dev-tools/README.md。

下一步建议:先在"截图 OCR"页认一张图,再在"批量 OCR"页跑一个图片文件夹,熟悉后处理方案与忽略区域这两项设置后,多数场景的结果就能直接可用。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 10:29:13

零基础入门本体论:Ontology Playground交互式本体图完整指南

零基础入门本体论:Ontology Playground交互式本体图完整指南 【免费下载链接】Ontology-Playground Free, open-source web app for learning about ontologies and Microsoft Fabric IQ. Explore a catalogue of pre-built ontologies, design your own visually, …

作者头像 李华
网站建设 2026/9/5 7:36:36

寒武纪软件岗笔试题复盘:从C++内存布局到AI芯片推理引擎

2019年秋天,我坐在寒武纪软件岗的笔试考场里。那会儿AI芯片公司正是最热的风口,寒武纪作为国内做AI芯片的代表企业,一场软件岗笔试能吸引几百号人投简历。拿到卷子翻了翻,第一感觉是:这不像互联网大厂那种全考算法题的…

作者头像 李华
网站建设 2026/9/6 8:11:59

核显占用高怎么办?从识别igd到系统优化三方法

一次远程帮朋友看电脑,他发来一张任务管理器截图,说是打游戏的时候核显占用一直跳,风扇响得厉害。他搜到了一个叫“igd”的词,问我能不能直接关掉。这个缩写在 Windows 环境里其实很容易造成误解:BIOS 里经常把集成显卡…

作者头像 李华
网站建设 2026/9/4 19:47:45

文档解析新范式:视觉语言模型直出Markdown,让RAG地基更稳

很多做 RAG(检索增强生成)应用的同学都有过这种体验:模型选型、向量库调优、提示词工程都花了大力气,最后线上效果却卡在了一个最不起眼的环节——文档解析。PDF 里提取出来的是一堆乱码,表格结构全部丢失,…

作者头像 李华