news 2026/9/5 11:52:19

MinerU 多语言 OCR 配置指南:12 个语言模型与 --lang 参数调优

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MinerU 多语言 OCR 配置指南:12 个语言模型与 --lang 参数调优

MinerU 多语言 OCR 配置指南:12 个语言模型与 --lang 参数调优

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

本文聚焦 MinerU pipeline 后端的多语言 OCR,讲清--lang的 12 个语言模型取值、别名映射和调优参数,帮你为外文文档选对识别模型。

功能全景:多语言 OCR 能力边界

MinerU 2.1.0 起,pipeline 后端默认识别模型更新为 PP-OCRv5 多语种模型,官方 changelog 标注其支持法语、西班牙语、葡萄牙语、俄语、韩语等 37 种语言,平均精度涨幅超 30%。在此之上,--lang又暴露了 12 个专用语言模型,覆盖东欧斯拉夫语系、阿拉伯语系、西里尔文和印度语系等默认模型覆盖不到或覆盖较弱的文字体系。需要注意:--lang仅对 pipeline 后端生效,hybrid 与 vlm 后端会忽略该值。

能力项说明适用场景备注
--lang12 个取值ch / ch_server / korean / ta / te / ka / th / el / arabic / east_slavic / cyrillic / devanagari指定文档语言以提升 OCR 准确率仅 pipeline 后端,默认 ch
别名短码en、ru、ar、hi 等 50+ 别名按 ISO 语言码直接传参自动映射到对应语言模型
-m解析方法auto / txt / ocr扫描件需强制走 OCR默认 auto 自动判定
ch_server模型PP-OCRv5_rec_server,1.8w 字典手写文档、日韩繁混合需模型已更新

快速跑通:一条命令解析外文文档

mineru -p <input.pdf> -o output/ -b pipeline -l ch

首次运行会自动下载对应语言模型,网络无法访问 HuggingFace 时先执行export MINERU_MODEL_SOURCE=modelscope切换模型源。运行完成后,output/目录下会生成以文件命名的目录,包含 Markdown 结果与抽取出的图片,OCR 识别出的文本已合入 Markdown 正文。

分模块说明:按文档文字体系选模型

12 个语言模型覆盖哪些文字

每个--lang取值对应一个专用识别模型,语言说明以--help输出为准。下表按文字体系归类,便于按文档实际用字快速定位:

取值覆盖语言
ch / ch_server中文、英文、日文、繁体中文、拉丁文
korean韩文、英文
ta / te / ka泰米尔语、泰卢固语、卡纳达语
th / el泰语、希腊语(均含英文)
arabic阿拉伯语、波斯语、维吾尔语、乌尔都语等 9 种
east_slavic俄语、白俄罗斯语、乌克兰语、英文
cyrillic / devanagari30+ 种西里尔文字语言 / 印地语、马拉地语等 15 种

别名短码:en、ru、ar 等可直接传

validate_public_ocr_lang等校验逻辑会把兼容别名规范到实际模型 key,例如enjapanchinese_chtlatin归一为chrubeuk归一为east_slavichimrne归一为devanagari。这样脚本里可以按 ISO 语言码传参而不必记忆模型 key:

mineru -p <doc_ru.pdf> -o output/ -b pipeline -l ru
  • ru等价于east_slavic,走俄语等东斯拉夫语系专用模型
  • 约 32 个西里尔文字别名(bgkkky等)统一映射到cyrillic
  • 不在白名单的语言值会直接抛错并列出合法取值

ch 与 ch_server:默认模型与手写场景

两者都面向中英日繁混合文档,区别在底层模型代次。1.3.12 版本起ch_server指向 PP-OCRv5_rec_server,强化手写场景和特殊字符;默认ch仍保留 PP-OCRv4_rec_server_doc,在一般文档类别上精度略优于 v5 server,手写场景则相反。

取值底层模型字典规模建议
ch(默认)PP-OCRv4_rec_server_doc1.5w普通文档的默认选择
ch_serverPP-OCRv5_rec_server1.8w手写文档、日韩繁混排

扫描件与纯文本文档:配合 -m 使用

-m决定每页走文本抽取还是 OCR:auto自动判定,txt强制抽取,ocr强制识别。对扫描件,auto 判定若偏保守会走文本抽取导致输出几乎为空,此时应显式指定ocr

mineru -p <scan.pdf> -o output/ -b pipeline -m ocr -l arabic
  • -m ocr--lang必须配合,否则指定语言模型不会参与识别
  • -s/-e指定起止页码(从 0 开始),长文档可分段试跑

配置与调优:参数、取值与依据

  • MINERU_PROCESSING_WINDOW_SIZE→ 默认 64,大页数外文文档内存吃紧时降至 16~32 → 该窗口直接决定单进程同时持有的页面数与内存占用
  • MINERU_PDF_RENDER_THREADS→ 默认 4,高核 CPU 可提到 8 → 控制 PDF 渲染 worker 并发,只影响渲染阶段速度
  • MINERU_MODEL_SOURCE→ 默认 huggingface,无法访问时设为modelscope→ 决定首次运行下载 12 个语言模型走哪条链路
  • -s/-e→ 0 到目标页码 → 先用 10 页以内区间验证--lang选择,再放大到全文
  • MINERU_FORMULA_ENABLE/MINERU_TABLE_ENABLE→ 不含公式、表格的纯外文文档设为false→ 跳过对应模型推理,缩短单文档耗时

多语言相关的版本事实,供核对升级收益(数据均来自仓库 changelog,无第三方基准):

版本多语言 OCR 变更数据来源
2.1.0pipeline 更新 PP-OCRv5 多语种模型,支持 37 种语言,平均精度涨幅超 30%官方 changelog
1.3.12ch_server 更新为 PP-OCRv5_rec_server(1.8w 字典)官方 changelog

典型场景:按文字体系配置

场景一:俄语文档扫描件

  • 问题:西里尔文字扫描 PDF,默认 ch 模型字典不覆盖,识别结果整段乱码
  • 做法:-b pipeline -m ocr -l east_slavic,纯西里尔小语种(保加利亚语、哈萨克语等)改用-l cyrillic
  • 效果:走对应文字体系专用模型,30+ 种西里尔文字语言在同一模型下识别

场景二:中英混排的手写会议纪要

  • 问题:默认 ch(v4 代模型)对手写覆盖有限
  • 做法:--lang ch_server,其余参数不变
  • 效果:PP-OCRv5_rec_server 强化手写与特殊字符,1.8w 字典对中英日繁混排保持覆盖

场景三:多语言混排的目录批处理

  • 问题:同一目录下混有英文、西班牙语、阿拉伯语文档,统一跑ch会出现个别语种精度差
  • 做法:按语言分组,每组单独执行mineru并指定对应--lang;默认模型已覆盖的 37 种语言(法语、西班牙语等)可留在 ch 组
  • 效果:每组各用最优模型,且分组后单任务内存占用更可控

常见坑:现象、原因与解法

  • 传了--lang但结果没有变化 → 该参数仅用于 pipeline 后端,hybrid / vlm 后端直接忽略 → 切换-b pipeline或调整预期
  • enlatin以为是纯拉丁语专用模型 → 别名只做兼容映射,en/latin实际归一到ch→ 以 12 个合法取值为准,不确定时查mineru --help
  • 扫描件输出几乎为空 → auto 判定走了文本抽取而非 OCR → 强制-m ocr并配合--lang
  • 手写文档错字偏多 → 默认ch仍是 PP-OCRv4_rec_server_doc → 改传--lang ch_server使用 v5 模型
  • 阿拉伯文、西里尔小语种精度不理想 → 默认模型字典未覆盖对应文字体系 → 改用-l arabic-l cyrillic专用模型

结语

按文字体系选对--lang,再配合-m ocr和窗口参数,即可覆盖绝大多数多语言 OCR 场景。本文基于 MinerU 3.4.4 编写,取值以实际版本--help为准。

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 20:26:51

1分钟连上手机,scrcpy 如何投屏并控制安卓设备

1分钟连上手机&#xff0c;scrcpy 如何投屏并控制安卓设备 【免费下载链接】scrcpy Display and control your Android device 项目地址: https://gitcode.com/GitHub_Trending/sc/scrcpy 手机上的消息和验证码总在你写代码、剪视频的时候跳出来。把手机屏幕镜像到电脑&…

作者头像 李华
网站建设 2026/8/31 19:08:35

Ventoy 启动盘制作教程:一个U盘装下所有系统镜像

Ventoy 启动盘制作教程&#xff1a;一个U盘装下所有系统镜像 【免费下载链接】Ventoy A new bootable USB solution. 项目地址: https://gitcode.com/GitHub_Trending/ve/Ventoy 凌晨三点&#xff0c;客户机器蓝屏&#xff0c;你翻遍抽屉只找到一根 U 盘&#xff0c;里面…

作者头像 李华
网站建设 2026/9/1 11:57:11

Ventoy快速制作多系统U盘启动盘的完整指南

Ventoy快速制作多系统U盘启动盘的完整指南 【免费下载链接】Ventoy A new bootable USB solution. 项目地址: https://gitcode.com/GitHub_Trending/ve/Ventoy Ventoy 是一款开源的多系统启动盘方案&#xff1a;把引导环境写进 U 盘后&#xff0c;ISO 镜像像普通文件一样…

作者头像 李华
网站建设 2026/9/2 12:00:19

MinerU Python 3.10-3.13 全版本兼容:3 种安装方式 10 分钟跑通

MinerU Python 3.10-3.13 全版本兼容&#xff1a;3 种安装方式 10 分钟跑通 【免费下载链接】MinerU Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows. 项目地址: https://gitcode.com/GitHub_Trending/mi…

作者头像 李华
网站建设 2026/8/31 23:50:12

Python实现灰色关联分析:原理、代码与可视化实战

1. 项目缘起&#xff1a;为什么需要灰色关联分析&#xff1f; 在数据分析的日常工作中&#xff0c;我们常常会遇到这样的场景&#xff1a;手头有一堆指标&#xff0c;比如影响某个产品销量的因素可能有广告投入、促销力度、渠道数量、竞品价格等等。老板问&#xff1a;“哪个因…

作者头像 李华
网站建设 2026/9/1 9:10:32

LSM6DSM低功耗六轴传感器实战:实现“始终开启”的智能感知系统

前阵子给一台资产追踪器做传感器选型&#xff0c;翻来翻去最后焊上的是ST的LSM6DSM。这颗芯片在资料里写得挺直白&#xff1a;“always-on 3D accelerometer and 3D gyroscope”&#xff0c;简单说就是一颗3D加速度计加一颗3D陀螺仪&#xff0c;封装在一个6轴惯性模块里&#x…

作者头像 李华