免费把 200 页扫描件 PDF 转成可编辑 Markdown,MinerU 只需几分钟
【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU
一份 200 页的扫描版采购合同,附件里还有十几张价格表。你需要它变成可搜索、可编辑的 Markdown,交给团队做条款比对。把文件拖进 MinerU 这个开源 PDF 转 Markdown 工具,几分钟后,正文、表格和公式都已经按原版面排好,放在输出目录里等你取用。
拿到手就能做的五件事
- 复杂版面 PDF 转 Markdown / JSON
- 扫描件自动识别,走 OCR 提取文字
- 表格自动检测,输出 HTML 格式
- 数学公式转成 LaTeX 文本
- 支持中英混排等 84 种语言
200 页扫描合同,从上传到拿结果
安装开源 PDF 工具 MinerU 后(快速开始指南里写了在线体验、命令行、本地部署三种方式,可以先用在线版评估效果)。把合同拖进解析界面的上传区:
界面上方列出了支持的文档类型:PDF、Word、PPT、Excel、图片,合同原件直接上传即可。任务完成后,输出目录里会生成 Markdown 与 JSON 两种格式,图片单独存图。正文里,章条标题变成 Markdown 标题结构,价格表转成带行列的 HTML 表格,公式变成 LaTeX,阅读顺序和原文件一致。
50 份合规文档批量转换,批量入口在哪
命令行工具直接吃目录:在终端输入mineru -p 输入目录 -o 输出目录,整个文件夹一次跑完,每份文件各生成一套结果。
场景一:法务合同批量结构化
- 之前:逐份复制付款条款、责任条款到 Excel,每份耗时数小时,难免漏行
- 之后:整批转换,每份合同得到结构化 Markdown,直接归档入库、全文检索
场景二:技术报告与论文表格提取
- 之前:手动把论文里 10 张表格重新录入表格软件,公式只能截图
- 之后:表格自动转 HTML,公式转 LaTeX,数据直接进表格软件复用
扫描件转 Markdown:OCR 如何参与
MinerU 会自动判断 PDF 是纯文本还是扫描版,扫描件自动进入 OCR 流程,无需你手动指定。解析管线按文档分类、版面检测、公式检测、文字识别分阶段处理,OCR 只是其中一环;输出不理想时,也能顺着这个流程定位问题出在哪一段。
解析后端怎么选
不同后端对结果的精度有明显差异(据官方文档):
| 解析后端 | 硬件要求 | 精度指标 |
|---|---|---|
| pipeline | 低,纯 CPU 可用 | 86.47 |
| vlm / hybrid | 需要 GPU | 95.3 左右 |
同一份文档,换后端往往比反复调参数见效更快。后端源码见 mineru/backend/。
上手入口:文档、API 与 MCP
从快速开始文档挑一种部署方式:在线体验免安装;命令行一条命令完成 PDF 转 Markdown;本地部署适合长期跑批。需要接入自己的系统或 AI 工具时,MinerU 提供 API 服务和 MCP 插件,可挂进现有工作流。
MinerU 把转换这件重复劳动接过去,你只需要处理文档本身。
【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考