news 2026/9/4 23:49:10

MinerU PDF 转换指南:如何按需组合模块并完成 GPU 加速配置

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MinerU PDF 转换指南:如何按需组合模块并完成 GPU 加速配置

MinerU PDF 转换指南:如何按需组合模块并完成 GPU 加速配置

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

把上百页的扫描件变成结构化的 Markdown,是搭建 RAG 知识库和 Agent 工作流绕不开的一步。MinerU 负责把 PDF、Office 文档解析成 LLM 可直接消费的 Markdown 与 JSON,它的扩展模块按需安装,不必全都要。这篇教程带你完成三件事:选对安装包、跑通第一次 PDF 转换、配好 GPU 加速。

第一步选安装包:先按机器配置做决策

MinerU 的可选安装组把功能拆成了几档,装多装少取决于你手头的硬件。先看结论:

安装组合适用人群特点
mineru(基础包)只做转换调用的轻量机器体积最小,把解析任务交给远端服务
mineru[core]需要在本地完成全部转换的用户除 vllm 外的核心组件,装完即可用mineru命令
mineru[all]有 GPU 且追求吞吐的用户等价于mineru[core,vllm],包含全部扩展

💡 选型口诀:没有 GPU 或机器配置低,选基础包走远程;要本地完整转换,选 core;GPU 够强想加速,直接 all。

三行命令跑通首次转换:安装到出结果的最短路径

选定 core 后,下面三条命令就是从空环境到拿到输出物的完整链路。

安装 core 组件:

uv pip install mineru[core]

对一份 PDF 发起转换,-p指输入文件,-o指输出目录:

mineru -p demo.pdf -o output

运行结束后,output目录下会生成解析出的 Markdown、图片与中间 JSON 结果,可以直接喂给下游的 LLM 流程。完整的参数清单(分页解析、公式/表格开关等)可查阅 CLI 工具文档。

给 GPU 换上加速引擎:vllm 模块的安装与门槛

vllm 模块面向 GPU 用户,前提条件是 Turing 架构及以上显卡,且显存 8G 起步。满足后,一条命令即可装齐全部扩展:

uv pip install mineru[all]

然后配置两个环境变量,设备模式指定为 cuda,虚拟显存大小按实际卡调整:

export MINERU_DEVICE_MODE=cuda export MINERU_VIRTUAL_VRAM_SIZE=16

原理一句话带过:vllm 借助 PagedAttention(一种把 KV 缓存分页管理的技术)避免显存碎片化,让批量推理更快更省,整体推理速度有显著提升。相关模型代码位于 mineru/model/vlm 目录。

连上远程推理服务:轻量客户端用法

本地没有 GPU 但有一台服务器时,基础包就是最合适的选择:它体积最小,把重活交给远端。客户端通过 HTTP 连接 vllm-server,一条命令即可发起转换:

mineru --backend vlm-http-client -u http://server-ip:8000 -p input.pdf -o output.md

其中-u指向远端的 OpenAI 兼容服务地址,适合边缘设备与多机分摊解析压力的部署形态。

环境变量速查表:不碰代码调节行为

不想每次都在命令行里堆参数时,环境变量更省事,且通常优先于命令行参数生效。

变量名作用示例值
MINERU_MODEL_SOURCE切换模型下载来源modelscope
MINERU_FORMULA_ENABLE公式解析开关false
MINERU_TABLE_ENABLE表格识别开关true

例如国内网络下载模型不便时,把来源切成 modelscope 即可;纯文字文档可以关掉公式与表格解析来省时间。全部变量的说明见 环境变量说明。

高频问题自查:现象、原因与一行修复

现象:vllm 安装失败或环境不兼容。原因:vllm 对显卡驱动与 CUDA 版本有硬性要求,手搓依赖容易踩坑。修复:直接使用官方 Docker 预构建镜像,参考 Docker 部署指南。

现象:转换结果中文显示为乱码。原因:解析时语言识别不准,OCR 按错误字符集还原了文字。修复:在运行转换时通过-l ch显式指定文档语言(该参数仅 pipeline 后端生效)。

现象:推理时报显存不足。原因:批量处理占用的显存超出了卡的实际容量。修复:调小MINERU_VIRTUAL_VRAM_SIZE的取值,为系统留出余量。

小结与延伸阅读

MinerU 把 PDF 转换拆成了基础包、core、all 三档安装组,分别对应远程调用、本地转换与 GPU 加速三种形态,配合环境变量即可覆盖多数场景。完整代码与更多示例可在 MinerU 仓库 找到。

延伸阅读:常见问题 FAQ、输出文件说明。

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 23:47:25

Python数据可视化实战:用Pandas+Matplotlib自动化生成专业图表

1. 项目概述:从数据到图形的自动化旅程 如果你手头有一份包含多列数据的CSV或Excel文件,比如实验记录、销售报表或者传感器日志,而你的老板或导师又急需一份清晰直观的趋势图来汇报,你会怎么做?是打开Excel手动拖拽生成…

作者头像 李华
网站建设 2026/9/4 23:47:51

随机森林时间序列预测:面向业务协变量的端到端实战指南

简介:时间序列预测本质上是建模目标变量与历史模式及外部驱动因素之间的关系。随机森林(RF)虽非传统时序模型,但凭借其对非线性关系、高维异构特征和缺失值的强鲁棒性,在具备丰富业务协变量(如促销、天气、…

作者头像 李华
网站建设 2026/8/31 17:29:21

5步跑通电竞数据分析:公开数据集从原始CSV到K/D比预测

5步跑通电竞数据分析:公开数据集从原始CSV到K/D比预测 【免费下载链接】awesome-public-datasets A topic-centric list of HQ open datasets. 项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets 季后赛前夜,教练组要在…

作者头像 李华
网站建设 2026/8/31 16:26:24

Mermaid 文本绘图:几行文字画出 20 多种图表,改文字即改图

Mermaid 文本绘图:几行文字画出 20 多种图表,改文字即改图 【免费下载链接】mermaid Generation of diagrams like flowcharts or sequence diagrams from text in a similar manner as markdown 项目地址: https://gitcode.com/GitHub_Trending/me/me…

作者头像 李华
网站建设 2026/9/2 8:26:10

AI游戏上半场:腾讯网易字节的效率战与技术栈拆解

2024 年之后,AI 游戏从“概念验证”阶段正式进入了“军备竞赛”阶段。腾讯、网易、字节跳动这三家国内游戏圈最重量级的玩家,已经在 AI 游戏这条赛道上完成了首个回合的布局。如果你是一名游戏开发者、技术负责人或 AI 应用研究者,现在最值得…

作者头像 李华
网站建设 2026/8/31 17:58:49

技能应存进权重而非提示词?抽象技能与on-policy自蒸馏

最近越来越觉得,很多模型“变笨”不是参数出了问题,而是技能的存放位置选错了。明明同样是让模型先分析再回答,写在提示词里的规则就是不稳定,换到权重里的能力却更可靠。这篇题为 Distill Skills into Weights, Not Prompts: Ab…

作者头像 李华