从混乱文档到结构化知识:Hyper-Extract 完整工作流图解
【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract
Hyper-Extract 是一款由大语言模型(LLM)驱动的智能知识提取工具,一条命令即可把杂乱无章的文档转化为知识图谱、超图、时间线等结构化知识,并支持语义搜索与交互式问答。这篇图解指南将带你完整走通"从混乱文档到可用知识库"的全流程,面向新手,几乎不需要写代码。
什么是 Hyper-Extract?
可以把它理解为一位"智能文档整理师":你丢给它一份 PDF 里的文本、财报、论文或合同,它会阅读全文,自动抽出实体、关系与时间线,存成可搜索、可对话、可可视化的结构化知识。
| 核心能力 | 说明 |
|---|---|
| 🔷 8 种知识结构 | 从简单列表到知识图谱、超图、时空图谱 |
| 🧠 10+ 提取引擎 | GraphRAG、LightRAG、KG-Gen 等开箱即用 |
| 📝 80+ YAML 模板 | 覆盖金融、法律、医疗、中医、工业、通用 6 大领域 |
| 🔄 增量演进 | 随时追加新文档,知识库自动扩展与精炼 |
整个转换过程分为三个阶段:文档输入 → AI 处理 → 结构化输出(见上方流程图)。长文档会被自动分块处理,LLM 逐块提取,最后合并去重,形成"知识摘要"(Knowledge Abstract)。
知识长什么样?8 种结构任你选
不同文档适合不同的知识形态:传记适合图谱,事件适合时间线,风险清单适合集合,多方合作适合超图。Hyper-Extract 内置 8 种强类型结构,无需手动定义 schema:
- AutoModel / AutoList / AutoSet— 结构化报告、要点列表、实体集合
- AutoGraph— 实体与关系的知识图谱
- AutoHypergraph— 多方参与的超边关系
- AutoTemporalGraph— 带时间轴的事件流
- AutoSpatialGraph / AutoSpatioTemporalGraph— 带地点、甚至"时间+地点"的图谱
准备工作:5 分钟完成安装与配置
一键安装步骤(要求 Python 3.11+,推荐用 uv):
# 安装 CLI uv tool install hyperextract # 或 pipx install hyperextract # 一次性配置模型提供商(以 OpenAI 为例) he config init -p openai -k YOUR_API_KEY除 OpenAI 外,还支持 Anthropic Claude、DeepSeek、阿里云百炼,以及本地 vLLM 部署(数据完全不出本机)。只需配置一次,后续所有命令自动读取配置。
完整工作流:6 条命令建成知识库
下面用一份苏轼传记示例走一遍全流程。
第 1 步:he parse从文档提取知识
he parse sushi.md -t general/biography_graph -o ./output/ -l zh-t指定提取模板(这里是"传记图谱")-o指定输出目录-l指定处理语言
执行后你会得到data.json(提取的知识)、metadata.json(元数据)和向量搜索索引。
第 2 步:he info查看知识库统计
he info ./output/一眼看到节点数、边数、模板、索引状态,方便确认提取质量。
第 3 步:he show交互式可视化
he show ./output/浏览器会打开一张可拖拽、可点击的图谱:人物、作品、地点是节点,"创作""父亲""任职地"是边,点击节点还能看到详情面板。
第 4 步:he search语义搜索
he search ./output/ "苏轼的代表作有哪些"即使关键词与原文不完全一致,也能基于向量索引召回相关节点。
第 5 步:he talk与知识对话
he talk ./output/ -i # 进入交互式问答 he talk ./output/ -q "用三句话总结苏轼生平"LLM 会基于提取出的知识摘要作答,相当于给文档配了一个"私人问答助手"。
第 6 步:he feed增量扩展知识库
he feed ./output/ new_doc.md # 追加新文档,自动合并去重 he build-index ./output/ -f # 重建搜索索引知识库不是一次性的——每周喂入新文档,图谱就会持续生长。
如何选择合适的提取模板?
内置 80+ 个 YAML 模板,按领域组织在hyperextract/templates/presets/目录下,零代码即可使用:
| 领域 | 模板目录 | 典型场景 |
|---|---|---|
| 通用 | hyperextract/templates/presets/general/ | 传记图谱、概念图谱、文档结构 |
| 金融 | hyperextract/templates/presets/finance/ | 财报摘要、风险因素、股权图谱 |
| 法律 | hyperextract/templates/presets/legal/ | 合同义务、案件时间线 |
| 医疗 | hyperextract/templates/presets/medicine/ | 治疗图谱、药物相互作用 |
| 中医 | hyperextract/templates/presets/tcm/ | 方剂组成、经络图谱、辨证推理 |
| 工业 | hyperextract/templates/presets/industry/ | 设备拓扑、操作流程、故障案例 |
不确定用哪个?运行he list template浏览全部模板,或参考项目中的 examples/ 目录里的可运行示例。
从单篇文档到多语言知识库
同一个工作流同样适用于英文文档——提取出的图谱与中文版本完全一致,只是语言切换:
批量处理时,只需为每份文档指定输出目录循环执行he parse,再分别he feed合并,即可把整个团队的文档沉淀为一套可检索的知识库。
它是怎么工作的?三层架构一览
Hyper-Extract 底层是清晰的三层设计,理解它有助于你选对工具:
- Auto-Types(
hyperextract/types/)— 8 种强类型数据结构,是"知识该长什么样"的底座 - Methods(
hyperextract/methods/)— KG-Gen、GraphRAG、LightRAG、Hyper-RAG 等提取算法,决定"怎么抽" - Templates(
hyperextract/templates/)— 80+ 预设 YAML 模板,用声明式配置组合前两层,实现零代码定制
知识沉淀:导出与应用
提取完的知识不止能看,还能用:
- 导出 Obsidian 知识库:
he export obsidian ./output/ -o ./vault/,每个节点变成一篇 Markdown 笔记,关系变成[[双向链接]],直接放进 Obsidian 图谱视图浏览 - MCP 服务器:运行
he-mcp,把知识库接入 Claude Desktop 或 IDE 智能体,随时查询你的知识摘要 - Python API:
uv pip install hyperextract后即可在代码中调用,嵌入自己的数据处理流水线
小结
回顾一下完整工作流:配置 → 提取 → 统计 → 可视化 → 搜索 → 对话 → 增量扩展,一共 6 条命令,就能把混乱文档变成结构化知识。对于科研人员、金融分析师或任何被文档淹没的团队,Hyper-Extract 提供的正是"停止阅读,开始理解"的那条捷径。
【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考