
Hyper-Extract dump / load 完全指南如何持久化与加载知识摘要存储【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-ExtractHyper-Extract是一个基于 LLM 的文档知识提取工具能把非结构化文本一键转化为图谱、超图与时空结构等知识摘要Knowledge Abstract简称 KA。本指南带你彻底搞懂它的持久化与加载机制——dump保存与load加载让你提取的知识不再随进程消失而是可靠地存进磁盘、随时取回使用。dump 保存了哪些内容dump()是序列化入口它会把一个 KA 完整落盘到指定目录包含三部分内容文件说明 核心数据data.json提取出的实体、关系等结构化知识️ 元数据metadata.json所用模板、语言、创建/更新时间戳 向量索引index/FAISS 搜索索引可选未构建则无保存后的目录长这样./my_ka/ ├── data.json # 提取的知识 ├── metadata.json # 提取信息 └── index/ # 搜索索引如已构建 ├── index.faiss └── docstore.json实现细节可以看 base.py 的 dump 方法数据必存、元数据必存、索引失败只告警不致命——因为索引随时可以重建。三步保存你的知识摘要Python 侧最简用法只有两行先提取再dump到目录。from hyperextract import Template ka Template.create(general/concept_graph, en) result ka.parse(text) # 建议先建索引保存时一并落盘 result.build_index() result.dump(./my_ka/)小技巧索引是可选的忘了建也没关系dump只会打印一条警告加载后重新build_index()即可。CLI 用户he parse 一条命令搞定如果你习惯命令行he parse -o ka_path会在提取完成后自动调用dump把整个 KA 写到目标目录无需任何额外操作he parse paper.md -t general/concept_graph -o ./my_ka/后续对磁盘上 KA 的读取全部通过ka_path参数完成he info、he search、he talk、he export等命令内部都会先load再操作。load 加载的正确姿势加载前有两个前提条件新手最容易踩坑模板必须一致——加载时创建的模板要和当初保存时用的相同否则数据结构对不上只加载可信目录——load会反序列化index/下的本地 FAISS 文件请只对自己生成的 KA 目录执行。ka Template.create(general/concept_graph, en) ka.load(./my_ka/) if not ka.empty(): print(f节点数: {len(ka.nodes)}, 边数: {len(ka.edges)}) response ka.chat(核心结论是什么)load的容错策略与dump对称见 base.py 的 load 方法数据缺失直接报错元数据和索引缺失则静默跳过保证能加载多少算多少。常见使用场景⏳长期存储提取 → 建索引 →dump几周后再load即可继续问答检索共享分发KA 目录是纯 JSON 索引文件直接拷贝到共享位置同事load后立即可用备份与版本按时间戳建目录kb_20260915/、kb_v1/、kb_v2/天然形成版本历史增量更新用he feed ka_path new_doc把新文档合并进已有 KA无需重新提取。自定义元数据如项目名、版本号也可以随metadata.json一起保存方便日后区分知识库来源。清理与维护he clean 命令不再需要的 KA 可以用 he clean 命令 安全清理默认只删除index/子目录保留data.json与元数据之后可用he build-index重建加--all才删除整个 KA 目录且会先要求确认该命令只认含data.json的目录输错路径不会误删无关文件。配合he info ka_path见 info 命令文档可随时查看某个 KA 的模板、时间戳、节点/边数量与索引状态是加载前快速体检的好帮手。最佳实践清单#建议原因1加载时模板与保存时保持一致避免数据结构不匹配2加载后检查索引缺失则build_index()保证语义搜索可用3使用先load再判断empty()避免空库直接查询4目录命名带日期或版本号便于回溯与备份更多细节可参考官方文档 保存与加载指南 与 CLI 工作流程。掌握了dump与load你的知识摘要就完成了从一次性提取到可存储、可共享、可迭代的闭环 【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考