
DataHub 本地跑通全流程10 分钟从容器启动到看到血缘图【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahubDataHub 本地部署其实没那么玄乎——装好 CLI、一条命令拉起服务栈、再灌一份演示数据10 分钟后你就能在浏览器里点开一张表看到它的上下游血缘。假设你的数据散落在 5 个平台、没人说得清谁在消费哪张表这篇文章带你亲手把这套元数据平台在本地跑起来。 第 1 分钟把 CLI 装进终端前置只需要 Docker Desktop 和 Python 3.10装好即可本文不展开。CLI 是整个流程的遥控器安装它才能一键起服务、灌数据pip install --upgrade acryl-datahub跑完执行datahub version能看到版本号说明 DataHub CLI 安装成功。后面所有命令都靠它。 第 5 分钟一条命令拉起的完整服务栈datahub docker quickstart这一条命令会拉镜像、建网络、起 MySQL、Kafka、OpenSearch再部署 GMS 后端和前端一条都不用你碰。跑完最后一行出现✔ DataHub is now running终端还会贴心地告诉你账号密码。上图是 DataHub 的整体架构左侧各数据源把元数据推/拉到平台右侧通过 GraphQL、REST、Kafka 输出给下游。完整 Compose 配置在 docker/quickstart/ 目录下官方入门文档同步在 docs/quickstart.md。 第 15 分钟灌入演示数据让目录活起来浏览器打开 http://localhost:9002用默认账号密码登录——都是datahub。但空的目录没意思先让 CLI 记住这个实例datahub init --username datahub --password datahub再加载官方演示数据一次灌入约 1050 个实体横跨 Snowflake、Looker、PowerBI、Tableau带血缘、标签、术语和数据产品datahub datapack load showcase-ecommerce跑完终端显示 ingestion 成功浏览器里整个目录瞬间被填满。这个数据包的加载逻辑就写在 metadata-ingestion/src/datahub/cli/ 里好奇可以翻翻。加载演示数据后先看哪三个页面全局搜索搜个表名回车比翻 5 个平台快得多。数据集详情页点开任意一张表Schema、Owner、标签一览无余。血缘图Lineage同一页面切到 Lineage 标签上游是谁、下游谁在消费一张图说清——这就是开头那个痛点的解法。 卡住了怎么办跑不通别慌90% 的问题出在这两处端口被占前端 9002、GMS 8080 被占时设环境变量DATAHUB_MAPPED_FRONTEND_PORT9003后重新执行 quickstart。资源不够容器起不来就先给 Docker 加内存到 8GB 以上再清理一下docker system prune datahub docker checkcheck会告诉你哪个容器没就绪照日志修即可。到这里你的本地 DataHub 已经跑通全流程下一步就可以把演示数据换成真实平台的连接配置让这个目录替你团队干活了。【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考