3 步跑通 DataHub:从启动到看见第一张血缘图
【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub
团队里 200 张表,那张核心宽表到底谁在维护、下游谁在用,基本没人说得清。DataHub 就是干这个的:一个开源的元数据管理平台,把散在各处的表、字段、血缘关系收进同一个目录,让你搜得到、看得懂、改得动。
🚀 先跑起来,再看别的
前提是装好 Docker(Docker Compose v2)和 Python 3.10+,机器至少留 8GB 内存给 Docker。然后三条命令:
python3 -m pip install --upgrade acryl-datahub装的是 CLI 工具,后面所有操作都用它。接着启动整套服务,GMS、前端、Kafka、搜索索引会一起拉起来:
datahub docker quickstart跑完这条,浏览器打开 http://localhost:9002,用默认账号 datahub / datahub 登录,看到欢迎页就算成了。想让界面里有点东西可看,再加载一份官方示例数据(约 1000 个实体,含血缘和标签):
datahub init --username datahub --password datahub datahub datapack load showcase-ecommerce🎯 3 个最值得花时间的功能
DataHub 的分工很简单:左边是各种数据源,通过摄取把元数据推进中间的 DataHub 平台,右边供人、API 和 Agent 消费。
1. 全局搜索:从表名查到业务名
在顶部搜索框直接敲Customer Profiles这类业务名字,不用记表名。结果卡片上直接带出数据平台、标签、业务术语和最近查询量。
2. 数据血缘:一张图看清上下游
点进任意数据集详情页,血缘 Tab 默认展开:上游是谁产的、下游谁在消费,一目了然。点任意一个上游节点,能直接跳到那个表或任务自己的页面。
3. 治理标注:标签 + 术语 + 负责人
给数据集打上 PII、金级客户 这类标签,挂上业务术语,指定负责人。之后左侧边栏就能按标签批量过滤,"哪些表涉及客户隐私"一个问题从群里@人变成一次筛选。
🔌 一个端到端小场景
把 MySQL 里的订单库用摄取配方接进来,跑一次,表结构、字段说明、上下游血缘自动落到目录里。某天一张销售报表跑得很慢,进 DataHub 搜到这张报表数据集,血缘页往上跳两跳,就能定位到它依赖的 MySQL 宽表和 Kafka topic,30 秒内确认是上游任务延迟,而不是报表本身的问题。
⚠️ 容易踩的 4 个坑
前端起不来,日志报 address already in use9002 端口被别的服务占了。 设置
DATAHUB_MAPPED_FRONTEND_PORT=19002再跑一次 quickstart 即可。刚接的数据搜不到数据在库里,但搜索索引还没刷出来。 看摄取状态,或
curl http://localhost:9200/_cat/indices确认索引存在。quickstart 起来后登不进去多半是 CLI 没初始化,指向了别的环境。 重新执行
datahub init --username datahub --password datahub。OpenSearch 容器反复重启Docker 分配内存不足 8GB。 给 Docker 加内存,然后
docker system prune后重启 quickstart。
接下来可以往哪走
- 接真实数据源:MySQL、Snowflake、BigQuery 等都有对应插件,配个摄取 recipe 定时跑就行,见 数据源插件目录。
- 生产部署:本地 quickstart 只适合验证,正式环境建议上 Kubernetes,见 Kubernetes 部署文档。
- 监控告警:仓库自带 Prometheus + Grafana 配置,见 监控配置。
开头那个"没人说得清"的问题,现在你已经有地方查了。服务跑起来了,示例数据也在了,搜表、看血缘、打标签,都是界面点两下的事。
【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考