数仓基于表级别的数据血缘分析

1.背景:数据血缘分析在日常的处理过程中非常重要,其分为应用级别、表级别和字段级别三种。在数据处理过程中,需要知道目标表的字段是来源于哪张原始表。对于简单的hsql来说我们很容易可以知道目标表的来源,但是复杂的hsql,想得到原始表不就那么方便了。故需要一个方法来便捷的导到目标表和来源表。

2.hive源码中有名为NodeProcessor的接口,可以通过实现该接口来获取表级别的数据血缘分析。

数仓基于表级别的数据血缘分析

上述为实现表界别的数据血缘分析的核心代码,字段级别待之后实现。