Was ist Column-Level Lineage?
Column-Level Lineage (Lineage auf Spaltenebene) ist die Fähigkeit, den Weg eines einzelnen Feldes oder einer Spalte durch das gesamte Datenökosystem vom Ursprung bis zur endgültigen Nutzung zu verfolgen. Während Lineage auf Tabellenebene Beziehungen zwischen vollständigen Datensätzen zeigt („Tabelle A speist Tabelle B"), zeigt Column-Level Lineage, wie jedes Feld transformiert, kombiniert oder weitergegeben wird.
Beispielsweise kann das Feld „revenue_total" in einem Finanz-Dashboard aus der Spalte „amount" der Transaktionstabelle stammen, multipliziert mit der Spalte „exchange_rate" der Währungstabelle, gefiltert durch die Spalte „status" = „completed". Column-Level Lineage dokumentiert genau diese Transformationskette, Feld für Feld.
Dieses Granularitätsniveau ist unerlässlich, um Fragen zu beantworten wie: „Woher stammt genau diese Zahl?", „Welche Felder sind betroffen, wenn ich den Datentyp dieser Spalte ändere?" oder „Welche Dashboards zeigen Daten, die von diesem PII-Feld abgeleitet sind?". Ohne Column-Level Lineage können diese Fragen nur manuell beantwortet werden, durch Überprüfung von Code und Abfragen eine nach der anderen.
Warum ist das wichtig?
Laut Branchenrecherchen entstehen 70 % der Datenvorfälle durch Änderungen auf Spaltenebene: Ein Feld umbenennen, seinen Datentyp ändern, eine Berechnungslogik modifizieren oder eine Spalte entfernen, von der andere Prozesse abhängen. Lineage auf Tabellenebene erfasst diese Änderungen nicht mit der nötigen Präzision, um Probleme zu verhindern.
Für die regulatorische Compliance ist Column-Level Lineage besonders wertvoll. Die DSGVO verlangt zu wissen, wo personenbezogene Datenfelder fließen, Feld für Feld. Wenn das Feld „email" aus der Kundentabelle in 15 nachgelagerte Tabellen kopiert wird, muss man das wissen, um sicherzustellen, dass alle Speicherpunkte die Aufbewahrungs- und Zugriffsrichtlinien einhalten.
Wie funktioniert das in der Praxis?
Column-Level Lineage wird durch Analyse von SQL-Transformationen, View-Definitionen, ETL/ELT-Pipeline-Konfigurationen und BI-Tool-Metadaten aufgebaut. SQL-Parser-Tools extrahieren die Beziehungen zwischen Quell- und Zielspalten, einschließlich Operationen wie JOINs, UNIONs, Aggregationsfunktionen und Berechnungen.
Das Ergebnis ist ein gerichteter Graph auf Feldebene, bei dem jeder Knoten eine bestimmte Spalte in einer bestimmten Tabelle ist und jede Kante eine Transformation oder Weitergabe darstellt. Dieser Graph ermöglicht die Navigation sowohl upstream (woher kommt dieses Feld?) als auch downstream (wohin geht dieses Feld?) mit absoluter Präzision.
Column-Level Lineage in Linedat
Linedat bietet Column-Level Lineage integriert in den Datenkatalog und visualisiert die Beziehungen zwischen einzelnen Feldern im gesamten Ökosystem. Kombiniert mit automatischer PII-Erkennung ermöglicht es die genaue Verfolgung, wohin personenbezogene Daten fließen, und die Impact-Analysis-Funktion zeigt die Auswirkungen geplanter Änderungen auf Feldebene vor deren Ausführung.
Verwandte Begriffe
Data Lineage ist die Nachverfolgbarkeit von Daten vom Ursprung bis zum Ziel, einschließlich aller Transformationen und Abhängigkeiten.
Was ist Datenauswirkungsanalyse (Impact Analysis)?Impact Analysis bewertet, was bei Änderungen an Daten, Tabellen oder Spalten bricht. Sie verhindert nachgelagerte Vorfälle.
Was sind PII-Daten (Personenbezogene Daten)?PII sind Daten, die eine Person identifizieren: Name, E-Mail, Ausweisnummer, IP-Adresse. Erfahre, wie du sie erkennst und für DSGVO-Compliance verwaltest.
Was ist ein Datenkatalog?Ein Datenkatalog ist ein zentrales Inventar aller Daten-Assets einer Organisation, mit Metadaten, Beschreibungen und Datenherkunft.
