Was ist ein Datenkatalog?
Ein Datenkatalog (Data Catalog) ist ein zentrales, intelligentes Inventar aller Daten-Assets einer Organisation. Er funktioniert wie eine „interne Google-Suche für Daten": Er ermöglicht das Suchen, Entdecken und Verstehen von Tabellen, Spalten, Dashboards, Pipelines und anderen Daten-Assets, ohne das Engineering-Team befragen zu müssen.
Im Unterschied zu einer einfachen Tabelle mit Tabellennamen umfasst ein moderner Datenkatalog technische Metadaten (Datentypen, Volumina, Aktualisierungshäufigkeit), fachliche Metadaten (lesbare Beschreibungen, zugehörige Glossarbegriffe), Datenherkunft (woher die Daten stammen und wohin sie fließen), Qualitätsmetriken und Sensibilitätsklassifizierungen.
Der Datenkatalog ist das zentrale Element eines jeden Data-Governance-Programms, da er die grundlegenden Fragen beantwortet: Welche Daten haben wir? Wo befinden sie sich? Was bedeuten sie? Sind sie verlässlich? Und wer ist verantwortlich?
Warum ist das wichtig?
Eine Studie von Alation zeigt, dass Datenanalysten bis zu 30 % ihrer Zeit damit verbringen, Daten zu suchen und zu verstehen, bevor sie sie nutzen können. Ohne einen Katalog lebt dieses Wissen in den Köpfen von Schlüsselpersonen, in verstreuten Dokumenten oder existiert schlicht nicht. Wenn diese Personen das Team wechseln oder das Unternehmen verlassen, geht das Wissen verloren.
Zudem ist die Datenduplizierung und die Erstellung von „Schattentabellen" ein häufiges Problem in Organisationen ohne Katalog. Verschiedene Teams erstellen eigene Kopien derselben Daten, jede mit leicht unterschiedlichen Transformationen, was zu Inkonsistenzen in Berichten und Entscheidungen führt.
Wie funktioniert das in der Praxis?
Ein Datenkatalog verbindet sich über Konnektoren mit den Datenquellen der Organisation (Datenbanken, Data Warehouses, BI-Tools) und extrahiert automatisch technische Metadaten: Tabellennamen, Spalten, Datentypen, Volumina und Beziehungen. Auf dieser technischen Grundlage werden fachliche Metadaten hinzugefügt: Beschreibungen, Glossarbegriffe, Eigentümer und Klassifizierungen.
Nutzer interagieren mit dem Katalog über Suche (Freitext oder Filter), Navigation nach Domänen oder Herkunft sowie Qualitätsabfragen. Ein moderner Katalog bietet auch KI-gestützte semantische Suche, die verwandte Assets vorschlägt, selbst wenn die technischen Namen nicht übereinstimmen.
Datenkatalog in Linedat
Der Datenkatalog von Linedat verbindet sich mit Quellen wie PostgreSQL, MySQL, BigQuery, Snowflake und MongoDB und extrahiert automatisch technische Metadaten. Die KI generiert fachliche Beschreibungen für Tabellen und Spalten, erkennt PII-Felder und schlägt zugehörige Glossarbegriffe vor, was den manuellen Dokumentationsaufwand drastisch reduziert.
Verwandte Begriffe
Data Governance ist das Rahmenwerk aus Richtlinien, Prozessen und Rollen, das Datenqualität, Sicherheit und korrekte Nutzung in einer Organisation gewährleistet.
Was ist Metadatenverwaltung (Metadata Management)?Metadatenverwaltung organisiert die Daten über deine Daten: Schemata, Beschreibungen, Lineage und Klassifizierungen in einem zentralen System.
Was ist Data Lineage?Data Lineage ist die Nachverfolgbarkeit von Daten vom Ursprung bis zum Ziel, einschließlich aller Transformationen und Abhängigkeiten.
Was ist ein Geschäftsglossar (Business Glossary)?Ein Geschäftsglossar definiert die offizielle Bedeutung von Fachbegriffen und beseitigt Mehrdeutigkeiten bei der Datennutzung.
