Qu'est-ce que le Data Mesh ?
Le Data Mesh est un paradigme d'architecture de données décentralisée proposé par Zhamak Dehghani en 2019 qui transfère la responsabilité des données d'une équipe centrale de données vers les équipes des domaines métier. Au lieu d'un entrepôt de données ou d'un data lake unique géré par une équipe centralisée, chaque domaine (marketing, finance, produit) est responsable de la publication de ses données sous forme de « produits de données » avec une qualité, une documentation et des SLAs garantis.
Le Data Mesh repose sur quatre principes : la propriété des données orientée domaine (domain-oriented ownership), les données comme produit (data as a product), l'infrastructure de données en libre-service (self-serve data platform) et la gouvernance fédérée computationnelle (federated computational governance). Ces principes visent à résoudre les goulots d'étranglement des architectures centralisées, où une seule équipe de données ne peut pas évoluer au rythme de l'organisation.
Il est important de comprendre que le Data Mesh n'est ni une technologie ni un produit : c'est un modèle organisationnel et architectural. Il peut être mis en œuvre avec différentes stacks technologiques, mais il requiert des changements significatifs dans la structure des équipes, les rôles et les processus.
Pourquoi est-ce important ?
Les architectures de données centralisées (entrepôt de données monolithique, data lake géré par une équipe centrale) font face à un problème de scalabilité organisationnelle. À mesure que l'entreprise grandit, l'équipe centrale de données devient un goulot d'étranglement : chaque nouvelle exigence de données passe par la même file d'attente. Selon des enquêtes sectorielles, les équipes de données centralisées ont généralement des backlogs de 3 à 6 mois.
Le Data Mesh propose de résoudre cela en distribuant la responsabilité. Les équipes qui connaissent le mieux les données (les équipes de domaine) sont celles qui les publient et les maintiennent. L'équipe de plateforme fournit l'infrastructure en libre-service. La gouvernance est mise en œuvre de façon fédérée via des politiques computationnelles (automatisées), et non via des approbations manuelles centralisées.
Comment ça fonctionne en pratique ?
En pratique, adopter le Data Mesh implique plusieurs changements. Chaque domaine métier identifie les données qu'il produit et les publie comme produits de données avec une documentation, des SLAs de qualité et des API standardisées. L'équipe de plateforme construit des outils en libre-service pour que les domaines puissent publier, découvrir et consommer des données sans dépendre d'une équipe centrale.
La gouvernance fédérée est mise en œuvre via des politiques automatisées : au lieu qu'un comité approuve chaque demande d'accès, les politiques de qualité, de sécurité et de conformité sont codifiées et exécutées automatiquement. Par exemple, « tout produit de données doit avoir au moins un contrôle de qualité actif » ou « aucun champ PII ne peut être publié sans classification ».
Data Mesh dans Linedat
Linedat facilite la mise en œuvre du Data Mesh en fournissant la couche de gouvernance fédérée que le modèle exige : catalogues de données par domaine, glossaire partagé entre domaines, politiques automatisées de qualité et de conformité, et rôles de Data Steward assignables par domaine pour que chaque équipe gère ses propres actifs de données.
Termes connexes
Le Data Governance est le cadre de politiques, processus et rôles qui garantit la qualité, la sécurité et l'utilisation correcte des données au sein d'une organisation.
Qu'est-ce qu'un Data Contract (Contrat de données) ?Un Data Contract est un accord formel entre producteur et consommateur de données définissant le schéma, la qualité, les SLAs et les responsabilités.
Qu'est-ce qu'un Data Steward ?Un Data Steward est le responsable opérationnel de la qualité, de la documentation et de la conformité des données dans un domaine spécifique.
Qu'est-ce qu'un Data Catalog ?Un Data Catalog est un inventaire centralisé de tous les actifs de données d'une organisation, avec métadonnées, descriptions et lignage.
