Qu'est-ce que la lignée de données ?

La traçabilité des données consiste enregistrement manière exhaustive enregistrement parcours enregistrement un ensemble de données depuis sa source d'origine, en passant par toutes les transformations, étapes du pipeline et tous les systèmes, jusqu'à sa destination finale dans un rapport, un modèle, tableau de bord ou une application opérationnelle.

Lineage répond à cinq questions concernant n'importe quel ensemble de données :

  • D'où provient-elle ? Le système source, la base de données, l'API ou le flux d'où proviennent les données.
  • Qu'est-ce qui lui est arrivé ? Toutes les transformations ont été appliquées : jointures SQL, agrégations, filtres, calculs, conversions de format.
  • Où cela va-t-il ? Vers tous les rapports, tableau de bord, modèles et systèmes en aval qui en dépendent.
  • Quand chaque étape a-t-elle eu lieu ? Horodatages de chaque mouvement et transformation dans la chaîne de lignage.
  • Qui y a eu accès ? Les pipelines, les tâches et les utilisateurs qui ont consulté ou modifié les données à chaque étape.

Définition de la traçabilité des données

La traçabilité des données désigne la visibilité de bout en bout des données tout au long de leur parcours au sein des systèmes d'une organisation. Elle offre un enregistrement traçable enregistrement l'origine des données, enregistrement l'historique de leurs transformations et enregistrement leur utilisation, ce qui permet de garantir leur fiabilité, de les auditer et de les gérer à grande échelle.

enregistrement de lignage enregistrement pas un diagramme statique dessiné une fois pour toutes puis oublié. Le lignage moderne est capturé automatiquement en observant l'exécution des pipelines, en analysant les transformations SQL et en surveillant les modifications de schéma. Il se met à jour en continu à mesure que les données circulent et que les pipelines s'exécutent ; ainsi, enregistrement de lignage enregistrement l'état actuel du patrimoine de données plutôt qu'un instantané datant de plusieurs mois.


Types de traçabilité des données

Type Ce qu'il suit cas d'usage principaux
Lignée technique Circulation des données via des pipelines, des tâches ETL, des requêtes SQL et des systèmes Débogage, analyse d'impact, documentation du pipeline
Historique de l'entreprise Comment jeux de données en termes métier, en indicateurs clés de performance (KPI) et en rapports Confiance dans l'analyse, partie prenante , cohérence des indicateurs
Lignée au niveau des colonnes Quels champs spécifiques ont subi quelles transformations pour générer chaque champ de sortie ? Traçabilité de la conformité, suivi des données à caractère personnel, analyse d'impact précise
traçabilité au jeu de données Relations entre les tables et jeux de données Cartographie et identification des dépendances de haut niveau
Lignée temporelle Versions historiques et évolutions du schéma au fil du temps Historique des audits, analyse des restaurations, détection des dérives de schéma
Lignée IA/ML apprentissage jeux de données, pipelines de caractéristiques et historique des versions des modèles Reproductibilité des modèles, gouvernance de l'IA, conformité réglementaire

Au niveau des colonnes ou jeu de données: La traçabilité jeu de données montre que le tableau A alimente le tableau B. La traçabilité au niveau des colonnes montre que le net_revenue La colonne du tableau B est calculée à partir de gross_revenue moins discount_amount dans le tableau A, filtré par transaction_status = 'completed'. Dans les environnements réglementés et pour les analyses complexes, la traçabilité au niveau des colonnes est indispensable : la traçabilité jeu de données ne suffit pas à elle seule support des pistes d'audit support ou une analyse d'impact précise.


Comment est tracé le parcours des données ?

La traçabilité moderne des données est assurée automatiquement grâce à trois mécanismes :

métadonnées :les outils de traçabilitése connectent aux sources de données, plateformes d'orchestration, outils bi et aux entrepôts de données pour en extraire les métadonnées qui décrivent les mouvements de données : requête , enregistrements d’exécution des pipelines, définitions de schémas et historiques d’appels d’API. Ces métadonnées constituent la matière première de la reconstruction de la traçabilité.

Analyse syntaxique du SQL et des transformations : Pour les transformations basées sur SQL, les outils de traçabilité analysent les requêtes afin d’identifier les tables sources, les colonnes sources, les relations de jointure, les filtres, les agrégations et les colonnes dérivées. Cela permet d’établir une traçabilité au niveau des colonnes à partir de la logique de transformation elle-même, sans que les ingénieurs aient à la documenter manuellement.

axé sur des événements qu'un pipeline s'exécute, qu'un schéma est modifié ou qu'une nouvelle source est connectée, le graphe de lignage se met automatiquement à jour. Le lignage actif reflète en permanence l'état actuel du parc de données, plutôt que de s'appuyer sur une actualisation par lots programmée.


À quoi ressemble la traçabilité des données dans la pratique ?

Un analyste repère un chiffre inattendu dans un tableau de bord. Grâce à la traçabilité : l'analyste ouvre le tableau de bord dans le catalogue de données, remonte la traçabilité jusqu’à la transformation qui l’a généré, identifie la table source d’où il provient et constate que celle-ci a été actualisée avec six heures de retard en raison d’un retard dans le pipeline. Durée totale de l’investigation : cinq minutes. Sans traçabilité : l’analyste fait appel à l’équipe chargée des données, qui retrace manuellement l’origine de ce chiffre à travers requête et les journaux du pipeline. Durée totale de l’investigation : deux à quatre heures.

Un ingénieur s'apprête à modifier le schéma d'une table source.Avecla traçabilité : l'ingénieur interroge le graphe de traçabilité pour identifier toutes les tables, tous les pipelines, tous les rapports et tous les modèles en aval qui dépendent d'une colonne quelconque de la table en cours de modification. Trois rapports en aval et un pipeline de caractéristiques d'apprentissage automatique (ML) seraient affectés. L'ingénieur coordonne les corrections avant la mise en production de la modification. Sans traçabilité : la modification est mise en production, trois rapports ne fonctionnent plus et le pipeline ML produit des caractéristiques erronées pendant 48 heures avant que le problème ne soit identifié et résolu.

Un responsable de la conformité répond à une demande d'effacement au titre du RGPD. Avec Lineage : le responsable interroge le graphe Lineage pour chaque élément en aval dérivé de enregistrement client de la personne concernée. Lineage renvoie une liste complète couvrant six systèmes en moins d'une minute. Les six systèmes sont mis à jour et la suppression est confirmée. Sans Lineage : le responsable contacte manuellement chaque responsable de système pour lui demander s'il détient les données de la personne concernée. Trois semaines plus tard, l'enquête n'est toujours pas terminée.


Traçabilité des données et concepts connexes

Lignage des données vs. provenance des données : La provenance des données est un concept plus large qui consiste à documenter l’origine et l’historique des données. La traçabilité des données est la mise en œuvre opérationnelle spécifique de la provenance dans le contexte d’un pipeline : il s’agit d’une cartographie de bout en bout illustrant la manière dont les données circulent à travers les systèmes et se transforment. La traçabilité permet de rendre la provenance consultable et automatisable.

Traçabilité des données vs catalogage des données :un catalogue de données un inventaire consultable des ressources de données, accompagné de métadonnées: définitions, propriété, scores de qualité et informations d'accès. La traçabilité des données est l'un des éléments constitutifs du catalogue : il s'agit de enregistrement la manière dont chaque ressource a été produite et des éléments qui en dépendent. Une traçabilité sans catalogue ne dispose d'aucune interface pour les utilisateurs métier. Un catalogue sans traçabilité ne contient pas les informations de provenance qui garantissent la fiabilité et l'auditabilité des ressources.

Lignée des données vs observabilité des données : observabilité des données surveille l’état des données en temps réel: elle détecte les anomalies, les modifications de schéma et les défaillances des pipelines. La lignée des données fournit le contexte de ces observations : lorsqu’une observabilité se déclenche suite à une anomalie, la lignée identifie anomalie cette anomalie et les ressources en aval qui sont affectées. Ces deux fonctionnalités sont complémentaires : observabilité le problème, la lignée l’explique.

FAQ

La traçabilité des données consiste enregistrement une donnée, les étapes qu'elle a suivies et sa destination finale. Si vous examinez un chiffre dans un rapport et que vous souhaitez savoir comment il a été calculé et d'où proviennent les données sous-jacentes, la traçabilité des données vous apporte la réponse.

Le rapport hebdomadaire sur le chiffre d'affaires d'une entreprise de vente au détail fait état d'une baisse inattendue. Un analyste de données ouvre le champ « chiffre d'affaires » dans le catalogue de données remonte sa traçabilité en amont. La traçabilité montre que ce champ est calculé à partir d'une table de transactions jointe à une table de tarification des produits. La table de tarification a été mise à jour il y a deux jours et une nouvelle catégorie de remise y a été ajoutée, que le calcul du chiffre d'affaires n'était pas prévu pour prendre en compte. La traçabilité a permis d'identifier la source de l'écart en quelques minutes, et non en plusieurs heures.

La traçabilité au niveau des colonnes permet de déterminer quels champs spécifiques des tables sources ont subi quelles transformations spécifiques pour générer chaque champ des tables en aval. Il s'agit d'une forme de traçabilité plus granulaire et plus coûteuse que la traçabilité jeu de données, mais elle est indispensable pour assurer la traçabilité réglementaire, réaliser des analyses d'impact précises, assurer le suivi des données à caractère personnel et garantir gouvernance apprentissage de l'IA.

gouvernance des données désigne l'ensemble des politiques, des rôles et des normes qui déterminent la manière dont les données sont gérées. La traçabilité des données est l'une des capacités opérationnelles qui permettent à gouvernance : elle fournit les pistes d'audit requises par la conformité, l'analyse d'impact dont dépend la gestion du changement, ainsi que les enregistrements de provenance nécessaires à la certification des données. La traçabilité est une composante de gouvernance, elle ne s'y substitue pas.

Les outils automatisés de traçabilité s'interfacent avec plateformes d'orchestration plateformes Airflow et dbt, des bases de données et des entrepôts de données, outils bi et plateformes d'intégration de données. Ils extraient métadonnées requête , des enregistrements d'exécution des pipelines et des définitions de schémas. L'analyse syntaxique SQL permet d'extraire la logique de transformation au niveau des colonnes à partir des requêtes. Les métadonnées extraites métadonnées pour former un graphe de traçabilité qui se met à jour en continu au fur et à mesure de l'exécution des pipelines.

Les modèles d’IA nécessitent apprentissage traçables et régies par une gouvernance. La traçabilité des données permet de déterminer quels jeux de données utilisés pour entraîner modèle, quelles transformations ont été appliquées pour produire les apprentissage , et à quelles normes de qualité les données répondaient au moment de apprentissage. Sans cette traçabilité, apprentissage des modèles apprentissage être reproduit et les audits des modèles ne peuvent être menés à bien. À mesure que gouvernance de l’IA se renforcent, la traçabilité apprentissage devient une exigence de conformité plutôt qu’une simple bonne pratique.

L'analyse d'impact consiste à identifier tous les éléments en aval qui seront affectés par une modification proposée apportée à une source de données ou à un pipeline. À partir d'un graphe de lignage, l'analyse d'impact parcourt toutes les arêtes en aval à partir du point de modification afin de générer une liste complète des tables, rapports, tableaux de bord et modèles concernés. Cela permet aux ingénieurs d'évaluer les risques avant la mise en production d'une modification, plutôt que de constater des dysfonctionnements une fois celle-ci déployée.