Data Intelligence

Guide d'entreprise sur la traçabilité des données

Une solide plateforme de données multicouches

La traçabilité des données consiste enregistrement exhaustive enregistrement parcours enregistrement un ensemble de données depuis sa source d'origine, en passant par toutes les transformations, étapes du pipeline et tous les systèmes, jusqu'à sa destination finale dans un rapport, un modèle ou une application opérationnelle.

Lorsque la traçabilité est mise en place, un analyste qui constate un chiffre inattendu dans un rapport trimestriel peut remonter jusqu’à la transformation exacte qui l’a généré, la table source d’où il provient et le pipeline qui l’a acheminé. Un ingénieur s’apprêtant à modifier un schéma peut visualiser tous les éléments en aval qui seront affectés avant que la modification ne soit déployée. Un responsable de la conformité chargé de répondre à un audit peut extraire une trace complète des données sans avoir à mener d’enquête manuelle.

Ce guide explique ce qu'est la traçabilité des données, les différents types de traçabilité, son fonctionnement technique, qui l'utilise, son lien avec gouvernance des données et la conformité, ainsi que la manière de la mettre en œuvre.


Qu'est-ce que la lignée de données ?

La traçabilité des données désigne la visibilité de bout en bout des données tout au long de leur parcours au sein des systèmes d'une organisation : depuis la source où elles ont été créées ou ingérées, en passant par chaque étape de transformation, de jointure, d'agrégation et de traitement, jusqu'aux rapports, tableaux de bord, modèles et systèmes opérationnels qui les exploitent.

Lineage répond à cinq questions pour chaque ensemble de données :

  • D'où provient-elle ? Le système source d'origine, la base de données, l'API ou le flux externe d'où proviennent ces données.
  • Qu'est-ce qui lui est arrivé ? Toutes les transformations ont été appliquées : jointures SQL, agrégations, filtres, calculs, conversions de format.
  • Où va-t-il ? Tous les systèmes, rapports, tableau de bord, modèles ou applications en aval qui dépendent de cet élément.
  • Quand chaque étape a-t-elle eu lieu ? Les horodatages de chaque mouvement et transformation dans la chaîne de filiation.
  • Qui y a eu accès ? Les pipelines, les tâches et les utilisateurs qui ont consulté ou modifié les données à chaque étape.

Types de traçabilité des données

Toutes les lignées n'ont pas la même finalité. Les organisations ont besoin de différents types de lignées en fonction de leurs exigences en matière de gouvernance d'analyse.

Type Ce qu'il suit Niveau de détail cas d'usage principaux
Lignée technique Comment les données circulent au sein des systèmes techniques : bases de données, pipelines, tâches ETL, API Au niveau des tables et des colonnes Analyse d'impact, recherche des causes profondes, documentation des pipelines
Historique de l'entreprise Comment les données se rapportent aux concepts et indicateurs métier : d'où provient le « chiffre d'affaires », comment est calculé le nombre de « clients actifs » Niveau des termes commerciaux utilisateur métier, cohérence des indicateurs, coordination entre les équipes
Lignée au niveau des colonnes Quels champs spécifiques, dans quelles tables spécifiques, ont subi quelles transformations pour générer chaque champ de sortie ? Colonne individuelle Traçabilité réglementaire, analyse d'impact des modifications de schéma, gouvernance apprentissage de l'IA
Lignée au niveau de la table Quelles tables alimentent quelles tables et quels rapports en aval ? Tableau Cartographie des dépendances à haut niveau, analyse d'impact globale
Lignée opérationnelle Comment les données circulent au sein des systèmes opérationnels en temps réel: flux d'événements, microservices, API Au niveau des événements et des messages Débogage des systèmes en temps réel, gouvernance des données opérationnelles
Lignée IA/ML Quels apprentissage jeux de données, pipelines de caractéristiques et logiques de transformation ont permis d'obtenir chaque version du modèle ? jeu de données niveau des caractéristiques Reproductibilité des modèles, conformité réglementaire, gouvernance de l'IA

Lignée au niveau des colonnes vs lignée au niveau des tables : La hiérarchie au niveau des tableaux montre que le tableau A alimente le tableau B. La hiérarchie au niveau des colonnes montre que le net_revenue La colonne du tableau B est calculée à partir de la gross_revenue colonne du tableau A moins la discount_amount colonne du tableau A, filtrée par transaction_status = 'completed'. Dans les secteurs réglementés et les environnements analytiques complexes, la traçabilité au niveau des colonnes est indispensable : la traçabilité au niveau des tables ne suffit pas à elle seule à répondre aux exigences en matière d'analyse d'impact ou d'audit.

La traçabilité est également l'un des principaux indicateurs de fiabilité dans découverte de données. Lorsque les utilisateurs trouvent un jeu de données un catalogue ou une interface de recherche, la traçabilité leur permet de vérifier si les données sous-jacentes correspondent bien à ce qu'elles prétendent refléter. Pour une présentation complète du lien entre la traçabilité et la découverte dedécouverte de données , consultezdécouverte de données .


Fonctionnement de la lignée de données

La traçabilité moderne des données est assurée automatiquement en observant le parcours des données au sein des systèmes du parc de données. Le processus technique comprend quatre étapes.

1. métadonnées

Les outils Lineage se connectent à toutes les sources du parc de données — bases de données, entrepôts de données, lacs de données, plateformes ETL et ELT, outils bi, streaming et référentiels de caractéristiques d'apprentissage automatique — et en extraient les métadonnées qui décrivent les mouvements de données :

  • Noms des tables et des colonnes, schémas et types de données.
  • requête et les enregistrements d'exécution provenant des bases de données et des entrepôts de données.
  • Configurations de pipelines issues d'outils d'orchestration tels qu'Airflow et dbt.
  • Journaux des appels API provenant plateformes d'intégration.
  • Historique d'exécution des tâches provenant plateformes ETL.

Ces métadonnées la matière première à partir de laquelle les systèmes de traçabilité reconstituent les parcours des données.

2. Analyse syntaxique par transformation

Pour que la traçabilité puisse montrer ce qu'il est advenu des données à chaque étape, le système doit analyser la logique de transformation. Pour les transformations basées sur SQL, les outils de traçabilité analysent les requêtes afin d'identifier les tables et colonnes sources, les relations de jointure, les filtres, les agrégations et les colonnes dérivées. Pour les transformations basées sur des pipelines, ils analysent les fichiers de configuration et les journaux d'exécution afin d'extraire les mêmes informations.

Le résultat est un graphique composé de nœuds (actifs de données) et d'arêtes (transformations) qui représente la chaîne de traçabilité complète, de la source à l'utilisation.

3. Création et stockage de graphiques

métadonnées extraites métadonnées la logique de transformation analysée sont assemblées pour former un graphe de lignage stocké dans ledépôt métadonnées . Chaque nœud représente une ressource de données : une table, une colonne, un fichier, un flux ou un modèle. Chaque arête représente une relation : une transformation, l'exécution d'un pipeline, une jointure ou une copie. Le graphe est interrogeable : à partir d'une ressource donnée, le système peut remonter en amont pour trouver ses sources ou descendre en aval pour identifier tout ce qui en dépend.

4. Mise à jour continue

Les diagrammes de lignage statiques, créés une seule fois et jamais mis à jour, perdent leur précision en l'espace de quelques jours à mesure que les pipelines changent et que les données évoluent. Les systèmes de lignage modernes se mettent à jour en continu : lorsqu'un pipeline s'exécute, le graphe de lignage est actualisé. Lorsqu'un schéma change, les arêtes concernées du graphe sont signalées. Lorsqu'une nouvelle source est connectée, son lignage est ajouté automatiquement. Le lignage actif reflète l'état actuel du patrimoine de données plutôt qu'un instantané à un moment donné.


Qui utilise la traçabilité des données et comment ?

Ingénieur de données : utilise la traçabilité pour analyser l’impact avant d’apporter des modifications. Avant de modifier le schéma d’une table source, l’ingénieur interroge la traçabilité pour identifier toutes les tables, tous les pipelines, tous les rapports et tous les modèles en aval qui dépendent d’une colonne quelconque de cette table. Les modifications susceptibles de perturber les consommateurs en aval sont ainsi identifiées et corrigées avant leur mise en production, plutôt que d’être découvertes après avoir provoqué des défaillances.

Lorsqu'un pipeline tombe en panne ou qu'un rapport affiche des valeurs inattendues, l'ingénieur remonte la chaîne de traitement à partir du résultat concerné afin d'identifier l'étape de transformation à l'origine du problème. L'analyse des causes profondes, qui nécessitait auparavant des heures requête manuel requête , ne prend désormais que quelques minutes.

Analyste de données : utilise la traçabilité pour s'assurer de la fiabilité des données figurant dans les rapports et les tableaux de tableau de bord . Lorsqu'un indicateur semble erroné, l'analyste suit la traçabilité depuis tableau de bord , en remontant à travers la logique de transformation jusqu'à la table source, afin de comprendre comment ce chiffre a été calculé. Lorsque la traçabilité montre un parcours clair et bien maîtrisé depuis une source certifiée, l'analyste fait confiance au chiffre sans avoir à faire appel à l'équipe chargée des données.

Responsable des données :il utilisela traçabilité pour comprendre l'impact en aval des problèmes de qualité des données. Lorsqu'un contrôle de qualité signale une anomalie un jeu de données source, le responsable suit la traçabilité en aval afin d'identifier tous les rapports, modèles et systèmes opérationnels susceptibles d'avoir été affectés. Cette analyse permet de déterminer la gravité de l'incident et l'ampleur des mesures correctives nécessaires.

Responsable de la conformité : Utilise la traçabilité pour répondre aux questions réglementaires sans avoir à mener d’enquête manuelle. D’où provient ce chiffre figurant dans notre déclaration réglementaire ? Quels systèmes contiennent les données personnelles de ce client ? Quelles transformations ce jeu de données -t-il jeu de données avant d’être utilisé pour entraîner modèle ? La traçabilité répond à chacune de ces questions à partir d’enregistrements conservés automatiquement, plutôt que rassemblés sous la pression d’un audit.

Data scientist :utilisela traçabilité pour documenter la provenance apprentissage . Chaque jeu de données pour entraîner optimiser modèle dispose d'un enregistrement de traçabilité enregistrement sa source, ses transformations, sa certification de qualité et son historique d'accès. Cet enregistrement apprentissage du modèle apprentissage — grâce à cet enregistrement, toute apprentissage peut être reconstituée à l'identique — et vérifiable à des fins réglementaires.

Directeur des données :utilisela traçabilité comme indicateur gouvernance . La couverture de la traçabilité — c'est-à-dire le pourcentage d'actifs de données disposant d'une traçabilité complète et automatisée — est un indicateur avancé de la maturité gouvernance . Une faible couverture dans un domaine donné indique que les pipelines de ce domaine ne sont ni documentés ni régis par une gouvernance.


Traçabilité et gouvernance des données

La traçabilité constitue le pilier opérationnel de gouvernance des données. gouvernance exigent que la traçabilité soit mise en œuvre et contrôlée.

gouvernance Comment la lignée y contribue
Pistes d'audit de conformité Lineage fournit la traçabilité complète des données exigée par les autorités de régulation : origine, historique des transformations, enregistrements d'accès et consommation
Analyse des causes profondes de la qualité des données Lineage remonte à la source des défaillances en matière de qualité, ce qui permet de mettre en place des mesures correctives ciblées plutôt que de mener une enquête à grande échelle.
Analyse d'impact La fonctionnalité « Lineage » affiche tous les éléments en aval concernés par une modification avant que celle-ci ne soit effectuée.
Certification des données La certification des actifs certifiés exige la mise à disposition d'une traçabilité documentée ; les utilisateurs font confiance à ces actifs certifiés en partie parce que leur provenance est traçable.
gouvernance de l'accès L'historique des accès indique qui a consulté les données à chaque étape, ce qui facilite le contrôle et l'audit des accès
IA, apprentissage , gouvernance apprentissage Lineage assure la traçabilité de chaquejeu de données apprentissage , garantissant ainsi la reproductibilité des modèles et le respect des exigences réglementaires.
Respect du droit à l'effacement Lineage recense tous les systèmes dans lesquels figurent les données d'une personne donnée, ce qui permet leur suppression complète sur l'ensemble de ces systèmes.

Pour une surveillance continue de l'état des pipelines, en complément de la traçabilité, consultez notre guide sur observabilité des données.

Traçabilité des données dans les secteurs réglementés

Services financiers :lanorme BCBS239 impose aux banques de démontrer que les données relatives aux risques sont exactes et que leur traçabilité, depuis leur source jusqu’à leur transmission aux autorités de régulation, est assurée et documentée. La documentation manuelle de la traçabilité établie chaque trimestre est insuffisante : les autorités de régulation exigent que la traçabilité soit assurée en continu et disponible à la demande. La conformité à la loi SOX exige des pistes d’audit pour les données de reporting financier, que la traçabilité automatisée permet d’assurer en tant que résultat indirect des opérations du pipeline.

Secteur de la santé :la loi HIPAAexige une traçabilité documentée des informations médicales protégées (PHI) : leur origine, leur parcours, les personnes qui y ont accédé et l'usage qui en a été fait. Lineage fournit automatiquement cette documentation pour chaque jeu de données PHI jeu de données le parc de données. Lorsqu'une enquête sur une violation de données nécessite d'identifier tous les systèmes ayant traité enregistrement d'un patient spécifique, Lineage apporte la réponse en quelques minutes.

Produits pharmaceutiques : La norme 21 CFR Partie 11 de la FDA et les réglementations GxP exigent une documentation relative à l’intégrité des données cliniques et de fabrication. Lineage assure la traçabilité de la provenance de chaque jeu de données dans les dossiers réglementaires, démontrant ainsi que les données sources n’ont pas été modifiées sans justification et que chaque transformation est traçable.

Assurance :les modèles actuarielsutilisés pour le calcul des fonds propres réglementaires doivent permettre de retracer de manière vérifiable le parcours des données, depuis les données brutes saisies jusqu'au output du modèle final output du modèle, en passant par toutes les étapes de transformation. Cette traçabilité rend ces modèles vérifiables et permet de reproduire leurs données d'entrée.

Commerce de détail et commerce électronique :les données clientsqui alimentent les modèles de personnalisation, les algorithmes de tarification et détection des fraudes doivent faire l'objet d'une traçabilité afin de garantir la conformité au RGPD et au CCPA. Lorsqu'un client soumet une demande d'effacement, la traçabilité permet d'identifier tous les systèmes du parc de données qui contiennent des données dérivées des dossiers de ce client.


Traçabilité des données et IA

gouvernance de l'IA gouvernance de nouvelles exigences en matière de traçabilité auxquelles les outils traditionnels de traçabilité n'étaient pas adaptés.

Traçabilitéapprentissage :chaque jeu de données pour entraîner optimiser modèle doit faire l'objet d'un enregistrement de traçabilité : système source, historique des transformations, certification de qualité au moment de apprentissage, examen de la classification des données à caractère personnel (PII) et identité du responsable qui l'a certifié. Sans cet enregistrement, apprentissage du modèle apprentissage être reproduit et les audits du modèle ne peuvent être menés à bien.

Traçabilité des pipelines de caractéristiques : Les pipelines d’ingénierie des caractéristiques transforment les données brutes en caractéristiques utilisées par les modèles. La traçabilité au niveau des colonnes via les pipelines de caractéristiques indique précisément quels champs sources ont contribué à chaque caractéristique du modèle, ce qui permet d’analyser l’impact en cas de modification des schémas sources et fournit la documentation requise pour les audits d’IA.

Historique des versions du modèle : Chaque version de modèle est le résultat de versions spécifiques apprentissage , de versions spécifiques du pipeline de caractéristiques et d'hyperparamètres spécifiques. La traçabilité du modèle permet de suivre tous ces éléments afin que n'importe quelle version de modèle puisse être reproduite à l'identique et que la différence entre deux versions de modèle puisse être comprise avec précision.

Historique du pipeline RAG : Les pipelines de génération augmentée par la récupération intègrent des documents et jeux de données les fenêtres de contexte des modèles de langage à grande échelle (LLM) au requête . La traçabilité permet de savoir quels documents et jeux de données sources jeux de données éligibles à la récupération, lesquels ont été utilisés dans requête spécifiques, et quels contrôles d’accès ont régit chaque récupération — c’est-à-dire la piste d’audit exigée par gouvernance de l’IA et les réglementations émergentes.

Les contrats de données entre les entrepôts de caractéristiques et apprentissage des modèles s'appuient sur la traçabilité pour régir les données d'entrée de l'IA. Consultez notreguide sur les contrats de données.


Bonnes pratiques pour la mise en œuvre du lignage des données

Commencez par les pipelines présentant le plus grand risque : Commencez la mise en œuvre de la traçabilité par les pipelines qui alimentent les rapports réglementaires, les tableaux de bord stratégiques et les modèles d'IA en production. La couverture complète de la traçabilité sur l'ensemble du patrimoine de données prend du temps. En commençant par les domaines où les enjeux sont les plus importants, vous générez immédiatement gouvernance .

Automatisez dès le départ : La documentation manuelle de la traçabilité — rédigée par les ingénieurs dans des wikis et des feuilles de calcul — devient inexacte en quelques semaines à mesure que les pipelines évoluent. La traçabilité automatisée, qui capture métadonnées d'exécution des pipelines métadonnées à partir des outils d'orchestration, des bases de données et plateformes BI, plateformes à jour sans intervention humaine.

Exiger une traçabilité au niveau des colonnes pour les données réglementées :la traçabilité au niveau des tableauxest insuffisante pour assurer la traçabilité réglementaire et l'analyse d'impact dans des environnements complexes. Définir la traçabilité au niveau des colonnes comme une exigence pour chaque pipeline traitant des données réglementées et pour chaque pipeline alimentant des rapports stratégiques ou des modèles d'IA.

Intégrer la traçabilité au catalogue de données: Lorsque la traçabilité est stockée dans un outil distinct du métadonnées , les utilisateurs doivent consulter deux systèmes. La traçabilité intégrée au catalogue de données apparaît aux côtés de la définition de la ressource, de son score de qualité et de son propriétaire dans une vue unique, ce qui le rend accessible aux analystes et aux utilisateurs métier, et non plus uniquement aux ingénieurs.

Rendre la traçabilité visible pour les utilisateurs métier : Les diagrammes de traçabilité technique illustrant les jointures SQL et les configurations de pipelines sont utiles aux ingénieurs, mais pas aux analystes ni aux gestionnaires de données. Les vues de traçabilité métier, qui traduisent les dépendances techniques en relations exprimées en termes métier, rendent la traçabilité utile à l'ensemble des personnes qui doivent se fier aux données et agir en fonction de celles-ci.

Suivre la couverture de la traçabilité en tant qu’ gouvernance :suivrele pourcentage de ressources de données disposant d’une documentation automatisée de la traçabilité en tant qu’indicateur gouvernance . Une faible couverture dans un domaine donné est un indicateur avancé signifiant que les pipelines de ce domaine ne sont pas documentés et que gouvernance relatives à ces ressources ne peuvent être ni appliquées ni auditées.

FAQ

La traçabilité des données permet de suivre le flux et la transformation des données entre les différents systèmes. gouvernance des données gouvernance les politiques, les normes et les contrôles relatifs à la manière dont les données doivent être gérées et protégées. Au sein d'une plateforme de data intelligence, la traçabilité permet de mettre en œuvre gouvernance offrant une visibilité sur la manière dont les données gouvernées sont réellement utilisées dans les workflows d'analyse et d'IA.

La traçabilité des données consiste enregistrement exhaustive enregistrement une donnée, les étapes qu'elle a suivies et sa destination finale. Elle permet de répondre à la question suivante : si je consulte ce chiffre dans un rapport, d'où provient-il exactement et comment a-t-il été calculé ?

La provenance des données est un concept général qui consiste à documenter l'origine et l'historique des données, c'est-à-dire leur provenance et la manière dont elles ont été produites. La traçabilité des données est la mise en œuvre spécifique du suivi de la provenance dans pipeline de données : il s'agit d'une cartographie de bout en bout illustrant la manière dont les données circulent à travers les systèmes et se transforment au fil du processus. La traçabilité est la forme opérationnelle de la provenance dans les environnements de données d'entreprise.

La traçabilité au niveau des tables indique quelles tables alimentent les tables et les rapports en aval. La traçabilité au niveau des colonnes montre quels champs spécifiques de tables spécifiques ont subi quelles transformations spécifiques pour produire chaque champ de sortie. La traçabilité au niveau des colonnes est indispensable pour la traçabilité réglementaire, l'analyse des impacts majeurs et gouvernance apprentissage de l'IA. La traçabilité au niveau des tables est utile pour cartographier les dépendances à un niveau global, mais elle s'avère insuffisante dans les environnements complexes.

Un catalogue de données un inventaire consultable de ressources de données, accompagné de métadonnées: définitions, propriété, indicateurs de qualité et informations d'accès. La traçabilité des données est l'un des éléments constitutifs d'un catalogue de données il s'agit de enregistrement la manière dont chaque ressource a été produite et des éléments qui en dépendent. Une traçabilité sans catalogue ne dispose d'aucune interface pour les utilisateurs métier. Un catalogue sans traçabilité ne contient pas les informations de provenance qui garantissent la fiabilité et l'auditabilité des ressources.

Les outils automatisés de traçabilité s'interfacent avec plateformes d'orchestration plateformes Airflow et dbt, des bases de données et des entrepôts de données, outils bi, ainsi que plateformes d'intégration de données. Ils extraient métadonnées requête , des enregistrements d'exécution des pipelines, des historiques d'appels d'API et des fichiers de configuration. L'analyse syntaxique SQL permet d'extraire la logique de transformation au niveau des colonnes à partir des requêtes. Les métadonnées extraites métadonnées rassemblées dans un graphe de traçabilité qui se met à jour en continu au fur et à mesure de l'exécution des pipelines.

L'analyse d'impact consiste à identifier tous les éléments en aval qui seront affectés par une modification apportée à une source de données ou à un pipeline. À partir d'un graphe de lignage, l'analyse d'impact parcourt toutes les arêtes en aval du point de modification proposé afin de générer une liste complète des tables, rapports, tableaux de bord et modèles concernés. Cela permet aux ingénieurs d'évaluer le risque et la portée d'une modification avant qu'elle ne soit mise en œuvre, plutôt que de constater des dysfonctionnements après déploiement.

Le RGPD impose aux organisations de savoir où se trouvent les données à caractère personnel, comment elles circulent et comment les supprimer sur demande. La traçabilité identifie chaque système du parc de données qui contient des données à caractère personnel ou des données dérivées de celles-ci, retrace leur parcours depuis leur source à travers chaque transformation et consigne chaque accès. Lorsqu’une demande d’effacement est reçue, la traçabilité identifie tous les systèmes sur lesquels la suppression est requise et vérifie que celle-ci a bien été effectuée dans son intégralité.

La traçabilité des données d'IA étend la traçabilité traditionnelle aux systèmes d'IA : quelsjeux de données apprentissage jeux de données chaque modèle, quels pipelines d'ingénierie des caractéristiques ont transformé les données brutes en entrées du modèle, quels hyperparamètres et critères d'évaluation ont permis d'obtenir chaque version du modèle, et quels documents sources ou jeux de données récupérés dans les réponses du pipeline RAG. La traçabilité de l'IA rend apprentissage des modèles apprentissage , permet de mener à bien les audits de modèles et rend gouvernance de l'IA défendables.

La traçabilité et le contrôle qualité sont gouvernance complémentaires. Le contrôle qualité permet de détecter les anomalies dans les données. La traçabilité permet d'identifier l'origine de ces anomalies. Lorsqu'un contrôle qualité signale un taux de valeurs nulles inattendu dans une table de reporting, la traçabilité remonte à la source du problème, c'est-à-dire à la table source spécifique ou à l'étape de transformation qui l'a généré, ce qui permet d'apporter une correction ciblée plutôt que de mener une enquête à grande échelle.