Qu'est-ce que la découverte de données?
Introduction
Dans une entreprise moderne, trouver des données n’est pas un problème de recherche. C’est un problème de confiance. N’importe quel analyste disposant d’un requête peut localiser une table. Ce qu’il ne peut pas faire facilement, c’est déterminer si cette table est exacte, à qui elle appartient, quand elle a été mise à jour pour la dernière fois, d’où elle provient, ou s’il est autorisé à l’utiliser. découverte de données résoudre ce problème de manière systématique, en reliant jeux de données métadonnées, jeux de données la traçabilité, jeux de données indicateurs de qualité et gouvernance qui les rendent exploitables. Les termes de ce glossaire définissent les capacités et les composants qui garantissent découverte de données d’entreprise à grande échelle.
Concept fondamental
Qu'est-ce que la découverte de données?
découverte de données le processus consistant à identifier, comprendre et évaluer les ressources de données présentes dans l'ensemble des systèmes, plateformes et des domaines d'activité d'une organisation. Elle permet aux analystes, aux ingénieurs et aux utilisateurs métier de repérer jeux de données pertinents, d'évaluer leur qualité et leur traçabilité, et de déterminer si une ressource donnée est adaptée à un cas d'usage spécifique cas d'usage analyse, reporting, apprentissage automatique ou conformité.
Dans les environnements de données de petite taille, la recherche d’informations se faisait de manière informelle. Un ingénieur de données savait où tout se trouvait. Un tableur permettait de répertorier les tables importantes. Un analyste envoyait un message sur Slack lorsqu’il avait besoin d’aide pour trouver quelque chose. Ce modèle cesse de fonctionner dès qu’une organisation dépasse quelques centaines jeux de données une poignée de sources de données. Passé ce stade, l’approche informelle engendre des incohérences : différentes équipes utilisent des versions différentes d’un même indicateur, des rapports sont établis à partir de données que personne n’a consultées depuis deux ans, et des décisions sont prises sur la base de chiffres dont personne ne peut expliquer la provenance.
La découverte des données d'entreprise moderne repose sur quatre couches interconnectées. métadonnées le contexte descriptif permettant de jeu de données ce jeu de données un jeu de données . La traçabilité consigne son origine et son évolution. Les indicateurs de qualité indiquent aux utilisateurs si les données sont fiables. gouvernance leur précise s'ils peuvent les utiliser et dans quelles conditions. Lorsque ces couches sont intégrées et maintenues à jour, la découverte passe d'une tâche de recherche manuelle tâche une expérience guidée et contextuelle.
Le résultat pour l'entreprise : libre-service réellement évolutives. Les équipes trouvent les données sans avoir à ouvrir de ticket. Les problèmes liés aux données sont détectés avant même d'apparaître dans un rapport. L'équipe centrale chargée des données ne passe plus la moitié de son temps à répondre à des questions sur l'emplacement des données.
La découverte n'est pas une fonctionnalité autonome. Elle constitue la partie visible d'une architecture plus large d'intelligence des données, et son efficacité dépend entièrement de la qualité métadonnées, de la traçabilité, de la qualité des données et de gouvernance qui la sous-tendent.
Termes du glossaire
métadonnées actives
métadonnées sont continuellement mises à jour, enrichies et exploitées en temps réel les données transitent par les pipelines et les systèmes. Contrairement métadonnées statiques ou passives métadonnées qui sont capturées à un moment donné et mises à jour manuellement —, métadonnées actives métadonnées l'état actuel d'un ensemble de données : son actualité, son niveau de qualité, ses tendances d'utilisation récentes et ses relations avec d'autres ensembles de données.
Dans la pratique, métadonnées actives qui font qu’un catalogue métadonnées utile et non pas simplement décoratif. Un catalogue basé sur métadonnées passives vous métadonnées où se trouve une table. Un catalogue basé sur métadonnées actives vous métadonnées non seulement où elle se trouve, mais aussi si elle a été mise à jour ce matin, qui l’a interrogée la semaine dernière et si son schéma a subi une modification qui a entraîné une rupture dans un rapport en aval.
métadonnées actives métadonnées le mécanisme qui sous-tend les recommandations intelligentes, les alertes de qualité automatisées et le classement des résultats de recherche en fonction de l'utilisation. C'est ce qui distingue un catalogue dynamique d'un simple inventaire indexé.
Termes associés : métadonnées, métadonnées , catalogue de données, observabilité des données
Glossaire métier
Un dépôt commun dépôt définitions convenues pour les termes et concepts métier, géré au niveau de l'organisation. Un glossaire métier définit ce que signifient des termes tels que « client actif », « chiffre d'affaires » ou « taux de désabonnement » pour une organisation spécifique, et relie ces définitions aux jeux de données techniques jeux de données aux colonnes qui les mettent en œuvre.
Le glossaire constitue la couche de traduction entre le langage utilisé par les équipes chargées des données (noms de tables, identifiants de colonnes, structures de schémas) et celui utilisé par les utilisateurs métier (indicateurs clés de performance, dimensions, entités métier). Sans lui, les recherches produisent des résultats que les analystes ne peuvent interpréter sans aide supplémentaire, et un même terme métier peut être défini différemment d'une équipe à l'autre.
Un glossaire métier bien entretenu réduit les coûts liés à l'intégration de nouveaux analystes, limite la prolifération d'indicateurs contradictoires et rend gouvernance compréhensibles pour les personnes chargées de les respecter. Dans les organisations qui mettent en œuvre data mesh gouvernance fédérée, le glossaire métier devient le contrat commun qui garantit la cohérence des produits de données spécifiques à chaque domaine à l'échelle de l'entreprise.
Termes associés : métadonnées , gouvernance des données, gestion des données, catalogue de données
Catalogue de données
Le système qui permet découverte de données. Un catalogue de données répertorie les ressources de données — tables, fichiers, tableaux de bord, API, modèles, pipelines — ainsi que leurs métadonnées, leur propriété, leurs relations et gouvernance , et permet de les rechercher et de les explorer à l'échelle de l'organisation.
Pour une présentation détaillée de la manière dont les catalogues sont constitués et des éléments qu'ils répertorient, consultez la rubrique « Qu'est-ce qu'un catalogue de données? ».
Les catalogues traditionnels étaient essentiellement des inventaires : des listes de ressources accompagnées de descriptions, gérées manuellement par une petite équipe. Leurs limites étaient évidentes. La gestion manuelle n'est pas évolutive, les descriptions deviennent obsolètes, et un inventaire dépourvu de contexte relationnel indique aux utilisateurs ce qui existe, mais pas ce que cela signifie ni si l'on peut s'y fier.
Les catalogues de données modernes s'articulent autour métadonnées automatisée métadonnées , de la cartographie des relations, métadonnées actives et gouvernance . Ils relient jeux de données termes métier, jeux de données responsables, jeux de données graphiques de traçabilité, jeux de données scores de qualité et jeux de données politiques d'accès. Le catalogue ne remplace pas la découverte : il constitue l'infrastructure sur laquelle repose la découverte.
Il convient de bien distinguer le catalogue de la recherche. Le catalogue, c'est le système. La recherche, c'est la fonctionnalité que ce système permet d'exploiter. Une organisation peut disposer d'un catalogue tout en ayant une recherche peu efficace si ce catalogue est incomplet, obsolète ou s'il n'est pas soumis à gouvernance à des normes de qualité.
Termes associés : découverte de données, métadonnées, métadonnées , métadonnées actives, gouvernance des données
Classification des données
Processus consistant à étiqueter des ressources de données ou des colonnes en fonction de leur type de contenu, de leur niveau de sensibilité ou de leur utilisation prévue. La classification permet de classer les données en différentes catégories, notamment les informations permettant d'identifier une personne (PII), les données financières, les dossiers médicaux, les informations commerciales confidentielles ou les données publiques, entre autres.
La classification alimente directement la découverte en mettant en évidence, parallèlement aux résultats de recherche, les informations relatives à gouvernance au contexte d'accès. Lorsqu'un utilisateur un jeu de données, la classification lui indique immédiatement s'il contient des données sensibles, quels contrôles d'accès s'appliquent et si son cas d'usage autorisé.
La classification automatisée s'appuie sur la reconnaissance de motifs, l'apprentissage automatique et métadonnées pour étiqueter les données dès leur ingestion, sans nécessiter d'examen manuel. Cela revêt une importance particulière à l'échelle de l'entreprise : les organisations disposant de milliers de tables et de dizaines de sources de données ne peuvent pas classer leurs ressources une par une. Sans classification automatisée, les données sensibles se retrouvent régulièrement dans des flux analytiques où elles n'ont pas leur place, et gouvernance ne disposent d'aucun moyen fiable de savoir quelles ressources doivent être protégées.
Termes associés : gouvernance des données, métadonnées , gestion des données, catalogue de données
Contrats de données
Accords formels conclus entre les producteurs et les utilisateurs de données, qui précisent la structure, la sémantique, les normes de qualité et la fréquence de mise à jour d'un ensemble de données. Un contrat de données définit ce jeu de données un jeu de données , quelle forme il revêt, quelle qualité il garantit et ce qui se passe lorsqu'il évolue.
Dans le cadre de la découverte des données, les contrats de données apportent un niveau d'engagement explicite que métadonnées ne peuvent métadonnées offrir. métadonnées l'état jeu de données d'un jeu de données . Un contrat précise ce qu'il est censé être, qui est chargé de sa maintenance et comment les utilisateurs seront informés en cas de modification. Les utilisateurs qui trouvent un jeu de données un contrat actif savent qu'ils travaillent avec une ressource gérée, et non avec un tableau tombé dans l'oubli que quelqu'un a créé pour un projet ponctuel.
Les contrats de données se sont généralisés à mesure que les organisations adoptent data mesh , dans lesquels les équipes métier sont chargées de publier des produits de données à l'intention du reste de l'organisation. Sans ces contrats, ces produits ne sont que des promesses non documentées. Grâce à eux, ils deviennent une infrastructure fiable.
Termes associés : gouvernance des données, gestion des données, qualité des données, data mesh, produits de données
Structure de données
Modèle architectural qui relie les données entre différents systèmes, sources et environnements distribués grâce à une couche unifiée de métadonnées, d'intégration et gouvernance. Une « data fabric » ne transfère pas l'ensemble des données vers un emplacement unique. Elle relie les données là où elles se trouvent, les rendant ainsi accessibles et gérables dans les environnements cloud, sur site et hybrides.
Dans le contexte d'un « data fabric », la découverte permet aux utilisateurs de trouver et d'utiliser des données, quel que soit leur emplacement physique. Le « data fabric » fournit le tissu conjonctif : métadonnées cohérentes, gouvernance partagées, une traçabilité intégrée et une recherche inter-environnements. Sans lui, la découverte dans un environnement distribué nécessite de naviguer individuellement dans chaque système, sans contexte commun entre eux.
Les concepts de « data fabric » et data mesh liés mais distincts. Le « data fabric » est une architecture technologique. Data mesh un modèle organisationnel et de gestion des données. Une organisation peut utiliser un « data fabric » pour mettre en œuvre un data mesh, mais les deux ne sont pas identiques.
Termes associés : catalogue de données, métadonnées , gouvernance des données, data mesh, traçabilité des données
gouvernance des données
Les politiques, normes, rôles et processus qui définissent la manière dont les données sont gérées, protégées et utilisées au sein d'une organisation. gouvernance précise à qui appartiennent les données, qui peut y accéder, pendant combien de temps elles sont conservées et quelles normes de qualité elles doivent respecter.
gouvernance la découverte sont indissociables dans une organisation de données qui fonctionne correctement. Une découverte sans gouvernance aux utilisateurs où se trouvent les données, mais ne leur permet pas de savoir s'ils sont autorisés à les utiliser ni si celles-ci répondent aux normes cas d'usage leur cas d'usage . gouvernance découverte signifie que les politiques existent sur le papier, mais ne peuvent être appliquées de manière cohérente, car personne n'a une vue d'ensemble complète des ressources de données disponibles.
gouvernance un contexte de recherche, gouvernance intégrée signifie que les politiques d'accès, les balises de conformité, les règles de conservation et les informations relatives à la propriété apparaissent directement dans les résultats de recherche et sur les pages consacrées aux ressources. Les utilisateurs prennent connaissance gouvernance dans le cadre même de leur expérience de recherche, et non dans le cadre d'un processus distinct qu'ils doivent consulter par la suite. C'est là toute la différence entre gouvernance protège les données et gouvernance facilite leur utilisation.
Termes associés : gestion des données, classification des données, catalogue de données, glossaire métier, contrats de données
Lignage des données
Un enregistrement l'origine, les mouvements et les transformations d'un ensemble de données au fil du temps. La traçabilité des données permet de répondre aux questions suivantes : d'où proviennent ces données, quel parcours ont-elles suivi et de quoi dépendent-elles aujourd'hui ?
Un graphe de lignage complet présente les systèmes sources qui ont alimenté un jeu de données, les pipelines et les transformations par lesquels il est passé, la logique appliquée à chaque étape, ainsi que les rapports, tableaux de bord et modèles en aval qui l'utilisent. Cet enregistrement le fondement de la confiance dans les données : sans lignage, les utilisateurs ne peuvent pas évaluer si un jeu de données ce qu'il prétend refléter, et les équipes chargées des données ne peuvent pas diagnostiquer la cause première d'un problème de qualité sans remonter manuellement la chaîne des systèmes.
La traçabilité comporte deux dimensions. La traçabilité en amont vous indique d'où proviennent les données, ce qui est important lorsque vous devez comprendre la définition d'un indicateur ou anomalie la source d'une anomalie . La traçabilité en aval vous indique ce qui dépend d'un jeu de données, ce qui est important lorsque vous devez évaluer l'impact d'une modification de schéma ou d'un problème de qualité avant que cela n'affecte un rapport.
La traçabilité au niveau des colonnes est la forme la plus précise : au lieu de suivre les données au niveau de la table, elle suit la transformation de chaque champ, de la source jusqu'à la sortie. Ce niveau de détail est particulièrement utile dans les pipelines complexes où une seule colonne de sortie est dérivée de plusieurs sources en amont via une série de jointures et de calculs.
Termes associés : observabilité des données, qualité des données, métadonnées, catalogue de données, gouvernance des données
Data mesh
Modèle organisationnel et architectural permettant de gérer les données à grande échelle, dans lequel la responsabilité des produits de données est répartie entre les équipes métier qui les produisent, plutôt que centralisée au sein d'une seule équipe d'ingénierie des données ou de plateforme. Chaque équipe métier est chargée de publier, de documenter et de maintenir les produits de données relevant de son domaine.
Data mesh le problème de la découverte de deux manières. Il augmente le nombre de producteurs de données, ce qui signifie qu’il y a davantage de ressources à trouver. Et il décentralise la propriété, ce qui implique que la découverte doit mettre en évidence le contexte de propriété et de responsabilité parallèlement aux données elles-mêmes. Les utilisateurs doivent savoir non seulement qu’un jeu de données , mais aussi quelle équipe en est propriétaire et comment la contacter.
gouvernance fédérée gouvernance le mécanisme qui assure data mesh d'un data mesh . Si les équipes métier disposent d'une autonomie sur leurs produits de données, gouvernance communes, des exigences d'interopérabilité et une métadonnées centrale métadonnées garantissent que la découverte fonctionne entre les différents domaines et que les exigences de conformité sont respectées de manière cohérente.
Termes associés : produits de données, contrats de données, gouvernance des données, gouvernance fédérée, catalogue de données
Observabilité des données
Surveillance continue des pipelines de données, jeux de données et des systèmes afin de détecter en temps réel les anomalies, les modifications de schéma, les problèmes d'actualité des données et la dégradation de la qualité. observabilité des données offre aux équipes chargées des données une visibilité sur l'état de leur infrastructure de données sans nécessiter de vérifications manuelles.
Alors que la qualité des données consiste à vérifier si un jeu de données des normes définies, observabilité des données observabilité à savoir quand ce n’est plus le cas. Un observabilité surveille les signaux indiquant qu’un changement s’est produit : une table qui se met habituellement à jour toutes les heures n’a pas été mise à jour depuis six heures ; une colonne qui ne devrait jamais contenir de valeurs nulles présente 30 % de valeurs nulles ; le nombre de lignes a diminué de moitié par rapport à la même période la semaine dernière.
Lors de la phase de découverte, observabilité des donnéesalimente le catalogue en signaux de qualité en temps réel. Lorsqu'un utilisateur un jeu de données, il peut consulter son état de santé actuel, les anomalies récentes et savoir si des incidents en cours l'affectent. C'est ce qui distingue un catalogue qui se contente de répertorier ce qui existe de celui qui indique ce qui est actuellement fiable.
Termes associés : qualité des données, traçabilité des données, métadonnées actives, catalogue de données, métadonnées
Data products
Ensembles de données sélectionnés et documentés, mis à disposition au sein d'une organisation, et traités avec la même rigueur que des produits logiciels. Un produit de données dispose d'un responsable désigné, d'un schéma documenté, d'une norme de qualité définie, d'une politique de gestion des versions, ainsi que d'un processus permettant de gérer les modifications et de les communiquer aux utilisateurs.
Le concept de « produit de données » trouve son origine dans data mesh, où les équipes métier sont chargées de produire et de maintenir les données générées par leur domaine. Mais ce concept s'applique de manière plus large : tout jeu de données publié à des fins d'utilisation partagée, documenté avec suffisamment de contexte pour permettre aux utilisateurs de l'évaluer et de l'utiliser de manière autonome, et maintenu conformément à des normes définies, constitue en pratique un produit de données.
Dans une organisation de données bien rodée, les produits de données constituent les unités de découverte. Plutôt que d'effectuer des recherches dans des tableaux et des fichiers hétéroclites, les utilisateurs découvrent des produits et s'y abonnent, avec l'assurance que ce qu'ils utilisent est géré et pris en charge.
Une marketplace des données est la plateforme sur laquelle les produits de données sont publiés, découverts et utilisés à grande échelle.
Termes associés : data mesh, contrats de données, catalogue de données, gouvernance des données, gestion des données
Profilage des données
Processus consistant à analyser le contenu jeu de donnéesafin de produire des synthèses statistiques et des évaluations de qualité : nombre de lignes, taux de valeurs nulles, distributions des valeurs, cardinalité, valeurs minimales et maximales, reconnaissance de modèles pour des formats tels que les dates et les adresses e-mail, et écarts par rapport aux plages attendues.
Le profilage fournit les données brutes à partir desquelles les scores de qualité sont calculés. Sans profilage, la qualité n'est qu'une affirmation. Avec le profilage, la qualité devient une mesure. Un jeu de données se veut complet et précis peut être évalué en fonction de ses taux de valeurs nulles réels, de la fréquence des valeurs aberrantes et cohérence de son format.
Lors de la phase de découverte, les résultats du profilage s'affichent sous forme d'indicateurs de qualité sur les pages des ressources. Un utilisateur un jeu de données client jeu de données ainsi constater immédiatement que 12 % des valeurs de la colonne « e-mail » présentent un format non valide et que 3 % des valeurs de la colonne « ID de transaction » sont nulles, et décider si ces taux sont acceptables pour son cas d'usage s'engager à utiliser ce jeu de données.
Grâce au profilage automatisé lors de l'ingestion, les informations contextuelles relatives à la qualité sont toujours à jour et ne dépendent pas d'une vérification manuelle effectuée par un opérateur.
Termes associés : qualité des données, observabilité des données, métadonnées, catalogue de données, métadonnées actives
Qualité des données
Le degré de précision, d'exhaustivité, jeu de données cohérence, d'actualité et jeu de données adéquation jeu de données un jeu de données à l'usage auquel il est destiné. La qualité ne se résume pas à un seul indicateur : il s'agit d'un ensemble de critères évalués par rapport à un cas d'usage spécifique cas d'usage à une norme définie.
Les cinq dimensions standard de la qualité sont l'exactitude (les données reflètent-elles bien ce qu'elles prétendent refléter ?), l'exhaustivité (les champs obligatoires sont-ils renseignés ?), cohérence les données sont-elles cohérentes entre elles et avec les sources associées ?), l'actualité (les données sont-elles suffisamment à jour pour le cas d'usage?) et la validité (les données sont-elles conformes aux formats et plages attendus ?). Un jeu de données obtenir de bons résultats sur certaines dimensions et de mauvais résultats sur d’autres, c’est pourquoi les évaluations de qualité au jeu de données des colonnes et jeu de données sont plus utiles qu’un simple statut « réussi/échoué ».
La qualité est à la fois une condition préalable à la découverte et un résultat de celle-ci. En tant que condition préalable, elle détermine si un jeu de données exploitable. En tant que résultat, les notes de qualité et les résumés de profilage mis à disposition dans le catalogue fournissent aux utilisateurs les informations dont ils ont besoin pour se forger leur propre opinion, sans avoir à faire appel à un ingénieur de données à chaque évaluation.
En aval de la découverte des données, les problèmes de qualité constituent l'une des sources les plus courantes d'erreurs d'analyse. Un rapport élaboré à partir d'un jeu de données des problèmes de qualité cachés produit des chiffres qui semblent corrects, mais qui ne le sont pas. Le coût ne réside pas dans le rapport lui-même, mais dans les décisions prises sur la base de celui-ci.
Termes associés : profilage des données, observabilité des données, traçabilité des données, métadonnées , gouvernance des données
Gestion des données
L'attribution de la responsabilité de ressources de données spécifiques à des personnes ou à des équipes désignées, ainsi que les pratiques et les responsabilités qui découlent de ce rôle. Les gestionnaires de données veillent à l'exactitude des métadonnées, résolvent les problèmes de qualité, gèrent les demandes d'accès, communiquent les modifications aux utilisateurs et servent de point de contact pour toute question concernant les ressources dont ils ont la charge.
La gestion responsable est ce qui rend gouvernance . Une gouvernance définissant les normes en matière de propriété des données est un document. La gestion responsable, quant à elle, est la pratique qui permet de la mettre en œuvre : une personne désignée examine l'actif, met à jour ses descriptions, gère la file d'attente d'accès et valide les modifications apportées au schéma.
Dans le cadre de la recherche documentaire, la gestion responsable garantit la fiabilité des résultats. Une ressource dont la gestion est assurée dispose d’un propriétaire identifié, d’une description mise à jour, d’un statut de qualité actuel et d’un interlocuteur en cas de questions. Une ressource sans gestionnaire peut comporter métadonnées exactes, mais il se peut aussi que sa description ait été rédigée il y a trois ans et n’ait jamais été révisée. Les utilisateurs ne peuvent pas faire la distinction sans que les informations relatives à la gestion responsable n’apparaissent directement dans le catalogue.
Termes associés : gouvernance des données, glossaire métier, métadonnées , produits de données, catalogue de données
gouvernance fédérée
gouvernance dans lequel des normes, des politiques et des exigences d'interopérabilité communes s'appliquent à l'ensemble d'une organisation, tandis que chaque domaine conserve son autonomie sur ses propres ressources de données et ses propres produits. gouvernance fédérée gouvernance le mécanisme organisationnel qui assure la cohérence des architectures de données distribuées.
Dans un gouvernance centralisé, une seule équipe définit et veille au respect de toutes les normes relatives aux données. Ce système fonctionne à petite échelle, mais s'avère inefficace à grande échelle : l'équipe centrale ne parvient pas à faire face au volume de données, au nombre de domaines et à la rapidité avec laquelle les choses évoluent. gouvernance fédérée gouvernance la responsabilité de veiller au respect des normes entre les équipes de domaine, tout en maintenant une couche commune de normes partagées auxquelles tous les domaines doivent se conformer.
En matière de recherche, gouvernance fédérée gouvernance qu’un utilisateur sur plusieurs domaines peut être assuré que métadonnées , les définitions de qualité, les schémas de classification et les modèles de contrôle d’accès sont cohérents, même si les équipes chargées de la gestion des données sous-jacentes sont différentes. Sans cette cohérence, la recherche inter-domaines produit des résultats structurellement incompatibles et pratiquement peu fiables.
Termes associés : gouvernance des données, data mesh, gestion des données, contrats de données, catalogue de données
Graphique de connaissances
Une structure en réseau qui représente des entités et les relations qui les unissent. En gestion des données, un graphe de connaissances relie jeux de données, des termes métier, des utilisateurs, des politiques, des parcours de traçabilité et des concepts de domaine au sein d'un graphe interrogeable où les relations ont autant d'importance que les nœuds eux-mêmes.
L'intérêt d'un graphe de connaissances dans le cadre de la recherche réside dans le fait qu'il permet une navigation contextuelle plutôt qu'une recherche par mot-clé. Un utilisateur des données clients dans un catalogue basé sur des mots-clés obtient une liste de tables dont le nom contient le terme « client ». Un utilisateur dans un catalogue s'appuyant sur un graphe de connaissances peut suivre les relations : ce jeu de données à l'équipe CRM, il met en œuvre le terme métier « client actif », il alimente le rapport trimestriel sur le chiffre d'affaires et il est régi par la politique relative aux données à caractère personnel. Le graphe révèle un contexte qu'aucune correspondance de mots-clés, aussi poussée soit-elle, ne peut fournir.
Les graphes de connaissances servent également de base aux recommandations et à l'analyse d'impact. Lorsqu'une modification de schéma est proposée, le graphe permet d'identifier tous les utilisateurs concernés en aval. Lorsqu'un utilisateur un jeu de données, le graphe peut mettre en avant les ressources associées dont il est susceptible d'avoir besoin. Ces fonctionnalités ne seraient pas possibles sans une représentation structurée des relations.
Termes associés : métadonnées, métadonnées , catalogue de données, métadonnées actives, traçabilité des données
métadonnées
Informations descriptives concernant un ensemble de données. métadonnées aux utilisateurs et aux systèmes ce jeu de données un jeu de données , d’où il provient, à qui il appartient, quel format il adopte, quand il a été mis à jour pour la dernière fois, quels sont ses liens avec d’autres ensembles de données, ainsi que son niveau de qualité et gouvernance .
Il existe plusieurs catégories de métadonnées pour découverte de données. métadonnées techniques métadonnées les propriétés structurelles d’une ressource : schéma, types de données, nombre de lignes, taille du fichier, emplacement de stockage. métadonnées opérationnelles métadonnées le comportement en exécution : horodatage de la dernière mise à jour, historique d’exécution du pipeline, temps de traitement, état de la tâche. métadonnées métier métadonnées la signification et la propriété : descriptions des ressources, liens vers des termes métier, attributions de propriété, notes d’utilisation. métadonnées sociales métadonnées les comportements observés : requête , utilisateur , journaux d'accès, utilisation en aval.
Plus les catégories de métadonnées renseignées et mises à jour, plus la recherche de données gagne en utilité. Un jeu de données que métadonnées techniques métadonnées aux utilisateurs où se trouvent les données et quelle est leur structure. Un jeu de données métadonnées jeu de données complètes métadonnées les quatre catégories indique aux utilisateurs ce qu’elles signifient, s’ils peuvent les utiliser, si elles sont actuellement en bon état et si d’autres équipes les ont trouvées utiles. C’est cet écart entre ces deux expériences qui distingue la recherche fonctionnelle du catalogage purement formel.
Termes associés : métadonnées , métadonnées actives, catalogue de données, traçabilité des données, profilage des données
Gestion des métadonnées
Pratique consistant à collecter, organiser, mettre à jour et gérer métadonnées l'environnement de données d'une entreprise. métadonnées englobe la manière dont métadonnées extraites des systèmes sources, enrichies d'informations contextuelles métier, mises à jour au fur et à mesure de l'évolution des systèmes, et gérées de manière à garantir leur exactitude et leur exhaustivité.
Le principal défi de métadonnées réside dans son ampleur. Une entreprise disposant de dizaines de systèmes sources, de milliers de tables et de centaines de pipelines actifs génère métadonnées . La gestion manuelle d’un tel volume n’est pas viable : les descriptions deviennent obsolètes, les attributions de propriété perdent de leur précision et la qualité des informations ne reflète plus l’état réel des données. métadonnées automatisée métadonnées , métadonnées actifs et la détection des changements sont les mécanismes qui permettent de maintenir métadonnées sans qu’une équipe dédiée ait à les mettre à jour manuellement.
métadonnées régit également les métadonnées : elle définit les normes relatives à la manière dont les ressources doivent être décrites, désigne les responsables de la mise à jour des descriptions dans chaque domaine et métadonnées des conflits entre métadonnées générées par le système et métadonnées validées par des humains. Sans gouvernance la métadonnées , un catalogue se transforme en une collection incohérente de ressources partiellement décrites, sans moyen fiable de distinguer les informations fiables de celles qui sont obsolètes.
Termes associés : métadonnées, métadonnées actives, catalogue de données, gestion des données, gouvernance des données
Couche sémantique
Une couche de traduction entre les structures de données brutes et les concepts métier que ces structures représentent. La couche sémantique définit les indicateurs, les dimensions et les hiérarchies métier dans un langage compréhensible par les utilisateurs métier, et les met en correspondance avec les tables, colonnes et jointures sous-jacentes qui les mettent en œuvre.
Dans le cadre de l'exploration des données, la couche sémantique permet aux utilisateurs métier de trouver et de comprendre les données sans avoir à les traduire eux-mêmes. Un utilisateur l'expression « chiffre d'affaires mensuel récurrent » devrait trouver non seulement le tableau brut des abonnements, mais aussi la définition de cet indicateur, la logique utilisée pour le calculer, ainsi que le rapport ou le modèle dans lequel il est implémenté. C'est la couche sémantique qui assure ce lien.
La couche sémantique est étroitement liée au glossaire métier, mais opère à un niveau différent. Le glossaire métier définit les termes. La couche sémantique les met en œuvre sous une forme que requête peuvent exécuter. Une organisation peut disposer d'un glossaire métier sans couche sémantique — ce qui est souvent le cas —, mais les utilisateurs devront alors traduire eux-mêmes les définitions métier en SQL.
Termes associés : glossaire des affaires, métadonnées, catalogue de données, métadonnées , produits de données
libre-service
La capacité des utilisateurs professionnels à trouver, consulter et analyser des données de manière autonome, sans avoir à passer par une équipe centrale chargée des données. libre-service est le résultat organisationnel que découverte de données à permettre découverte de données efficace.
Le lien entre la découverte et libre-service direct : les analystes ne peuvent travailler de manière autonome que s’ils sont en mesure de trouver des données, d’évaluer leur qualité et leur traçabilité, d’en comprendre la signification métier et de confirmer leur accès — le tout sans avoir à ouvrir de ticket. Chacune de ces étapes repose sur une capacité de découverte. La recherche et le filtrage permettent de localiser la ressource. Les scores de qualité et le contexte de traçabilité permettent l’évaluation. Le glossaire métier et la couche sémantique apportent du sens. gouvernance met en évidence le statut d’accès.
Lorsque l’une de ces couches fait défaut ou n’est pas fiable, libre-service à cette étape. Les analystes qui ne peuvent pas évaluer la qualité des données s’abstiendront de les utiliser ou les utiliseront sans savoir si elles sont fiables. Ceux qui ne parviennent pas à en tirer des informations pertinentes s’adresseront à un ingénieur de données. Ceux qui ne parviennent pas à déterminer leurs droits d’accès ouvriront un ticket. L’équipe chargée des données finit par passer du temps à répondre à des questions auxquelles la couche de découverte devrait répondre d’elle-même.
Pour libre-service véritable libre-service grande échelle soit possible, tous les éléments de ce glossaire doivent fonctionner de concert et être tenus à jour. Il s'agit d'un résultat architectural, et non d'une fonctionnalité de produit.
Termes associés : catalogue de données, gouvernance des données, métadonnées , qualité des données, glossaire métier
Principales comparaisons
« découverte de données « catalogue de données »
| Découverte de données | Catalogue de données | |
|---|---|---|
| Ce que c’est | Une capacité : la capacité à identifier, évaluer et comprendre les ressources de données | Un système — la technologie au service de la découverte |
| Fonction principale | Aide les utilisateurs à trouver les données pertinentes et à évaluer leur pertinence pour l'usage prévu | Répertorie les actifs, métadonnées, les relations et gouvernance |
| expérience utilisateur | Rechercher, parcourir, filtrer, évaluer, explorer les relations | L'interface et l'infrastructure qui permettent la découverte |
| Cela dépend de | métadonnées, traçabilité, indicateurs de qualité, gouvernance | métadonnées , métadonnées actives, cartographie des relations |
| Peut exister sans l'autre | Non — une recherche sans catalogue ne repose sur aucune infrastructure | Oui — un catalogue peut offrir une expérience de recherche médiocre, voire inexistante, si métadonnées insuffisantes ou obsolètes. |
métadonnées actives métadonnées métadonnées passives
| métadonnées actives | métadonnées passives | |
|---|---|---|
| Comment est-il mis à jour ? | En continu, en temps réel les données évoluent | Manuellement, lors de l'importation ou selon une fréquence programmée |
| Reflète l'état actuel | Oui | Souvent non |
| Exemples | Scores de qualité en temps réel, journaux d'utilisation récents, état d'exécution du pipeline, détection des modifications de schéma | Descriptions statiques, balises attribuées manuellement, résultats de profilage ponctuels |
| La valeur de la découverte | Présente l'état actuel de la santé et le contexte, formule des recommandations | Fournit une structure de référence et des définitions |
| Risque en cas de péremption | Faible — mise à jour automatique | Élevé — métadonnées passives obsolètes métadonnées l'une des causes les plus courantes d'abandon du catalogue |
FAQ
découverte de données le processus consistant à identifier, comprendre et évaluer les ressources de données présentes dans l'ensemble des systèmes et plateformes d'une organisation. Elle va au-delà de la simple recherche et englobe l'évaluation de la qualité, la traçabilité de la provenance, la détermination de la propriété et la vérification gouvernance — c'est-à-dire l'ensemble des informations utilisateur un utilisateur pour déterminer si un jeu de données adapté à son cas d'usage.
Un « catalogue de données » catalogue de données le système. découverte de données la fonctionnalité offerte par ce système. Un catalogue bien conçu et mis à jour régulièrement permet une découverte efficace. À l'inverse, un catalogue incomplet, obsolète ou déconnecté des normes de qualité et gouvernance une découverte médiocre, quelle que soit la technologie sur laquelle il repose.
métadonnées qui permettent jeu de données un jeu de données , et pas seulement de le localiser. métadonnées techniques métadonnées aux utilisateurs ce jeu de données un jeu de données . métadonnées métier leur métadonnées ce qu'il signifie. métadonnées opérationnelles leur métadonnées s'il est à jour.métadonnées gouvernance leurmétadonnées s'ils peuvent l'utiliser. Une recherche sans métadonnées riches métadonnées des résultats. Une recherche avec des métadonnées riches renvoie des réponses.
métadonnées actives métadonnées métadonnées se mettent à jour en continu à mesure que les données circulent dans les systèmes. Elles reflètent l'état actuel d'un élément plutôt que son état au moment de la dernière mise à jour manuelle. Concrètement, cela correspond à la différence entre un catalogue qui répertorie ce qui existe et un catalogue qui indique ce qui est actuellement en bon état, a été utilisé récemment et fait l'objet d'une maintenance active.
La traçabilité constitue le pilier de la confiance dans le processus de découverte. Lorsqu'un utilisateur un jeu de données, la traçabilité lui indique d'où il provient et comment il a été transformé, ce qui permet de déterminer si les chiffres qu'il contient reflètent bien ce qu'ils sont censés refléter. La traçabilité met également en évidence l'impact : si un jeu de données source jeu de données , elle permet d'identifier les rapports et modèles en aval qui sont affectés avant même que quiconque ne détecte le problème dans un rapport.
gouvernance le cadre qui permet d'exploiter les résultats de la découverte en toute sécurité. Elle indique aux utilisateurs s'ils sont autorisés à utiliser un jeu de données, quelles sont les exigences de conformité qui s'y appliquent et à quelles normes il doit se conformer. La découverte sans gouvernance les données gouvernance . La découverte avec gouvernance les données que les utilisateurs peuvent réellement exploiter sans créer de risque de non-conformité.
gouvernance fédérée gouvernance un modèle dans lequel des normes et des politiques communes s'appliquent à l'ensemble d'une organisation, tandis que chaque domaine conserve son autonomie sur ses propres données. C'est le mécanisme qui assure la cohérence de la découverte inter-domaines au sein des organisations utilisant des architectures distribuées telles que data mesh, où aucune équipe ne détient à elle seule l'intégralité des données.
libre-service désigne la capacité des utilisateurs métier à trouver et à exploiter des données sans faire appel à une équipe centrale chargée des données. découverte de données le préalable indispensable. Les utilisateurs ne peuvent travailler de manière autonome que s'ils sont capables de trouver des données, d'évaluer leur qualité, d'en comprendre la signification et de valider leur accès — le tout par eux-mêmes. La découverte des données fournit l'infrastructure nécessaire à chacune de ces étapes. Lorsqu'une étape fait défaut ou n'est pas fiable, les utilisateurs se rabattent sur la création de tickets.