Data Intelligence

Qu'est-ce que la gestion de la qualité des données ?

Qu'est-ce que la gestion de la qualité des données ?

La gestion de la qualité des données (DQM) consiste, de manière continue, à mesurer, surveiller, corriger et améliorer la qualité des données au sein de l'ensemble du parc de données d'une organisation, afin que celles-ci restent exactes, complètes, cohérentes, à jour, valides et uniques pour les utilisations auxquelles elles sont destinées.

Il est important de faire la distinction entre la qualité des données et la gestion de la qualité des données. La qualité des données est un état : elle correspond au degré de conformité des données à des normes définies à un moment donné. La gestion de la qualité des données, quant à elle, est un programme : elle englobe les processus, les rôles, les outils et gouvernance qui permettent de maintenir et d’améliorer cet état au fil du temps.

Les organisations qui évaluent la qualité des données une seule fois et corrigent les problèmes détectés ont procédé à nettoyage des données ». Celles qui intègrent dans leurs opérations liées aux données une surveillance continue, une responsabilité en matière de gestion des données et une amélioration continue ont mis en place une gestion de la qualité des données.

Qualité des données vs gestion de la qualité des données

Qualité des données Gestion de la qualité des données
Qu'est-ce que c'est ? L'état des données : dans quelle mesure elles répondent aux normes définies à un moment donné Le programme : les processus, les rôles, les outils et gouvernance permettent de maintenir et d'améliorer cet état
Question principale À quel point ces données sont-elles actuellement précises, complètes et cohérentes ? Comment pouvons-nous garantir que les données respectent systématiquement les normes de qualité au fil du temps ?
Horizon temporel Moment précis En cours et continu
Résultats Scores de qualité, résultats de profilage, résultats de validation Tendances en matière d'amélioration de la qualité, jeux de données certifiés, processus de gestion des données, gouvernance
Qui est responsable ? Mesurées par les ingénieurs de données et les responsables de données Géré par un programme dont la responsabilité, les processus et les indicateurs de performance sont clairement définis
Relation La méthode DQM a pour résultat la qualité des données La qualité des données est ce que DQM évalue et améliore

L'erreur la plus courante dans les programmes de gestion des données d'entreprise consiste à considérer la qualité comme une mesure ponctuelle plutôt que comme une discipline de gestion continue. nettoyage des données qui améliore les scores de qualité de 30 %, mais qui n'est pas suivi d'une gestion continue, aboutit à une dégradation des données qui reviennent à leur état initial en l'espace de quelques mois, à mesure que de nouveaux enregistrements s'accumulent, que les pipelines changent et que les systèmes sources évoluent.


Ce que recouvre la gestion de la qualité des données

Un programme DQM complet couvre sept disciplines.

Profilage des données

Analyse automatisée des ressources de données afin d'évaluer leurs caractéristiques de qualité actuelles : taux de valeurs nulles, distributions des valeurs, modèles de format, taux de doublons et intégrité référentielle. Le profilage établit une base de référence pour chaque domaine de données, identifie les lacunes en matière de qualité et fournit les éléments dont les gestionnaires et les propriétaires ont besoin pour hiérarchiser les mesures correctives.

Le profilage doit s'exécuter en continu, et pas seulement au lancement du programme. Les caractéristiques de qualité évoluent à mesure que les volumes de données augmentent, que les systèmes sources changent et que les pipelines sont modifiés.

Validation des données

Règles métier qui définissent les caractéristiques des données valides pour chaque champ : plages de valeurs acceptables, formats requis, contraintes référentielles et dépendances entre champs. Les règles de validation s'appliquent au moment de la saisie et de l'ingestion des données afin d'empêcher l'entrée de valeurs non valides dans le système, et elles s'appliquent en continu aux données stockées afin de détecter les valeurs qui ne sont plus conformes aux normes en vigueur.

Une validation efficace nécessite une collaboration entre les ingénieurs de données (qui mettent en œuvre les règles sur le plan technique) et les responsables de données ainsi que les responsables métier (qui définissent ce que signifie « valide » pour chaque domaine d'activité). Une validation technique hors contexte métier aboutit à des règles qui laissent passer des données erronées. Des exigences métier sans mise en œuvre technique aboutissent à des normes qui ne sont jamais appliquées.

nettoyage des données correction

Processus consistant à corriger, normaliser et enrichir les données qui ne satisfont pas aux contrôles de qualité. Le nettoyage peut être automatisé pour les volumes importants présentant des schémas corrigibles — par exemple, le reformatage des numéros de téléphone selon un format standard, la correction des codes postaux à l'aide d'une base de données de référence, ou la fusion des enregistrements en double au-delà d'un seuil de confiance — et manuel pour les cas ambigus nécessitant un jugement humain.

Le principe le plus important en matière de nettoyage des données est de privilégier la correction à la source plutôt que la correction en aval. Corriger les données dans un entrepôt de données en aval alors que le système source continue de générer les mêmes erreurs entraîne une charge de maintenance indéfinie. Tout investissement dans le nettoyage des données devrait inclure une évaluation visant à déterminer si la cause première peut être traitée à la source.

Suivi de la qualité et système d'alerte

Suivi continu des scores de qualité sur l'ensemble des ressources de données, avec des alertes automatisées lorsque les scores descendent en dessous de seuils définis ou lorsque des anomalies apparaissent. Le suivi de la qualité permet de détecter les problèmes avant qu'ils n'affectent les rapports de production, les systèmes opérationnels ou apprentissage de l'IA.

Une surveillance efficace s'intègre aux processus de gestion plutôt que de se limiter à un simple tableau de bord de surveillance. Une alerte qui se déclenche et atterrit dans une file d'attente dont personne n'a la charge n'améliore pas la qualité. Une alerte qui se déclenche, crée un ticket de gestion attribué au responsable, suit le délai de résolution par rapport à un SLA et est transmise à un niveau supérieur si elle n'est pas résolue : voilà ce qu'est la gestion de la qualité.

Certification des données

Processus formel consistant à certifier qu’un ensemble de données est approuvé pour utilisation après avoir satisfait à des critères de qualité définis et avoir été examiné par un responsable des données. La certification traduit les mesures de qualité en utilisateur : un jeu de données certifié et jeu de données dans le catalogue de données aux utilisateurs que ces données sont fiables, sans qu’ils aient à les valider eux-mêmes.

La certification est le moment où la gestion de la qualité apporte sa valeur ajoutée la plus directe à l'entreprise. Lorsque les analystes et data scientists trouver jeux de données certifiés jeux de données le catalogue et les utiliser sans avoir à passer par un niveau hiérarchique supérieur ni à recourir à une validation indépendante, le temps et les efforts consacrés à la gestion de la qualité sont directement rentabilisés.

Intendance et propriété

La gestion de la qualité des données nécessite une responsabilité humaine à deux niveaux : d'une part, les propriétaires de données, qui définissent les normes de qualité et assument la responsabilité finale de l'intégrité des données de leur domaine ; d'autre part, les gestionnaires de données, qui mettent en œuvre la gestion de la qualité sur le plan opérationnel — en surveillant les scores, en résolvant les incidents, en mettant à jour les termes du glossaire et en certifiant les ressources.

En l'absence d'une responsabilité clairement définie, les programmes de gestion de la qualité perdent de leur efficacité. Les ingénieurs peuvent mettre en place des infrastructures de surveillance, mais ils ne sont pas en mesure de définir ce que signifie « précis » dans un domaine d'activité donné, ni de certifier qu'un jeu de données adapté à un usage métier spécifique. Ces décisions requièrent une expertise métier et une responsabilité au niveau de l'entreprise.

Rapports sur la qualité et gouvernance

Intégration des indicateurs de qualité dans gouvernance , permettant ainsi à la direction d'avoir une vue d'ensemble de l'état de la qualité des données à l'échelle de l'organisation. Les rapports de qualité portent sur le taux de couverture (pourcentage d'actifs faisant l'objet d'un suivi actif de la qualité), l'évolution des scores de qualité par domaine, le délai moyen de résolution des incidents liés à la qualité et les taux de certification.

C'est grâce gouvernance que le programme DQM s'inscrit dans une démarche durable plutôt que de rester un simple projet. Lorsque les indicateurs de qualité sont régulièrement communiqués à la direction et que les défaillances en matière de qualité font l'objet d'une responsabilisation claire, la culture organisationnelle liée à la qualité des données s'améliore au fil du temps.


Le cycle de vie de la gestion de la qualité des données

Le DQM fonctionne selon un cycle continu plutôt que selon un processus linéaire.

1. Découvrir : Dressez l’inventaire des ressources de données concernées. Connectez des outils de profilage à chaque source prioritaire et effectuez une analyse initiale pour évaluer la qualité actuelle selon six critères : exactitude, exhaustivité, cohérence, actualité, validité et unicité. Identifiez les domaines présentant les plus grands écarts de qualité et les risques métier les plus élevés.

2. Définir des normes : Collaborez avec les propriétaires et les gestionnaires de données pour définir les seuils de qualité applicables à chaque domaine prioritaire : taux de valeurs nulles acceptables, pourcentages d’exhaustivité requis, règles de validation des formats, accords de niveau de service (SLA) relatifs à l’actualité des données et exigences en matière d’unicité. Consignez ces normes dans le catalogue de données politique officielle de qualité pour chaque domaine.

3. Valider et nettoyer : Mettez en œuvre des règles de validation qui garantissent le respect des normes définies dès l’ingestion et qui s’appliquent en continu aux données stockées. Lancez des processus de nettoyage sur les données existantes qui ne respectent pas les normes en vigueur. Privilégiez, dans la mesure du possible, la correction à la source plutôt que le nettoyage en aval.

4. Surveillance :Mettez en placeune surveillance continue de la qualité avec des alertes automatisées reliées aux processus de gestion. Définissez des seuils de surveillance au niveau du domaine en fonction des normes définies à l'étape 2. Suivez l'évolution des scores de qualité au fil du temps.

5. Correction : Résoudre les incidents liés à la qualité via le workflow de gestion : enquêter sur la cause première, mettre en œuvre la correction à la source dans la mesure du possible, vérifier la résolution via le système de surveillance, puis clore l’incident en documentant les mesures prises. Suivre les SLA de correction afin d’évaluer la santé du programme de gestion.

6. Certifier :Examinerles ressources qui répondent aux critères de qualité définis et leur attribuer le statut de certification. Publier les ressources certifiées dans le catalogue de données indiquant aux utilisateurs les preuves de qualité. Examiner et renouveler la certification selon une fréquence définie.

7. Rendre compte et s'améliorer : Générer gouvernance de la qualité destinés à être examinés par la direction. Identifier les défaillances persistantes en matière de qualité et s'attaquer à leurs causes profondes. Mettre à jour les normes de qualité à mesure que les exigences métier évoluent. Suivre les tendances d'amélioration de la qualité au fil du temps. Un programme de gestion de la qualité des données (DQM) qui ne parvient pas à démontrer une amélioration de la qualité sur une période de 12 mois ne gère pas la qualité : il se contente de la documenter.


DQM et Master gestion des données

La gestion de la qualité des données et gestion des données de référence gestion des données MDM) sont des disciplines étroitement liées, mais distinctes.

Maîtrise gestion des données gère un enregistrement unique faisant autorité enregistrement un « enregistrement de référence enregistrement pour les entités métier clés : clients, produits, fournisseurs, collaborateurs. Il résout les doublons, garantit cohérence et régit la manière dont la version faisant autorité est gérée et diffusée dans l'ensemble des systèmes.

La gestion de la qualité des donnéespermet de contrôleret d'améliorer la qualité de l'ensemble des ressources de données au sein du parc informatique, qu'il s'agisse des données de référence, mais aussi des données transactionnelles, opérationnelles, de référence et analytiques.

La gestion des données de référence (MDM) dépend de la gestion de la qualité des données (DQM) : un programme de gestion des données de référence qui ne mesure ni ne contrôle la qualité de ses enregistrements de référence produit des enregistrements faisant autorité dont la qualité est incertaine. La gestion de la qualité des données (DQM) dépend de la gestion des données de référence (MDM) : un programme de qualité qui ne traite pas cohérence de résolution des entités et cohérence que résout la MDM continuera à échouer sur les plans des doublons et des incohérences, quel que soit le nombre de règles de validation mises en œuvre.

Dans la pratique, les organisations matures gèrent la gestion de la qualité des données (DQM) et la gestion des données de référence (MDM) comme des programmes complémentaires dotés gouvernance commune : les mêmes responsables et gestionnaires de données sont chargés de veiller à la qualité dans les domaines relevant de la MDM, les normes de qualité s’appliquent aux données de référence au même titre qu’à toutes les autres données, et les enregistrements de référence MDM sont certifiés selon le même processus de certification DQM que les autres actifs de données.


DQM et gouvernance des données

La gestion de la qualité des données est l'une des disciplines opérationnelles d'un programme gouvernance des données.

gouvernance les normes de qualité — les seuils, les dimensions et les critères de certification applicables à chaque domaine. DQM met en œuvre ces normes par le biais du profilage, de la validation, de la surveillance et de la correction.

gouvernance DQM s'exécute
Seuils de qualité par domaine Surveillance continue par rapport à ces seuils
Responsabilité en matière de gestion Résolution des problèmes liés à la qualité opérationnelle
Critères de certification Certification applicable aux actifs éligibles
Exigences de conformité Conservation de preuves de qualité à des fins d'audit
Propriété des données Responsabilité des propriétaires quant à la qualité et à l'état des domaines

gouvernance dépourvu de mise en œuvre de la gestion de la qualité (DQM) aboutit à des politiques de qualité qui ne font jamais l'objet d'une évaluation. Un programme de gestion de la qualité (DQM) dépourvu gouvernance des indicateurs de qualité qui ne donnent lieu à aucune action, en raison de l'absence de structures de responsabilisation.


Outils Support la gestion de la qualité Support

Le DQM nécessite des outils relevant de trois catégories. Il s'agit de catégories fonctionnelles, et non de recommandations de fournisseurs.

plateformes de profilage et de surveillance des données : Outils qui se connectent à des sources de données, analysent automatiquement les caractéristiques de qualité, calculent des scores de qualité et génèrent des alertes lorsque ces scores descendent en dessous de certains seuils ou que des anomalies apparaissent. plateformes modernes plateformes anomalie automatisée anomalie qui identifie les schémas inhabituels sans nécessiter la définition manuelle de règles pour chaque mode de défaillance possible.

Catalogues de données intégrant des informations sur la qualité :un catalogue de donnéesqui affiche les scores de qualité, le statut de certification et l'historique de validation parallèlement aux définitions des ressources et à la traçabilité fournit aux utilisateurs le contexte dont ils ont besoin pour évaluer les données avant de les utiliser. Les informations sur la qualité intégrées au catalogue sont plus accessibles que celles qui sont dissimulées dans un tableau de bord de surveillance distinct.

plateformes observabilité des données :observabilité surveillent les pipelines de données de bout en bout afin de détecter les problèmes liés à l'actualité des données, au volume, aux modifications de schéma et aux anomalies de distribution. Ils complètent les outils de profilage en détectant les problèmes de qualité au niveau du pipeline — un pipeline dont le chargement s'est interrompu, une modification de schéma ayant rompu une dépendance en aval — plutôt que de se limiter aux indicateurs de qualité jeu de données.

frameworks de validation et de test : Frameworks ingénieurs de données d'écrire et d'exécuter des tests de qualité sous forme de code, intégrés aux pipelines CI/CD et plateformes d'orchestration. Les tests de qualité exécutés dans le cadre de l'exécution du pipeline détectent les problèmes au moment de la transformation plutôt qu'une fois que les données ont atteint l'environnement de production.

plateformes de résolution d'entités et de gestion des données de référence (MDM) :outilspermettant d'identifier et de fusionner les enregistrements en double, de gérer les enregistrements de référence pour les entités clés et de diffuser les versions faisant autorité vers les systèmes connectés. Indispensables à tout programme de gestion de la qualité des données (DQM) devant garantir l'unicité et cohérence à cohérence .

workflow de gestion de la qualité :outilspermettant de gérer l'aspect humain de la gestion de la qualité des données (DQM) : acheminement des incidents de qualité vers le responsable compétent, suivi de leur résolution par rapport aux accords de niveau de service (SLA), enregistrement des décisions de certification et génération des pistes d'audit requises par gouvernance la conformité.


Mise en place d'un programme de gestion de la qualité des données

Commencez par une évaluation de la qualité

Avant de déployer des outils ou de définir des politiques, procédez à une évaluation de la qualité de l'état actuel dans tous les domaines prioritaires. Analysez chaque jeu de données prioritaire jeu de données des six dimensions de qualité et établissez des scores de référence. Identifiez les domaines présentant les écarts de qualité les plus importants et les risques opérationnels les plus élevés : ce sont eux qui constitueront le point de départ du programme.

Définir des normes de qualité par domaine

Collaborez avec les responsables et les gestionnaires des données afin de définir des seuils acceptables pour chaque critère de qualité dans chaque domaine prioritaire. Un domaine lié aux transactions financières peut exiger une précision de 99,9 % et une exhaustivité de 100 % pour les champs obligatoires. Un domaine lié aux contacts marketing peut, quant à lui, tolérer des taux de valeurs nulles plus élevés pour les champs facultatifs. Les seuils définis par domaine permettent de mesurer et de certifier la qualité.

Attribuer la gestion

Identifiez les responsables et les gestionnaires des données pour chaque domaine prioritaire avant de mettre en place le suivi. Un suivi de la qualité sans attribution claire des responsabilités génère des alertes auxquelles personne ne donne suite. La structure de gestion constitue le fondement du programme ; les outils lui confèrent évolutif.

Déployer la surveillance et se connecter aux flux de travail

Mettez en place une surveillance continue de la qualité pour les domaines prioritaires. Associez les alertes de surveillance aux processus de gestion plutôt qu’à un simple tableau de bord de surveillance. Définissez des accords de niveau de service (SLA) pour la gestion des incidents et assurez le suivi de leur respect. Signalez les non-conformités persistantes aux responsables des données.

Mettre en place une validation lors de l'ingestion

Mettez en place des règles de validation dès la saisie des données et lors de leur intégration dans le pipeline pour les domaines prioritaires. Empêchez les données invalides, incomplètes ou en double d'entrer dans le système plutôt que de les corriger a posteriori. La prévention à la source génère des retombées croissantes à mesure que le programme gagne en maturité.

Certifier les actifs prioritaires

Passez en revue la liste des ressources prioritaires et certifiez jeux de données respectent les seuils de qualité définis. Publiez le statut de certification dans le catalogue de données. Définissez une fréquence de révision pour le renouvellement de la certification — généralement trimestrielle pour les domaines à haut risque.

Mesurer et rendre compte

Définir tableau de bord des indicateurs clés de performance (KPI) du programme DQM : taux de couverture du catalogue, évolution des scores de qualité par domaine, délai moyen de résolution des incidents, taux de certification et SLA en matière de gestion responsable. Communiquer ces informations chaque mois à gouvernance . Mettre en évidence les progrès réalisés au fil du temps.

FAQ

La gestion de la qualité des données désigne la pratique continue consistant à mesurer, surveiller, corriger et améliorer la qualité des données dans l'ensemble du parc de données d'une organisation. Elle englobe les processus, les rôles, les outils et gouvernance qui garantissent que les données restent exactes, complètes, cohérentes, à jour, valides et uniques pour les utilisations auxquelles elles sont destinées, et ce sur la durée — et non pas uniquement à un moment donné.

La qualité des données correspond à l'état de celles-ci à un moment donné, c'est-à-dire à leur conformité aux normes définies. La gestion de la qualité des données désigne le programme qui permet de maintenir et d'améliorer cet état au fil du temps grâce au profilage, à la validation, à la surveillance, à la gestion et à gouvernance. Le nettoyage ponctuel des données ne relève pas de la gestion de la qualité des données. En revanche, la mise en place d'un programme continu visant à garantir la propreté des données en fait partie.

Le profilage des données pour établir des références, les règles de validation pour garantir le respect des normes, le nettoyage et la correction pour résoudre les problèmes existants à la source, la surveillance continue assortie d'alertes liées à la gestion responsable, la certification des données pour traduire la mesure de la qualité en utilisateur , l'attribution des responsabilités en matière de gestion et de propriété, ainsi que gouvernance qui suivent l'amélioration de la qualité au fil du temps.

La gestion des données de référence (MDM) assure la gestion d'un enregistrement de référence unique et faisant autorité enregistrement les entités métier clés — clients, produits, fournisseurs — et régit sa diffusion dans l'ensemble des systèmes. La gestion de la qualité des données (DQM) évalue et améliore la qualité de l'ensemble des ressources de données du parc informatique, y compris les données de référence. La MDM traite cohérence de qualité liés à l'unicité et cohérence des entités clés. La DQM couvre les six dimensions de la qualité pour l'ensemble des ressources de données. Les organisations matures mettent en œuvre ces deux approches sous forme de programmes complémentaires.

Les principales catégories d'outils sont les suivantes : plateformes de profilage et de surveillance des données, les catalogues de données intégrant un indicateur de qualité,plateformes observabilité des données, frameworks de validation et de test frameworks exécutent des contrôles de qualité sous forme de code au sein des pipelines, plateformes de résolution d'entités et de gestion des données maîtrises (MDM) plateformes la gestion des doublons, ainsi que workflow de gouvernance qui gèrent l'aspect humain de la résolution des incidents de qualité et de la certification.

À travers six indicateurs suivis dans le temps : le taux de couverture du catalogue (pourcentage des actifs faisant l'objet d'un suivi qualité actif), l'évolution des scores de qualité par domaine (les scores s'améliorent-ils ?), le délai moyen de résolution des incidents liés à la qualité, le taux de certification (pourcentage des actifs prioritaires disposant d'une certification à jour), SLA de gestion (les incidents sont-ils résolus dans les délais définis ?) et la réduction de la fréquence des incidents liés à la qualité des données d'une année sur l'autre.

Le retour sur investissement (ROI) provient de quatre sources : la réduction des retouches techniques due à la diminution des défaillances du pipeline causées par des problèmes de qualité, la diminution du nombre de mauvaises décisions commerciales liées à des données peu fiables, la réduction du risque de pénalités liées à la conformité et l’accélération de la préparation aux audits. Gartner estime que la mauvaise qualité des données coûte en moyenne 15 millions de dollars par an aux organisations. Un programme de gestion de la qualité des données (DQM) qui réduit de 50 % la fréquence et la gravité des défaillances liées à la qualité génère un retour sur investissement substantiel, même en cas d’investissement important dans le programme. La plupart des entreprises enregistrent un retour sur investissement positif dans les 12 à 18 mois suivant la mise en place d’un programme DQM opérationnel.

Les modèles d'IA héritent de tous les problèmes de qualité présents dans leurs apprentissage . DQM garantit quejeux de données apprentissage jeux de données analysés, validés et certifiés avant d'intégrer les pipelines d'IA ; que les preuves de qualité sont conservées pour assurer la reproductibilité des modèles et répondre aux exigences des audits réglementaires ; et que les données de production alimentant les modèles déployés font l'objet d'une surveillance continue afin de détecter toute dérive des données avant qu'elle n'entraîne une dégradation des performances des modèles.