Meilleures pratiques en matière de qualité des données dans le cadre de gouvernance des données
Résumé
- La qualité des données doit être considérée comme un gouvernance permettant de prévenir les problèmes avant qu'ils n'atteignent l'environnement de production.
- Les programmes efficaces définissent des critères de qualité mesurables et les relient directement à l'impact sur l'activité.
- La définition claire des responsabilités en matière de maîtrise d'ouvrage, de gestion et d'ingénierie permet d'éviter que les problèmes de qualité ne restent en suspens sans trouver de solution.
- La surveillance automatisée, la traçabilité et l'application des règles aident les équipes à détecter et à résoudre plus rapidement les problèmes tout au long des pipelines.
- Les programmes les plus efficaces accordent la priorité aux données à fort impact, s'attaquent aux causes profondes et intègrent la qualité dans leurs indicateurs clés de performance (KPI).
La qualité des données ne se détériore pas d’un seul coup. Elle se dégrade progressivement : un champ laissé vide, une définition qui varie d’un système à l’autre, un pipeline qui s’exécute sans validation. Lorsque les utilisateurs en aval s’aperçoivent qu’il y a un problème, celui-ci s’est généralement aggravé au fil des semaines.
Une gestion efficace de la qualité des données dans un gouvernance ne consiste pas à nettoyer les données a posteriori. Il s'agit plutôt de mettre en place les normes, les structures de responsabilité et les contrôles automatisés qui empêchent, dès le départ, les problèmes de qualité d'atteindre l'environnement de production.
Définir les dimensions de la qualité des données — et les mettre en correspondance avec leur impact sur l'activité
Avant de pouvoir évaluer la qualité des données, il faut s'accorder sur ce que ce terme recouvre. Le référentiel le plus couramment utilisé définit six dimensions fondamentales :
| Dimension | Définition | Exemple d'échec |
|---|---|---|
| Précision | Les données reflètent fidèlement la valeur réelle qu'elles décrivent | L'adresse de facturation d'un client a été enregistrée de manière erronée |
| Complétude | Les champs obligatoires sont remplis | 23 % des fiches clients ne comportent pas d'adresse e-mail |
| cohérence | Les données sont homogènes d'un système à l'autre et dans le temps | La définition d'un client « actif » diffère entre le CRM et le système de facturation |
| Rapidité d'exécution | Les données sont à jour et disponibles en cas de besoin | Les inventaires effectués hier servent de base aux décisions prises aujourd'hui concernant la préparation des commandes |
| Validité | Les données sont conformes aux formats, plages et règles définis | Un champ de date contient la valeur « N/A » |
| Unicité | Il n'y a pas de doublons involontaires | Le même client apparaît trois fois sous des noms légèrement différents |
En associant chaque dimension à un impact concret sur l'activité — un audit échoué, une mauvaise expérience client, un rapport de direction erroné —, la qualité des données passe du statut de préoccupation technique à celui de priorité opérationnelle. C'est également cette approche qui permet aux programmes gouvernance des donnéesde bénéficier du support organisationnel support ont besoin pour fonctionner.
Définir clairement les rôles en matière de propriété et de gestion des données
La qualité des données sans responsabilité n'est qu'un document d'orientation, et non un programme. Chaque domaine de données nécessite des rôles bien définis :
Les responsables des données sont responsables de la qualité d’un domaine de données au niveau de l’entreprise. Ils définissent les normes de qualité, approuvent les exceptions et veillent à ce que les données de leur domaine répondent aux exigences des utilisateurs en aval.
Responsables des données assurent les tâches opérationnelles quotidiennes : suivi des scores de qualité, analyse des défaillances, résolution des conflits de définition et mise à jour des entréesdu glossaire métier. gestion des données est le point de rencontre entre la politique de qualité et sa mise en œuvre.
Ingénieurs de données mettent en œuvre et assurent la maintenance des contrôles techniques — règles de validation, vérifications des pipelines, respect des schémas — qui permettent de mesurer la qualité dans les systèmes automatisés.
Sans cette structure, des problèmes de qualité apparaissent, mais personne n'en assume clairement la responsabilité. Les enquêtes s'enlisent. Les corrections ne sont plus considérées comme prioritaires. Les mêmes problèmes se reproduisent.
Définir des seuils de qualité mesurables avant que les données n'entrent en production
Les normes de qualité doivent être définies dès l'intégration d'un ensemble de données, et non après plusieurs mois d'utilisation. Pour chaque jeu de données critique, il convient de consigner les éléments suivants :
- Quels sont les champs obligatoires et lesquels sont facultatifs ?
- Plages de valeurs acceptables, formats et listes d'énumération.
- Taux de valeurs nulles maximaux tolérés par colonne.
- Exigences en matière de fraîcheur — quel est le délai de validité de ces données avant qu'elles ne soient plus utilisables ?
- Règles d'intégrité référentielle — que les clés étrangères doivent respecter.
Ces seuils servent de base à la validation automatisée. Ils doivent être enregistrés sous forme de métadonnées aux côtés de l'ensemble de données, afin que les règles de qualité accompagnent les données lors de leurs transferts d'un système à l'autre.
Mettre en place une surveillance et un système d'alerte automatisés sur l'ensemble des pipelines
Les contrôles qualité manuels ne sont pas évolutifs. Compte tenu des volumes de données traités par les entreprises, la seule approche viable consiste à mettre en place une surveillance automatisée en continu qui détecte les anomalies avant qu'elles n'atteignent les tableaux de bord, les modèles ou les systèmes opérationnels.
Une surveillance automatisée efficace couvre les aspects suivants :
- Contrôles de volume — Le nombre de lignes attendu a-t-il bien été reçu ?
- Vérifications du schéma—Une colonne a-t-elle changé de type, a-t-elle été renommée ou a-t-elle disparu ?
- Contrôles de distribution — Les distributions des valeurs semblent-elles statistiquement normales par rapport aux références historiques ?
- Suivi du taux de valeurs manquantes — Le taux de valeurs manquantes a-t-il considérablement évolué ?
- Contrôles de fraîcheur — Les données ont-elles été mises à jour dans le délai requis ?
Lorsqu'une vérification échoue, les alertes doivent être automatiquement transmises au responsable des données concerné, et non rester dans un fichier journal. C'est là quela traçabilité des donnéesdevient essentielle : une alerte concernant une table en aval est bien plus exploitable lorsque l'on peut immédiatement identifier la source ou la transformation en amont à l'origine du problème.
Intégrer la qualité des données dans gouvernance , et non pas en tant qu'élément secondaire
La qualité des données et gouvernance des données sont plus efficaces lorsqu'elles sont conçues conjointement. Concrètement, cela signifie :
- Les critères de qualité devraient faire partie intégrante des contrats de données — accords formels conclus entre les producteurs et les utilisateurs de données, précisant le contenu des données et leur date de livraison.
- Les classifications des données sensibles mises en œuvre dans le cadre de gouvernance automatiquement entraîner des exigences de qualité plus strictes.
- Les données qui ne satisfont pas aux contrôles de qualité ne doivent pas être certifiées dans le catalogue de données jusqu’à ce que les problèmes soient résolus.
- L'accès à jeux de données essentiels jeux de données être subordonné au respect de seuils de qualité, ce qui empêche que des décisions en aval soient prises sur la base de données ne répondant pas aux normes minimales.
L'objectif est de mettre en place un contrôle de qualité automatique et Embarqué flux de données habituels, et non un cycle d'audit distinct mené chaque trimestre.
Donner la priorité aux données de référence et aux domaines à fort impact
Tenter de mettre en place des contrôles qualité sur l'ensemble jeu de données revient à disperser trop les efforts et à obtenir des résultats trop lentement pour instaurer la confiance au sein de l'organisation. Commencez par :
- Données de référence — Clients, produits, fournisseurs, collaborateurs. Ces entités sont présentes dans tous les systèmes. Les problèmes de qualité à ce niveau se répercutent sur l'ensemble du parc de données.
- Données destinées aux déclarations réglementaires — Tout jeu de données un rapport de conformité ou des états financiers. Le coût d’un défaut de qualité est ici direct et mesurable.
- apprentissage pour l'IA et l'apprentissage automatique — Les modèles entraînés sur des données de mauvaise qualité produisent des résultats peu fiables. Les contrôles de qualitéjeux de données apprentissage jeux de données être traités avec la même rigueur que les données financières de production.
Une fois que des programmes de qualité ont été mis en place dans des domaines à fort impact, les modèles, les outils et la capacité organisationnelle s'étendent jeux de données efficacement à jeux de données plus vastes.
Mettre en place une boucle de rétroaction entre les défaillances en matière de qualité et la correction des causes profondes
Détecter un problème de qualité ne représente que la moitié du travail. L'autre moitié consiste à s'assurer que la solution apportée s'attaque à la cause profonde du problème plutôt qu'à ses symptômes.
Une boucle de correction structurée se présente comme suit :
- La surveillance automatisée détecte une anomalie crée une tâche de gestion.
- Le responsable mène l'enquête en s'appuyant surl'historique pour remonter à la source du problème.
- La cause première a été identifiée : une modification du système source, une erreur de logique dans le pipeline, une incohérence dans les définitions.
- La correction a été intégrée au code source ; il ne s'agit pas d'un correctif appliqué en aval.
- La règle de qualité ou le seuil qui n'a pas permis de détecter le problème plus tôt a été mis à jour.
- La résolution est documentée sous forme de métadonnées sur l'élément concerné.
Sans l'étape 6, le même problème réapparaît. Sans l'étape 4, la correction en aval crée une dépendance cachée qui provoque une erreur dès la prochaine modification du code source.
Mesurer et rendre compte de la qualité des données en tant qu'indicateur de performance
Les programmes de qualité des données qui ne parviennent pas à démontrer leur impact ne survivent pas aux cycles budgétaires. Définissez un petit ensemble d'indicateurs qui relient les performances en matière de qualité aux résultats de l'entreprise, et communiquez-les de manière régulière :
- Note globale de qualité — Moyenne pondérée des différents critères pour chaque domaine clé.
- Délai de détection — Délai entre l'apparition d'un problème de qualité et sa détection.
- Délai de résolution — Délai entre la détection du problème et la confirmation de sa résolution.
- Taux d'incidents liés à la qualité — Combien de défaillances en aval (rapports erronés, pipelines défaillants, mauvaises décisions) sont imputables à des problèmes de qualité des données par trimestre ?
- Couverture — Quel pourcentage des ressources de données critiques dispose de seuils de qualité définis et fait l’objet d’une surveillance active ?
La communication de ces indicateurs aux responsables des données et aux promoteurs stratégiques fait passer la qualité des données du simple domaine de l'ingénierie à celui de la gouvernance avec une responsabilité clairement définie.
Résumé
Dans un gouvernance , la qualité des données ne se résume pas à un projet ponctuel de mise en conformité. Il s'agit d'une discipline opérationnelle permanente qui repose sur des normes claires, une répartition des responsabilités, un suivi automatisé et une amélioration continue.
Les organisations qui y parviennent considèrent la qualité comme une caractéristique inhérente à chaque ensemble de données : elle est définie dès l'intégration, surveillée en permanence, garantie par des règles et évaluée en tant que résultat commercial. Il en résulte des données que les équipes en aval — analystes, systèmes d'IA, responsables de la conformité — peuvent exploiter sans avoir à vérifier au préalable si elles sont fiables.
Pour en savoir plus sur les principes fondamentaux gouvernance métadonnées , qui permettent de garantir la qualité des données, consultez leGuide d'entreprise sur gouvernance des donnéeset leGuide d'entreprise sur métadonnées .