Qu'est-ce que la qualité des données ?

Qu'est-ce que la qualité des données ?

La qualité des données mesure dans quelle mesure celles-ci répondent aux normes requises pour l'usage auquel elles sont destinées. Des données suffisamment précises pour un usage donné peuvent s'avérer insuffisantes pour un autre. Des fiches clients suffisamment précises pour la facturation peuvent ne pas répondre aux exigences d'exhaustivité requises pour un modèle prédictif de désabonnement. Des données financières suffisantes pour le reporting interne peuvent ne pas répondre aux exigences de traçabilité et de précision requises pour une déclaration réglementaire.

La qualité n'est pas une caractéristique unique. Elle résulte de la combinaison de six dimensions mesurables, dont l'importance varie en fonction du cas d'usage du domaine.


Définition de la qualité des données

La qualité des données correspond au degré d'adéquation des données à l'usage auquel elles sont destinées, selon six critères : l'exactitude, l'exhaustivité, cohérence, l'actualité, la validité et l'unicité.

Des données de haute qualité permettent des analyses fiables, une IA digne de confiance et des rapports réglementaires solides. Des données de mauvaise qualité entraînent des décisions erronées, des pipelines défaillants, des sanctions pour non-conformité et des modèles d'IA qui apprennent des schémas incorrects à partir de apprentissage défectueuses.


Les six dimensions de la qualité des données

Dimension Définition Exemple de défaillance
Précision Les données reflètent fidèlement la valeur réelle qu'elles décrivent L'adresse d'un client correspond à son ancienne adresse, celle qu'il avait avant son déménagement il y a deux ans.
Complétude Tous les champs obligatoires sont renseignés avec des valeurs significatives et non nulles. 18 % des fiches clients ne comportent pas d'adresse e-mail
cohérence Une même valeur est représentée de manière identique dans tous les systèmes où elle apparaît. Le terme « client actif » désigne un client présent depuis 90 jours dans le CRM et depuis 180 jours dans le système financier — les rapports inter-systèmes ne concordent pas
Rapidité d'exécution Les données sont à jour et disponibles au moment où elles sont nécessaires pour l'usage auquel elles sont destinées. Les données d'inventaire d'hier servent à honorer les commandes d'aujourd'hui, ce qui entraîne une survente
Validité Les données sont conformes aux formats, plages et règles métier définis Un champ de date contient « 13/2026 » — ce n'est pas une date valide, quel que soit le format standard utilisé.
Unicité Chaque entité du monde réel est représentée exactement une fois, sans doublon. Ce même client apparaît 23 fois dans le CRM avec des orthographes légèrement différentes de son nom.

Tout programme de qualité des données doit définir des seuils acceptables pour chaque dimension, par domaine. Un jeu de données sur les transactions financières jeu de données par exemple exiger une précision de 99,9 % et une exhaustivité de 100 % pour les champs obligatoires. Une liste de contacts marketing peut, quant à elle, tolérer des taux de valeurs nulles plus élevés pour les champs facultatifs. Les seuils définis par domaine permettent de mesurer et de certifier la qualité.


Pourquoi la qualité des données est-elle importante ?

Décisions : La fiabilité de toute décision commerciale dépend de celle des données sur lesquelles elle repose. Une prévision des ventes fondée sur des données de pipeline inexactes aboutit à une projection erronée. Un Chaîne d'approvisionnement basé sur des données de stock obsolètes entraîne des défaillances dans l'exécution des commandes. La qualité des données est un enjeu de performance commerciale, et non un enjeu technique.

Conformité : Le RGPD, la loi HIPAA, la loi SOX et la norme BCBS 239 imposent tous des exigences en matière d’exactitude et d’exhaustivité. La norme BCBS 239 exige des banques qu’elles démontrent que leurs données de risque sont exactes et traçables. La loi HIPAA exige que les dossiers médicaux des patients soient exacts et à jour. La loi SOX exige que les données figurant dans les rapports financiers soient fiables. Les manquements à la conformité dus à une mauvaise qualité des données entraînent des sanctions financières et exposent les entreprises à des risques réglementaires.

IA et apprentissage automatique : Les modèles d’IA apprennent à partir apprentissage . détection des fraudes entraîné sur des enregistrements de transactions comportant 15 % de codes de catégorie de commerçant inexacts apprend des schémas erronés. Un modèle de recommandation entraîné sur des données produit obsolètes propose des articles en rupture de stock. La qualité des données est le fondement qui détermine si les résultats de l’IA sont fiables ou non.

Efficacité opérationnelle : Une mauvaise qualité des données entraîne des tâches supplémentaires : des ingénieurs doivent réparer des pipelines qui tombent en panne à cause de valeurs nulles inattendues, des analystes doivent relancer des rapports après avoir découvert des erreurs à la source, et les équipes du service client doivent corriger des erreurs de facturation. Gartner estime que la mauvaise qualité des données coûte en moyenne 15 millions de dollars par an aux entreprises — dont la majeure partie est invisible, Embarqué temps passé à contourner des données auxquelles personne ne fait confiance.


Qualité des données et concepts connexes

Qualité des données et gestion de la qualité des données : La qualité des données est un état : le degré de conformité des données à des normes définies à un moment donné. La gestion de la qualité des données (DQM) est le programme : l’ensemble des processus, rôles, outils et gouvernance mis en place pour mesurer, surveiller et améliorer cet état au fil du temps. Mesurer la qualité une seule fois ne revient pas à la gérer.

Qualité des données vs gouvernance des données :  gouvernance des données définit les normes de qualité — les seuils, les dimensions et les critères de certification applicables à chaque domaine — et attribue la responsabilité de leur mise en œuvre. La gestion de la qualité des données met en œuvre ces normes par le biais du profilage, de la surveillance et de la correction. gouvernance gestion de la qualité produit des normes qui ne sont jamais évaluées. Une gestion de la qualité sans gouvernance des indicateurs sur lesquels personne n’agit.

Qualité des données vs observabilité des données :  observabilité des données observabilité l'état des pipelines de données en temps réel: elle détecte les anomalies au niveau du nombre de lignes, les modifications de schéma et les changements de distribution. La qualité des données mesure l'exactitude, l'exhaustivité, cohérence, l'actualité, la validité et l'unicité des données elles-mêmes. observabilité les problèmes liés à l'état des pipelines. La mesure de la qualité évalue la pertinence des données produites par le pipeline. Les deux sont complémentaires : observabilité le signal, tandis que la mesure de la qualité en explique la signification.

Qualité des données vs. nettoyage des données: nettoyage des données est un processus réactif : il consiste à détecter et à corriger les problèmes de qualité dans les données existantes. La gestion de la qualité des données est un programme proactif : elle vise à prévenir les problèmes grâce à des règles de validation, à surveiller la qualité en continu et à s'attaquer aux causes profondes à la source. Le nettoyage traite les symptômes. La gestion de la qualité traite les causes.


À quoi ressemble une bonne qualité des données dans la pratique ?

Un analyste de données à la recherche d'un jeu de données sur le chiffre d'affaires : trouve trois ressources candidates dans le catalogue de données. Chacune affiche un score de qualité, un statut de certification, la date et l’heure de la dernière mise à jour, ainsi qu’un historique de validation. Deux d’entre elles sont certifiées au-dessus du seuil défini. L’analyste en sélectionne une et l’utilise sans en référer à l’équipe chargée des données. La preuve de qualité rend inutile toute validation indépendante.

Un ingénieur de données qui prépare une modification de schéma : Vérifie catalogue de données le catalogue de données le score de qualité et la traçabilité de la table en cours de modification. Constate que trois rapports en aval et un pipeline de caractéristiques d'apprentissage automatique dépendent de la colonne concernée par la modification. La coordination des corrections avant la mise en production permet d'éviter les défaillances en production.

Un responsable de la conformité répondant à une demande d'effacement au titre du RGPD : ilextrait enregistrement catalogue enregistrement enregistrement client enregistrement la enregistrement concernée. Cet historique identifie tous les systèmes en aval contenant des données dérivées de cet enregistrement. Les rapports de qualité confirment que la copie des données de chaque système était exacte et à jour au moment de sa dernière utilisation. La suppression est confirmée sur l'ensemble des six systèmes en moins d'une heure.


Comment mesure-t-on la qualité des données ?

Profilage des données :analyse automatisée des ressources de données visant à évaluer leurs caractéristiques de qualité actuelles : taux de valeurs nulles, distributions des valeurs, modèles de format, taux de doublons et intégrité référentielle. Le profilage permet d'établir une base de référence et d'identifier les lacunes existantes.

Règles de validation : Règles métier qui définissent les caractéristiques des données valides pour chaque champ : plages de valeurs acceptables, formats requis, contraintes référentielles et dépendances entre champs. Les règles de validation s’appliquent en continu lors de l’ingestion et sur les données stockées.

Évaluation de la qualité : Regroupement des résultats du profilage et de la validation en un score unique par élément. Les scores permettent de comparer la qualité entre les différents éléments et au fil du temps, et servent de base aux décisions de certification.

Surveillance continue : Surveillance automatisée des scores de qualité, avec des alertes lorsque les scores descendent en dessous de seuils définis ou que des anomalies apparaissent. La surveillance permet de détecter les problèmes de qualité avant qu’ils n’atteignent les rapports de production ou les pipelines d’IA.

FAQ

La qualité des données correspond à leur capacité à remplir leur fonction. Si vous posez une question aux données et que la réponse est erronée parce que celles-ci sont inexactes, incomplètes, obsolètes ou incohérentes, vous êtes confronté à un problème de qualité des données. Des données de haute qualité vous fournissent des réponses correctes de manière fiable.

Exactitude, exhaustivité, cohérence, actualité, validité et unicité. La plupart frameworks en matière de qualité des données frameworks ces six dimensions. Certains y ajoutent l'intégrité ( cohérence référentielle cohérence jeux de données liés) et la conformité (respect d'une norme ou d'un schéma défini) en tant que dimensions supplémentaires, selon le domaine concerné.

Les causes les plus courantes sont les suivantes : la saisie manuelle de données sans validation ; les intégrations système qui chargent des enregistrements sans déduplication ni normalisation du format ; les modifications de schéma qui enfreignent les règles de validation existantes ; les pipelines par lots dont la latence dépasse les exigences de fraîcheur des cas d'utilisation en aval ; et l'absence d'un glossaire métier réglementé, ce qui entraîne des définitions différentes d'un même concept d'un système à l'autre.

Représentation chiffrée du degré de conformité d'un ensemble de données aux normes de qualité qui lui sont applicables, généralement exprimée en pourcentage. Un score de 96 % signifie que l'ensemble de données satisfait à 96 % des contrôles de qualité définis. Les scores permettent de comparer la qualité entre les différents ensembles de données et au fil du temps, et servent de base aux décisions de certification.

Processus formel consistant à marquer un ensemble de données comme « approuvé pour utilisation » après qu’il a satisfait à des critères de qualité définis et fait l’objet d’un examen par un responsable des données. Les ensembles certifiés apparaissent accompagnés d’un badge « vérifié » dans le catalogue de données. Les utilisateurs font confiance aux ensembles certifiés sans qu’une validation indépendante soit nécessaire — c’est ce qui confère aux programmes de qualité des données leur valeur opérationnelle.

Les modèles d'IA héritent de tous les problèmes de qualité présents dans leurs apprentissage . Des données inexactes enseignent aux modèles des schémas erronés. Des données incomplètes font que les modèles passent à côté de signaux prédictifs. Des données incohérentes conduisent les modèles à apprendre des schémas contradictoires à partir de définitions sources différentes. La certification de la qualité des données pourjeux de données apprentissage de l'IAjeux de données l'exigence infrastructurelle qui rend les résultats de l'IA fiables et gouvernance de l'IA défendables.

L'exactitude est l'une des six dimensions de la qualité des données. Elle permet de déterminer si les données reflètent correctement la réalité qu'elles décrivent. La qualité des données est un concept plus large qui englobe l'exactitude, mais aussi l'exhaustivité, cohérence, l'actualité, la validité et l'unicité. Un jeu de données être exact mais incomplet, ou exact et complet mais obsolète : la qualité des données évalue ces six dimensions dans leur ensemble.

La responsabilité est partagée. Les propriétaires des données assument la responsabilité opérationnelle finale de la qualité des données de leur domaine. Les gestionnaires de données assurent la gestion opérationnelle quotidienne de la qualité : suivi des scores, résolution des incidents et certification des actifs. Les ingénieurs de données développent et maintiennent l’infrastructure technique qui mesure et garantit le respect des normes de qualité. Le CDO ou gouvernance définit les normes de qualité à l’échelle de l’organisation et assure le suivi de la bonne santé du programme.