La qualité des données mesure dans quelle mesure celles-ci répondent aux normes requises pour l'usage auquel elles sont destinées — qu'il s'agisse de prendre une décision commerciale, de générer un rapport réglementaire, apprentissage modèle d'IA ou de servir un client.
Des données de haute qualité sont précises, complètes, cohérentes, actualisées, valides et uniques. On estime que les données de mauvaise qualité coûtent aux entreprises en moyenne entre 12 et 15 millions de dollars par an, en raison d'inefficacités opérationnelles, de mauvaises décisions, d'échecs de projets et de sanctions liées au non-respect des réglementations.
Ce guide explique ce qu'est la qualité des données, présente les six dimensions utilisées pour la mesurer, décrit le fonctionnement de la gestion de la qualité, précise qui en est responsable, explique ses liens avec gouvernance des données gouvernance l'intelligence artificielle, et indique comment mettre en place un programme visant à l'améliorer de manière systématique.
Qu'est-ce que la qualité des données ?
La qualité des données correspond au degré d'adéquation des données à l'usage auquel elles sont destinées. Un jeu de données haute qualité pour un usage jeu de données peut s'avérer insuffisant pour un autre. Des fiches clients suffisamment précises pour la facturation peuvent ne pas répondre aux exigences d'exhaustivité requises pour un modèle prédictif de désabonnement. Des données sur les transactions financières suffisantes pour le reporting interne peuvent ne pas répondre aux exigences de traçabilité et de précision requises pour une déclaration réglementaire.
La qualité n'est pas une caractéristique unique : c'est un ensemble composé de six dimensions mesurables, dont chacune revêt une importance différente selon le cas d'usage.
Les six dimensions de la qualité des données
| Dimension | Définition | Exemple d'échec | Comment cela est-il mesuré ? |
|---|---|---|---|
| Précision | Les données reflètent fidèlement la valeur réelle qu'elles décrivent | L'adresse d'un client est enregistrée comme ancienne adresse après son déménagement. | Comparaison avec les systèmes de référence ; taux d'erreur par champ |
| Complétude | Tous les champs obligatoires contiennent des valeurs non nulles et non vides. | 15 % des fiches clients ne comportent pas d'adresse e-mail | Taux de valeurs nulles et taux de valeurs manquantes par champ obligatoire |
| cohérence | Une même valeur est représentée de manière identique dans tous les systèmes où elle apparaît | Les statuts « Actif » dans le CRM et « A » dans le système de facturation désignent tous deux un client actif, mais les systèmes ne s'accordent pas sur le nombre de clients concernés. | Comparaison inter-systèmes des champs partagés |
| Rapidité d'exécution | Les données sont à jour et disponibles dès qu'on en a besoin pour l'usage auquel elles sont destinées | Les données d'inventaire d'hier servent à honorer les commandes d'aujourd'hui | Âge des données au moment de leur utilisation ; latence de mise à jour par rapport SLA |
| Validité | Les données sont conformes aux formats, plages et règles métier définis | Un champ de date contient « 13/2026 », ce qui n'est pas un format de date valide. | Taux de conformité aux règles de validation définies |
| Unicité | Chaque entité du monde réel est représentée exactement une fois, sans doublon. | Ce même client apparaît 47 fois dans le CRM avec des orthographes légèrement différentes de son nom. | Taux de détection des doublons ; taux de correspondance de la résolution d'entités |
Tout programme de qualité des données doit définir des seuils acceptables pour chaque dimension, par domaine de données. Un jeu de données relatif aux transactions financières jeu de données , par exemple, exiger une précision de 99,9 % et une exhaustivité de 100 % pour les champs obligatoires. Une liste de contacts marketing peut, quant à elle, tolérer des taux de valeurs nulles plus élevés pour les champs facultatifs. Les seuils définis par domaine permettent de mesurer et de certifier la qualité.
Pourquoi la qualité des données est-elle importante ?
prise de décision: La fiabilité de toute décision commerciale dépend de celle des données sur lesquelles elle repose. Des prévisions fondées sur des données de vente inexactes donnent lieu à des projections erronées. Les campagnes marketing ciblées à partir de données clients incomplètes passent à côté de certains segments de clientèle. L’optimisation des opérations sur la base de données de stock obsolètes entraîne des défaillances dans l’exécution des commandes. La qualité des données n’est pas un simple enjeu technique : c’est un enjeu de performance commerciale.
Conformité réglementaire : le RGPD, la loi HIPAA, la loi SOX, la norme BCBS 239 et la loi CCPA imposent toutes des exigences en matière d’exactitude et d’exhaustivité des données. La norme BCBS 239 impose aux banques de démontrer que leurs données de risque sont exactes et exhaustives. La loi HIPAA exige que les dossiers médicaux des patients soient exacts et à jour. La loi SOX exige que les données des rapports financiers soient fiables et traçables. Les manquements à la conformité dus à une mauvaise qualité des données entraînent des sanctions, un risque de poursuites judiciaires et une atteinte à la réputation.
IA et apprentissage automatique : Les modèles d’IA apprennent à partir de apprentissage . apprentissage inexactes, incomplètes ou incohérentes produisent des modèles qui génèrent des prédictions erronées. détection des fraudes entraîné sur des données comportant 20 % de transactions en double apprend à reconnaître des schémas qui n’existent pas. Un modèle de recommandation entraîné sur des données de produits obsolètes propose des articles en rupture de stock. La qualité des données est le fondement d’une IA fiable.
Efficacité opérationnelle : Une mauvaise qualité des données entraîne des tâches supplémentaires : les ingénieurs doivent réparer des pipelines qui tombent en panne à cause de valeurs nulles inattendues, les analystes doivent relancer des rapports après avoir découvert des erreurs à la source, et les équipes du service client doivent corriger des erreurs de facturation causées par des enregistrements incohérents. Gartner estime que la mauvaise qualité des données coûte en moyenne 15 millions de dollars par an aux entreprises. La majeure partie de ce coût est invisible : elle est Embarqué temps que les collaborateurs passent à contourner des données auxquelles ils ne font pas confiance.
expérience client: Les doublons dans les fiches clients entraînent des communications redondantes. Des données d'adresse inexactes sont à l'origine d'échecs de livraison. Des données de préférences obsolètes génèrent des recommandations non pertinentes. expérience client d'une entreprise est déterminée par la qualité des données en amont.
Pour assurer une surveillance continue de l'intégrité des données tout au long des pipelines, consultez notre guide sur observabilité des données.
Comment mesure-t-on la qualité des données ?
Pour évaluer la qualité, il faut définir ce que l'on entend par « bonne qualité » dans chaque domaine avant de procéder à la mesure. Le processus d'évaluation comporte quatre éléments.
Profilage des données : Analyse automatisée des ressources de données afin d'évaluer leurs caractéristiques de qualité actuelles : taux de valeurs nulles, distributions des valeurs, modèles de format, taux de doublons et intégrité référentielle. Le profilage établit une base de référence et identifie les lacunes en matière de qualité sans nécessiter d'inspection manuelle.
Règles de validation :règles métierqui définissent les caractéristiques des données valides pour chaque champ : plages de valeurs acceptables, formats requis, contraintes référentielles et dépendances entre champs. Les règles de validation sont appliquées en continu aux données entrantes et stockées, et signalent les enregistrements non conformes.
Évaluation de la qualité : Agrégation des résultats de profilage et des résultats de validation en un score de qualité unique par ressource. Les scores permettent de comparer la qualité entre les ressources et au fil du temps. Un jeu de données un score de qualité de 94 % est plus fiable qu’un autre noté à 71 %, et un jeu de données le score est passé de 94 % à 87 % en deux semaines indique un problème de qualité au niveau du pipeline ou de la source qui nécessite une analyse.
Surveillance de la qualité et alertes : Surveillance continue des scores de qualité avec des alertes automatisées lorsque les scores descendent en dessous de seuils définis ou lorsque des anomalies apparaissent : baisses inattendues du nombre de lignes, augmentations soudaines du taux de valeurs nulles, modifications de schéma qui enfreignent les règles de validation. La surveillance détecte les problèmes de qualité avant qu’ils n’atteignent les rapports de production ou apprentissage des modèles.
Les scores de qualité constituent l'un des principaux indicateurs d'évaluation dans découverte de données. Les utilisateurs qui cherchent à déterminer si un jeu de données adapté à leur cas d'usage sur les résultats de profilage et les critères de qualité mis en avant dans le catalogue. Pour les définitions de la qualité et des autres concepts qui garantissent la fiabilité de la découverte, consultezdécouverte de données .
Le coût d'une mauvaise qualité des données
Les entreprises mesurent rarement directement le coût d'une mauvaise qualité des données, ce qui explique pourquoi ce problème persiste. Ces coûts sont répartis entre les différentes équipes et les différents budgets d'une manière qui masque la cause profonde du problème.
| Catégorie de coûts | Comment une mauvaise qualité des données en est la cause |
|---|---|
| Révision technique | Les pipelines tombent en panne en raison de valeurs nulles inattendues, de violations de format ou de violations de l'intégrité référentielle. Les ingénieurs passent leur temps à déboguer et à corriger des problèmes plutôt qu'à développer. |
| Révision par un analyste | Les rapports sont réexécutés dès que des problèmes de qualité sont détectés dans les données sources. Les analystes passent alors leur temps à valider les données plutôt qu'à les analyser. |
| Mauvaises décisions | Les stratégies fondées sur des données inexactes conduisent à des résultats erronés : objectifs de chiffre d'affaires non atteints, surstock, échecs de lancements de produits. |
| Sanctions pour non-respect des obligations réglementaires | Les infractions au RGPD, à la loi HIPAA et à la loi SOX résultant de données inexactes ou incomplètes entraînent des sanctions financières directes. |
| Taux de désabonnement | Les communications en double, les erreurs de facturation et les livraisons non abouties dues à une mauvaise qualité des données nuisent aux relations avec la clientèle. |
| Défaillances de l'IA | Les modèles entraînés à partir de données de mauvaise qualité génèrent des prévisions peu fiables, ce qui nécessite un réentraînement coûteux et retarde déploiement. |
| Préparation de l'audit | La reconstitution manuelle des éléments attestant de la qualité des données dans le cadre des audits mobilise plusieurs semaines de travail de l'équipe chargée de la conformité lorsque les enregistrements relatifs à la qualité ne sont pas mis à jour automatiquement. |
Qui est responsable de la qualité des données ?
La qualité des données relève d'une responsabilité partagée, répartie entre différents rôles assortis de responsabilités distinctes.
| Fonction | Responsabilité | Responsabilité au quotidien |
|---|---|---|
| Propriétaire des données | Responsabilité ultime de l'entreprise en matière de qualité dans son domaine d'activité | Définit les normes de qualité pour le domaine, approuve les critères de certification et soutient la gestion responsable |
| Responsable des données | Gestion de la qualité opérationnelle au sein du domaine | Surveille les scores de qualité, résout les problèmes signalés, certifie les ressources qui respectent les seuils, gère les exceptions |
| Ingénieur de données | Infrastructure de qualité technique | Intègre des contrôles de qualité dans les pipelines, met en œuvre des règles de validation et exécute des mesures correctives techniques |
| gouvernance des données | Normes de qualité à l'échelle de l'organisation | Définit les critères de qualité et les seuils applicables à l'ensemble des domaines, et assure le suivi de la bonne marche du programme |
| Analyste de données | Utilisation responsable des ressources évaluées en termes de qualité | Signale les problèmes de qualité rencontrés lors des travaux d'analyse et utilise des ressources certifiées pour l'établissement des rapports de production |
| CDO | Responsabilité de la direction en matière de qualité des données | Analyse les indicateurs de qualité, affecte les ressources nécessaires pour remédier aux défaillances persistantes en matière de qualité et rend compte à la direction de l'état de la qualité des données |
L'erreur la plus courante dans les programmes de qualité des données consiste à considérer la qualité comme une responsabilité purement technique incombant à l'ingénierie des données. Les ingénieurs peuvent mettre en place des contrôles de qualité et résoudre les problèmes techniques, mais ils ne peuvent pas définir ce que signifie « exact » dans un domaine métier, certifier qu'un jeu de données adapté à un objectif métier spécifique, ni résoudre les incohérences de définition entre différents domaines. Ces tâches nécessitent une appropriation métier et une responsabilité en matière de gestion.
Les six étapes de la gestion de la qualité des données
1. Évaluer
Réalisez une analyse détaillée de chaque ensemble de données concerné afin d'établir un niveau de référence en matière de qualité selon les six dimensions. Identifiez les domaines présentant le risque opérationnel ou l'exposition réglementaire le plus élevé et fixez en priorité des seuils de qualité pour ces domaines.
2. Définir des normes
Rédigez les normes de qualité applicables à chaque domaine prioritaire : les seuils acceptables pour chaque dimension, les règles de validation qui garantissent leur respect, ainsi que les critères de certification qui garantissent qu’une donnée est suffisamment fiable pour être utilisée dans le reporting de production et apprentissage en IA.
3. Assurer une surveillance continue
Mettez en place un système automatisé de surveillance de la qualité qui vérifie en permanence la conformité de chaque ressource par rapport aux normes définies. Configurez des alertes en cas de dépassement des seuils ou d'anomalies. Intégrez la surveillance aux processus de gestion afin que les problèmes soient automatiquement transmis à la personne compétente, plutôt que de rester bloqués dans un tableau de bord de surveillance tableau de bord personne n'y donne suite.
4. Remédier au problème
Résolvez les problèmes de qualité à la source dans la mesure du possible. Le nettoyage en aval — c'est-à-dire la correction des données après leur entrée dans l'entrepôt — ne fait que traiter les symptômes plutôt que les causes et engendre une charge de maintenance permanente. Lorsque la correction à la source n'est pas immédiatement possible, mettez en place des contrôles en aval qui empêchent les données de mauvaise qualité d'atteindre les rapports de production ou les pipelines d'IA.
5. Certifier
Attribuer le statut « certifié » aux ressources qui répondent aux critères de qualité définis et qui ont été validées par un responsable. Les ressources certifiées apparaissent avec un badge « vérifié » dans le catalogue de données. Les utilisateurs font confiance aux ressources certifiées sans qu'une validation indépendante soit nécessaire. La certification est le mécanisme qui traduit la mesure de la qualité en utilisateur .
6. Améliorer
Suivez l'évolution des scores de qualité au fil du temps, par domaine. Identifiez les défaillances de qualité persistantes et traitez leurs causes profondes : problèmes liés au système source, erreurs de logique dans le pipeline, incohérences dans les définitions ou règles de validation manquantes. Communiquez chaque mois les indicateurs de qualité aux gouvernance . Les programmes qui ne parviennent pas à démontrer une amélioration de la qualité au fil du temps ne progressent pas.
La qualité des données par fonction : ce que cela signifie concrètement
Analyste de données : Avant la mise en place de la gestion de la qualité : consacre 30 à 40 % de son temps de travail à rechercher des données, à les valider et à vérifier auprès des ingénieurs que la version trouvée est bien la bonne. Après : effectue une recherche dans le catalogue, vérifie le score de qualité et le statut de certification des ressources candidates, puis utilise celles qui sont certifiées sans avoir à faire appel à ses supérieurs. Le temps consacré à la validation des données passe sous la barre des 10 %.
Ingénieur de données : Avant : détecte les problèmes de qualité des données lorsque les pipelines échouent en production. L'analyse des causes profondes prend des heures. Les corrections sont réactives et souvent incomplètes. Après : des contrôles de qualité sont effectués dans le pipeline avant que les données n'atteignent la production. Les échecs sont automatiquement acheminés vers les workflows de gestion des données. Les ingénieurs traitent les problèmes de manière proactive plutôt que réactive.
Responsable des données : Surveille les scores de qualité de chaque ressource relevant de sa compétence via une interface de catalogue unique. Lorsqu'un score passe en dessous du seuil défini, une alerte est déclenchée et le problème est attribué. Le responsable mène l'enquête, coordonne la correction avec l'ingénieur de données, puis résout le problème ou maintient la ressource hors du statut « certifié » jusqu'à ce que le problème soit résolu.
Responsable de la conformité :Les certifications de qualitéet l'historique des validations sont conservés en tant que gouvernance dans le catalogue de données. Les demandes d'audit portant sur les preuves de qualité sont traitées à partir de ces documents, sans qu'il soit nécessaire de les rassembler manuellement. Les audits BCBS 239, HIPAA et SOX nécessitant une documentation relative à la qualité des données ne prennent plus que quelques heures, au lieu de plusieurs semaines.
Data scientist : jeux de données des notes de qualité, l'historique des validations et le statut de certification. Le data scientist sélectionne jeux de données certifiés jeux de données les notes de qualité dépassent les seuils définis et peut documenter les preuves de leur qualité à des fins de reproductibilité du modèle et de conformité réglementaire, sans travail manuel supplémentaire.
Qualité des données et gouvernance des données
La qualité des données et gouvernance des données gouvernance interdépendantes. gouvernance les normes de qualité, attribue les responsabilités en matière de mise en œuvre de ces normes et élabore les politiques permettant de concrétiser les exigences de qualité. La gestion de la qualité des données met en œuvre ces politiques par le biais du profilage, de la surveillance et des mesures correctives.
| gouvernance | La gestion de la qualité des données est mise en œuvre |
|---|---|
| Normes de qualité et seuils par domaine | Suivi continu par rapport à ces normes |
| Missions de gestion responsable | Résolution des problèmes liés à la qualité opérationnelle et certification |
| Critères de certification | Statut de certification attribué aux actifs qui répondent aux critères |
| Exigences de conformité | Conservation de preuves de qualité à des fins d'audit |
| Responsabilité en matière de propriété des données | Rapports destinés aux propriétaires sur l'état de santé des domaines |
gouvernance dépourvu de gestion de la qualité aboutit à des normes qui ne sont jamais évaluées. Un programme de gestion de la qualité dépourvu gouvernance des indicateurs dont personne ne tient compte, car les responsabilités ne sont pas clairement définies.
Pour en savoir plus sur les contrats de données en tant que mécanisme de garantie de la qualité, consultez notreguide sur les contrats de données.
Qualité des données et IA
La qualité des données est la condition infrastructurelle la plus importante pour garantir la fiabilité de l'IA. Tout problème de qualité des données présent dans apprentissage est repris par le modèle qui s'en sert pour apprendre.
Erreurs de précision dans apprentissage : détection des fraudes entraîné sur des enregistrements de transactions comportant 5 % de codes de catégorie de commerçant inexacts apprend à associer des transactions légitimes à des schémas de fraude. Le modèle signale alors des transactions légitimes comme frauduleuses et ne détecte pas les fraudes réelles.
Défauts d'exhaustivité dans apprentissage : Un modèle de prédiction de la perte de clientèle, entraîné sur des enregistrements dans lesquels 20 % des valeurs du champ « ancienneté » sont nulles, apprend à prédire la perte de clientèle sans disposer de l’un des signaux prédictifs les plus forts. Les performances du modèle sont systématiquement inférieures à ce qu’elles devraient être, et la cause de ce problème reste invisible sans traçabilité remontant jusqu’aux enregistrements relatifs à la qualité apprentissage .
cohérence dans apprentissage : Un modèle de recommandation entraîné sur des données provenant de deux systèmes sources qui définissent différemment la notion de « client actif » apprend simultanément deux modèles contradictoires. Les recommandations destinées aux clients correspondant à l’une des définitions diffèrent systématiquement de celles destinées aux clients correspondant à l’autre, ce qui engendre utilisateur incohérentes qui ne peuvent s’expliquer sans remonter au problème de qualité apprentissage .
Ce qu'exige la qualité des données prêtes pour l'IA : Chaque jeu de données pour apprentissage de l’IA apprentissage être accompagné d’une certification de qualité : des résultats de profilage confirmant les scores de qualité actuels, un historique de validation attestant que les données répondaient aux normes définies au moment de apprentissage, ainsi qu’une validation par un responsable confirmant que les données sont adaptées à l’usage prévu du modèle. Sans cette certification, apprentissage du modèle apprentissage être ni audité, ni reproduit, ni justifié au regard gouvernance de l’IA.
La qualité des données dans les secteurs réglementés
Services financiers : La norme BCBS 239 exige des banques qu'elles démontrent que les données relatives aux risques sont exactes, complètes et traçables depuis leur source jusqu'à leur transmission aux autorités de régulation. Les certifications de qualité obtenues dans le cadre d'un gouvernance permettent de satisfaire à cette exigence de manière continue, plutôt que par le biais d'évaluations manuelles périodiques. La loi SOX exige des données de reporting financier fiables, assorties de contrôles qualité documentés.
Santé : La loi HIPAA exige que les dossiers des patients soient exacts et à jour. Des données inexactes sur les patients entraînent des erreurs cliniques, des litiges de facturation et des atteintes à la vie privée. Les programmes de qualité des données dans le secteur de la santé doivent s'appliquer jeux de données contenant des informations médicales protégées (PHI) jeux de données les normes de qualité les plus strictes et en mettant en place un suivi des plus rigoureux.
Produits pharmaceutiques : La norme 21 CFR Partie 11 de la FDA et les réglementations GxP exigent l'intégrité des données cliniques et de fabrication. Les programmes de gestion de la qualité doivent conserver l'historique complet des validations pour toutes les données utilisées dans les dossiers réglementaires, afin de démontrer que les données n'ont pas été modifiées sans justification et que tous les contrôles de qualité ont été validés.
Commerce de détail et commerce en ligne : La qualité des données clients a un impact direct sur le chiffre d'affaires : les doublons dans les enregistrements entraînent des communications redondantes qui nuisent à la confiance envers la marque, les adresses inexactes provoquent des échecs de livraison, et les données de préférences obsolètes génèrent des recommandations non pertinentes. La qualité des données d'inventaire influe sur la gestion des commandes : des données de stock obsolètes entraînent des surventes et la déception des clients.
FAQ
La qualité des données correspond à leur capacité à remplir leur fonction. Si vous posez une question aux données et que la réponse est erronée parce que celles-ci sont inexactes, incomplètes, obsolètes ou incohérentes, vous êtes confronté à un problème de qualité des données. Des données de haute qualité vous fournissent des réponses correctes de manière fiable.
Exactitude (les données reflètent fidèlement la réalité), exhaustivité (tous les champs obligatoires sont renseignés), cohérence une même valeur est représentée de manière identique dans tous les systèmes), actualité (les données sont à jour au moment où elles sont nécessaires), validité (les données respectent les formats et les règles définis) et unicité (chaque entité du monde réel est représentée exactement une fois, sans doublon).
Les causes les plus courantes sont les suivantes : erreurs de saisie manuelle des données, migrations de systèmes entraînant une transformation incorrecte des données, modifications de schéma qui enfreignent les règles de validation existantes, échecs d'intégration entraînant une synchronisation incorrecte des enregistrements, définitions incohérentes entre les systèmes (deux systèmes définissent différemment la notion de « client actif ») et l'absence de règles de validation permettant de détecter les erreurs avant leur entrée dans le système.
La gestion de la qualité des données (DQM) consiste à mesurer, surveiller, corriger et améliorer de manière systématique la qualité des données à l'échelle de l'organisation. Elle englobe les processus, les outils, les rôles et les normes qui garantissent la fiabilité des données au fil du temps. L'objectif de la DQM n'est pas seulement de résoudre les problèmes de qualité lorsqu'ils surviennent, mais aussi de les prévenir grâce à une surveillance proactive et à des mesures correctives à la source.
gouvernance des données gouvernance les normes de qualité, attribue les responsabilités quant à leur application et élabore les politiques permettant de mettre en œuvre les exigences de qualité. La gestion de la qualité des données assure le respect de ces normes par le biais du profilage, de la surveillance et des mesures correctives. gouvernance gestion de la qualité aboutit à des normes qui ne sont jamais évaluées. Une gestion de la qualité sans gouvernance des indicateurs qui ne donnent lieu à aucune action.
Grâce à quatre mécanismes : le profilage des données (analyse automatisée visant à évaluer les caractéristiques de qualité actuelles), les règles de validation (règles métier définissant les critères de validité des données), la notation de la qualité (agrégation des résultats du profilage et de la validation en un score unique par élément) et la surveillance continue (alertes automatisées lorsque les scores descendent en dessous des seuils définis ou que des anomalies apparaissent).
Une représentation chiffrée du degré de conformité d’un ensemble de données aux normes de qualité qui lui sont définies, généralement exprimée en pourcentage. Un score de 95 % signifie que l’ensemble de données satisfait à 95 % des contrôles de qualité qui lui sont imposés. Les scores permettent de comparer la qualité entre les différents ensembles de données et au fil du temps, et servent de base aux décisions de certification : les ensembles de données dont le score dépasse un seuil défini peuvent prétendre au statut de « certifié ».
La certification des données est le processus formel consistant à marquer un ensemble de données comme étant approuvé pour utilisation après qu’il a satisfait à des seuils de qualité définis et fait l’objet d’un examen par un responsable des données. Les ensembles certifiés apparaissent accompagnés d’un badge « vérifié » dans le catalogue de données. Les utilisateurs font confiance aux ensembles certifiés sans qu’une validation indépendante soit nécessaire, ce qui confère aux programmes de qualité des données une valeur opérationnelle réelle, au-delà d’une simple conformité bureaucratique.
Les modèles d'IA héritent de tous les problèmes liés à la qualité des données présentes dans leurs apprentissage . apprentissage inexactes produisent des modèles qui apprennent des schémas erronés. apprentissage incomplètes produisent des modèles qui ne détectent pas certains signaux prédictifs. apprentissage incohérentes produisent des modèles dont le comportement est incohérent. La certification de la qualité des données pourjeux de données apprentissage de l'IAjeux de données l'exigence infrastructurelle qui garantit la fiabilité des résultats de l'IA et la validité gouvernance de l'IA.
Le retour sur investissement (ROI) résulte de la réduction des retouches techniques, de la diminution du nombre de mauvaises décisions, de la baisse du risque de sanctions liées à la conformité, d’une préparation plus rapide aux audits et d’une fiabilité accrue des modèles d’IA. Gartner estime qu’une mauvaise qualité des données coûte en moyenne 15 millions de dollars par an aux entreprises. Un programme de gestion de la qualité qui réduit de 50 % la fréquence et la gravité des défaillances en matière de qualité génère un retour sur investissement substantiel, même en cas d’investissement important dans ce programme.