Problèmes liés à la qualité des données : 6 solutions pour les grandes entreprises
La mauvaise qualité des données coûterait aux entreprises américaines environ 3 100 milliards de dollars par an. Pour les entreprises individuelles, Gartner estime le coût annuel moyen lié aux données erronées entre 12 et 15 millions de dollars — un chiffre qui sous-estime l’impact réel, car la plupart des coûts liés à la qualité des données sont invisibles, Embarqué le temps que les équipes passent à contourner des données auxquelles elles ne font pas confiance.
Les problèmes liés à la qualité des données d'entreprise suivent des schémas reconnaissables. Les six mêmes problèmes reviennent systématiquement dans tous les secteurs d'activité, et chacun d'entre eux dispose d'un ensemble de solutions éprouvées. Ce guide aborde les six problèmes les plus courants en matière de qualité des données, explique leurs causes, évalue leur coût et propose des solutions pour y remédier à grande échelle.
Les six problèmes les plus courants liés à la qualité des données
| Problème | Ce que cela signifie | Cause principale | Impact sur les activités |
|---|---|---|---|
| Enregistrements en double | Une même entité du monde réel apparaît plusieurs fois dans un jeu de données | Points de saisie multiples, intégrations système défaillantes, absence de déduplication lors de l'ingestion | Communications en double, indicateurs gonflés, erreurs de facturation, manquements à la conformité |
| Données incomplètes | Des champs obligatoires sont manquants ou vides | Conception des champs facultatifs, défaillances du système source, erreurs de migration, absence de validation des champs obligatoires | Analyses défaillantes, règles de validation qui ne fonctionnent pas, apprentissage des modèles d'apprentissage automatique peu fiable |
| Données inexactes | Les valeurs des données ne reflètent pas correctement la réalité qu'elles décrivent. | Erreurs de saisie manuelle, enregistrements obsolètes, migrations de systèmes entraînant une transformation incorrecte des données | Décisions erronées, sanctions réglementaires, expérience client |
| Données incohérentes | Un même concept est représenté différemment selon les systèmes | Absence de glossaire métier harmonisé, en silo avec des définitions disparates, logique ETL incohérente | Divergences dans les rapports entre les différents systèmes, résultats analytiques contradictoires, gouvernance défaillances |
| Données obsolètes | Les données ne sont pas actualisées assez fréquemment pour l'usage auquel elles sont destinées. | Latence élevée dans le pipeline, cycles de mise à jour exclusivement par lots, absence SLA | Décisions fondées sur des informations obsolètes, défaillances dans l'exécution des commandes, dérive des modèles d'IA |
| Données non valides | Les données ne respectent pas les formats, les plages ou les règles métier définis | Absence de validation des données à la source, modifications du schéma qui enfreignent les règles existantes, conception défaillante de l'intégration | Défaillances des pipelines, erreurs au niveau des systèmes en aval, dépôts de documents réglementaires incorrects |
Problème n° 1 : enregistrements en double
Pourquoi cela se produit-il ?
Les doublons s'accumulent lorsque les données parviennent à une organisation par plusieurs canaux — formulaires Web, importations depuis un CRM, saisie manuelle, intégrations système — sans contrôle de déduplication au moment de leur ingestion. Un client qui contacte support trois canaux différents peut se retrouver sous la forme de trois enregistrements présentant de légères différences au niveau de l'orthographe du nom, de la capitalisation de l'adresse e-mail ou du format du numéro de téléphone. Chaque enregistrement suffisamment distinct pour passer un simple contrôle de correspondance exacte.
Les migrations de systèmes aggravent le problème. Lorsque deux systèmes sont fusionnés, les enregistrements des deux systèmes sont chargés dans le système cible sans résolution des entités, ce qui double ou triple le nombre de doublons existants.
Combien ça coûte ?
Pour une entreprise de vente au détail disposant de 5 millions de fiches clients et présentant un taux de doublons de 15 %, 750 000 fiches sont des doublons. Si 10 % de ces doublons reçoivent des communications marketing en double, à raison de 2 dollars par communication, cela représente 150 000 dollars de dépenses marketing gaspillées par campagne. Si l'on multiplie ce chiffre par la fréquence des campagnes et que l'on ajoute l'atteinte à l'image de marque causée par les clients qui reçoivent trois fois le même e-mail, le coût devient considérable.
Dans les environnements réglementés, les enregistrements en double constituent un risque en matière de conformité. Une demande d'effacement au titre du RGPD qui supprime un enregistrement trois laisse deux copies des données à caractère personnel dans le système, ce qui constitue une infraction.
Solution : déduplication automatisée et résolution des entités
Au moment de la saisie : Mettez en place une comparaison approximative au moment de la saisie et de l’intégration des données afin de détecter les enregistrements quasi-duplicatas avant qu’ils n’entrent dans le système. La comparaison approximative compare les noms, adresses, adresses e-mail et numéros de téléphone à l’aide d’algorithmes de similarité plutôt que par correspondance exacte de chaînes de caractères, ce qui permet de repérer « John Smith » et « Jon Smyth » comme des duplicatas potentiels.
Dans les données existantes :effectuezune résolution d'entités sur l'ensemble des enregistrements historiques afin d'identifier et de fusionner les doublons. La résolution d'entités utilise des modèles d'apprentissage automatique entraînés sur des paires de doublons connues pour évaluer la probabilité que deux enregistrements correspondent à la même entité du monde réel. Les enregistrements dont le score de confiance dépasse un certain seuil sont fusionnés automatiquement ; ceux dont le score se situe dans une fourchette d'incertitude sont transmis pour être examinés par un opérateur.
En cours : Mettre en place une gestion des données qui gère un enregistrement de référence unique enregistrement chaque entité — client, produit, fournisseur, employé — et achemine toutes les mises à jour via cet enregistrement que de laisser s'accumuler des copies parallèles.
Prévention :ajoutezdes règles de validation de l'unicité aux pipelines d'ingestion afin de comparer les nouveaux enregistrements à la base de données existante avant de les valider. Acheminez les doublons potentiels vers un workflow de gestion des données workflow que de créer enregistrement un nouvel enregistrement .
Problème n° 2 : données incomplètes
Pourquoi cela se produit-il ?
Les données incomplètes ont deux causes principales : la conception de champs facultatifs et les défaillances dans l'application des règles.
La conception de champs facultatifs signifie que les champs importants pour les cas d'utilisation en aval ont été rendus facultatifs dans le système source, car ils n'étaient pas obligatoires au moment de la collecte des données. Un formulaire de prospect qui ne demande pas de champ « taille de l'entreprise » génère un CRM rempli de prospects sans information sur la taille de leur entreprise — ce qui rend impossible toute segmentation dépendant de ce champ.
On parle de « défaillances de validation » lorsque les champs obligatoires sont techniquement validés, mais que cette validation est contournée : par exemple, la saisie d’un « 999 » ou d’un « N/A » dans un champ numérique obligatoire, l’insertion d’une date par défaut (le 1er janvier 1900) en l’absence de date, ou l’utilisation d’une adresse e-mail fictive pour passer la validation. Ces enregistrements semblent complets, mais les valeurs des champs n’ont aucun sens.
Combien ça coûte ?
Des données incomplètes faussent les analyses sans que l'on s'en aperçoive. Un modèle de valeur vie client qui exclut les 20 % d'enregistrements pour lesquels la durée de fidélité est inconnue sous-estime systématiquement la valeur vie client d'un segment spécifique de clientèle — celui qui ne fournit pas cette information. Le modèle semble correct puisqu'il produit des chiffres, mais ces chiffres sont erronés d'une manière difficile à détecter sans examinerla qualité des données apprentissage .
Dans le secteur de la santé, les dossiers médicaux incomplets sont à l'origine d'erreurs cliniques. Un enregistrement médical enregistrement rubrique « allergies » ne constitue pas simplement un enregistrement incomplet enregistrement il représente un risque pour la sécurité du patient.
Solution : contrôle de l'exhaustivité, règles de validation et correction au niveau du code source
Suivi de l'exhaustivité :analysez en continuchaque jeu de données mesurer le taux de valeurs nulles et le taux de valeurs manquantes pour chaque champ. Suivez l'évolution de ces tendances dans le temps. Un champ dont le taux d'exhaustivité passe de 98 % à 85 % en deux semaines indique un changement au niveau du système source ou une défaillance du pipeline qui nécessite une analyse immédiate.
Règles de validation lors de l'ingestion :définissezles exigences d'exhaustivité pour chaque champ considéré comme obligatoire pour les cas d'utilisation en aval et appliquez-les dès l'ingestion. Les enregistrements qui ne satisfont pas aux contrôles d'exhaustivité sont acheminés vers une file d'attente de correction au lieu d'être transférés vers le jeu de données de production.
Correction à la source :dans la mesure dupossible, collaborez avec les responsables des systèmes sources afin de rendre obligatoires les champs dont les systèmes en aval ont besoin. Un champ CRM qui était facultatif peut désormais être rendu obligatoire pour les nouveaux enregistrements. Il n'est peut-être pas possible de combler les lacunes historiques, mais il est toujours possible d'empêcher l'accumulation future d'enregistrements incomplets.
Enrichissement :pourles champs qui ne peuvent pas être rendus obligatoires à la source, utilisez des services d'enrichissement des données afin de combler les lacunes à partir de sources externes faisant autorité. Les champs relatifs à l'adresse peuvent être enrichis à partir des bases de données des services postaux. Les champs relatifs aux entreprises peuvent être enrichis à partir de bases de données firmographiques.
Problème n° 3 : données inexactes
Pourquoi cela se produit-il ?
L'inexactitude des données a trois causes principales.
Erreurs de saisie manuelle surviennent lorsque des personnes saisissent des données : fautes de frappe, inversions, affectations incorrectes de champs et erreurs de copier-coller qui introduisent des valeurs provenant d'enregistrements adjacents.
Données obsolètes s'accumulent lorsque les données ne sont pas mises à jour après des changements survenus dans la réalité : un client qui a déménagé il y a deux ans figure toujours avec son ancienne adresse dans le système, un fournisseur dont les coordonnées ont changé a un interlocuteur principal erroné, un produit dont la classification réglementaire a changé est toujours associé à l'ancienne classification.
Erreurs de migration surviennent lorsque des données sont transférées d'un système à un autre et que la logique de transformation introduit des inexactitudes : des mappages de champs incorrects, des conversions de format entraînant une perte de précision ou des changements de type de données entraînant le tronquage de valeurs.
Combien ça coûte ?
Une seule erreur dans un champ d'un dossier réglementaire peut invalider un rapport dont l'élaboration a pris plusieurs semaines. Une institution financière qui soumet un rapport sur les risques contenant des données inexactes relatives à l'exposition s'expose à un contrôle réglementaire, à d'éventuelles sanctions et à un problème de crédibilité auprès de l'autorité de régulation qui persistera au-delà de l'incident lui-même.
Dans les activités en contact avec la clientèle, les données inexactes nuisent à expérience client. Un patient recevant une facture à son nom mais à une ancienne adresse, un client recevant un e-mail personnalisé contenant une recommandation de produit erronée, une livraison acheminée vers une adresse obsolète : chacun de ces cas constitue un manquement à l'exactitude des données ayant un impact direct sur le client.
Solution : profilage, validation et détection des modifications automatisés
Profilage automatisé analyse jeux de données afin d’identifier les valeurs qui sortent des fourchettes statistiques attendues : un montant de transaction supérieur de 50 écarts-types à la moyenne, une date de naissance impliquant un âge de 150 ans, un code postal qui n’existe pas dans la base de données postale de référence. La détection des valeurs aberrantes met en évidence les données suspectes à soumettre à l’examen d’un responsable, sans nécessiter une inspection manuelle de chaque enregistrement.
Validation intersystèmes compare les valeurs des champs entre les systèmes qui partagent des données afin de détecter les incohérences. Si le CRM indique qu'un client est actif et que le système de facturation le considère comme ayant quitté le service, l'un des deux systèmes est inexact. La validation inter-systèmes détecte ces conflits et les transmet au système enregistrement ils soient résolus.
Détection des modifications et suivi de l'actualité des données suivre la date de la dernière mise à jour des enregistrements et signaler ceux dont les valeurs sont susceptibles d’être obsolètes en fonction du taux de changement attendu pour ce champ. Les champs d’adresse client qui n’ont pas été mis à jour depuis cinq ans ou plus sont susceptibles de faire l’objet d’un enrichissement ou d’une campagne de relance.
Validation au niveau source détecte les erreurs dès la saisie : validation des adresses par recoupement avec les bases de données postales au moment de la saisie dans le CRM, validation du format des numéros de téléphone avant enregistrement , et contrôles d'intégrité référentielle qui vérifient l'existence des enregistrements associés avant enregistrement d'un nouvel enregistrement .
Problème n° 4 : données incohérentes
Pourquoi cela se produit-il ?
L'incohérence est le problème de qualité des données le plus directement lié à gouvernance . Lorsque différents systèmes définissent un même concept de manière différente — par exemple, un « client actif » désigne un acheteur ayant effectué un achat au cours des 90 derniers jours dans le service marketing, mais un acheteur ayant effectué un achat au cours des 180 derniers jours dans le service financier —, chaque rapport inter-systèmes produit des chiffres qui ne concordent pas. Aucun des deux systèmes n'est erroné selon sa propre définition, mais l'entreprise ne peut pas fournir une réponse unique et cohérente à la question « Combien avons-nous de clients actifs ? »
Les incohérences s'accumulent au fil des années, à mesure que les systèmes sont développés de manière indépendante par différentes équipes ayant des exigences différentes, que les acquisitions apportent des données externes avec des définitions divergentes, et que la terminologie évolue de manière disparate d'une unité opérationnelle à l'autre, en l'absence d'une autorité centrale chargée de l'harmoniser.
Combien ça coûte ?
Chaque réunion de direction au cours de laquelle deux équipes présentent des chiffres contradictoires issus de systèmes différents représente un coût direct lié au manque de cohérence des données : le temps passé en réunion à débattre pour déterminer quel chiffre est le bon, l'enquête de suivi visant à les rapprocher, ainsi que l'érosion de la confiance dans prise de décision fondée sur les données prise de décision s'accumule lorsque ce phénomène se répète.
Pour les systèmes d'IA, apprentissage incohérentes sont particulièrement préjudiciables. Un modèle entraîné à partir de données provenant de deux systèmes sources qui définissent la même caractéristique de manière différente apprend des schémas contradictoires, produisant ainsi des résultats incohérents qui ne peuvent être expliqués ni corrigés sans remonter à la source de l'incohérence dans apprentissage .
Solution : glossaire métier réglementé, contrats de données et gestion des données de référence
Glossaire métier réglementé : Définissez chaque terme métier apparaissant dans plusieurs systèmes à l’aide d’une définition unique faisant autorité, associez cette définition aux champs spécifiques de chaque système auquel elle s’applique, désignez un responsable chargé de sa mise à jour et publiez-la dans le catalogue de données toutes les équipes pourront la consulter. Une entrée du glossaire métier pour « Client actif », précisant qu’il s’agit d’« un client ayant effectué un achat au cours des 90 derniers jours, tel que mesuré par le champ order_date de la table des transactions », élimine la source d’incohérence.
Contrats de données : Accords formels entre les producteurs et les consommateurs de données qui précisent le schéma, les définitions des champs et les normes de qualité que le producteur s'engage à respecter. Lorsqu'un producteur modifie la définition d'un champ, le système de contrôle des contrats de données signale la violation avant qu'elle ne se propage aux consommateurs en aval.
Maîtrise gestion des données: Une couche MDM gère un enregistrement de référence unique enregistrement les entités métier clés — clients, produits, fournisseurs — et garantit la cohérence des définitions dans tous les systèmes qui y font référence. Les systèmes qui ont besoin de connaître le statut d’un client requête MDM plutôt que de conserver leur propre copie de enregistrement client.
Problème n° 5 : données obsolètes
Pourquoi cela se produit-il ?
Les données deviennent obsolètes lorsque le délai entre les mises à jour de la source et leur mise à disposition en aval dépasse le délai de mise à jour requis pour l'usage auquel elles sont destinées. Un pipeline par lots quotidien qui actualise les données d'inventaire à 2 h du matin produit des données datant de 23 heures au moment où l'équipe chargée de la préparation des commandes les utilise dans l'après-midi. Dans un environnement d'inventaire à haut débit, des données datant de 23 heures ne sont pas adaptées à la prise de décisions en matière de préparation des commandes.
Le caractère obsolète des données passe souvent inaperçu, car les pipelines s'exécutent correctement et les données semblent à jour — la table a été actualisée pour la dernière fois aujourd'hui —, mais les données sources à partir desquelles elle a été créée dataient elles-mêmes de plusieurs heures, voire de plusieurs jours, au moment de l'exécution du pipeline.
Combien ça coûte ?
Dans le commerce électronique, des données de stock obsolètes entraînent des surventes : les clients commandent des produits qui ne sont pas en stock, car le système de gestion des stocks affiche des quantités qui étaient exactes il y a 18 heures. Chaque survente entraîne une annulation de commande, une intervention du service client et un risque de perte de clientèle.
Dans le secteur des services financiers, l'utilisation de données de marché obsolètes dans les modèles de risque conduit à des calculs de positions qui ne reflètent pas les conditions actuelles du marché. Dans le secteur de la santé, des listes de médicaments obsolètes entraînent des décisions de prescription fondées sur des antécédents thérapeutiques dépassés.
Solution : accords de niveau de service (SLA) relatifs à la fraîcheur des données, surveillance du pipeline et chemins de données en temps réel
Accords de niveau de service (SLA) relatifs à la fraîcheur des données : Définissez l’ancienneté maximale acceptable des données pour chaque jeu de données dans le cadre d’opérations sensibles au facteur temps. Un jeu de données d’inventaire jeu de données pour la gestion des commandes peut nécessiter une ancienneté maximale de 15 minutes. Un jeu de données de segmentation de la clientèle jeu de données pour des campagnes marketing hebdomadaires peut tolérer une ancienneté maximale de 24 heures. Consignez ces SLA dans le catalogue de données le cadre deenregistrement gouvernance jeu de données.
Suivi des pipelines avec alertes de fraîcheur : Surveillez chaque pipeline pour garantir son achèvement dans les délais et déclenchez immédiatement une alerte en cas d'échec ou de retard. Associez la surveillance de l'actualité aux workflows de gestion des données afin qu'un jeu de données obsolète jeu de données signalé au responsable concerné avant d'être utilisé dans des décisions de production.
Parcours de données en temps réel pour les cas d'utilisation où le temps est un facteur critique :pourles opérations qui ne peuvent absolument pas tolérer la latence inhérente aux traitements par lots, remplacez les pipelines par lots par streaming qui fournissent les données dans les secondes qui suivent les événements source. Streaming utilisant Kafka ou plateformes similaires plateformes le délai de mise à jour de plusieurs heures à quelques secondes pour les cas d'utilisation qui l'exigent.
Visibilité de l'ancienneté des données dans le catalogue :affichezclairement les horodatages de la dernière mise à jour dans le catalogue de données des scores de qualité et du statut de certification, afin que les utilisateurs puissent évaluer l'actualité des données avant d'utiliser un jeu de données. Un analyste qui constate qu'un jeu de données actualisé pour la dernière fois il y a 19 heures peut ainsi décider en connaissance de cause si celui-ci est suffisamment récent pour son cas d'usage.
Problème n° 6 : Données non valides
Pourquoi cela se produit-il ?
Les données non valides ne respectent pas les formats définis, les plages de valeurs ou les règles métier. Un champ de date contenant « 99/99/9999 », une valeur négative dans un champ de quantité qui n’autorise que des entiers positifs, une adresse e-mail sans le symbole « @ », un code postal qui ne correspond à aucun code postal valide : chacun de ces éléments est techniquement présent, mais n’a aucun sens ou peut être préjudiciable lorsqu’il est utilisé dans un calcul, requête ou un modèle.
Des données non valides s'accumulent lorsque des règles de validation font défaut au moment de la saisie, lorsque des modifications apportées au schéma introduisent de nouvelles contraintes auxquelles les données existantes ne répondent pas, ou lorsque des données provenant de sources externes sont chargées sans normalisation de format.
Combien ça coûte ?
Des données non valides provoquent des défaillances du pipeline lorsque les systèmes en aval tentent d'analyser des valeurs qui ne respectent pas les formats attendus. Une tâche ETL qui attend une année à quatre chiffres et rencontre la valeur « 9999 » génère une exception et échoue. Le pipeline s'arrête, les données ne sont pas chargées et les rapports en aval font défaut jusqu'à ce que le problème soit examiné et résolu.
Dans les secteurs réglementés, la présence de données non valides dans un dossier entraîne son rejet. Une entreprise pharmaceutique dont jeu de données d’essai clinique jeu de données des valeurs hors limites dans des champs obligatoires reçoit une lettre de réponse complète de la FDA lui demandant de soumettre à nouveau son dossier. Le coût ne se limite pas à la resoumission du dossier : il réside également dans le retard pris dans le calendrier réglementaire.
Solution : validation des données d'entrée, respect du schéma et correction automatisée
Validation des données à la source : Mettez en place des règles de validation au moment de la saisie des données et de l'intégration au système afin d'empêcher l'introduction de valeurs non valides dans le système. La validation du format pour les champs e-mail, téléphone et adresse postale, la validation de la plage de valeurs pour les champs numériques, les contrôles d'intégrité référentielle pour les champs de clé étrangère et la validation des règles métier pour les contraintes spécifiques au domaine doivent toutes être effectuées avant enregistrement d'un enregistrement .
Contrôle de conformité au schéma lors de l'ingestion : Pour les données provenant de sources externes, mettez en place une validation du schéma au niveau de la couche d’ingestion, qui vérifie la conformité des données entrantes par rapport au schéma cible avant leur chargement. Les enregistrements qui ne passent pas la validation du schéma sont mis en quarantaine dans une table de rejet en vue d’une analyse, plutôt que de charger des valeurs non valides dans le jeu de données de production.
Correction automatisée des cas courants : De nombreuses catégories de données invalides peuvent être corrigées automatiquement : les numéros de téléphone pouvant être reformatés selon un format standard, les codes postaux pouvant être validés et corrigés à l'aide d'une base de données postale faisant autorité, les champs de date dont le format est connu mais qui sont mal encodés. Mettez en place des règles de correction automatisée pour les schémas courants et fréquents, et transmettez les cas véritablement ambigus à l'équipe de gestion des données pour examen.
gouvernance des schémas basée sur des contrats : Les contrats de données, qui spécifient le schéma exact, les types de champs et les règles de validation que les producteurs de données doivent respecter, offrent aux consommateurs en aval une garantie formelle quant aux données qu’ils reçoivent, ainsi qu’un mécanisme d’alerte en cas de violation de cette garantie.
Choisir les solutions adaptées à votre environnement
Toutes les entreprises n'ont pas nécessairement besoin des six solutions au même niveau de maturité en même temps. Établissez vos priorités en fonction des problèmes qui posent le plus de difficultés à votre entreprise aujourd'hui.
| Si votre plus gros problème est… | Commencez par ici |
|---|---|
| Enregistrements en double concernant des clients ou des produits | Résolution d'entités et gestion des données de référence (MDM) |
| Les champs manquants perturbent l'analyse ou apprentissage automatique | Contrôle de l'exhaustivité et exigences relatives aux champs au niveau de la source |
| Rapports présentant des divergences entre les différentes divisions | Glossaire métier réglementé et contrats de données |
| Des données obsolètes à l'origine de défaillances opérationnelles | Accords de niveau de service (SLA) relatifs à la fraîcheur et suivi du pipeline |
| Défaillances du pipeline dues à des valeurs inattendues | Contrôle de conformité au schéma lors de l'ingestion et validation des données d'entrée |
| Des valeurs erronées découvertes après avoir influencé des décisions | Profilage automatisé, validation intersystèmes et détection des changements |
Les améliorations les plus durables en matière de qualité des données s’attaquent aux causes profondes à la source, plutôt que de recourir à un nettoyage en aval qui doit être répété indéfiniment. La validation au niveau de la source empêche les données invalides d’entrer dans le système. Des définitions réglementées empêchent l’accumulation d’incohérences. Le contrôle de l’actualité des données empêche les données obsolètes d’atteindre l’environnement de production. Chacun de ces investissements en amont génère des retombées cumulatives à mesure que le parc de données s’étoffe.
FAQ
Les six problèmes les plus courants sont les doublons, les données incomplètes, les données inexactes, les incohérences entre les systèmes, les données obsolètes et les données non valides qui ne satisfont pas aux validations de format ou aux règles métier. La plupart des entreprises sont confrontées simultanément à ces six problèmes, mais leur gravité et leur impact sur l'activité varient selon le secteur d'activité et cas d'usage.
Les causes profondes les plus courantes sont les suivantes : la saisie manuelle de données sans validation ; les intégrations système qui ne dédupliquent pas ou ne valident pas les enregistrements entrants ; l'absence de glossaire métier standardisé, entraînant des incohérences de définition entre les systèmes ; les pipelines de traitement par lots dont la latence dépasse les exigences de fraîcheur des cas d'utilisation en aval ; les modifications de schéma qui enfreignent les règles de validation existantes ; et les migrations de systèmes qui transforment les données de manière incorrecte.
nettoyage des données est un processus réactif : il consiste à détecter et à corriger les problèmes de qualité dans les données existantes. La gestion de la qualité des données est un programme proactif : elle vise à prévenir les problèmes de qualité grâce à des règles de validation, à surveiller la qualité en continu, à s'attaquer aux causes profondes à la source et à maintenir la qualité dans la durée grâce à la gestion et à gouvernance. Le nettoyage traite les symptômes ; la gestion de la qualité traite les causes.
Grâce à la résolution d'entités : des modèles d'apprentissage automatique entraînés sur des paires de doublons connues évaluent la probabilité que deux enregistrements correspondent à la même entité du monde réel. Les enregistrements dont le score dépasse un seuil de confiance sont fusionnés automatiquement. Ceux dont le score se situe dans une fourchette d'incertitude sont transmis à un contrôle humain. Une gestion des données de référence assure ensuite enregistrement d'un enregistrement unique et empêche l'accumulation de nouveaux doublons.
observabilité des données observabilité surveiller en permanence l'état des données dans l'ensemble du parc de données : suivre les scores de qualité, détecter les anomalies au niveau du nombre de lignes, des taux de valeurs nulles et de la répartition des valeurs, et alerter les équipes lorsque les données tombent en dessous de seuils définis ou présentent un comportement inattendu. Il s'agit de la couche opérationnelle qui détecte les problèmes de qualité avant qu'ils n'atteignent les rapports de production ou les pipelines d'IA, faisant ainsi passer la gestion de la qualité d'une approche réactive à une approche proactive.
Un contrat de données est un accord formel entre un producteur de données et un consommateur de données qui précise le schéma, les définitions des champs, les normes de qualité et SLA de mise à jour SLA producteur s'engage à respecter. Lorsqu'un producteur modifie la définition d'un champ ou ne respecte pas un seuil de qualité, le système de mise en œuvre du contrat alerte les consommateurs en aval avant que la modification ne se propage. Les contrats de données constituent le mécanisme le plus efficace pour prévenir les incohérences et les défaillances de qualité liées aux modifications de schéma.
Les modèles d’IA héritent de tous les problèmes liés à la qualité des données présentes dans leurs apprentissage . Les enregistrements en double conduisent les modèles à accorder une importance excessive à certaines tendances. Les enregistrements incomplets les empêchent de détecter certains signaux prédictifs. Les définitions incohérentes les amènent à apprendre des tendances contradictoires. Les valeurs inexactes les conduisent à établir des relations erronées. La qualité des données n’est pas une simple condition préalable à l’IA : c’est le fondement même qui détermine si les résultats de l’IA sont fiables ou dangereusement peu fiables.
Des résultats rapides peuvent être obtenus en quelques semaines : profilage automatisé pour établir une base de référence, règles de validation élémentaires lors de l'ingestion et tableau de bord de suivi de l'exhaustivité. Une amélioration durable — définitions standardisées, résolution des entités, contrats de données, validation au niveau des sources sur l'ensemble des principaux pipelines — prend généralement entre 6 et 12 mois pour les entreprises de taille moyenne. Les entreprises qui maintiennent la qualité de leurs données à long terme investissent dans la prévention plutôt que dans des campagnes de nettoyage périodiques.