Comment détecter les problèmes de qualité des données avant qu'ils n'atteignent l'environnement de production
Résumé
- La qualité des données commence par les principes de base : saisie automatisée, formats cohérents et utilisateurs responsables des données qu'ils saisissent.
- La véritable solution consiste à détecter les problèmes au sein même du pipeline, grâce au profilage, à l’ Embarqué , aux règles de qualité et à des contrats permettant de repérer toute dérive du schéma dès l’ingestion, et non après l’apparition d’un rapport erroné.
- Les contrôles de qualité détectent ce que vous avez déjà défini. observabilité détecte ce que vous n'avez pas défini. La plupart des pipelines ont besoin des deux.
- De toute façon, il y aura toujours quelque chose qui passera entre les mailles du filet. Ce qui compte, ce n’est pas tant que cela se produise, mais la rapidité avec laquelle on le détecte et on le maîtrise.
- L'argument en faveur d'un investissement avant qu'un problème ne survienne réside dans la prévention des coûts, et non dans une hypothèse : ces coûts sont déjà supportés, sans qu'on s'en rende compte, sous forme de retouches et de temps perdu.
La plupart des problèmes de qualité des données n’apparaissent pas là où on s’y attendrait. Vous ne les repérerez pas lors d’une révision du code. Vous les découvrirez plus tard, dans une « tableau de bord » qui ne tient pas la route, un modèle entraîné sur des données que personne n’a vérifiées, ou encore un rapport qu’il faudra discrètement retirer. À ce stade, la correction coûte bien plus cher qu’elle ne l’aurait fait plus tôt. Détecter ces problèmes avant même qu’ils n’atteignent l’environnement de production n’est pas un simple plus. C’est ce qui distingue une équipe chargée des données qui anticipe les problèmes de celle qui passe son temps à en corriger les conséquences.
Il y a deux façons de s'y prendre. Attendre qu'un problème survienne, puis le résoudre. Ou bien l'anticiper avant même qu'il ne sorte de la chaîne de production.
Approche réactive vs approche « pipeline » — Qualité des données d'Embarqué
La différence entre ces deux approches réside dans le moment où la vérification a lieu.
| Qualité réactive des données | Pipeline - Qualité des données «Embarqué » | |
| Lorsque des problèmes surviennent | Une fois qu’ils ont déjà atteint un tableau de bord, un rapport ou un modèle | Avant même que les données n'atteignent l'environnement de production |
| Comment se déroulent les contrôles ? | Des vérifications manuelles et des audits ponctuels, généralement lorsqu'un problème semble se poser | Contrôles automatisés directement intégrés au pipeline |
| Ce que vous faites | Corriger des données déjà erronées | Empêcher dès le départ que les données erronées ne soient transmises en aval |
| Coût | De plus, les dégâts ont déjà commencé à s'étendre au moment où vous vous en rendez compte. | En résumé, la correction s'effectue à la source. |
| Ce que l'on ressent au quotidien | Une lutte incessante contre les incendies | Une fiabilité constante et prévisible |
5 étapes pour détecter les problèmes de qualité des données avant qu'ils n'atteignent l'environnement de production
- Validez les données dès leur saisie. Détectez les problèmes liés au schéma, au format et à l'exhaustivité avant qu'un enregistrement e ne soit chargé en aval, et vérifiez également que les valeurs ont un sens, et pas seulement qu'elles sont correctement formatées. Un nombre peut être valide tout en étant impossible, comme une mesure de température qui ne pourrait pas exister en dehors d'un laboratoire.
- Automatisez les tests à chaque modification du pipeline. Les nouvelles logiques de transformation sont vérifiées avant leur déploiement, et non après que quelqu’un ait remarqué que le résultat semblait anormal. Comparez les comptages des sources avec ceux de l’entrepôt de données afin de vous assurer qu’aucun élément ne soit omis ou dupliqué en silence au cours du processus.
- Détecter automatiquement les dérives de schéma. Signaler les modifications inattendues apportées à un schéma source avant qu'elles ne provoquent des dysfonctionnements en aval.
- Mettez en place des contrôles de fraîcheur des données. Définissez un niveau d'actualité requis pour les données et signalez tout élément qui ne respecte pas cette exigence.
- Suivez les indicateurs de qualité au sein même du pipeline. Surveillez les écarts de précision ou d'exhaustivité à ce niveau, et non lors d'un bilan trimestriel.
7 façons d'améliorer la qualité des données
1. Automatisation de la saisie des données
L'automatisation de la saisie des données est l'une des stratégies les plus efficaces pour améliorer la qualité des données. L'automatisation permet de s'assurer que les données sont saisies avec précision et rapidité, ce qui réduit le risque d'erreur humaine. L'automatisation vous permet également d'identifier rapidement toute erreur ou incohérence dans les données, ce qui vous permet de vous fier aux données que vous utilisez pour prendre des décisions. L'automatisation peut contribuer à réduire le temps consacré à la saisie manuelle des données, ce qui permet de consacrer plus de temps à d'autres tâches.
2. Normalisation des données
La normalisation des données constitue une autre stratégie essentielle pour améliorer la qualité des données. Elle permet de garantir la cohérence et la fiabilité des données, ainsi que leur saisie dans un format uniforme à l'échelle de l'organisation. Cela contribue à rendre les données comparables et faciles à analyser. La normalisation des données permet également de réduire le risque d'erreurs liées à des formats et des versions divergents.
3. Vérification des données
La vérification des données est une autre stratégie essentielle pour améliorer la qualité des données. Elle permet de s'assurer que les données sont exactes et de détecter toute anomalie ou erreur dans les données. La vérification des données peut également vous aider à identifier des modèles ou des anomalies qui pourraient indiquer un problème avec les données ou vos pipelines de données. Cela permet au personnel de diagnostiquer et de résoudre les problèmes plus rapidement.
4. Utiliser des outils d'intégration de données
Les outils d'intégration de données constituent un excellent moyen d'améliorer la qualité des données. Les solutions d'intégration de données, telles que la plateforme Actian Analytics AI, vous permettent de combiner rapidement et facilement des données provenant de plusieurs sources, ce qui contribue à garantir leur exactitude et leur actualité. Les outils d'intégration de données peuvent également vous aider à automatiser les processus de combinaison et de transformation des données, ce qui permet de réduire le temps consacré à la saisie manuelle des données.
5. Encourager la qualité des données du libre-service
Encourager libre-service la qualitélibre-service est une autre excellente stratégie. libre-service la qualité libre-service permet aux utilisateurs de s'approprier les données qu'ils saisissent. En mettant à leur disposition des outils faciles à utiliser, apprentissage et support, vous pouvez contribuer à garantir que les données sont saisies correctement et rapidement.
6. Mettre en œuvre le profilage des données
Le profilage des données permet d'identifier des modèles ou des anomalies dans les données, ce qui peut vous aider à identifier des problèmes potentiels avec les données. Mettez en œuvre des outils ou des processus qui permettent d'identifier et de séparer facilement les données qui ne respectent pas les normes de votre organisation en matière de données.
7. Intégrer la qualité des données dans vos pipelines
Créez des règles de profilage et de qualité pouvant être intégrées à vos pipelines. Les capacités des outils d’ gestion des données s varient considérablement ; privilégiez donc les produits capables de fournir un aperçu rapide de la qualité des données, en fonction des règles que vous avez définies. Cela permettra à votre équipe de déterminer plus facilement si les anomalies de qualité des données correspondent à des résultats attendus ou si elles pourraient indiquer un problème plus grave à un stade précoce du pipeline.
Empêchez les modifications de schéma en amont de perturber votre pipeline
La dérive de schéma est l'une des causes les plus courantes de défaillance des pipelines, et l'une des plus difficiles à détecter lors d'une revue de code. Quelqu'un modifie le nom d'un champ dans un système source, ajoute une colonne ou change un type de données, sans que cette modification ne lui semble anormale. C'est votre pipeline qui s'en rend compte à ses dépens, en s'attendant à trouver un champ qui a disparu, ou un nombre là où une chaîne de caractères vient d'apparaître.
Cela provient généralement des mêmes causes : une API en amont qui n'est pas versionnée, un fournisseur de données qui introduit une modification rompant la compatibilité sans aucun avertissement, ou encore un système source exportant des données au format CSV, par exemple, pour lequel il n'existe pas de schéma à respecter.
Les outils d’« évolution de schéma » sont utiles, mais uniquement pour un ensemble de modifications plus restreint que ce que leur nom laisse entendre. L’ajout d’une colonne ou l’élargissement du type d’un nombre sont gérés sans problème. En revanche, le renommage d’un champ, la modification de son type ou la suppression d’une colonne sont des changements qui provoquent réellement des ruptures dans les pipelines, et la plupart des outils d’évolution de schéma ne vous en protègent pas.
La solution ne consiste pas à espérer que personne en amont ne modifie quoi que ce soit. Il s'agit de définir ce à quoi vos données doivent ressembler, et de détecter dès que la réalité ne correspond plus à cette attente.
C’est ce qu’on appelle un contrat de données . Il définit dès le départ le schéma, le format et les règles attendus pour une « jeu de données », de sorte qu’une modification de l’un de ces éléments ne soit pas une surprise inattendue ; il s’agit d’une violation que le pipeline peut détecter et signaler avant que les données ne progressent plus loin. En pratique, cela signifie vérifier la conformité du schéma entrant par rapport à ce qui est attendu à chaque fois que les données arrivent, et pas seulement lorsque quelqu’un pense à le faire.
Au lieu de vous rendre compte qu'une source a changé lorsqu'un rapport présente une erreur, vous l'apprenez dès que le contrat détecte l'incohérence, dès la phase d'ingestion.
Exemple : un contrat de données pour la table « clients »
- Prévu :
customer_id(entier),email(chaîne de caractères),signup_date(date) - Infraction : changement de nom des fichiers source
signup_dateàcreated_at, ou envoiecustomer_idsous forme de texte plutôt que de chiffre - Résultat : détecté lors de l'ingestion, avant d'atteindre la production
Avantages de l'amélioration de la qualité des données
Il est difficile de convaincre les parties prenantes de l'intérêt des outils de qualité des données, car les bénéfices sont invisibles. Personne ne remarque l'incident qui ne s'est pas produit. Il faut donc présenter les arguments en utilisant des termes qui parlent déjà aux gens.
La réduction des coûts est plus efficace que n’importe quel argumentaire fondé sur des hypothèses. Mettez en avant le temps qu’une équipe passe à refaire un rapport, le budget consacré à la recherche de prospects à partir de données erronées, ou le temps de vente perdu à assurer le suivi de contacts qui n’aboutissent à rien. Pour cela, nul besoin d’imaginer un désastre futur. Cela se produit déjà, discrètement, et il est moins coûteux d’y remédier que de continuer à en payer le prix.
L'amélioration de la qualité des données peut présenter de nombreux avantages pour toute organisation. Voici quelques-uns des principaux avantages liés à l'amélioration de la qualité des données :
- Amélioration de la prise de décision: Lorsque les données sont précises et fiables, elles peuvent contribuer à améliorer la prise de décision de décision en garantissant que les décisions sont fondées sur des données exactes et actualisées.
- Amélioration de l'efficacité : L'amélioration de la qualité des données peut également contribuer à améliorer l'efficacité, car elle réduit le temps consacré à la saisie manuelle et à la vérification des données, ce qui permet de consacrer plus de temps à d'autres tâches.
- Un meilleur service à la clientèle : L'amélioration de la qualité des données peut également contribuer à améliorer le service à la clientèle, car elle permet de s'assurer que les données relatives aux clients sont exactes et à jour.
- Réduction des coûts : L'amélioration de la qualité des données peut également permettre de réaliser des économies, car elle réduit le temps et les ressources consacrés à la saisie et à la vérification manuelles des données.
Quand privilégier l'observabilité e plutôt que la qualité des données ?
- Contrôles de qualité des données détectent les erreurs que vous avez déjà définies. Un contrat exigeant un entier, une règle signalant un champ manquant, une vérification de la plage de valeurs d'un nombre qui ne doit jamais être négatif. Si vous savez à l'avance à quoi ressemble une « erreur », c'est ce qui permet de la détecter.
- observabilité détecte les défaillances que vous n’aviez pas prévues. Une source qui cesse discrètement d’envoyer des données, un volume qui chute de 40 % du jour au lendemain, un pipeline qui continue de fonctionner mais qui n’a en réalité pas été mis à jour depuis trois jours. Personne n’a défini de règle pour cela, car personne ne l’avait vu venir.
- La plupart des pipelines ont besoin des deux. Les contrôles de qualité gèrent ce que vous pouvez identifier à l'avance. L'observabilité e gère ce que vous ne pouvez pas identifier.
Commencer
L’automatisation de la saisie des données, la normalisation des données, la vérification des données, les outils d’intégration des données et les processus de qualité des données constituent d’excellentes stratégies pour améliorer la qualité des données. L’ gouvernance des données est également essentielle pour garantir l’exactitude et la fiabilité des données. En suivant ces stratégies, vous pouvez vous assurer que vos données sont exactes et fiables, ce qui peut contribuer à améliorer l’ prise de décision, à renforcer l’efficacité et à optimiser le service client. Cela peut également permettre de réaliser des économies, car cela réduit le temps et les ressources consacrés à la saisie et à la vérification manuelles des données. Actian DataConnect peut vous support r à mettre en œuvre ces stratégies afin de tirer le meilleur parti de vos données.