Comment nettoyer des données d'entreprise désordonnées ou incohérentes
Points clés à retenir
- Normalisez avant de procéder au nettoyage : définissez dès le départ les formats et les règles de nettoyage applicables aux enregistrements hérités afin d'éviter les retouches répétitives.
- Hiérarchisez les priorités en fonction de l'impact : utilisez des indicateurs visibles de qualité des données pour nettoyer en priorité les « jeux de données s » fortement sollicitées, plutôt que de vous fier à des suppositions.
- Résoudre les divergences à la source : corriger les chiffres contradictoires entre les différents systèmes à l'aide d'une définition unique et normalisée, et non en les considérant comme de simples erreurs de saisie courantes.
- Automatisation de l'gouvernance: les contrôles de validation au niveau du pipeline empêchent toute dégradation de la qualité dès l'ingestion, de sorte que les données erronées n'atteignent jamais les rapports ni les modèles d'IA.
Signes indiquant que les données de votre entreprise ont besoin d'un nettoyage
Il faut nettoyer vos données dès lors qu'un même fait prend deux significations différentes, selon le système que vous consultez ce jour-là.
- Des enregistrements en double concernant un même client, un même produit ou une même transaction, généralement en raison de légères différences orthographiques ou d'abréviations.
- Des champs vides ou manquants à des endroits où ils devraient toujours être remplis.
- Une même donnée qui présente des valeurs différentes selon le système ou le rapport à partir duquel on l'extrait.
- Des formats qui varient entre enregistrement et enregistrement: des dates écrites de trois façons différentes, des numéros de téléphone avec ou sans indicatif régional, des noms d'entreprises écrits avec une capitalisation incohérente.
- Les équipes consacrent une partie de leur temps de réunion à vérifier manuellement les chiffres avant que quiconque n'ose les énoncer à voix haute.
- Des intégrations qui échouent ou qui nécessitent une intervention manuelle à chaque fois que deux systèmes tentent de se synchroniser.
Définissez d'abord vos normes de qualité des données
Avant de modifier le moindre enregistrement, déterminez ce que signifie «nettoyage» pour chaque champ de votre schéma. Si vous sautez cette étape, le nettoyage devient une cible mouvante, ce qui entraîne la réapparition d’erreurs dès que les membres de l’équipe oublient pourquoi ils ont apporté une correction.
- Définir les critères d'acceptation : Définissez des normes explicites pour chaque champ, notamment les formats valides, les pourcentages d'exhaustivité requis et les plages de valeurs numériques acceptables.
- Tenir à jour un dictionnaire de données : Publier un document de référence simple indiquant le nom de chaque champ, ses valeurs autorisées et son responsable désigné.
- Mettre en place une politique relative aux données héritées : Déterminez comment traiter les données historiques antérieures à l'entrée en vigueur des nouvelles normes. Apportez rétroactivement des corrections aux champs critiques pour l'activité et maintenez les anciennes entrées non essentielles.
| Champ | Standard | Exemple de saisie (avant) | Sortie nettoyée (après) |
| Nom de l'entreprise | Pas d'abréviations, sauf si elles sont légalement enregistrées | Actian Corp. | Actian Corporation |
| Numéro de téléphone | E.164 (non formaté) | (555) 123-4567 | +15551234567 |
| Date | ISO 8601 (AAAA-MM-JJ) | 2026 | 26 août 2026 |
Analyser et évaluer les ressources dont vous disposez
L'analyse de la situation doit précéder la résolution du problème, et non l'inverse. Passez en revue tous les domaines avant de vous attaquer à quoi que ce soit, afin de connaître précisément l'ampleur réelle du problème, plutôt que de vous fier à des suppositions issues d'une réunion infructueuse.
- Effectuez une analyse de profil avant toute correction : comptez le nombre de valeurs nulles, de doublons et de valeurs hors plage pour chaque champ.
- Identifiez la cause réelle de chaque problème récurrent — qu'il s'agisse d'un formulaire spécifique, d'une intégration défaillante ou d'un système hérité — plutôt que de vous contenter de répertorier les symptômes.
- Indiquez quels champs sont essentiels à l'activité et lesquels peuvent, pour l'instant, rester incomplets sans risque.
Si vous vous retrouvez à corriger plusieurs fois le même doublon ou le même format de date incorrect, c'est le signe que vous avez traité un symptôme au lieu de remédier à la cause profonde.
Normaliser les formats et les conventions relatives aux champs
La normalisation signifie que tous les systèmes s'accordent sur la forme que doivent prendre une date, un nom ou un nombre.
- Convertir chaque champ de date dans un format unique sur tous les systèmes concernés.
- Uniformiser les noms d'entreprises et de personnes en respectant une seule convention en matière de majuscules et de suffixes.
- Enregistrez les nombres sous forme de nombres, et non de texte, afin que les calculs ultérieurs ne se soldent pas par un échec silencieux.
- Alignez les unités de mesure et les devises avant de fusionner jeux de données.
Une date stockée sous forme de texte dans un système et sous forme d'horodatage dans un autre peut passer tous les contrôles de validation et pourtant fausser le rapport qui les associe.
Supprimer les enregistrements en double
- Définissez ce qui constitue un doublon pour chaque entité avant d'utiliser un outil de mise en correspondance : une adresse e-mail commune ne signifie pas nécessairement qu'il s'agit de la même entreprise.
- Utilisez la recherche approximative, et non pas uniquement les règles de correspondance exacte, pour détecter les quasi-doublons tels que « Smith, John » et « John Smith ».
- Fusionner automatiquement les correspondances évidentes, mais confier les correspondances peu fiables à une personne plutôt que de les fusionner à l'aveugle.
- Indiquez quelle « enregistrement » l'emporte en cas de conflit, afin que la règle soit appliquée de manière cohérente la prochaine fois.
Gérer les valeurs manquantes selon une politique claire
Les données manquantes se répartissent en deux catégories distinctes : les champs critiques qui entravent les processus en aval, et les champs non critiques qui peuvent rester vides.
- Champs obligatoires : Les identifiants de compte, les numéros d'identification fiscale et les clés primaires doivent être renseignés ou signalés avant que les enregistrements ne transitent par votre pipeline.
- Champs non essentiels : Les coordonnées secondaires ou les réponses au questionnaire peuvent rester vides sans que cela n'affecte l'analyse en aval.
- Méthodes d'imputation : Pour combler les lacunes, utilisez des méthodes statistiques explicites plutôt que des valeurs par défaut arbitraires :
- Données numériques : Appliquer une imputation par moyenne ou médiane pour les valeurs normalement distribuées, ou utiliser la méthode des k plus proches voisins (k-NN) / des modèles de régression pour les jeux de données s complexes.
- Données catégorielles : Utilisez l’imputation par mode ou marquez explicitement les entrées comme « INCONNU ».
- Traçabilité : Veillez à toujours marquer les valeurs imputées dans votre « métadonnées » afin que les estimations statistiques ne soient jamais confondues avec les données d'origine fournies par les clients.
- Suppression ou conservation : Ne supprimez des lignes que lorsque des valeurs manquantes rendent l'ensemble de l'enregistrement s inutilisable. Le recours par défaut à la suppression de lignes réduit la taille de l'échantillon tout en écartant silencieusement des signaux valides et précieux.
Vérifier et corriger les erreurs restantes
La validation permet de détecter ce que les étapes précédentes ont laissé passer : une « enregistrement » qui satisfait à toutes les vérifications au niveau des champs, mais qui échoue dès qu’elle est évaluée au regard d’une règle couvrant plusieurs champs ou systèmes.
Commencez par des vérifications de plage et de logique, appliquées sous forme de contraintes CHECK au niveau de la base de données, ou sous forme d’assertions de pipeline si vous effectuez la validation avant le chargement. Un pourcentage ne peut pas dépasser 100. Une date de fin ne peut pas précéder une date de début. Une clé étrangère doit renvoyer vers une enregistrement qui existe réellement. Ces vérifications permettent de détecter des erreurs qu’aucune règle de mise en forme ne signalerait jamais, car les valeurs individuelles sont toutes techniquement valides en elles-mêmes.
Vérifiez les champs critiques (noms, adresses, e-mails, numéros d’identification fiscale) par rapport à une source externe lorsqu’elle est disponible : une API de validation d’adresse, un service de vérification d’e-mail, une recherche dans un registre officiel. Gardez pour la fin le nettoyage structurel, la mise en majuscules/minuscules, les espaces superflus et les caractères de fin. Une fonction TRIM() et un passage par expression régulière sont très simples à exécuter, mais les lancer avant les vérifications logiques et référentielles revient simplement à refaire le travail dès qu’un problème plus profond apparaît.
Automatisez les tâches récurrentes et continuez à surveiller
Une règle de validation qui ne s'exécute qu'une seule fois ne vaut qu'un seul nettoyage. Intégrez cette même logique dans le pipeline afin qu'elle se déclenche à chaque nouvelle enregistrement, et pas seulement pour le lot que vous étiez justement en train de consulter.
- Transformez chacune des règles ci-dessus en un contrôle automatisé : une bibliothèque de validation ou une tâche planifiée dans votre orchestrateur, un DAG Airflow, une suite de tests dbt… mais surtout pas une macro de tableur que quelqu’un doit penser à exécuter.
- Définissez des seuils d'alerte afin qu'une faible « anomalie », une légère augmentation du taux de valeurs nulles ou un taux de doublons dépassant progressivement la normale soient signalés avant que cela ne devienne un problème à signaler.
- Réexécutez un cycle complet de profilage selon un calendrier défini. Les données dérivent même lorsqu’aucun dysfonctionnement n’est visible.
Manuel ou automatisé : quand choisir l'une ou l'autre solution ?
| Approche manuelle | Approche automatisée |
| Une personne vérifie manuellement les nouvelles fiches à l'aide d'une liste de contrôle | Les règles de validation s'appliquent à chaque nouvelle « enregistrement » dès sa réception. |
| Les erreurs apparaissent quelques jours plus tard, généralement lors d'un rapport | Les erreurs sont signalées dès qu'elles apparaissent |
| Ça fonctionne très bien pour un fichier isolé ou un petit jeu de données | Nécessaire lorsque le nettoyage est récurrent ou concerne plusieurs systèmes |
| Limité par la quantité de contenu qu'une personne peut relire | Se développer sans augmenter les effectifs |
Choisir par où commencer le ménage
Traiter toutes les « jeux de données s » de manière indifférenciée revient à gaspiller des ressources sur des tables isolées, tandis que les flux critiques impliquant plusieurs systèmes restent défaillants. Hiérarchisez les « jeux de données s » en fonction des dépendances en amont et de leur impact global sur l’activité.
- Cartographie des dépendances : commencez par cibler les tables centrales qui alimentent plusieurs pipelines d'analyse en aval ou des modèles d'IA destinés aux clients.
- Grille d'évaluation : résoudre les ex æquo par un calcul direct :
Score de priorité = (Impact sur l'activité × Urgence) + Effort
Facteur de décision |
Audit manuel (traditionnel) |
Visibilité automatisée (approche Actian) |
Évaluation de l'état des données |
Des requêtes SQL manuelles fastidieuses pour estimer les taux d'erreur. |
Les indicateurs de qualité de type « feux tricolores » (précision, exhaustivité, actualité) Embarqué s'affichent directement dans les vues de recherche et de lignée. |
Priorité en matière d'assainissement |
Correction réactive en fonction du rapport publié le plus récemment. |
Triage systématique ciblant les « jeux de données » ayant obtenu les scores les plus bas lors des contrôles « gouvernance ». |
Que faire lorsque les sources divergent ?
Le fait que deux systèmes affichent des chiffres différents pour un même client n'est pas une erreur de saisie. Il s'agit d'une divergence de définition, et aucune opération de reformatage ou de déduplication ne permettra d'y remédier.
- Lorsqu'un système s'impose clairement comme celui d'enregistrement, utilisez-le et consignez cette décision par écrit afin que la même question ne se pose plus.
- Lorsque aucun des deux systèmes ne fait clairement autorité, il est nécessaire de disposer d'une définition unique et normalisée pour les concepts communs : client, chiffre d'affaires, compte actif. Cette définition sert de référence aux deux systèmes, ce qui évite que chacun ne défende ses propres chiffres.
- Signalez l'anomalie et prévenez toutes les personnes qui s'appuient sur ces données. Ne laissez pas cette anomalie refaire surface en aval sous la forme d'un mystère que quelqu'un devra élucider lors de l'élaboration d'un rapport.
Faites une sauvegarde avant de toucher à quoi que ce soit
Chaque règle de nettoyage que vous écrivez peut aggraver la situation, et pas seulement l'améliorer. Considérez les données que vous vous apprêtez à modifier comme étant en lecture seule jusqu'à ce que vous ayez vérifié que la règle fonctionne réellement.
- Travaillez toujours à partir d'une copie, d'une table de test ou d'un instantané, jamais à partir de l'original en production, afin qu'une règle défectueuse ne puisse pas détruire des données irrécupérables.
- Testez les règles de nettoyage sur un petit échantillon avant de les appliquer à l'ensemble de l'jeu de données.
- Conservez un historique des versions des étapes de nettoyage elles-mêmes, et pas seulement du résultat final, afin de pouvoir remonter à l'origine d'une modification indésirable et l'annuler.
Comment savoir si le nettoyage a réellement fonctionné ?
On ne peut pas savoir si un nettoyage a fonctionné en se basant uniquement sur l'aspect des données. On ne peut le déterminer qu'en comparant les mesures effectuées avant de commencer à celles effectuées après.
- Suivez quelques indicateurs clés avant et après : pourcentage d'achèvement, pourcentage de doublons, pourcentage de données validées.
- Fixez-vous un objectif précis, par exemple un taux de réussite de 98 % à la validation, plutôt qu'un objectif vague tel que « des données plus propres ».
- Réexaminez régulièrement ces mêmes indicateurs afin de détecter rapidement toute baisse de qualité, et non pas seulement une fois le projet terminé.
Rendre ce processus reproductible avec Actian
Une stratégie efficace en matière de qualité des données transforme le nettoyage manuel en un processus automatisé et continu s'exécutant en arrière-plan.
Plateforme Actian Data Intelligence intègre directement dans vos résultats de recherche et vos graphes de traçabilité des indicateurs de précision, d’exhaustivité et d’ cohérence s en temps réel, offrant ainsi à votre équipe une visibilité immédiate sur la qualité des données sans avoir recours à des audits manuels. Associée à l’ gouvernance , qui s’appuie sur un graphe de connaissances, et à Actian DataConnect pour l’intégration hybride, cette plateforme vous permet de résoudre les conflits entre sources et de garantir la propreté et la fiabilité des données dans l’ensemble de votre organisation.
Foire aux questions (FAQ)
- Quel serait un calendrier réaliste pour un premier projet de nettoyage des données ?
Un nettoyage initial ciblé, portant sur 1 à 2 « jeux de données » hautement prioritaires, prend généralement entre 2 et 4 semaines. Cela comprend la définition des normes relatives aux champs, l'exécution des premiers cycles de profilage, l'application des transformations et la vérification des règles du pipeline automatisé.
- Deux systèmes sources peuvent-ils tous deux être « corrects » en même temps ?
Oui. Par exemple, un CRM peut « enregistrement r » le « chiffre d’affaires » dès la signature du contrat, tandis qu’un ERP l’enregistre au moment du paiement de la facture. Ces deux chiffres sont exacts dans leurs contextes respectifs, c’est pourquoi il est essentiel d’établir des définitions claires et réglementées pour l’ensemble des systèmes.
- Quel niveau de risque de perte de données est acceptable lors de l'automatisation des règles de nettoyage ?
Aucune perte de données irrécupérable n'est acceptable. Effectuez toujours les opérations de nettoyage automatisées sur des copies de transit, conservez des sauvegardes immuables des données brutes d'entrée et marquez ou mettez en quarantaine les lignes défectueuses plutôt que de les supprimer définitivement.
- Le fait de donner la priorité aux « pires » jeu de données s signifie-t-il parfois qu'on en néglige une autre, plus modeste mais plus cruciale ?
Non. La hiérarchisation doit toujours être déterminée par l'impact sur l'activité et les dépendances, plutôt que par le volume brut d'erreurs. Une petite table de référence présentant un taux d'erreur de 5 % et servant à l'établissement de rapports réglementaires a la priorité sur une table de journaux volumineuse présentant un taux d'erreur de 30 % et que personne ne consulte.
- Une petite équipe peut-elle garantir la qualité des données sans responsable des données dédié ?
Oui, à condition que les règles de validation et le contrôle qualité soient automatisés au sein de vos pipelines de données. Les plateformes s modernes intègrent directement des alertes automatisées et des scores de qualité dans les workflows des développeurs, ce qui permet aux équipes d'ingénierie de garantir la qualité des données sans effort manuel supplémentaire.