Blog | Datenmanagement | | 9 Lesezeit

So erkennen Sie Probleme mit der Datenqualität, bevor sie die Produktion erreichen

Fußabdruck, der zeigt, dass Probleme mit der Datenqualität bereits im Keim erstickt wurden

Zusammenfassung

  • Saubere Daten beginnen bei den Grundlagen: automatisierte Erfassung, einheitliche Formate und Nutzer, die für die von ihnen eingegebenen Daten verantwortlich sind.
  • Die eigentliche Lösung besteht darin, Probleme bereits innerhalb der Pipeline selbst zu erkennen – mithilfe von Profiling, der Funktion „ eingebettet “, Qualitätsregeln und Verträgen, die Schemaabweichungen bereits bei der Datenaufnahme erkennen und nicht erst, wenn ein Bericht fehlerhaft ist.
  • Qualitätsprüfungen erkennen das, was Sie bereits definiert haben. „ Beobachtbarkeit “ erkennt das, was Sie nicht definiert haben. Die meisten Pipelines benötigen beides.
  • Irgendetwas wird früher oder später sowieso durchrutschen. Es kommt mehr darauf an, wie schnell man es entdeckt und eindämmt, als darauf, ob es überhaupt passiert ist.
  • Das Argument für Investitionen, bevor etwas kaputtgeht, ist die Vermeidung von Kosten – und das ist kein hypothetisches Szenario; diese Kosten werden bereits stillschweigend in Form von Nachbesserungen und Zeitverschwendung bezahlt.

Die meisten Probleme mit der Datenqualität treten nicht dort auf, wo man sie erwarten würde. Bei einer Code-Review werden Sie sie nicht entdecken. Man entdeckt sie erst später – in einer „ dashboard “, die nicht aufgeht, in einem Modell, das auf Daten trainiert wurde, die niemand doppelt überprüft hat, oder in einem Bericht, der stillschweigend zurückgezogen werden muss. Zu diesem Zeitpunkt kostet die Behebung der Fehler schon viel mehr, als es früher der Fall gewesen wäre. Diese Probleme zu erkennen, bevor sie überhaupt in die Produktion gelangen, ist kein „Nice-to-have“. Es ist das, was ein Datenteam, das Problemen immer einen Schritt voraus ist, von einem Team unterscheidet, das ständig deren Folgen beseitigen muss.

Es gibt zwei Möglichkeiten, das zu erreichen. Entweder man wartet, bis etwas kaputtgeht, und repariert es dann. Oder man erkennt das Problem, bevor es überhaupt die Pipeline verlässt.

Reaktive vs. Pipeline-eingebettet -Datenqualität

Der Unterschied zwischen den beiden Ansätzen liegt darin, wo die Überprüfung stattfindet.

Reaktive Datenqualität Pipeline – Datenqualität bei „eingebettet “
Wenn Probleme auftreten Nachdem sie bereits einen „ dashboard “, einen Bericht oder ein Modell veröffentlicht haben Bevor die Daten überhaupt in die Produktion gelangen
Wie die Überprüfungen ablaufen Manuelle Überprüfungen und einmalige Audits, meist nachdem etwas nicht in Ordnung zu sein scheint Direkt in die Pipeline integrierte automatisierte Prüfungen
Was du gerade machst Bereits fehlerhafte Daten korrigieren Verhindern, dass fehlerhafte Daten überhaupt erst weiterverarbeitet werden
Kosten Außerdem hat sich der Schaden bereits ausgebreitet, wenn man ihn bemerkt. Weiter unten wird das Problem an der Quelle behoben
Wie sich das im Alltag anfühlt Ständiges Feuerlöschen Stetige, vorhersehbare Zuverlässigkeit

5 Schritte, um Probleme mit der Datenqualität zu erkennen, bevor sie in die Produktion gelangen

  1. Validieren Sie Daten bereits bei der Eingabe. Erkennen Sie Probleme hinsichtlich Schema, Format und Vollständigkeit, bevor ein „ Aufzeichnung “ in nachgelagerte Systeme geladen wird, und prüfen Sie, ob die Werte auch sinnvoll sind – nicht nur, ob sie korrekt formatiert sind. Eine Zahl kann zwar gültig sein, aber dennoch unrealistisch, wie beispielsweise ein Temperaturwert, der außerhalb eines Labors nicht vorkommen könnte.
  2. Automatisieren Sie Tests für jede Änderung an der Pipeline. Neue Transformationslogik wird vor der Bereitstellung überprüft – und nicht erst, wenn jemand bemerkt, dass die Ausgabe nicht stimmt. Gleichen Sie die Zahlen aus den Quellen mit denen im Data Warehouse ab, damit unterwegs nichts unbemerkt verloren geht oder doppelt erfasst wird.
  3. Schema-Abweichungen automatisch erkennen. Unerwartete Änderungen an einem Quellschema kennzeichnen, bevor sie zu Problemen in nachgelagerten Prozessen führen.
  4. Führen Sie Frischeprüfungen durch. Legen Sie fest, wie aktuell die Daten sein müssen, und kennzeichnen Sie alles, was diese Vorgaben nicht erfüllt.
  5. Erfassen Sie Qualitätskennzahlen direkt innerhalb der Pipeline. Achten Sie dort auf Abweichungen bei der Genauigkeit oder Vollständigkeit – und nicht erst bei einer vierteljährlichen Überprüfung.

7 Möglichkeiten zur Verbesserung der Datenqualität

1. Automatisierung der Dateneingabe

Die Automatisierung der Dateneingabe ist eine der wirksamsten Strategien zur Verbesserung der Datenqualität. Die Automatisierung trägt dazu bei, dass die Daten genau und schnell eingegeben werden, wodurch das Risiko menschlicher Fehler verringert wird. Durch die Automatisierung lassen sich auch Fehler oder Unstimmigkeiten in den Daten schnell erkennen, so dass Sie sich auf die Daten verlassen können, die Sie für Ihre Entscheidungen verwenden. Die Automatisierung kann dazu beitragen, den Zeitaufwand für die manuelle Dateneingabe zu verringern, so dass mehr Zeit für andere Aufgaben zur Verfügung steht.

2. Daten Standardisierung

Die Datenstandardisierung ist eine weitere wichtige Strategie zur Verbesserung der Datenqualität. Sie trägt dazu bei, dass Daten konsistent und zuverlässig sind und unternehmensweit im gleichen Format erfasst werden. Dadurch wird sichergestellt, dass die Daten vergleichbar und leicht zu analysieren sind. Die Standardisierung von Daten hilft zudem, das Risiko von Fehlern aufgrund unterschiedlicher Formate und Versionen zu verringern.

3. Datenüberprüfung

Die Datenprüfung ist eine weitere wichtige Strategie zur Verbesserung der Datenqualität. Die Datenüberprüfung hilft sicherzustellen, dass die Daten korrekt sind, und sie hilft, Unstimmigkeiten oder Fehler in den Daten zu erkennen. Die Datenüberprüfung kann Ihnen auch helfen, Muster oder Anomalien zu erkennen, die auf ein Problem mit den Daten oder Ihren Datenpipelines hinweisen könnten. So können die Mitarbeiter Probleme schneller diagnostizieren und beheben.

4. Datenintegrationstools verwenden

Datenintegrationswerkzeuge sind eine hervorragende Möglichkeit, die Datenqualität zu verbessern. Mit Datenintegrationslösungen wie der Actian Analytics AI Platform können Sie Daten aus verschiedenen Quellen schnell und einfach zusammenführen, wodurch sichergestellt wird, dass die Daten korrekt und aktuell sind. Datenintegrationswerkzeuge können Ihnen zudem dabei helfen, den Prozess der Datenzusammenführung und -transformation zu automatisieren, wodurch sich der Zeitaufwand für die manuelle Dateneingabe reduzieren lässt.

5. Förderung der Self-Service

Die Förderung Self-Service ist eine weitere hervorragende Strategie. Durch Self-Service werden die Nutzer in die Lage versetzt, Verantwortung für die von ihnen eingegebenen Daten zu übernehmen. Indem Sie den Nutzern benutzerfreundliche Tools, Training und Unterstützung zur Verfügung stellen, können Sie dazu beitragen, dass Daten korrekt und schnell eingegeben werden.

6. Datenprofilierung umsetzen

Die Erstellung von Datenprofilen hilft bei der Identifizierung von Mustern oder Anomalien in den Daten, was Ihnen helfen kann, mögliche Probleme mit den Daten zu erkennen. Implementieren Sie Tools oder Prozesse, mit denen sich Daten, die nicht den Datenstandards Ihres Unternehmens entsprechen, leicht identifizieren und aussondern lassen.

7. Integrieren Sie Datenqualität in Ihre Pipelines

Erstellen Sie Profiling- und Qualitätsregeln, die sich in Ihre Pipelines integrieren lassen. Datenmanagement -Tools unterscheiden sich erheblich in Fähigkeiten – suchen Sie daher nach Produkten, die auf der Grundlage der von Ihnen festgelegten Regeln einen schnellen Überblick über die Datenqualität bieten. Dies kann es Ihren Mitarbeitern erleichtern, festzustellen, ob es sich bei Anomalien in der Datenqualität um erwartete Ergebnisse handelt oder um etwas, das auf ein größeres Problem in einer früheren Phase der Pipeline hindeuten könnte.

Verhindern Sie, dass Schemaänderungen im vorgelagerten Bereich Ihre Pipeline unterbrechen

Schema-Drift ist einer der häufigsten Gründe für Ausfälle von Pipelines und lässt sich bei einer Code-Review nur schwer erkennen. Jemand ändert einen Feldnamen in einem Quellsystem, fügt eine Spalte hinzu oder wechselt den Datentyp – und diese Änderung erscheint ihm völlig unproblematisch. Ihre Pipeline muss dies jedoch auf die harte Tour erfahren, wenn sie ein Feld erwartet, das nicht mehr vorhanden ist, oder eine Zahl, wo plötzlich eine Zeichenkette steht.

Meistens liegt die Ursache in einer der folgenden wenigen Ursachen: einer vorgelagerten API ohne Versionsverwaltung, einem Datenanbieter, der ohne Vorwarnung eine kompatibilitätsbrechende Änderung einführt, oder einem Quellsystem, das Daten im CSV-Format exportiert, bei dem es von vornherein kein Schema gibt, das durchgesetzt werden könnte.

Tools zur „Schema-Evolution“ sind zwar hilfreich, decken jedoch nur einen engeren Umfang an Änderungen ab, als der Name vermuten lässt. Das Hinzufügen einer Spalte oder die Erweiterung des Datentyps einer Zahl werden problemlos bewältigt. Ein umbenanntes Feld, ein geänderter Datentyp, eine entfernte Spalte – das sind die Änderungen, die tatsächlich zu Unterbrechungen in den Pipelines führen, und die meisten Tools zur Schema-Evolution können Sie davor nicht bewahren.

Die Lösung besteht nicht darin, darauf zu hoffen, dass niemand in den vorgelagerten Prozessen etwas ändert. Vielmehr geht es darum, festzulegen, wie Ihre Daten aussehen sollen, und sofort zu erkennen, wenn die Realität nicht mehr mit dieser Erwartung übereinstimmt.

Das ist es, was ein Datenvertrag . Er legt das erwartete Schema, das Format und die Regeln für eine „ Datensatz “ im Voraus fest, sodass eine Änderung an einem dieser Punkte keine unerwartete Überraschung darstellt; es handelt sich vielmehr um einen Verstoß, den die Pipeline erkennen und kennzeichnen kann, bevor die Daten weiterverarbeitet werden. In der Praxis bedeutet dies, dass das eingehende Schema bei jedem Dateneingang mit den Erwartungen abgeglichen wird – und nicht nur dann, wenn jemand daran denkt, dies zu überprüfen.

Anstatt erst dann festzustellen, dass sich eine Quelle geändert hat, wenn ein Bericht fehlerhaft ist, erfahren Sie es bereits in dem Moment, in dem der Vertrag die Abweichung erkennt – direkt bei der Erfassung.

Beispiel: Ein Datenvertrag für eine Kundentabelle

  • Erwartet: customer_id (Ganzzahl), email (Zeichenkette), signup_date (Datum)
  • Verstoß: Umbenennung von Quelldateien signup_date zu created_at, oder sendet customer_id als Text statt als Zahl
  • Ergebnis: Bei der Zuführung abgefangen, bevor es in die Produktion gelangt

Vorteile der Verbesserung der Datenqualität

Es ist schwierig, Unterstützung für Tools zur Datenqualitätssicherung zu gewinnen, da der Nutzen nicht sichtbar ist. Niemand nimmt den Vorfall wahr, der nicht eingetreten ist. Daher muss das Argument in Begriffen formuliert werden, die den Menschen bereits am Herzen liegen.

Kostenvermeidung funktioniert besser als jedes Verkaufsgespräch, das auf einer hypothetischen Annahme basiert. Verweisen Sie auf die Stunden, die ein Team damit verbringt, einen Bericht erneut zu erstellen, auf das Budget, das für die Verfolgung von Leads aufgewendet wird, die auf fehlerhaften Daten beruhen, oder auf die verkaufsbezogene Zeit, die für die Nachverfolgung von Kontakten verschwendet wird, die in einer Sackgasse enden. Für all das muss sich niemand eine zukünftige Katastrophe vorstellen. Es geschieht bereits, still und leise, und es ist billiger, das Problem zu beheben, als weiterhin dafür zu bezahlen.

Die Verbesserung der Datenqualität kann für jedes Unternehmen eine Reihe von Vorteilen mit sich bringen. Hier sind einige der wichtigsten Vorteile einer verbesserten Datenqualität:

  1. Verbesserte Entscheidungsfindung: Wenn Daten genau und zuverlässig sind, können sie zur Verbesserung der Entscheidungsfindung beitragen, da sie sicherstellen, dass Entscheidungen auf genauen und aktuellen Daten beruhen.
  2. Gesteigerte Effizienz: Eine verbesserte Datenqualität kann auch zur Effizienzsteigerung beitragen, da weniger Zeit für die manuelle Eingabe und Überprüfung von Daten aufgewendet werden muss, wodurch mehr Zeit für andere Aufgaben zur Verfügung steht.
  3. Bessere Kundenbetreuung: Eine verbesserte Datenqualität kann auch zur Verbesserung des Kundendienstes beitragen, da sie sicherstellt, dass die Kundendaten korrekt und aktuell sind.
  4. Kosteneinsparungen: Eine verbesserte Datenqualität kann auch zu Kosteneinsparungen beitragen, da sie den Zeit- und Ressourcenaufwand für die manuelle Eingabe und Überprüfung von Daten verringert.

Wann sollte man sich für „ Beobachtbarkeit “ oder für „Data Quality“ entscheiden?

  • Datenqualitätsprüfungen erkennen Fehler, die Sie bereits definiert haben. Ein Vertrag, der eine ganze Zahl erwartet, eine Regel, die ein fehlendes Feld kennzeichnet, eine Bereichsprüfung für eine Zahl, die niemals negativ sein darf. Wenn Sie im Voraus wissen, wie ein „Fehler“ aussieht, dann werden diese Fehler dadurch erkannt.
  • Beobachtbarkeit Erkennt Fehler, die Sie nicht vorhergesehen haben. Eine Quelle, die still und leise aufhört, Daten zu senden, ein Volumen, das über Nacht um 40 % sinkt, eine Pipeline, die zwar noch läuft, aber seit drei Tagen nicht mehr aktualisiert wurde. Niemand hat dafür eine Regel geschrieben, weil niemand damit gerechnet hat.
  • Die meisten Pipelines benötigen beides. Qualitätsprüfungen kümmern sich um das, was Sie im Voraus benennen können. „ Beobachtbarkeit “ kümmert sich um das, was Sie nicht benennen können.

Los geht’s

Die Automatisierung der Dateneingabe, Datenstandardisierung, Datenüberprüfung, Datenintegrationswerkzeuge und Datenqualitätsprozesse sind hervorragende Strategien zur Verbesserung der Datenqualität. Data Governance ist ebenfalls unerlässlich, um die Genauigkeit und Zuverlässigkeit der Daten zu gewährleisten. Durch die Umsetzung dieser Strategien können Sie sicherstellen, dass Ihre Daten korrekt und zuverlässig sind, was dazu beitragen kann, Entscheidungsfindung zu verbessern, die Effizienz zu steigern und den Kundenservice zu optimieren. Außerdem lassen sich dadurch Kosten einsparen, da der Zeit- und Ressourcenaufwand für die manuelle Eingabe und Überprüfung von Daten reduziert wird. Actian DataConnect kann Sie bei der Umsetzung dieser Strategien unterstützen, damit Sie das Beste aus Ihren Daten herausholen können.