Cómo detectar problemas de calidad de los datos antes de que lleguen a la fase de producción
Resumen
- Para disponer de datos limpios hay que empezar por lo básico: la introducción automatizada, formatos coherentes y usuarios que se responsabilicen de los datos que introducen.
- La solución definitiva consiste en detectar los problemas dentro del propio proceso, mediante el análisis de rendimiento, las reglas de calidad integradas y los contratos que detectan las desviaciones del esquema en el momento de la ingesta, y no después de que falle un informe.
- Los controles de calidad detectan lo que ya has definido. La observabilidad detecta lo que no has definido. La mayoría de los procesos necesitan ambas cosas.
- De todas formas, tarde o temprano algo acabará escapándose. Lo importante no es si ha ocurrido, sino la rapidez con la que se detecte y se controle.
- El argumento a favor de invertir antes de que algo falle es la prevención de costes, no una hipótesis; ese coste ya se está pagando de forma encubierta en forma de trabajo de corrección y tiempo perdido.
La mayoría de los problemas de calidad de los datos no aparecen donde cabría esperar. No los detectarás en una revisión del código. Los descubrirás más tarde, en un panel de control que no cuadra, en un modelo entrenado con datos que nadie ha comprobado dos veces o en un informe que hay que retirar discretamente. Para entonces, la solución cuesta mucho más de lo que habría costado antes. Detectar estos problemas antes de que lleguen a producción no es algo «que estaría bien tener». Es lo que distingue a un equipo de datos que se adelanta a los problemas de uno que siempre está arreglando lo que estos han causado.
Hay dos formas de llegar hasta ahí. Esperar a que algo falle y luego arreglarlo. O detectarlo antes de que salga del proceso.
Calidad de datos reactiva frente a calidad de datos integrada en el proceso
La diferencia entre ambos enfoques radica en dónde se lleva a cabo la comprobación.
| Calidad reactiva de los datos | Calidad de los datos integrada en el proceso | |
| Cuando surgen problemas | Una vez que ya han accedido a un panel de control, un informe o un modelo | Antes de que los datos lleguen al entorno de producción |
| Cómo se realizan las comprobaciones | Revisiones manuales y auditorías puntuales, normalmente cuando se detecta algún problema | Comprobaciones automatizadas integradas directamente en el proceso |
| Lo que estás haciendo | Corregir datos que ya están erróneos | Evitar desde el principio que los datos erróneos se transmitan a las fases posteriores del proceso |
| Coste | Además, para cuando te das cuenta, el daño ya ha empezado a extenderse. | Más abajo, la corrección se realiza en el origen |
| Cómo se vive el día a día | Lucha constante contra los incendios | Fiabilidad constante y predecible |
5 pasos para detectar problemas de calidad de los datos antes de que lleguen a producción
- Valida los datos en el momento de su introducción. Detecta problemas relacionados con el esquema, el formato y la integridad antes de que un registro se cargue en las fases posteriores del proceso, y comprueba también que los valores tengan sentido, no solo que estén bien formateados. Un número puede ser válido y, aun así, ser imposible, como una lectura de temperatura que no podría darse fuera de un laboratorio.
- Automatiza las pruebas cada vez que se produzca un cambio en el proceso de integración. La nueva lógica de transformación se comprueba antes de su implementación, y no después de que alguien se dé cuenta de que el resultado no es el esperado. Compara los recuentos de las fuentes con los del almacén de datos para que nada se omita o se duplique sin que se detecte.
- Detecta automáticamente las desviaciones en el esquema. Señala los cambios inesperados en un esquema de origen antes de que provoquen fallos en las fases posteriores del proceso.
- Aplica controles de vigencia. Establece unos criterios sobre el grado de actualidad que deben tener los datos y señala todo aquello que no los cumpla.
- Realiza un seguimiento de los indicadores de calidad dentro del propio proceso. Presta atención a cualquier desviación en la precisión o la exhaustividad en ese mismo proceso, y no en una revisión trimestral.
7 formas de mejorar la calidad de los datos
1. Automatización de la introducción de datos
La automatización de la introducción de datos es una de las estrategias más eficaces para mejorar su calidad. La automatización ayuda a garantizar que los datos se introducen con precisión y rapidez, reduciendo el riesgo de error humano. La automatización también le permite identificar rápidamente cualquier error o incoherencia en los datos, lo que le permite confiar en los datos que utiliza para tomar decisiones. La automatización puede ayudar a reducir el tiempo dedicado a la introducción manual de datos, liberando más tiempo para otras tareas.
2. Normalización de datos
La estandarización de los datos es otra estrategia clave para mejorar la calidad de los datos. La estandarización de los datos contribuye a garantizar que estos sean coherentes y fiables, y que se introduzcan con el mismo formato en toda la organización. Esto ayuda a garantizar que los datos sean comparables y fáciles de analizar. La estandarización de los datos también contribuye a reducir el riesgo de errores debidos a la existencia de diferentes formatos y versiones.
3. Verificación de datos
La verificación de datos es otra estrategia esencial para mejorar la calidad de los datos. La verificación de datos ayuda a garantizar que los datos son precisos y a detectar cualquier discrepancia o error en los datos. La verificación de datos también puede ayudarle a identificar cualquier patrón o anomalía que pudiera indicar un problema con los datos o sus conductos de datos. Esto permite al personal diagnosticar y resolver los problemas con mayor rapidez.
4. Utilizar herramientas de integración de datos
Las herramientas de integración de datos son una forma excelente de mejorar la calidad de los datos. Las soluciones de integración de datos, como Actian Analytics AI Platform, te permiten combinar de forma rápida y sencilla datos procedentes de múltiples fuentes, lo que ayuda a garantizar que los datos sean precisos y estén actualizados. Las herramientas de integración de datos también pueden ayudarte a automatizar el proceso de combinación y transformación de datos, lo que puede contribuir a reducir el tiempo dedicado a introducir datos manualmente.
5. Fomentar el autoservicio de calidad de datos
Fomentar la gestión autónoma de la calidad de los datos es otra estrategia excelente. La gestión autónoma de la calidad de los datos permite a los usuarios asumir la responsabilidad de los datos que introducen. Al proporcionar a los usuarios herramientas fáciles de usar, formación y asistencia, se puede contribuir a garantizar que los datos se introduzcan de forma correcta y rápida.
6. Aplicación de perfiles de datos
La elaboración de perfiles de datos ayuda a identificar cualquier patrón o anomalía en los datos, lo que puede ayudarle a identificar cualquier problema potencial con los datos. Implemente herramientas o procesos que puedan identificar y separar fácilmente los datos que no se adhieran a las normas de datos de su organización.
7. Integrar la calidad de los datos en sus procesos
Crea reglas de perfilado y calidad que puedan integrarse en tus flujos de trabajo. Las herramientas de gestión de datos varían enormemente en cuanto a sus capacidades, por lo que conviene buscar productos que ofrezcan una visión rápida y general de la calidad de los datos basada en las reglas que hayas establecido. Esto puede facilitar al personal la tarea de determinar si las anomalías en la calidad de los datos se deben a resultados esperados o si podrían indicar un problema más grave en una fase temprana del flujo de trabajo.
Evita que los cambios en el esquema de las etapas anteriores afecten a tu proceso de integración de datos
La deriva del esquema es una de las causas más habituales de fallo en los flujos de trabajo, y una de las más difíciles de detectar en una revisión de código. Alguien cambia el nombre de un campo en un sistema de origen, añade una columna o modifica un tipo de datos, y ese cambio no le parece en absoluto incorrecto. Es tu flujo de trabajo el que lo descubre por las malas, al esperar un campo que ya no existe o un número donde de repente aparece una cadena de caracteres.
Normalmente se debe a los mismos motivos de siempre: una API de origen que no tiene versiones, un proveedor de datos que introduce un cambio que rompe la compatibilidad sin previo aviso, o un sistema fuente que exporta un formato como CSV, en el que, para empezar, no hay ningún esquema que se pueda hacer cumplir.
Las herramientas de «evolución de esquemas» son útiles, pero solo con un conjunto de cambios más limitado de lo que su nombre sugiere. Añadir una columna o ampliar el tipo de un número son operaciones que se gestionan sin problemas. Sin embargo, cambiar el nombre de un campo, modificar su tipo o eliminar una columna son los cambios que realmente provocan fallos en los flujos de trabajo, y la mayoría de las herramientas de evolución de esquemas no te protegen de ellos.
La solución no consiste en esperar que nadie en las fases anteriores cambie nada. Consiste en definir cómo esperas que sean tus datos y detectar el problema en cuanto la realidad deje de coincidir con esa expectativa.
Eso es lo que es un contrato de datos . Establece de antemano el esquema, el formato y las reglas esperadas para un conjunto de datos, de modo que cualquier cambio en cualquiera de ellos no sea una sorpresa silenciosa, sino una infracción que el proceso pueda detectar y señalar antes de que los datos sigan su recorrido. En la práctica, eso significa comparar el esquema entrante con lo esperado cada vez que llegan los datos, no solo cuando alguien se acuerda de comprobarlo.
En lugar de darte cuenta de que una fuente ha cambiado cuando falla un informe, te enteras en el mismo momento en que el contrato detecta la discrepancia, justo en el momento de la ingesta.
Ejemplo: un contrato de datos para la tabla de un cliente
- Previsto:
customer_id(entero),email(cadena),signup_date(fecha) - Infracción: cambio de nombre en el código fuente
signup_dateacreated_at, o envíacustomer_idcomo texto en lugar de un número - Resultado: detectado en la fase de ingestión, antes de que llegue a la producción
Ventajas de mejorar la calidad de los datos
Conseguir que se acepten las herramientas de calidad de datos es difícil porque los beneficios no son visibles. Nadie se da cuenta de los incidentes que no se han producido. Por eso, hay que presentar los argumentos en términos que ya sean importantes para la gente.
La reducción de costes funciona mejor que cualquier argumento basado en hipótesis. Señala las horas que un equipo dedica a volver a generar un informe, el presupuesto gastado en perseguir pistas obtenidas a partir de datos erróneos o el tiempo de ventas desperdiciado en hacer un seguimiento de contactos que no han dado resultado. Nada de eso requiere que nadie imagine un desastre futuro. Ya está ocurriendo, de forma silenciosa, y es más barato solucionarlo que seguir pagando por ello.
Mejorar la calidad de los datos puede reportar numerosas ventajas a cualquier organización. A continuación se enumeran algunas de las principales ventajas de mejorar la calidad de los datos:
- Mejora de la toma de prise de décision: Cuando los datos son precisos y fiables, pueden ayudar a mejorar prise de décision toma de decisiones al garantizar que éstas se basan en datos precisos y actualizados.
- Mayor eficiencia: La mejora de la calidad de los datos también puede contribuir a mejorar la eficiencia, ya que reduce el tiempo dedicado a introducir y verificar datos manualmente, liberando más tiempo para otras tareas.
- Mejor servicio al cliente: La mejora de la calidad de los datos también puede contribuir a mejorar el servicio al cliente, ya que ayuda a garantizar que los datos de los clientes sean precisos y estén actualizados.
- Ahorro de costes: La mejora de la calidad de los datos también puede ayudar a ahorrar costes, ya que reduce el tiempo y los recursos dedicados a introducir y verificar los datos manualmente.
Cuándo optar por la observabilidad frente a la calidad de los datos
- Comprobaciones de calidad de los datos detectan los errores que ya has definido. Un contrato que espera un número entero, una regla que señala un campo que falta, una comprobación de rango en un número que nunca debe ser negativo. Si sabes de antemano cómo es un «error», esto es lo que lo detecta.
- Observabilidad detecta fallos que no habías previsto. Una fuente que deja de enviar datos sin avisar, un volumen que cae un 40 % de la noche a la mañana, un flujo de datos que sigue en marcha pero que, en realidad, no se ha actualizado en tres días. Nadie estableció una regla para ello porque nadie lo vio venir.
- La mayoría de los procesos automatizados necesitan ambas cosas. Los controles de calidad se encargan de lo que se puede prever de antemano. La observabilidad se encarga de lo que no se puede prever.
Iníciese
La automatización de la introducción de datos, la estandarización de datos, la verificación de datos, las herramientas de integración de datos y los procesos de calidad de datos son estrategias excelentes para mejorar la calidad de los datos. La gobernanza de datos también es esencial para garantizar la precisión y la fiabilidad de los datos. Al seguir estas estrategias, puedes asegurarte de que tus datos sean precisos y fiables, lo que puede ayudar a mejorar la toma de decisiones, aumentar la eficiencia y mejorar el servicio al cliente. También puede ayudar a ahorrar costes, ya que reduce el tiempo y los recursos dedicados a introducir y verificar datos manualmente. Actian DataConnect puede ayudarle a implementar estas estrategias para sacar el máximo partido a sus datos.