¿Qué es la calidad de los datos?

¿Qué es la calidad de los datos?

La calidad de los datos es la medida de hasta qué punto los datos cumplen los estándares exigidos para el uso previsto. Unos datos que sean lo suficientemente precisos para un fin pueden resultar insuficientes para otro. Los registros de clientes que sean lo suficientemente precisos para la facturación pueden no cumplir los requisitos de exhaustividad para un modelo predictivo de pérdida de clientes. Los datos financieros que sean suficientes para la elaboración de informes internos pueden no cumplir los requisitos de trazabilidad y precisión para una presentación ante las autoridades reguladoras.

La calidad no es un único atributo. Es una combinación de seis dimensiones cuantificables, cada una de las cuales tiene una importancia diferente en función del caso de uso y del ámbito.


Definición de calidad de los datos

La calidad de los datos es el grado en que estos se adaptan al uso previsto en seis dimensiones: exactitud, exhaustividad, coherencia, actualidad, validez y unicidad.

Los datos de alta calidad permiten realizar análisis fiables, desarrollar una IA digna de confianza y elaborar informes normativos bien fundamentados. Los datos de baja calidad dan lugar a decisiones erróneas, procesos interrumpidos, sanciones por incumplimiento normativo y modelos de IA que aprenden patrones incorrectos a partir de datos de entrenamiento defectuosos.


Las seis dimensiones de la calidad de los datos

Dimensión Definición Ejemplo de un fallo
Precisión Los datos representan correctamente el valor del mundo real que describen La dirección de un cliente sigue siendo la misma que tenía antes de mudarse hace dos años.
Integridad Todos los campos obligatorios se han rellenado con valores significativos y no nulos. Al 18 % de los registros de clientes les falta una dirección de correo electrónico
cohérence El mismo valor se representa de forma idéntica en todos los sistemas en los que aparece. Por «cliente activo» se entiende 90 días en el CRM y 180 días en el departamento financiero; los informes de los distintos sistemas no coinciden.
Oportunidad Los datos están actualizados y disponibles cuando se necesitan para el uso previsto. Los datos de existencias de ayer se utilizan para atender los pedidos de hoy, lo que provoca un exceso de ventas
Validez Los datos se ajustan a los formatos, rangos y reglas de negocio definidos Un campo de fecha contiene «13/2026», que no es una fecha válida en ningún formato estándar.
Singularidad Cada entidad del mundo real se representa exactamente una vez, sin registros duplicados. El mismo cliente aparece 23 veces en el CRM con variaciones ortográficas en su nombre.

Todo programa de calidad de datos debe definir umbrales aceptables para cada dimensión según el ámbito. Un conjunto de datos de transacciones financieras podría requerir una precisión del 99,9 % y una exhaustividad del 100 % en los campos obligatorios. Una lista de contactos de marketing podría tolerar tasas de valores nulos más elevadas en los campos opcionales. Los umbrales definidos por ámbito permiten medir y certificar la calidad.


Por qué es importante la calidad de los datos

Decisiones: Toda decisión empresarial es tan fiable como los datos en los que se basa. Una previsión de ventas basada en datos inexactos sobre el carrito de ventas da lugar a una proyección errónea. Un modelo de cadena de suministro basado en datos de inventario obsoletos provoca fallos en el cumplimiento de los pedidos. La calidad de los datos es una cuestión de rendimiento empresarial, no técnica.

Cumplimiento normativo: El RGPD, la HIPAA, la ley SOX y la norma BCBS 239 establecen requisitos de exactitud y exhaustividad. La norma BCBS 239 exige a los bancos que demuestren que los datos sobre riesgos son exactos y trazables. La HIPAA exige que los historiales de los pacientes sean exactos y estén actualizados. La ley SOX exige que los datos de los informes financieros sean fiables. Los incumplimientos normativos provocados por una mala calidad de los datos acarrean sanciones económicas y riesgos regulatorios.

IA y aprendizaje automático: Los modelos de IA aprenden a partir de los datos de entrenamiento. Un modelo de detección de fraudes entrenado con registros de transacciones en los que el 15 % de los códigos de categoría de comerciante son inexactos aprende patrones erróneos. Un modelo de recomendación entrenado con datos de productos obsoletos muestra artículos agotados. La calidad de los datos es la base que determina si los resultados de la IA son fiables o no.

Eficiencia operativa: La mala calidad de los datos genera trabajo adicional: ingenieros que reparan flujos de datos que fallan debido a valores nulos inesperados, analistas que vuelven a generar informes tras descubrir errores en las fuentes, equipos de atención al cliente que corrigen errores de facturación. Gartner estima que la mala calidad de los datos cuesta a las organizaciones una media de 15 millones de dólares al año —la mayor parte de este coste es invisible, ya que se traduce en el tiempo dedicado a sortear datos en los que nadie confía—.


La calidad de los datos frente a conceptos relacionados

Calidad de los datos frente a gestión de la calidad de los datos: La calidad de los datos es un estado: el grado en que los datos cumplen con los estándares definidos en un momento dado. La gestión de la calidad de los datos (DQM) es el programa: los procesos continuos, las funciones, las herramientas y las estructuras de gobernanza que miden, supervisan y mejoran ese estado a lo largo del tiempo. Medir la calidad una sola vez no equivale a gestionarla.

Calidad de los datos frente a gobernanza de los datos: La gobernanza de datos define los estándares de calidad —los umbrales, las dimensiones y los criterios de certificación que se aplican a cada ámbito— y asigna la responsabilidad de velar por su cumplimiento. La gestión de la calidad de los datos aplica dichos estándares mediante la elaboración de perfiles, la supervisión y la corrección. La gobernanza sin gestión de la calidad da lugar a estándares que nunca se miden. La gestión de la calidad sin gobernanza da lugar a métricas sobre las que nadie actúa.

Calidad de los datos frente a observabilidad de los datos: La observabilidad de los datos supervisa el estado de los flujos de datos en tiempo real: detecta anomalías en el recuento de filas, cambios en el esquema y variaciones en la distribución. La calidad de los datos mide la precisión, la exhaustividad, la coherencia, la actualidad, la validez y la unicidad de los propios datos. La observabilidad detecta problemas en el estado de los flujos de datos. La medición de la calidad evalúa la idoneidad de los datos que genera el flujo. Ambos conceptos son complementarios: la observabilidad capta la señal y la medición de la calidad explica lo que significa.

Calidad de los datos frente a limpieza de datos: La limpieza de datos es un proceso reactivo: consiste en detectar y corregir problemas de calidad en los datos existentes. La gestión de la calidad de los datos es un programa proactivo: consiste en prevenir problemas mediante reglas de validación, supervisar la calidad de forma continua y abordar las causas fundamentales en su origen. La limpieza trata los síntomas. La gestión de la calidad trata las causas.


Cómo se traduce en la práctica una buena calidad de los datos

Un analista de datos que busca un conjunto de datos sobre ingresos: Encuentra tres activos candidatos en el catálogo de datos. Cada uno muestra una puntuación de calidad, el estado de certificación, la fecha y hora de la última actualización y un historial de validación. Dos de ellos están certificados por encima del umbral definido. El analista selecciona uno y lo utiliza sin consultarlo con el equipo de datos. La evidencia de calidad elimina la necesidad de una validación independiente.

Un ingeniero de datos que prepara un cambio en el esquema: Consulta el catálogo de datos para comprobar la puntuación de calidad y el linaje de la tabla que se va a modificar. Observa que tres informes posteriores y un proceso de características de aprendizaje automático dependen de la columna que se va a modificar. Coordinar las correcciones antes de la implementación evita fallos en producción.

Un responsable de cumplimiento normativo que atiende una solicitud de derecho al olvido en virtud del RGPD:extraedel catálogo el registro de linaje correspondiente al expediente de cliente del interesado. El linaje identifica todos los sistemas posteriores que contienen datos derivados de ese registro. Los registros de calidad confirman que la copia de los datos de cada sistema era precisa y estaba actualizada en el momento de su último uso. La supresión se confirma en los seis sistemas en menos de una hora.


Cómo se mide la calidad de los datos

Perfilado de datos:análisis automatizado de los activos de datos para evaluar sus características de calidad actuales: índices de valores nulos, distribuciones de valores, patrones de formato, índices de duplicados e integridad referencial. El perfilado establece la línea de referencia e identifica dónde existen deficiencias.

Reglas de validación: Reglas de negocio que definen cómo deben ser los datos válidos para cada campo: rangos de valores aceptables, formatos obligatorios, restricciones de referencia y dependencias entre campos. Las reglas de validación se ejecutan de forma continua durante la ingesta y sobre los datos almacenados.

Puntuación de calidad: Agregación de los resultados del análisis de perfiles y la validación en una única puntuación por activo. Las puntuaciones permiten comparar la calidad entre activos y a lo largo del tiempo, y sirven de base para las decisiones de certificación.

Supervisión continua: Supervisión automatizada de los índices de calidad con alertas cuando los índices caen por debajo de los umbrales definidos o aparecen anomalías. La supervisión detecta los problemas de calidad antes de que lleguen a los informes de producción o a los flujos de trabajo de IA.

Preguntas frecuentes

La calidad de los datos se refiere a la eficacia con la que estos cumplen su función. Si le haces una pregunta a un conjunto de datos y la respuesta es incorrecta porque los datos son inexactos, incompletos, obsoletos o incoherentes, tienes un problema de calidad de los datos. Unos datos de alta calidad te proporcionan respuestas correctas de forma fiable.

Exactitud, exhaustividad, coherencia, puntualidad, validez y unicidad. La mayoría de los marcos de calidad de datos utilizan estas seis dimensiones. Algunos añaden la integridad (coherencia referencial entre conjuntos de datos relacionados) y la conformidad (cumplimiento de una norma o esquema definido) como dimensiones adicionales, en función del ámbito.

Las causas más habituales son: la introducción manual de datos sin validación; las integraciones de sistemas que cargan registros sin deduplicación ni normalización del formato; los cambios en el esquema que incumplen las reglas de validación existentes; los procesos por lotes con una latencia que supera los requisitos de actualidad de los casos de uso posteriores; y la ausencia de un glosario empresarial regulado, lo que provoca que un mismo concepto se defina de forma diferente en los distintos sistemas.

Una representación numérica del grado en que un activo de datos cumple con los estándares de calidad definidos, que suele expresarse en forma de porcentaje. Una puntuación del 96 % significa que el activo supera el 96 % de los controles de calidad definidos. Las puntuaciones permiten comparar la calidad entre distintos activos y a lo largo del tiempo, y sirven de base para las decisiones de certificación.

Proceso formal mediante el cual se marca un activo de datos como aprobado para su uso una vez que ha cumplido los umbrales de calidad definidos y ha sido revisado por un responsable de datos. Los activos certificados aparecen con una insignia de verificación en el catálogo de datos. Los usuarios confían en los activos certificados sin necesidad de una validación independiente, lo que confiere a los programas de calidad de datos un gran valor operativo.

Los modelos de IA heredan todos los problemas de calidad presentes en sus datos de entrenamiento. Los datos inexactos enseñan a los modelos patrones erróneos. Los datos incompletos hacen que los modelos pasen por alto señales predictivas. Los datos incoherentes hacen que los modelos aprendan patrones contradictorios a partir de definiciones de fuentes diferentes. La certificación de la calidad de los datos de los conjuntos de datos de entrenamiento de la IA es el requisito de infraestructura que garantiza la fiabilidad de los resultados de la IA y la solidez de los programas de gobernanza de la IA.

La exactitud es una de las seis dimensiones de la calidad de los datos. Mide si los datos representan correctamente el valor del mundo real que describen. La calidad de los datos es un concepto más amplio que incluye la exactitud, además de la exhaustividad, la coherencia, la actualidad, la validez y la unicidad. Un conjunto de datos puede ser exacto pero incompleto, o exacto y completo pero desactualizado; la calidad de los datos evalúa las seis dimensiones en su conjunto.

La responsabilidad es compartida. Los propietarios de los datos asumen la responsabilidad empresarial última sobre la calidad de los datos de su ámbito. Los gestores de datos se encargan de la gestión operativa diaria de la calidad: supervisan las puntuaciones, resuelven incidencias y certifican los activos. Los ingenieros de datos crean y mantienen la infraestructura técnica que mide y garantiza el cumplimiento de los estándares de calidad. El director de datos (CDO) o el responsable de gobernanza establece los estándares de calidad para toda la organización y supervisa el estado del programa.