Problemas relacionados con la calidad de los datos: 6 soluciones para grandes empresas
Se calcula que la mala calidad de los datos supone un coste de 3,1 billones de dólares al año para las empresas estadounidenses. En el caso de las empresas individuales, Gartner estima que el coste medio anual de los datos de mala calidad oscila entre los 12 y los 15 millones de dólares, una cifra que subestima el impacto real, ya que la mayor parte de los costes relacionados con la calidad de los datos son invisibles, al estar ocultos en el tiempo que los equipos dedican a sortear los problemas que plantean los datos en los que no confían.
Los problemas de calidad de los datos en las empresas siguen patrones reconocibles. Las mismas seis dificultades se repiten de forma constante en todos los sectores, y cada una de ellas cuenta con un conjunto de soluciones de eficacia probada. Esta guía aborda las seis dificultades más comunes relacionadas con la calidad de los datos, las causas por las que se producen, su coste y cómo solucionarlas a gran escala.
Los seis problemas más habituales relacionados con la calidad de los datos
| Tema | Qué significa | Causa principal | Impacto en el negocio |
|---|---|---|---|
| Registros duplicados | La misma entidad del mundo real aparece varias veces en un conjunto de datos | Múltiples puntos de introducción de datos, integraciones de sistemas fallidas, ausencia de deduplicación en la ingesta | Comunicaciones duplicadas, métricas infladas, errores de facturación, incumplimientos normativos |
| Datos incompletos | Faltan campos obligatorios o están vacíos | Diseño de campos opcionales, fallos en el sistema de origen, errores de migración, falta de aplicación de los campos obligatorios | Análisis defectuosos, reglas de validación fallidas, entrenamiento poco fiable de los modelos de aprendizaje automático |
| Datos inexactos | Los valores de los datos no reflejan correctamente el valor real que describen. | Errores en la introducción manual de datos, registros obsoletos, migraciones de sistemas que transforman los datos de forma incorrecta | Decisiones erróneas, sanciones regulatorias, fallos en la experiencia del cliente |
| Datos incoherentes | El mismo concepto se representa de forma diferente en los distintos sistemas | Falta de un glosario empresarial estandarizado, sistemas aislados con definiciones independientes, lógica ETL incoherente | Discrepancias en los informes entre sistemas, resultados analíticos contradictorios, fallos en la gobernanza |
| Datos obsoletos | Los datos no se actualizan con la frecuencia necesaria para el uso previsto. | Latencia prolongada en el proceso, ciclos de actualización exclusivamente por lotes, falta de supervisión del SLA | Decisiones tomadas a partir de información obsoleta, fallos en la ejecución de los pedidos, desviación de los modelos de IA |
| Datos no válidos | Los datos no se ajustan a los formatos, rangos o reglas de negocio definidos | Falta de validación de datos de entrada en el código fuente, cambios en el esquema que incumplen las reglas existentes, diseño de integración deficiente | Fallos en los procesos, errores en los sistemas posteriores, presentaciones incorrectas ante las autoridades reguladoras |
Problema n.º 1: Registros duplicados
Por qué ocurre
Los registros duplicados se acumulan cuando los datos llegan a una organización a través de múltiples canales —formularios web, importaciones de CRM, introducción manual, integraciones de sistemas— sin que se realice una comprobación de deduplicación en el momento de la ingesta. Un cliente que se ponga en contacto con el servicio de atención al cliente a través de tres canales puede acabar generando tres registros con ligeras diferencias en la ortografía del nombre, las mayúsculas del correo electrónico o el formato del número de teléfono. Cada registro parece lo suficientemente distinto como para superar una simple comprobación de coincidencia exacta.
Las migraciones de sistemas agravan el problema. Cuando se consolidan dos sistemas, los registros de ambos se cargan en el sistema de destino sin resolución de entidades, lo que duplica o triplica los duplicados existentes.
Cuánto cuesta
En el caso de una empresa minorista con 5 millones de registros de clientes y una tasa de duplicación del 15 %, hay 750 000 registros duplicados. Si el 10 % de esos registros duplicados recibe comunicaciones de marketing duplicadas a un coste de 2 dólares por comunicación, eso supone un gasto de marketing desperdiciado de 150 000 dólares por campaña. Si multiplicamos esta cifra por la frecuencia de las campañas y sumamos el daño a la imagen de marca que supone que los clientes reciban el mismo correo electrónico tres veces, el coste se vuelve considerable.
En entornos regulados, los registros duplicados suponen un riesgo en materia de cumplimiento normativo. Una solicitud de derecho al olvido en virtud del RGPD que elimine uno de cada tres registros deja dos copias de los datos personales en el sistema, lo que constituye una infracción.
Solución: Deduplicación automatizada y resolución de entidades
En el momento de la introducción de datos: Aplicar la comparación aproximada en el momento de la introducción e integración de los datos para detectar registros casi duplicados antes de que entren en el sistema. La comparación aproximada compara nombres, direcciones, direcciones de correo electrónico y números de teléfono utilizando algoritmos de similitud en lugar de la coincidencia exacta de cadenas de caracteres, detectando «John Smith» y «Jon Smyth» como posibles duplicados.
En los datos existentes:aplicarla resolución de entidades a los registros históricos para identificar y fusionar los duplicados. La resolución de entidades utiliza modelos de aprendizaje automático entrenados con pares de duplicados conocidos para calcular la probabilidad de que dos registros correspondan a la misma entidad del mundo real. Los registros que superan un umbral de confianza se fusionan automáticamente; los que se encuentran en un rango de incertidumbre se remiten para su revisión manual.
En curso: Implementar una capa de gestión de datos maestros que mantenga un único registro de referencia para cada entidad —cliente, producto, proveedor, empleado— y canalice todas las actualizaciones a través de ese registro, en lugar de permitir que se acumulen copias paralelas.
Prevención:Añadereglas de validación de unicidad a los flujos de ingestión que comprueben los nuevos registros con respecto al conjunto de datos existente antes de guardarlos. Deriva los posibles duplicados a un flujo de trabajo de gestión de datos, en lugar de crear automáticamente un nuevo registro.
Problema n.º 2: Datos incompletos
Por qué ocurre
Los datos incompletos tienen dos causas fundamentales: el diseño de campos opcionales y los fallos en la aplicación de las normas.
El diseño de campos opcionales implica que los campos que resultan importantes para los casos de uso posteriores se configuraron como opcionales en el sistema de origen, ya que no eran obligatorios en el momento de la recopilación de datos. Un formulario de captación de clientes potenciales que no incluya un campo sobre el tamaño de la empresa genera una base de datos de CRM llena de clientes potenciales sin información sobre el tamaño de la empresa, lo cual resulta inútil para cualquier segmentación que dependa de ese campo.
Los fallos de validación se producen cuando los campos obligatorios están técnicamente validados, pero se elude dicha validación: por ejemplo, al introducir un «999» o un «N/A» en un campo numérico obligatorio, al insertar una fecha por defecto (1 de enero de 1900) cuando no hay ninguna fecha disponible, o al utilizar una dirección de correo electrónico de relleno para superar la validación. Estos registros parecen completos, pero los valores de los campos carecen de sentido.
Cuánto cuesta
Los datos incompletos afectan al análisis de forma silenciosa. Un modelo de valor del ciclo de vida del cliente que excluye el 20 % de los registros en los que faltan datos sobre la antigüedad subestima sistemáticamente el LTV de un segmento específico de clientes: aquel que no proporciona datos sobre la antigüedad. El modelo parece correcto porque genera cifras, pero estas son erróneas de una forma difícil de detectar sin examinar la calidad de los datos de entrenamiento.
En el ámbito sanitario, los historiales de los pacientes incompletos provocan errores clínicos. Un historial de medicación en el que falte el campo correspondiente a las alergias no es un historial incompleto, sino un riesgo para la seguridad del paciente.
Solución: Control de la integridad, reglas de validación y corrección a nivel de código fuente
Supervisión de la integridad:Analiza continuamentecada conjunto de datos para medir la tasa de valores nulos y la tasa de valores perdidos en cada campo. Realiza un seguimiento de las tendencias a lo largo del tiempo. Un campo cuya tasa de integridad descienda del 98 % al 85 % en dos semanas indica un cambio en el sistema de origen o un fallo en el proceso de tratamiento de datos que requiere una investigación inmediata.
Reglas de validación en la ingesta:Definelos requisitos de integridad para cada campo clasificado como obligatorio para los casos de uso posteriores y aplícalos en el momento de la ingesta. Los registros que no superen las comprobaciones de integridad se desvían a una cola de corrección, en lugar de pasar al conjunto de datos de producción.
Corrección a nivel de origen:siempre que seaposible, colabora con los responsables de los sistemas de origen para exigir los campos que necesitan los sistemas posteriores. Un campo del CRM que antes era opcional puede pasarse a ser obligatorio para los nuevos registros a partir de ahora. Puede que no sea posible subsanar las lagunas históricas, pero siempre es posible evitar que se acumulen registros incompletos en el futuro.
Enriquecimiento:En el caso delos campos que no puedan marcarse como obligatorios en la fuente, utilice servicios de enriquecimiento de datos para completar la información a partir de fuentes externas fiables. Los campos de dirección pueden enriquecerse a partir de bases de datos de las autoridades postales. Los campos relativos a las empresas pueden enriquecerse a partir de bases de datos firmográficas.
Problema n.º 3: Datos inexactos
Por qué ocurre
La inexactitud de los datos tiene tres causas principales.
Errores de introducción manual se producen cuando las personas introducen datos: errores tipográficos, transposiciones, asignaciones incorrectas de campos y errores al copiar y pegar que introducen valores de registros adyacentes.
Registros obsoletos se acumulan cuando los datos no se actualizan tras los cambios que se producen en la vida real: un cliente que se mudó hace dos años sigue figurando en el sistema con su antigua dirección, un proveedor cuyo contacto ha cambiado tiene un contacto principal incorrecto, un producto cuya clasificación normativa ha cambiado sigue etiquetado con la clasificación anterior.
Errores de migración se producen cuando los datos se transfieren entre sistemas y la lógica de transformación introduce imprecisiones: asignaciones de campos incorrectas, conversiones de formato que pierden precisión o cambios en los tipos de datos que truncan los valores.
Cuánto cuesta
Un solo campo incorrecto en una presentación reglamentaria puede invalidar un informe cuya elaboración ha llevado semanas. Una entidad financiera que presente un informe de riesgos con datos de exposición inexactos se enfrenta a un escrutinio por parte de las autoridades reguladoras, a posibles sanciones y a un problema de credibilidad ante el regulador que persiste más allá del incidente inmediato.
En las operaciones de atención al cliente, los datos inexactos se traducen en una mala experiencia para el cliente. Un paciente que recibe una factura a su nombre pero con una dirección anterior, un cliente que recibe un correo electrónico personalizado con una recomendación de producto errónea, un envío dirigido a una dirección obsoleta… Cada uno de estos casos supone un fallo de precisión que repercute directamente en el cliente.
Solución: Creación automática de perfiles, validación y detección de cambios
Perfilado automatizado analiza continuamente los conjuntos de datos para identificar valores que se salen de los rangos estadísticos esperados: el importe de una transacción que se sitúa 50 desviaciones estándar por encima de la media, una fecha de nacimiento que implica una edad de 150 años, un código postal que no existe en la base de datos postal oficial. La detección de valores atípicos señala los casos dudosos para que los revisen los responsables, sin necesidad de inspeccionar manualmente cada registro.
Validación entre sistemas compara los valores de los campos entre los distintos sistemas que comparten datos para detectar inconsistencias. Si el CRM muestra a un cliente como activo y el sistema de facturación lo muestra como dado de baja, uno de los dos está incorrecto. La validación entre sistemas detecta estos conflictos y los remite al sistema de referencia para su resolución.
Detección de cambios y seguimiento de la actualidad Realiza un seguimiento de cuándo se actualizaron por última vez los registros y señala aquellos cuyos valores puedan estar desactualizados en función de la tasa de cambio prevista para ese campo. Los campos de dirección de los clientes que no se hayan actualizado en cinco o más años son candidatos para el enriquecimiento de datos o para acciones de captación.
Validación a nivel de fuente detecta los errores en el momento de la introducción de datos: validación de direcciones frente a bases de datos postales en el momento de la introducción en el CRM, validación del formato de los números de teléfono antes de guardar el registro y comprobaciones de integridad referencial que confirman la existencia de registros relacionados antes de que se guarde un nuevo registro.
Cuestión 4: Datos incoherentes
Por qué ocurre
La incoherencia es el problema de calidad de los datos que se debe más directamente a un fallo en la gobernanza. Cuando distintos sistemas definen un mismo concepto de forma diferente —«cliente activo» significa «comprador en los últimos 90 días» en marketing y «comprador en los últimos 180 días» en finanzas—, cada informe que cruza datos de distintos sistemas arroja cifras que no coinciden. Ninguno de los sistemas está equivocado según su propia definición, pero la organización no puede ofrecer una respuesta única y coherente a la pregunta: «¿Cuántos clientes activos tenemos?».
Las incoherencias se van acumulando con el paso de los años, a medida que los equipos desarrollan los sistemas de forma independiente con requisitos distintos, las adquisiciones incorporan datos externos con definiciones diferentes y la terminología varía de una unidad de negocio a otra sin que exista una autoridad central que la armonice.
Cuánto cuesta
Cada reunión ejecutiva en la que dos equipos presentan cifras contradictorias procedentes de sistemas diferentes supone un coste directo derivado de la falta de coherencia de los datos: el tiempo dedicado en la reunión a debatir qué cifra es la correcta, la investigación posterior para conciliarlas y la pérdida de confianza en la toma de decisiones basada en datos que se va acumulando cuando esto ocurre de forma repetida.
En el caso de los sistemas de inteligencia artificial, los datos de entrenamiento incoherentes resultan especialmente perjudiciales. Un modelo entrenado con datos procedentes de dos sistemas de origen que definen la misma característica de forma diferente aprende patrones contradictorios, lo que da lugar a resultados incoherentes que no pueden explicarse ni depurarse sin rastrear el origen de la incoherencia hasta los datos de entrenamiento.
Solución: Glosario empresarial regulado, contratos de datos y gestión de datos maestros
Glosario empresarial regulado: Define cada término empresarial que aparezca en más de un sistema con una única definición oficial, vincula esa definición a los campos específicos de cada sistema al que se aplique, asigna un responsable para su mantenimiento y publícalo en el catálogo de datos, donde todos los equipos puedan encontrarlo. Una entrada en el glosario empresarial para «Cliente activo» que especifique «un cliente que haya realizado una compra en los últimos 90 días, según lo registrado en el campo order_date de la tabla de transacciones» elimina la fuente de la inconsistencia.
Contratos de datos: Acuerdos formales entre productores y consumidores de datos que especifican el esquema, las definiciones de los campos y los estándares de calidad que el productor se compromete a mantener. Cuando un productor modifica la definición de un campo, el sistema de cumplimiento de los contratos de datos señala la infracción antes de que se propague a los consumidores posteriores.
Gestión de datos maestros: Una capa de MDM mantiene un único registro de referencia para las entidades clave del negocio —clientes, productos, proveedores— y garantiza la coherencia de las definiciones en todos los sistemas que hacen referencia a ellas. Los sistemas que necesitan conocer el estado de un cliente consultan el MDM en lugar de mantener su propia copia del registro del cliente.
Tema 5: Datos obsoletos
Por qué ocurre
Los datos quedan obsoletos cuando el intervalo entre las actualizaciones de la fuente y su disponibilidad en las fases posteriores supera el requisito de actualidad para el uso previsto. Un proceso por lotes diario que actualiza los datos de inventario a las 2 de la madrugada genera datos que tienen hasta 23 horas de antigüedad cuando el equipo de gestión de pedidos de la tarde los utiliza. En un entorno de inventario de alta velocidad, los datos con 23 horas de antigüedad no son adecuados para tomar decisiones sobre la gestión de pedidos.
A menudo, la información obsoleta pasa desapercibida porque los flujos de datos se completan correctamente y los datos parecen estar actualizados —la tabla se actualizó por última vez hoy—, pero los datos de origen a partir de los cuales se creó ya tenían varias horas o días de antigüedad cuando se ejecutó el flujo de datos.
Cuánto cuesta
En el comercio electrónico, los datos de inventario desactualizados provocan sobreventas: los clientes piden productos que no están en stock porque el sistema de inventario muestra cantidades que eran correctas hace 18 horas. Cada sobreventa genera una cancelación, una interacción con el servicio de atención al cliente y una posible pérdida de clientes.
En el sector de los servicios financieros, los datos de mercado obsoletos que se introducen en los modelos de riesgo dan lugar a cálculos de posiciones que no reflejan las condiciones actuales del mercado. En el ámbito sanitario, las listas de medicamentos desactualizadas provocan que las decisiones sobre la prescripción se basen en historiales farmacológicos obsoletos.
Solución: Acuerdos de nivel de servicio (SLA) de frescura, supervisión de los procesos y rutas de datos en tiempo real
Acuerdos de nivel de servicio (SLA) sobre la frescura: Define la antigüedad máxima aceptable de los datos para cada conjunto de datos utilizado en operaciones en las que el tiempo es un factor crítico. Un conjunto de datos de inventario utilizado para la gestión de pedidos puede requerir una antigüedad máxima de 15 minutos. Un conjunto de datos de segmentación de clientes utilizado para campañas de marketing semanales puede tolerar una antigüedad máxima de 24 horas. Documenta estos SLA en el catálogo de datos como parte del registro de gobernanza del conjunto de datos.
Supervisión de los procesos con alertas de vigencia: Supervisa cada proceso para garantizar que se complete a tiempo y avisa inmediatamente cuando un proceso falle o se retrase. Vincula la supervisión de la vigencia a los flujos de trabajo de gestión, de modo que cualquier conjunto de datos obsoleto se señale al responsable correspondiente antes de que se utilice en decisiones de producción.
Rutas de datos en tiempo real para casos de uso en los que el tiempo es un factor crítico:paraaquellas operaciones que realmente no pueden tolerar la latencia de los procesos por lotes, sustituye los flujos de datos por lotes por flujos en tiempo real que entreguen los datos en cuestión de segundos tras los eventos de origen. Las arquitecturas de streaming que utilizan Kafka o plataformas similares reducen el retraso en la actualización de los datos de horas a segundos en los casos de uso que así lo requieran.
Visibilidad de la antigüedad de los datos en el catálogo:Muestrade forma destacada en el catálogo de datos las marcas de tiempo de la última actualización, junto con las puntuaciones de calidad y el estado de la certificación, para que los usuarios puedan evaluar la actualidad de los datos antes de utilizar un conjunto de datos. Un analista que vea que un conjunto de datos se actualizó por última vez hace 19 horas podrá tomar una decisión fundamentada sobre si está lo suficientemente actualizado para su caso de uso.
N.º 6: Datos no válidos
Por qué ocurre
Los datos no válidos son aquellos que no se ajustan a los formatos definidos, a los rangos de valores o a las reglas de negocio. Un campo de fecha que contenga «99/99/9999», un valor negativo en un campo de cantidad que solo admita números enteros positivos, una dirección de correo electrónico sin el símbolo «@» o un código postal que no coincida con ningún código postal válido: todos ellos están técnicamente presentes, pero carecen de sentido o resultan perjudiciales cuando se utilizan en un cálculo, una consulta o un modelo.
Los datos no válidos se acumulan cuando no existen reglas de validación en el momento de la introducción de datos, cuando los cambios en el esquema introducen nuevas restricciones que los datos existentes no cumplen, o cuando se cargan datos procedentes de fuentes externas sin normalizar su formato.
Cuánto cuesta
Los datos no válidos provocan fallos en el proceso de integración cuando los sistemas posteriores intentan analizar valores que no se ajustan a los formatos esperados. Una tarea ETL que espera un año de cuatro dígitos y se encuentra con «9999» genera una excepción y falla. El proceso se detiene, los datos no se cargan y los informes posteriores no están disponibles hasta que se investigue y resuelva el problema.
En los sectores regulados, la presencia de datos no válidos en una presentación da lugar a su rechazo. Una empresa farmacéutica cuyo conjunto de datos de un ensayo clínico contenga valores fuera de rango en los campos obligatorios recibe una carta de respuesta completa de la FDA en la que se le exige volver a presentar la documentación. El coste no es solo el de volver a presentar la documentación, sino también el retraso que ello supone en el calendario regulatorio.
Solución: Validación de datos de entrada, aplicación del esquema y corrección automática
Validación de datos en origen: Se deben aplicar reglas de validación en el momento de la introducción de datos y la integración del sistema que impidan que se introduzcan valores no válidos en el sistema. La validación del formato de los campos de correo electrónico, teléfono y dirección postal, la validación de rangos para los campos numéricos, las comprobaciones de integridad referencial para los campos de clave externa y la validación de reglas de negocio para las restricciones específicas del dominio deben activarse antes de que se guarde un registro.
Aplicación del esquema en la ingesta: En el caso de los datos procedentes de fuentes externas, se debe implementar una validación del esquema en la capa de ingesta que compruebe que los datos entrantes se ajustan al esquema de destino antes de cargarlos. Los registros que no superen la validación del esquema se ponen en cuarentena en una tabla de rechazo para su análisis, en lugar de cargar valores no válidos en el conjunto de datos de producción.
Corrección automática de patrones habituales: Muchos tipos de datos no válidos pueden corregirse automáticamente: números de teléfono que pueden reformatearse a un formato estándar, códigos postales que pueden validarse y corregirse comparándolos con una base de datos postal oficial, y campos de fecha cuyo formato se conoce pero que están codificados incorrectamente. Implemente reglas de corrección automática para patrones corregibles que se den en grandes volúmenes y remita los casos realmente ambiguos a revisión por parte del responsable de la gestión de datos.
Gobernanza de esquemas basada en contratos: Los contratos de datos que especifican el esquema exacto, los tipos de campo y las reglas de validación que deben respetar los productores de datos ofrecen a los consumidores posteriores una garantía formal sobre los datos que reciben y un mecanismo de alerta en caso de que se incumpla dicha garantía.
Elegir las soluciones adecuadas para tu entorno
No todas las organizaciones necesitan las seis soluciones al mismo nivel de madurez al mismo tiempo. Establece prioridades en función de los problemas que más dificultades están causando actualmente a la empresa.
| Si tu mayor problema es… | Empieza por aquí |
|---|---|
| Registros duplicados de clientes o productos | Resolución de entidades y gestión de datos maestros (MDM) |
| Los campos que faltan afectan al análisis o al entrenamiento de aprendizaje automático | Control de la exhaustividad y requisitos de campo a nivel de fuente |
| Informes que presentan discrepancias entre las distintas unidades de negocio | Glosario empresarial regulado y contratos de datos |
| Los datos obsoletos provocan fallos operativos | Acuerdos de nivel de servicio (SLA) de frescura y supervisión del proceso |
| Fallos en el proceso de tratamiento de datos debidos a valores inesperados | Aplicación del esquema durante la ingesta y validación de los datos de entrada |
| Valores inexactos que se detectan después de que hayan influido en las decisiones | Creación automática de perfiles, validación entre sistemas y detección de cambios |
Las mejoras en la calidad de los datos más duraderas abordan las causas fundamentales en el origen, en lugar de aplicar procesos de limpieza posteriores que deben repetirse indefinidamente. La validación en el origen evita que los datos no válidos entren en el sistema. Las definiciones reguladas evitan que se acumulen las incoherencias. La supervisión de la actualidad de los datos impide que los datos obsoletos lleguen al entorno de producción. Cada una de estas inversiones en las fases iniciales genera beneficios acumulativos a medida que crece el conjunto de datos.
Preguntas frecuentes
Los seis problemas más habituales son: registros duplicados, datos incompletos, datos inexactos, datos incoherentes entre sistemas, datos obsoletos y datos no válidos que no superan la validación de formato o de reglas de negocio. La mayoría de las empresas se enfrentan a los seis problemas a la vez, pero la gravedad y el impacto en el negocio varían según el sector y el caso de uso.
Las causas fundamentales más habituales son: la introducción manual de datos sin validación; las integraciones de sistemas que no eliminan los registros duplicados ni validan los registros entrantes; la ausencia de un glosario empresarial regulado, lo que provoca incoherencias en las definiciones entre los distintos sistemas; los procesos por lotes con una latencia que supera los requisitos de actualidad de los casos de uso posteriores; los cambios en el esquema que incumplen las reglas de validación existentes; y las migraciones de sistemas que transforman los datos de forma incorrecta.
La limpieza de datos es un proceso reactivo: consiste en detectar y corregir problemas de calidad en los datos existentes. La gestión de la calidad de los datos es un programa proactivo: consiste en prevenir los problemas de calidad mediante reglas de validación, supervisar la calidad de forma continua, abordar las causas fundamentales en su origen y mantener la calidad a lo largo del tiempo mediante la administración y la gobernanza. La limpieza trata los síntomas; la gestión de la calidad trata las causas.
Mediante la resolución de entidades: modelos de aprendizaje automático entrenados con pares de duplicados conocidos que calculan la probabilidad de que dos registros correspondan a la misma entidad del mundo real. Los registros que superan un umbral de confianza se fusionan automáticamente. Los registros que se encuentran en un rango de incertidumbre se remiten para su revisión humana. A continuación, una capa de gestión de datos maestros se encarga de mantener un único registro de referencia de cara al futuro y evita que se acumulen nuevos duplicados.
La observabilidad de los datos consiste en la supervisión continua del estado de los datos en todo el entorno de datos: el seguimiento de los índices de calidad, la detección de anomalías en el recuento de filas, las tasas de valores nulos y las distribuciones de valores, así como la notificación a los equipos cuando los datos caen por debajo de los umbrales definidos o se comportan de forma inesperada. Se trata de la capa operativa que detecta los problemas de calidad antes de que lleguen a los informes de producción o a los flujos de trabajo de IA, lo que permite pasar de una gestión de la calidad reactiva a una proactiva.
Un contrato de datos es un acuerdo formal entre un productor de datos y un consumidor de datos que especifica el esquema, las definiciones de los campos, los estándares de calidad y el acuerdo de nivel de servicio (SLA) de actualización que el productor se compromete a mantener. Cuando un productor modifica la definición de un campo o incumple un umbral de calidad, el sistema de cumplimiento del contrato avisa a los consumidores posteriores antes de que el cambio se propague. Los contratos de datos son el mecanismo más eficaz para prevenir inconsistencias y fallos de calidad relacionados con cambios en el esquema.
Los modelos de IA heredan todos los problemas de calidad de los datos presentes en sus conjuntos de entrenamiento. Los registros duplicados hacen que los modelos den demasiada importancia a ciertos patrones. Los registros incompletos hacen que los modelos pasen por alto señales predictivas. Las definiciones incoherentes hacen que los modelos aprendan patrones contradictorios. Los valores inexactos hacen que los modelos aprendan relaciones erróneas. La calidad de los datos no es un requisito previo para la IA, sino la base que determina si los resultados de la IA son fiables o peligrosamente poco fiables.
Se pueden obtener resultados rápidos en cuestión de semanas: creación automatizada de perfiles para establecer una referencia, reglas básicas de validación en el momento de la ingesta y un panel de control para supervisar la integridad de los datos. La mejora sostenible —definiciones reguladas, resolución de entidades, contratos de datos y validación a nivel de fuente en todos los principales flujos de trabajo— suele llevar entre 6 y 12 meses en el caso de las organizaciones de tamaño medio. Las organizaciones que mantienen la calidad de los datos a largo plazo invierten en prevención, en lugar de en campañas periódicas de limpieza.