La calidad de los datos es la medida de hasta qué punto los datos cumplen los estándares exigidos para el uso al que están destinados, ya sea para tomar una decisión empresarial, elaborar un informe normativo, entrenar un modelo de inteligencia artificial o atender a un cliente.
Los datos de alta calidad son precisos, completos, coherentes, oportunos, válidos y únicos. Se calcula que los datos de baja calidad suponen a las organizaciones un coste medio de entre 12 y 15 millones de dólares al año debido a ineficiencias operativas, decisiones erróneas, proyectos fallidos y sanciones por incumplimiento normativo.
Esta guía explica qué es la calidad de los datos, las seis dimensiones que se utilizan para medirla, cómo funciona la gestión de la calidad, quién es el responsable de ella, cómo se relaciona con la gobernanza de los datos y la inteligencia artificial, y cómo crear un programa que la mejore de forma sistemática.
¿Qué es la calidad de los datos?
La calidad de los datos es el grado en que estos son adecuados para el uso previsto. Un conjunto de datos de alta calidad para un fin concreto puede resultar insuficiente para otro. Los registros de clientes lo suficientemente precisos para la facturación pueden no cumplir los requisitos de exhaustividad para un modelo predictivo de pérdida de clientes. Los datos de transacciones financieras suficientes para la elaboración de informes internos pueden no cumplir los requisitos de trazabilidad y precisión para una presentación ante las autoridades reguladoras.
La calidad no es un único atributo, sino una combinación de seis dimensiones cuantificables, cada una de las cuales tiene una importancia diferente en función del caso de uso.
Las seis dimensiones de la calidad de los datos
| Dimensión | Definición | Ejemplo de fallo | Cómo se mide |
|---|---|---|---|
| Precisión | Los datos representan correctamente el valor del mundo real que describen | La dirección de un cliente se registra como dirección anterior una vez que se ha mudado. | Comparación con sistemas de referencia fidedignos; tasa de error por campo |
| Integridad | Todos los campos obligatorios se han rellenado con valores no nulos y no vacíos. | Al 15 % de los registros de clientes les falta una dirección de correo electrónico | Porcentaje de valores nulos y porcentaje de valores faltantes por campo obligatorio |
| cohérence | El mismo valor de datos se representa de forma idéntica en todos los sistemas en los que aparece. | Tanto «Activo» en el CRM como «A» en el sistema de facturación se refieren a un cliente activo, pero los sistemas no coinciden en el recuento. | Comparación entre sistemas de los campos compartidos |
| Oportunidad | Los datos están actualizados y disponibles cuando se necesitan para el uso previsto. | Los datos de existencias de ayer se utilizan para atender los pedidos de hoy. | Antigüedad de los datos en el momento de su uso; latencia de actualización frente al SLA |
| Validez | Los datos se ajustan a los formatos, rangos y reglas de negocio definidos | Un campo de fecha contiene «13/2026», que no es un formato de fecha válido. | Índice de conformidad con las reglas de validación definidas |
| Singularidad | Cada entidad del mundo real se representa exactamente una vez, sin duplicados. | El mismo cliente aparece 47 veces en el CRM con variaciones ortográficas en su nombre. | Índice de detección de duplicados; índice de coincidencia en la resolución de entidades |
Todo programa de calidad de datos debe definir umbrales aceptables para cada dimensión, según el ámbito de datos. Un conjunto de datos de transacciones financieras podría requerir una precisión del 99,9 % y una exhaustividad del 100 % en los campos obligatorios. Una lista de contactos de marketing podría tolerar índices de valores nulos más elevados en los campos opcionales. Los umbrales definidos por ámbito permiten medir y certificar la calidad.
Por qué es importante la calidad de los datos
Toma de decisiones: Toda decisión empresarial es tan fiable como los datos en los que se basa. Las previsiones elaboradas a partir de datos de ventas inexactos dan lugar a proyecciones erróneas. Las campañas de marketing dirigidas a segmentos de clientes con datos incompletos no llegan a los destinatarios adecuados. Las operaciones optimizadas a partir de datos de inventario obsoletos provocan fallos en la gestión de los pedidos. La calidad de los datos no es una cuestión técnica, sino que afecta al rendimiento empresarial.
Cumplimiento normativo: El RGPD, la HIPAA, la ley SOX, la norma BCBS 239 y la CCPA establecen requisitos en materia de exactitud e integridad de los datos. La norma BCBS 239 exige a los bancos que demuestren que los datos sobre riesgos son exactos y completos. La HIPAA exige que los historiales de los pacientes sean exactos y estén actualizados. La ley SOX exige que los datos de los informes financieros sean fiables y trazables. El incumplimiento de estas normas debido a una mala calidad de los datos conlleva sanciones, riesgo de litigios y daños a la reputación.
IA y aprendizaje automático: Los modelos de IA aprenden a partir de los datos de entrenamiento. Unos datos de entrenamiento inexactos, incompletos o incoherentes dan lugar a modelos que realizan predicciones erróneas. Un modelo de detección de fraudes entrenado con datos en los que el 20 % de las transacciones están duplicadas aprende a reconocer patrones que no existen. Un modelo de recomendación entrenado con datos de productos obsoletos muestra artículos que están agotados. La calidad de los datos es la base de una IA fiable.
Eficiencia operativa: La mala calidad de los datos genera trabajo adicional: los ingenieros tienen que reparar flujos de datos que fallan debido a valores nulos inesperados; los analistas tienen que volver a generar informes tras descubrir errores en las fuentes; y los equipos de atención al cliente tienen que corregir errores de facturación causados por registros incoherentes. Gartner estima que la mala calidad de los datos cuesta a las organizaciones una media de 15 millones de dólares al año. La mayor parte de ese coste es invisible, ya que se traduce en el tiempo que las personas dedican a sortear los problemas que plantean unos datos en los que no confían.
Experiencia del cliente: Los registros duplicados de clientes generan comunicaciones duplicadas. Los datos de dirección inexactos provocan fallos en las entregas. Los datos de preferencias desactualizados dan lugar a recomendaciones irrelevantes. La experiencia del cliente en las fases posteriores de un negocio viene determinada por la calidad de los datos en las fases iniciales.
Para realizar un seguimiento continuo del estado de los datos en todas las cadenas de procesamiento, consulta nuestra guía sobre la observabilidad de los datos.
Cómo se mide la calidad de los datos
La medición de la calidad requiere definir qué se considera «bueno» en cada ámbito antes de realizar la evaluación en función de ello. El proceso de medición consta de cuatro componentes.
Perfilado de datos: Análisis automatizado de los activos de datos para evaluar sus características de calidad actuales: índices de valores nulos, distribuciones de valores, patrones de formato, índices de duplicados e integridad referencial. La elaboración de perfiles establece la línea de referencia e identifica dónde existen deficiencias de calidad sin necesidad de una inspección manual.
Reglas de validación:Reglas de negocioque definen qué se considera datos válidos para cada campo: rangos de valores aceptables, formatos obligatorios, restricciones de referencia y dependencias entre campos. Las reglas de validación se aplican de forma continua a los datos entrantes y almacenados, y marcan los registros que no cumplen los requisitos.
Puntuación de calidad: Agregación de los resultados del análisis de perfiles y de la validación en una única puntuación de calidad por activo. Las puntuaciones permiten comparar la calidad entre activos y a lo largo del tiempo. Un conjunto de datos con una puntuación de calidad del 94 % es más fiable que uno con una puntuación del 71 %, y un conjunto de datos cuya puntuación haya descendido del 94 % al 87 % en dos semanas indica un problema de calidad en el proceso o en la fuente que debe investigarse.
Supervisión de la calidad y alertas: Supervisión continua de los índices de calidad con alertas automáticas cuando los índices caen por debajo de los umbrales definidos o cuando aparecen anomalías: caídas inesperadas en el recuento de filas, aumentos repentinos de la tasa de valores nulos, cambios en el esquema que incumplen las reglas de validación. La supervisión detecta los problemas de calidad antes de que lleguen a los informes de producción o a los procesos de entrenamiento de modelos.
Los índices de calidad son uno de los principales indicadores de evaluación en la búsqueda de datos. Los usuarios que valoran si un conjunto de datos es adecuado para su caso de uso se basan en los resultados de los perfiles y en los parámetros de calidad que aparecen en el catálogo. Para consultar las definiciones de «calidad» y los demás conceptos que garantizan la fiabilidad de la búsqueda, véase elglosario de búsqueda de datos.
El coste de una mala calidad de los datos
Las organizaciones rara vez miden directamente el coste que supone la mala calidad de los datos, y por eso este problema persiste. Los costes se reparten entre los distintos equipos y presupuestos de tal forma que la causa principal queda oculta.
| Categoría de gastos | Cómo la mala calidad de los datos lo provoca |
|---|---|
| Revisión de diseño | Los procesos de integración fallan debido a valores nulos inesperados, errores de formato o violaciones de la integridad referencial. Los ingenieros dedican tiempo a depurar y corregir errores, en lugar de a desarrollar. |
| Revisión del analista | Los informes se vuelven a generar tras detectarse problemas de calidad en los datos de origen. Los analistas dedican tiempo a validar los datos en lugar de analizarlos. |
| Malas decisiones | Las estrategias basadas en datos inexactos dan lugar a resultados erróneos: objetivos de ingresos no alcanzados, exceso de existencias y lanzamientos de productos fallidos. |
| Sanciones por incumplimiento | Las infracciones del RGPD, la HIPAA y la ley SOX provocadas por datos inexactos o incompletos conllevan sanciones económicas directas. |
| Pérdida de clientes | Las comunicaciones duplicadas, los errores de facturación y los fallos en las entregas provocados por una mala calidad de los datos perjudican las relaciones con los clientes. |
| Fallos de la IA | Los modelos entrenados con datos de baja calidad ofrecen predicciones poco fiables, lo que obliga a realizar un nuevo entrenamiento costoso y retrasa su puesta en marcha. |
| Preparación de la auditoría | La reconstrucción manual de los datos que acreditan la calidad de los datos para las auditorías supone semanas de trabajo para el equipo de cumplimiento normativo cuando los registros de calidad no se mantienen de forma automática. |
¿Quién es responsable de la calidad de los datos?
La calidad de los datos es una responsabilidad compartida que se distribuye entre distintos puestos con funciones específicas.
| Función | Responsabilidad | Responsabilidad en el día a día |
|---|---|---|
| Titular de los datos | Responsabilidad empresarial máxima en materia de calidad en su ámbito de competencia | Establece las normas de calidad para el dominio, aprueba los criterios de certificación y promueve la gestión responsable |
| Responsable de datos | Gestión de la calidad operativa en el ámbito | Supervisa los índices de calidad, resuelve los problemas señalados, certifica los activos que cumplen los umbrales y gestiona las excepciones |
| Ingeniero de datos | Infraestructura de calidad técnica | Incorpora controles de calidad en los procesos, aplica reglas de validación y lleva a cabo medidas correctivas técnicas |
| Responsable de gobernanza de datos | Normas de calidad para toda la organización | Define los indicadores de calidad y los umbrales que se aplican en todos los ámbitos, y realiza un seguimiento del estado del programa |
| Analista de datos | Uso responsable de los activos con puntuación de calidad | Informa de los problemas de calidad detectados en el trabajo analítico y utiliza recursos certificados para la elaboración de informes de producción |
| CDO | Responsabilidad de la dirección respecto a la situación de la calidad de los datos | Analiza los indicadores de calidad, asigna recursos para solucionar los fallos de calidad recurrentes y comunica a la dirección el estado de la calidad de los datos. |
El error más habitual en los programas de calidad de datos es considerar la calidad como una responsabilidad puramente técnica que recae en el departamento de ingeniería de datos. Los ingenieros pueden crear controles de calidad y resolver problemas técnicos, pero no pueden definir qué significa «preciso» en un ámbito empresarial concreto, certificar si un conjunto de datos es adecuado para un fin empresarial específico ni resolver inconsistencias en las definiciones entre distintos ámbitos. Para ello se requiere la implicación de las áreas de negocio y la responsabilidad de gestión.
Las seis fases de la gestión de la calidad de los datos
1. Evaluar
Realice un análisis detallado de todos los activos de datos incluidos en el alcance para establecer un nivel de calidad de referencia en las seis dimensiones. Identifique los ámbitos que presentan un mayor riesgo empresarial o exposición normativa y establezca en primer lugar los umbrales de calidad para dichos ámbitos.
2. Definir normas
Redacta las normas de calidad aplicables a cada ámbito prioritario: los umbrales aceptables para cada dimensión, las reglas de validación que garantizan su cumplimiento y los criterios de certificación que hacen que un activo sea lo suficientemente fiable como para utilizarlo en la elaboración de informes de producción y en el entrenamiento de la inteligencia artificial.
3. Realizar un seguimiento continuo
Implemente un sistema automatizado de supervisión de la calidad que compruebe continuamente que cada activo cumple con los estándares definidos. Configure alertas para los casos en que se superen los umbrales establecidos y se detecten anomalías. Vincule la supervisión a los flujos de trabajo de gestión, de modo que los problemas se deriven automáticamente a la persona adecuada, en lugar de quedarse en un panel de control sin que nadie les dé seguimiento.
4. Corregir
Resuelve los problemas de calidad en el origen siempre que sea posible. La limpieza posterior —es decir, corregir los datos una vez que han entrado en el almacén— trata los síntomas en lugar de las causas y genera una carga de mantenimiento continua. Cuando no sea posible aplicar medidas correctivas en el origen de forma inmediata, implementa controles posteriores que eviten que los datos de mala calidad lleguen a los informes de producción o a los flujos de trabajo de IA.
5. Certificar
Aplicar el estado de certificación a los activos que cumplan los umbrales de calidad definidos y hayan sido revisados por un responsable. Los activos certificados aparecen con una insignia de verificación en el catálogo de datos. Los usuarios confían en los activos certificados sin necesidad de una validación independiente. La certificación es el mecanismo que traduce la medición de la calidad en confianza por parte de los usuarios.
6. Mejorar
Realiza un seguimiento de la evolución de la puntuación de calidad a lo largo del tiempo por dominio. Identifica los fallos de calidad recurrentes y aborda sus causas fundamentales: problemas en el sistema de origen, errores en la lógica del proceso, incoherencias en las definiciones o reglas de validación que faltan. Presenta mensualmente al equipo directivo de gobernanza un informe con las métricas de calidad. Los programas que no muestran una mejora de la calidad a lo largo del tiempo no están mejorando.
La calidad de los datos según la función: qué significa en la práctica
Analista de datos: Antes de la gestión de la calidad: dedica entre el 30 y el 40 % de su tiempo de trabajo a buscar datos, validarlos y confirmar con los ingenieros que la versión encontrada es la correcta. Después: busca en el catálogo, comprueba la puntuación de calidad y el estado de certificación de los activos candidatos, y utiliza los certificados sin necesidad de escalar el problema. El tiempo dedicado a la validación de datos se reduce a menos del 10 %.
Ingeniero de datos: Antes: detecta problemas de calidad de los datos cuando los flujos de trabajo fallan en producción. La investigación de la causa raíz lleva horas. Las soluciones son reactivas y, a menudo, incompletas. Después: se realizan comprobaciones de calidad en el flujo de trabajo antes de que los datos lleguen a producción. Los fallos se derivan automáticamente a los flujos de trabajo de gestión de datos. Los ingenieros abordan los problemas de forma proactiva en lugar de reactiva.
Responsable de datos: Supervisa las puntuaciones de calidad de cada activo de su ámbito a través de una única interfaz de catálogo. Cuando una puntuación cae por debajo del umbral, se activa una alerta y se asigna el problema. El responsable investiga, coordina la solución con el ingeniero de datos y, o bien resuelve el problema, o bien mantiene el activo fuera del estado de certificación hasta su resolución.
Responsable de cumplimiento:Las certificaciones de calidady los historiales de validación se conservan como registros de gobernanza en el catálogo de datos. Las solicitudes de auditoría relativas a pruebas de calidad se atienden a partir de estos registros, en lugar de recopilarse manualmente. Las auditorías conforme a las normas BCBS 239, HIPAA y SOX que requieren documentación sobre la calidad de los datos se completan en cuestión de horas, en lugar de semanas.
Científico de datos: Los conjuntos de datos de entrenamiento incluyen puntuaciones de calidad, historiales de validación y estado de certificación. El científico de datos selecciona conjuntos de datos certificados con puntuaciones de calidad superiores a los umbrales definidos y puede documentar las pruebas de calidad para garantizar la reproducibilidad del modelo y cumplir con los requisitos normativos sin necesidad de realizar trabajo manual adicional.
Calidad y gobernanza de los datos
La calidad de los datos y la gobernanza de los datos son interdependientes. La gobernanza define los estándares de calidad, asigna la responsabilidad de velar por su cumplimiento y establece las políticas que permiten aplicar los requisitos de calidad. La gestión de la calidad de los datos se encarga de aplicar dichas políticas mediante la elaboración de perfiles, la supervisión y la corrección.
| La gobernanza garantiza | La gestión de la calidad de los datos se lleva a cabo |
|---|---|
| Normas de calidad y umbrales por ámbito | Seguimiento continuo con respecto a dichas normas |
| Tareas de administración | Resolución de problemas de calidad operativa y certificación |
| Criterios de certificación | Estado de certificación aplicado a los activos que cumplen los criterios |
| Requisitos de cumplimiento | Se conservan pruebas de calidad a efectos de auditoría |
| Responsabilidad en materia de propiedad de los datos | Informes para los propietarios sobre el estado de la calidad de los dominios |
Un programa de gobernanza sin gestión de la calidad da lugar a normas que nunca se evalúan. Un programa de gestión de la calidad sin gobernanza genera indicadores sobre los que nadie actúa, ya que la responsabilidad no está clara.
Para obtener información sobre los contratos de datos como mecanismo de garantía de la calidad, consulta nuestraguía sobre contratos de datos.
Calidad de los datos e inteligencia artificial
La calidad de los datos es el requisito de infraestructura más importante para una IA fiable. Cualquier problema de calidad de los datos que exista en los datos de entrenamiento se transmite al modelo que aprende a partir de ellos.
Errores de precisión en los datos de entrenamiento: Un modelo de detección de fraudes entrenado con registros de transacciones en los que el 5 % de los códigos de categoría de comerciante son inexactos aprende a asociar transacciones legítimas con patrones de fraude. El modelo marca transacciones legítimas como fraudulentas y pasa por alto los fraudes reales.
Faltas de exhaustividad en los datos de entrenamiento: Un modelo de predicción de la pérdida de clientes entrenado con registros en los que el 20 % del campo «antigüedad» está en blanco aprende a predecir la pérdida de clientes sin una de las señales predictivas más sólidas. El rendimiento del modelo es sistemáticamente inferior al que debería ser, y la causa no se aprecia sin un seguimiento que remita a los registros de calidad de los datos de entrenamiento.
Faltas de coherencia en los datos de entrenamiento: Un modelo de recomendaciones entrenado con datos procedentes de dos sistemas fuente que definen el término «cliente activo» de forma diferente aprende simultáneamente dos patrones contradictorios. Las recomendaciones para los clientes que se ajustan a una de las definiciones son sistemáticamente diferentes de las recomendaciones para los clientes que se ajustan a la otra, lo que genera experiencias de usuario incoherentes que no pueden explicarse sin rastrear el problema de calidad de los datos de entrenamiento.
Requisitos para una calidad de datos apta para la IA: Cada conjunto de datos utilizado para el entrenamiento de la IA debe contar con una certificación de calidad: resultados de perfilado que confirmen las puntuaciones de calidad actuales, un historial de validación que confirme que los datos cumplían con los estándares definidos en el momento del entrenamiento y una aprobación del responsable de datos que confirme que los datos son adecuados para el uso previsto del modelo. Sin esta certificación, el entrenamiento del modelo no puede ser auditado, reproducido ni defendido conforme a la normativa de gobernanza de la IA.
La calidad de los datos en los sectores regulados
Servicios financieros: La norma BCBS 239 exige a los bancos que demuestren que los datos sobre riesgos son precisos, completos y trazables desde su origen hasta su presentación a las autoridades reguladoras. Las certificaciones de calidad mantenidas a través de un programa de gobernanza satisfacen este requisito de forma continua, en lugar de mediante evaluaciones manuales periódicas. La ley SOX exige datos fiables en la información financiera, con controles de calidad documentados.
Sanidad: La ley HIPAA exige que los historiales de los pacientes sean precisos y estén actualizados. Los datos inexactos de los pacientes provocan errores clínicos, disputas de facturación y violaciones de la privacidad. Los programas de calidad de los datos en el ámbito sanitario deben abarcar los conjuntos de datos de información médica protegida (PHI) con los estándares de calidad más estrictos y la supervisión más rigurosa.
Productos farmacéuticos: La norma 21 CFR Parte 11 de la FDA y las normativas GxP exigen la integridad de los datos clínicos y de fabricación. Los programas de gestión de la calidad deben mantener historiales de validación completos de todos los datos utilizados en las solicitudes reglamentarias, demostrando que los datos no se han alterado sin documentación y que se han superado todos los controles de calidad.
Comercio minorista y comercio electrónico: La calidad de los datos de los clientes afecta directamente a los ingresos: los registros duplicados generan comunicaciones duplicadas que dañan la confianza en la marca; los datos de direcciones inexactos provocan fallos en las entregas; y los datos de preferencias desactualizados dan lugar a recomendaciones irrelevantes. La calidad de los datos de inventario afecta al cumplimiento de los pedidos: los datos de existencias desactualizados provocan sobreventas y la decepción de los clientes.
Preguntas frecuentes
La calidad de los datos se refiere a la eficacia con la que estos cumplen su función. Si le haces una pregunta a un conjunto de datos y la respuesta es incorrecta porque los datos son inexactos, incompletos, obsoletos o incoherentes, tienes un problema de calidad de los datos. Unos datos de alta calidad te proporcionan respuestas correctas de forma fiable.
Exactitud (los datos representan correctamente el valor del mundo real), exhaustividad (todos los campos obligatorios están rellenados), coherencia (el mismo valor se representa de forma idéntica en todos los sistemas), actualidad (los datos están actualizados cuando es necesario), validez (los datos se ajustan a los formatos y normas definidos) y unicidad (cada entidad del mundo real se representa exactamente una vez, sin duplicados).
Las causas más habituales son: errores en la introducción manual de datos, migraciones de sistemas que transforman los datos de forma incorrecta, cambios en el esquema que incumplen las reglas de validación existentes, fallos de integración que provocan una sincronización incorrecta de los registros, definiciones incoherentes entre sistemas (dos sistemas definen «cliente activo» de forma diferente) y la ausencia de reglas de validación que detecten los errores antes de que entren en el sistema.
La gestión de la calidad de los datos (DQM) es la práctica de medir, supervisar, corregir y mejorar de forma sistemática la calidad de los datos en toda la organización. Abarca los procesos, las herramientas, las funciones y las normas que garantizan la fiabilidad de los datos a lo largo del tiempo. El objetivo de la DQM no es solo solucionar los problemas de calidad cuando surgen, sino prevenirlos mediante una supervisión proactiva y la corrección en el origen.
La gobernanza de datos define los estándares de calidad, asigna la responsabilidad de velar por su cumplimiento y establece las políticas que permiten aplicar los requisitos de calidad. La gestión de la calidad de los datos se encarga de aplicar dichos estándares mediante la elaboración de perfiles, la supervisión y la corrección. Una gobernanza sin gestión de la calidad da lugar a estándares que nunca se miden. Una gestión de la calidad sin gobernanza da lugar a métricas sobre las que nadie actúa.
A través de cuatro mecanismos: análisis de perfiles de datos (análisis automatizado para evaluar las características de calidad actuales), reglas de validación (reglas de negocio que definen cómo deben ser los datos válidos), puntuación de calidad (agregación de los resultados del análisis de perfiles y de la validación en una única puntuación por activo) y supervisión continua (alertas automáticas cuando las puntuaciones caen por debajo de los umbrales establecidos o aparecen anomalías).
Una representación numérica del grado en que un activo de datos cumple con los estándares de calidad definidos, que suele expresarse en forma de porcentaje. Una puntuación del 95 % significa que el activo supera el 95 % de los controles de calidad definidos. Las puntuaciones permiten comparar la calidad entre distintos activos y a lo largo del tiempo, y sirven de base para las decisiones de certificación: los activos que superan un umbral de puntuación definido pueden optar a la certificación.
La certificación de datos es el proceso formal mediante el cual se indica que un activo de datos está aprobado para su uso, una vez que ha cumplido los umbrales de calidad definidos y ha sido revisado por un responsable de datos. Los activos certificados aparecen con una insignia de verificación en el catálogo de datos. Los usuarios confían en los activos certificados sin necesidad de una validación independiente, lo que hace que los programas de calidad de datos tengan un valor operativo, en lugar de ser simplemente correctos desde el punto de vista burocrático.
Los modelos de IA heredan todos los problemas de calidad de los datos presentes en sus conjuntos de datos de entrenamiento. Unos datos de entrenamiento inexactos dan lugar a modelos que aprenden patrones erróneos. Unos datos de entrenamiento incompletos dan lugar a modelos que pasan por alto señales predictivas. Unos datos de entrenamiento incoherentes dan lugar a modelos con un comportamiento incoherente. La certificación de la calidad de los datos de los conjuntos de datos de entrenamiento de la IA es el requisito de infraestructura que garantiza la fiabilidad de los resultados de la IA y la solidez de los programas de gobernanza de la IA.
El retorno de la inversión (ROI) se debe a la reducción de las modificaciones de ingeniería, al menor número de decisiones erróneas, a un menor riesgo de sanciones por incumplimiento normativo, a una preparación más rápida de las auditorías y a una mayor fiabilidad de los modelos de IA. Gartner estima que la mala calidad de los datos supone a las organizaciones un coste medio de 15 millones de dólares al año. Un programa de gestión de la calidad que reduzca la frecuencia y la gravedad de los fallos de calidad en un 50 % ofrece un retorno de la inversión sustancial, incluso con una inversión significativa en el programa.