Inteligencia de datos

Gobernanza de datos lista para IA: guía práctica de implementación

gestión de datos preparada para la IA

La gobernanza de datos preparada para la IA es la ampliación de las disciplinas tradicionales de gobernanza de datos —gestión de metadatos, seguimiento del linaje, control de calidad y control de acceso— a los datos que alimentan a los sistemas de IA y a los propios sistemas de IA.

Una organización que cuente con un marco de gobernanza preparado para la IA puede responder a estas preguntas para cada modelo de IA en producción: ¿Con qué datos se entrenó? ¿Quién certificó esos datos? ¿Qué estándares de calidad cumplió? ¿Contiene alguno de ellos información de carácter personal (PII) o información sujeta a regulación? ¿Qué ocurre con el modelo cuando cambian los datos de entrenamiento en las fases previas? Y, si un organismo regulador lo solicita, ¿se puede demostrar todo lo anterior?

La mayoría de las organizaciones no pueden hacerlo. Esta guía aborda los requisitos que debe cumplir una gobernanza preparada para la IA, cómo funciona el ciclo de vida de los metadatos en el contexto de la IA, cómo diseñar la arquitectura y cómo implementarla siguiendo una secuencia estructurada.


¿Qué es la gobernanza de datos preparada para la IA?

La gobernanza de datos preparada para la IA es un programa de gobernanza que amplía sus políticas, controles y supervisión para abarcar tres aspectos para los que los programas de gobernanza tradicionales no estaban diseñados:

Datos de entrenamiento de IA: Los conjuntos de datos utilizados para entrenar, ajustar y evaluar modelos requieren las mismas medidas de gobernanza que cualquier otro activo de datos empresarial —certificación de calidad, documentación del linaje, clasificación de la información de carácter personal (PII), controles de acceso—, además de requisitos adicionales en materia de reproducibilidad y auditoría normativa.

Linaje del modelo de IA:Unmodelo es el resultado de sus datos de entrenamiento, su proceso de ingeniería de características, sus hiperparámetros y sus criterios de evaluación. El linaje del modelo realiza un seguimiento de todos estos elementos, de modo que cualquier sesión de entrenamiento pueda reproducirse con exactitud, cualquier versión del modelo pueda auditarse por completo y cualquier deterioro del rendimiento pueda atribuirse a un cambio específico anterior en la cadena.

Resultados de los sistemas de IA: Los resultados de los sistemas de IA —decisiones crediticias, recomendaciones médicas, alertas de fraude, clasificaciones de contenidos— requieren una gestión adecuada en entornos regulados. Los resultados de alto riesgo necesitan flujos de trabajo de revisión humana, registros de auditoría y supervisión para detectar sesgos y desviaciones.


Por qué la gobernanza tradicional no es suficiente para la IA

La gobernanza de datos tradicional se diseñó para activos de datos estructurados utilizados en la elaboración de informes analíticos. La gobernanza de la IA introduce requisitos que van más allá de lo que abordan la mayoría de los programas de gobernanza.

Requisito Gobernanza tradicional Gobernanza preparada para la IA
Certificación de datos Puntuación de calidad y aprobación del responsable Puntuación de calidad, revisión de la información de carácter personal, evaluación del sesgo y aprobación del responsable, específicamente para el uso de la IA
Linaje Fuente a nivel de informe, tabla o columna Datos de origen para el modelo, incluyendo la ingeniería de características, los parámetros de entrenamiento y la versión del modelo
Controles de datos sensibles Controles de acceso a los datos regulados Comprobaciones previas a la ingesta que impiden que los datos regulados entren en los flujos de trabajo de IA sin una autorización explícita
Control de calidad Seguimiento continuo de conjuntos de datos analíticos Supervisión continua de las entradas del proceso de IA con detección de desviaciones ajustada a la distribución de entrenamiento
Registro de auditoría Registros de acceso e historial de cambios en las políticas Registro completo de la procedencia del modelo: versiones de los datos de entrenamiento, lógica de transformación, resultados de la evaluación e historial de implementación
Gobernanza de los resultados No aplicable Revisar los flujos de trabajo, el control de sesgos y los registros de auditoría de los resultados de los modelos de alto riesgo
Cumplimiento de la normativa RGPD, HIPAA, SOX, BCBS 239 Todo lo anterior, además de la Ley de IA de la UE, el Marco de Gestión de la IA del NIST y las normativas sobre IA específicas de cada sector

El ciclo de vida de los metadatos de la gobernanza de la IA

La gobernanza preparada para la IA sigue un ciclo de vida continuo que abarca siete etapas. Cada etapa genera metadatos que alimentan la siguiente.

1. Captura: Captura esquemas, registros de linaje y estadísticas de uso de todas las fuentes conectadas: bases de datos, lagos de datos, almacenes en la nube, sistemas de streaming, herramientas de BI, canalizaciones ETL y registros de modelos. En el caso de los flujos de trabajo de IA, esto incluye los almacenes de características y los repositorios de datos de entrenamiento que alimentan el desarrollo de modelos.

2. Catálogo: Almacenar todos los metadatos incorporados en un repositorio central —una combinación de un almacén de metadatos relacional para registros de gobernanza estructurados y un almacén vectorial para la búsqueda semántica—. Cada activo de datos y cada modelo de IA cuenta con una entrada en el catálogo que incluye su definición, linaje, puntuación de calidad, clasificación y titularidad.

3. Enriquecer: Añadir contexto empresarial a los metadatos técnicos: enlaces a términos del glosario, clasificaciones de dominio, etiquetas de sensibilidad, certificaciones de calidad y asignaciones de gestión. En el caso de los activos de IA, el enriquecimiento incluye los resultados de la evaluación de sesgos, la documentación sobre el uso previsto y la clasificación normativa según los marcos de IA aplicables.

4. Gobernanza:Aplicary hacer cumplir las políticas: controles de acceso a los conjuntos de datos de entrenamiento y a los artefactos de los modelos, contratos de datos entre productores y usuarios de IA, políticas de conservación y controles de cumplimiento para los datos regulados. La aplicación de las políticas se lleva a cabo en el momento de la solicitud, de forma automática, a través de un motor de políticas que comprueba cada solicitud de acceso con respecto a las reglas definidas antes de concederla o denegarla.

5. Observar: Supervisa continuamente la calidad de los datos en todos los activos que alimentan los flujos de trabajo de IA. Detecta anomalías —descensos en el recuento de filas, picos en la tasa de valores nulos, cambios en el esquema, variaciones en la distribución— antes de que afecten al rendimiento del modelo. En el caso de los modelos implementados, supervisa la distribución de las solicitudes de predicción entrantes comparándola con la distribución de entrenamiento para detectar a tiempo cualquier desviación de los datos.

6. Actuar: Derivar las anomalías y las infracciones de las políticas a flujos de trabajo de corrección: correcciones automatizadas cuando la regla sea clara, y revisión por parte de un responsable humano cuando se requiera criterio. En el caso de los flujos de trabajo de IA, esto incluye detener la inferencia del modelo cuando la calidad de los datos de entrada caiga por debajo de los umbrales definidos y activar flujos de trabajo de reentrenamiento cuando la deriva supere los límites aceptables.

7. Auditar y mejorar:Mantenerregistros en series temporales de los indicadores clave de rendimiento (KPI) de gobernanza —tasa de cobertura, puntuaciones de calidad, frecuencia de incidentes, tasa de cumplimiento de las políticas— y utilizarlos para identificar en qué áreas es necesario invertir en gobernanza. En el caso de los sistemas de IA, elaborar informes listos para auditoría que documenten, cuando sea necesario, la procedencia de los datos de entrenamiento, las certificaciones de calidad y el historial de rendimiento de los modelos.


Componentes básicos de la arquitectura

Una arquitectura de gobernanza preparada para la IA requiere que siete componentes funcionen de forma coordinada.

Agentes de ingesta de metadatos:conectoresque extraen metadatos técnicos de todas las fuentes del entorno de datos: bases de datos, lagos de datos, almacenes en la nube, herramientas de BI, procesos ETL y ELT, plataformas de streaming y registros de modelos. La ingesta debe ser automatizada y continua, no manual ni periódica.

Repositorio central de metadatos: Un almacén relacional para registros estructurados de gobernanza —definiciones de activos, titularidad, puntuaciones de calidad, registros de acceso, registros de linaje— combinado con un almacén vectorial para incrustaciones de búsqueda semántica. El almacén vectorial permite realizar búsquedas en lenguaje natural en todos los activos sin necesidad de que coincidan exactamente los nombres de los campos.

Motor de políticas: Un almacén de políticas y una API de aplicación que aplica las normas de gobernanza en el momento de la solicitud. Las políticas se definen como normas estructuradas —«denegar la exportación de columnas etiquetadas como PII sin la aprobación del equipo de privacidad de datos»— y se aplican automáticamente sin necesidad de revisión manual para cada decisión. Los patrones de «política como código» permiten que las normas de gobernanza estén sujetas a control de versiones y se implementen a través de procesos de CI/CD junto con el trabajo de ingeniería de datos.

Capa de observabilidad: Las pruebas de calidad de los datos se ejecutan de forma continua en las fuentes conectadas. Los monitores de entrada de los modelos comparan las distribuciones de los datos entrantes con los valores de referencia del entrenamiento. Las alertas basadas en el linaje rastrean el impacto de los fallos de calidad en las fases iniciales en los modelos y los informes posteriores, antes de que estos se vean afectados. Las alertas se envían a los flujos de trabajo de gestión, en lugar de limitarse a los paneles de control.

Orquestación y bus de eventos: El linaje en tiempo real y los metadatos activos requieren una arquitectura basada en eventos. Cuando se ejecuta un proceso, se modifica un esquema o se activa un control de calidad, se publica un evento en un bus de mensajes y este es consumido por el repositorio de metadatos, la capa de observabilidad y cualquier sistema posterior que deba reaccionar. Esto es lo que hace que los metadatos sean activos en lugar de pasivos.

Interfaz de gobernanza y catálogo: La capa orientada al usuario: un catálogo de datos con función de búsqueda, un explorador de linaje, la gestión de flujos de trabajo de administración, la tramitación de solicitudes de acceso y paneles de informes. Aquí es donde los administradores realizan su trabajo diario y donde los analistas buscan y evalúan los activos de datos.

Auditoría y generación de informes: Almacenamiento de series temporales para los indicadores clave de rendimiento (KPI) de gobernanza y una capa de informes de auditoría que genera pruebas de cumplimiento bajo demanda. En el caso de la gobernanza de la IA, esto incluye informes de procedencia de los modelos que documentan el linaje de los datos de entrenamiento, las certificaciones de calidad y el historial de implementación de cada versión del modelo.


Secuencia de implementación: 12 semanas hasta obtener los primeros indicadores clave de rendimiento (KPI) medibles en materia de gobernanza de la IA

Semanas 1 a 2: Fundamentos

Conecta la plataforma de ingesta de metadatos a las tres o cinco fuentes de datos de mayor prioridad —es decir, aquellas que alimentan tus cargas de trabajo analíticas más críticas y cualquier modelo de IA que se encuentre actualmente en producción—. Ejecuta el análisis inicial de metadatos. Revisa la precisión de los resultados de la clasificación automática. Asigna responsables y gestores de datos a los ámbitos prioritarios.

En lo que respecta específicamente a la IA: identifica todos los modelos que se encuentran actualmente en producción. Documenta con qué conjuntos de datos se ha entrenado cada modelo. Este inventario es el punto de partida para la gestión de los datos de entrenamiento.

Semanas 3 a 4: Catálogo y linaje

Completar la introducción inicial de datos en el catálogo para las fuentes prioritarias. Configurar el seguimiento automatizado del linaje para los flujos de trabajo prioritarios. En el caso de los flujos de trabajo de IA, configurar el seguimiento del linaje desde las fuentes de datos de entrenamiento, pasando por la ingeniería de características, hasta los artefactos del modelo.

Publica los primeros 20 términos del glosario empresarial correspondientes a los ámbitos prioritarios. Vincula los términos a los campos específicos que describen en las fuentes relacionadas.

Semanas 5 a 6: Gestión de la calidad y el acceso

Definir umbrales de calidad para los conjuntos de datos prioritarios: índice de exhaustividad, límite máximo de valores nulos y requisito de actualidad. Configurar la supervisión continua de la calidad con redireccionamiento de alertas a los flujos de trabajo de gestión de datos. Para las entradas de los procesos de IA, configurar umbrales de detección de desviaciones basados en las distribuciones de los datos de entrenamiento.

Aplica políticas de control de acceso para los datos sujetos a normativa. Configura flujos de trabajo de aprobación para las solicitudes de acceso a datos de carácter personal (PII) e información médica protegida (PHI). En el caso de los flujos de trabajo de entrenamiento de IA, configura comprobaciones previas a la ingesta que señalen los datos sujetos a normativa antes de que entren en el flujo de trabajo.

Semanas 7 a 8: Gobernanza específica de la IA

Certifica los conjuntos de datos de entrenamiento de todos los modelos que se encuentran actualmente en producción. La certificación requiere: una puntuación de calidad superior al umbral definido, la revisión de la clasificación de la información de carácter personal (PII) completada, el linaje documentado desde la fuente hasta el proceso de entrenamiento y la aprobación del responsable de datos. Crea un registro de gobernanza para cada modelo en producción en el que se documenten sus conjuntos de datos de entrenamiento certificados, la lógica de transformación aplicada y los resultados de la evaluación en el momento de la implementación.

Configura la supervisión de las entradas de los modelos de producción. Define los umbrales de calidad y distribución que activan una alerta de desviación.

Semanas 9 a 10: Flujos de trabajo de gestión y valores de referencia de los indicadores clave de rendimiento (KPI)

Formar a los responsables de los catálogos en los flujos de trabajo relacionados con los mismos: revisión de la calidad, mantenimiento del glosario, autorizaciones de acceso y registros de gobernanza de los modelos. Establecer acuerdos de nivel de servicio (SLA) para la gestión de los catálogos. Definir el cuadro de mando de indicadores clave de rendimiento (KPI) de gobernanza y establecer valores de referencia para: la tasa de cobertura del catálogo, la tasa de cobertura del glosario, el tiempo medio de resolución de incidencias de calidad, el tiempo de tramitación de las solicitudes de acceso y el porcentaje de modelos en producción con datos de entrenamiento certificados.

Semanas 11 a 12: Elaboración de informes y expansión

Elaborar el primer informe formal de gobernanza en relación con la línea de referencia de los KPI. Identificar la próxima serie de ámbitos de datos y modelos de IA que se van a incorporar. Definir la hoja de ruta para las capacidades avanzadas: gobernanza federada, metadatos activos, implementación completa de «políticas como código» y documentación sobre el cumplimiento de la Ley de IA de la UE.


Requisitos normativos en materia de gobernanza de la IA

Ley de la UE sobre IA:LaLey de la UE sobre IA clasifica los sistemas de IA según su nivel de riesgo e impone requisitos de documentación, pruebas y supervisión a las aplicaciones de alto riesgo, entre las que se incluyen la puntuación crediticia, la clasificación médica de pacientes, los sistemas de selección de personal y las herramientas de las fuerzas del orden. Los sistemas de IA de alto riesgo requieren: una gestión documentada de los datos de entrenamiento con evaluaciones de calidad y sesgos, documentación técnica sobre el diseño y las capacidades del sistema, mecanismos de supervisión humana para las decisiones de gran trascendencia, así como seguimiento tras la implementación y notificación de incidentes. Las organizaciones que cuentan con programas maduros de gestión de datos están mejor preparadas para cumplir estos requisitos, ya que la documentación de los datos de entrenamiento, los registros de linaje y las certificaciones de calidad ya existen como elementos de la gestión.

Marco de gestión de riesgos de la IA del NIST:El RMF de IA del NIST ofrece un marco voluntario para gestionar los riesgos de la IA a través de cuatro funciones: gobernanza, mapeo, medición y gestión. Se ajusta estrechamente a las disciplinas de la gobernanza de datos: la función de gobernanza abarca las políticas y las estructuras de rendición de cuentas que ya definen los programas de gobernanza de datos; la función de medición abarca el seguimiento y la evaluación que ya proporcionan las capas de observabilidad.

El RGPD y la IA: Los sistemas de IA que tratan datos personales están sujetos a los requisitos del RGPD, entre los que se incluyen la minimización de datos, la limitación de la finalidad y el derecho a una explicación de las decisiones automatizadas. Un programa de gobernanza de datos que clasifique automáticamente la información de identificación personal (PII), aplique controles de acceso y mantenga registros de tratamiento cumple muchos de los requisitos de gestión de datos que el RGPD impone a los sistemas de IA.

Normativa sobre IA específica para cada sector: Los organismos reguladores de los servicios financieros de EE. UU., el Reino Unido y la UE han publicado directrices sobre la gestión del riesgo de los modelos que se extienden a los sistemas de IA. Los organismos reguladores del sector sanitario están elaborando requisitos para el apoyo a la toma de decisiones clínicas asistida por IA. Las empresas farmacéuticas que utilizan la IA en el descubrimiento de fármacos deben cumplir los requisitos de integridad de datos GxP para los datos de entrenamiento de la IA. En cada caso, las disciplinas de gobernanza requeridas se corresponden directamente con las capacidades de un programa maduro de gobernanza de la IA.

Preguntas frecuentes

La gobernanza de datos preparada para la IA amplía las disciplinas tradicionales de gobernanza —gestión de metadatos, supervisión de la calidad, control de acceso y seguimiento del linaje— a los datos que alimentan los sistemas de IA y a los propios sistemas de IA. Garantiza que todos los modelos de IA en producción se basen en datos certificados, trazables y sometidos a gobernanza, y que los resultados de los modelos en categorías de alto riesgo estén sujetos a revisión y auditoría.

La gobernanza de datos abarca todo el ciclo de vida de los activos de datos: calidad, definiciones, acceso, linaje y cumplimiento normativo. La gobernanza de la IA es un subconjunto centrado específicamente en los requisitos de gobernanza de los sistemas de IA: certificación de los datos de entrenamiento, linaje de los modelos, controles de datos sensibles para los flujos de trabajo de IA, supervisión de los resultados y cumplimiento normativo de las aplicaciones de IA. La gobernanza de la IA requiere la gobernanza de datos como base: no se pueden gestionar las entradas de la IA sin gestionar los datos.

Cada conjunto de datos utilizado para entrenar o ajustar un modelo debe contar con: una certificación de calidad que confirme que cumple los umbrales establecidos; una revisión de la clasificación de los datos de carácter personal (PII) y los datos sensibles que confirme que los datos regulados se han gestionado adecuadamente; documentación sobre el linaje que permita rastrear el conjunto de datos desde su origen, pasando por todas las transformaciones, hasta llegar al proceso de entrenamiento; y la aprobación de un responsable que certifique que los datos son adecuados para el uso previsto del modelo.

El historial del modelo registra qué conjuntos de datos de entrenamiento, procesos de ingeniería de características, lógica de transformación, hiperparámetros y criterios de evaluación dieron lugar a cada versión del modelo. Esto permite que las sesiones de entrenamiento sean reproducibles —a partir del historial del modelo, se puede reconstruir exactamente qué elementos se utilizaron en una versión concreta del modelo— y hace que los modelos sean auditables, proporcionando una trazabilidad completa para su revisión por parte de las autoridades reguladoras.

La deriva de datos se produce cuando la distribución estadística de los datos que recibe un modelo implementado en producción se aleja de la distribución con la que se entrenó. Cuando la deriva es significativa, el rendimiento del modelo se ve mermado, ya que este realiza predicciones sobre datos que parecen diferentes de aquellos con los que aprendió. Los programas de gobernanza supervisan la deriva comparando continuamente las distribuciones de los datos entrantes con los valores de referencia del entrenamiento y emitiendo alertas cuando la diferencia supera los umbrales definidos.

La Ley de IA de la UE exige que los sistemas de IA de alto riesgo cuenten con una gestión documentada de los datos de entrenamiento, que incluya evaluaciones de calidad y sesgos, documentación técnica sobre el diseño del sistema, mecanismos de supervisión humana para las decisiones de gran trascendencia y un seguimiento posterior a la implementación. Un programa maduro de gobernanza de la IA genera la mayor parte de esta documentación como resultado de las operaciones diarias, y no como un ejercicio de cumplimiento normativo independiente.

Un contrato de datos es un acuerdo formal entre un productor de datos y un consumidor de datos —en este contexto, un proceso de IA— que especifica el esquema, los estándares de calidad y la frecuencia de actualización que el productor se compromete a mantener. Los contratos de datos evitan que los cambios incompatibles silenciosos en los datos de origen degraden el rendimiento del modelo sin previo aviso. Cuando un productor de origen modifica un esquema o elimina un campo cubierto por un contrato, el sistema de cumplimiento del contrato señala la infracción antes de que llegue al proceso de entrenamiento o de inferencia.

La secuencia de implementación de 12 semanas descrita en esta guía permite obtener indicadores clave de rendimiento (KPI) medibles en materia de gobernanza de la IA —conjuntos de datos de entrenamiento certificados, registros del linaje de los modelos y supervisión de la deriva ya en funcionamiento— durante el primer trimestre para un dominio inicial. La cobertura completa de la gobernanza de la IA en todos los modelos de producción y dominios de datos suele llevar entre 6 y 12 meses, dependiendo del número de modelos, las fuentes de datos y los requisitos normativos implicados.