Inteligencia de datos

Guía empresarial sobre el linaje de los datos

Una sólida plataforma de datos multicapa

El linaje de datos es el registro completo del recorrido que sigue un activo de datos desde su fuente original, pasando por todas las transformaciones, etapas del proceso y sistemas, hasta su destino final en un informe, un modelo o una aplicación operativa.

Cuando se ha establecido el linaje, un analista que detecte una cifra inesperada en un informe trimestral puede rastrearla hasta la transformación exacta que la generó, la tabla de origen de la que procede y el proceso que la transmitió. Un ingeniero que se disponga a modificar un esquema puede ver todos los activos posteriores que se verán afectados antes de que se aplique el cambio. Un responsable de cumplimiento normativo que responda a una auditoría puede obtener un historial completo de los datos sin necesidad de realizar una investigación manual.

Esta guía explica qué es el linaje de datos, los tipos de linaje, cómo funciona desde el punto de vista técnico, quién lo utiliza, cómo se relaciona con la gobernanza de datos y el cumplimiento normativo, y cómo implementarlo.


¿Qué es el linaje de los datos?

El linaje de datos es la visibilidad de principio a fin de los datos a medida que circulan por los sistemas de una organización: desde la fuente en la que se crearon o se incorporaron, pasando por cada transformación, unión, agregación y paso del proceso de tratamiento, hasta los informes, paneles de control, modelos y sistemas operativos que los utilizan.

Lineage responde a cinco preguntas sobre cada activo de datos:

  • ¿De dónde procede? El sistema de origen, la base de datos, la API o la fuente externa de donde proceden estos datos.
  • ¿Qué le ha pasado? Todas las transformaciones aplicadas: uniones SQL, agregaciones, filtros, cálculos y conversiones de formato.
  • ¿A dónde va? A todos los sistemas, informes, paneles de control, modelos o aplicaciones posteriores que dependan de este activo.
  • ¿Cuándo tuvo lugar cada paso? Las marcas de tiempo de cada movimiento y transformación en la cadena de linaje.
  • ¿Quién lo ha consultado? Los canales, las tareas y los usuarios que accedieron a los datos o los modificaron en cada paso.

Tipos de linaje de datos

No todos los linajes tienen la misma finalidad. Las organizaciones necesitan diferentes tipos en función de sus requisitos de gobernanza y análisis.

Tipo Qué datos recopila Granularidad Caso de uso principal
Línea técnica Cómo se mueven los datos a través de los sistemas técnicos: bases de datos, flujos de datos, tareas ETL, API A nivel de tabla y de columna Análisis de impacto, investigación de las causas fundamentales, documentación de los procesos
Tradición empresarial Cómo se relacionan los datos con los conceptos y las métricas empresariales: de dónde proceden los «ingresos» y cómo se calcula el número de «clientes activos» Nivel de términos empresariales Confianza de los usuarios empresariales, coherencia de las métricas, coordinación entre equipos
Linaje a nivel de columna ¿Qué campos concretos de qué tablas concretas se sometieron a qué transformaciones para generar cada campo de salida? Columna individual Trazabilidad normativa, análisis de impacto de los cambios en los esquemas, gobernanza de los datos de entrenamiento de la IA
Linaje a nivel de tabla ¿Qué tablas alimentan a qué tablas e informes posteriores? Cuadro Mapeo de dependencias de alto nivel, análisis de impacto general
Línea operativa Cómo se transmiten los datos a través de los sistemas operativos en tiempo real: flujos de eventos, microservicios y API Nivel de eventos y mensajes Depuración de sistemas en tiempo real, gestión de datos operativos
Línea de IA/ML ¿Qué conjuntos de datos de entrenamiento, procesos de extracción de características y lógica de transformación dieron lugar a cada versión del modelo? Nivel de conjunto de datos y de características Reproducibilidad de los modelos, cumplimiento normativo, gobernanza de la IA

Linaje a nivel de columna frente a linaje a nivel de tabla: El linaje a nivel de tabla muestra que la tabla A alimenta a la tabla B. El linaje a nivel de columna muestra que la net_revenue La columna de la tabla B se calcula a partir de la gross_revenue columna de la tabla A menos la discount_amount columna de la tabla A, filtrada por transaction_status = 'completed'. En los sectores regulados y los entornos analíticos complejos, es necesario disponer de un historial a nivel de columna; el historial a nivel de tabla por sí solo no basta para cumplir los requisitos de análisis de impacto o de auditoría.

El linaje es también una de las principales señales de fiabilidad en el descubrimiento de datos. Cuando los usuarios encuentran un conjunto de datos a través de un catálogo o una interfaz de búsqueda, el linaje les indica si los datos que lo componen reflejan lo que se afirma que reflejan. Para obtener información detallada sobre cómo se relaciona el linaje con el descubrimiento, consulta elglosario de descubrimiento de datos.


Cómo funciona el linaje de datos

El linaje de datos moderno se registra automáticamente observando cómo se mueven los datos a través de los sistemas del entorno de datos. El proceso técnico consta de cuatro etapas.

1. Recopilación de metadatos

Las herramientas de Lineage se conectan a todas las fuentes del entorno de datos —bases de datos, almacenes de datos, lagos de datos, plataformas ETL y ELT, herramientas de BI, sistemas de streaming y almacenes de características de aprendizaje automático— y extraen los metadatos que describen el movimiento de los datos:

  • Nombres de tablas y columnas, esquemas y tipos de datos.
  • Consultar los registros de consultas y de ejecución de las bases de datos y los almacenes de datos.
  • Configuraciones de flujos de trabajo procedentes de herramientas de orquestación como Airflow y dbt.
  • Registros de llamadas a la API procedentes de plataformas de integración.
  • Registros de ejecución de tareas de las plataformas ETL.

Estos metadatos constituyen la materia prima que utilizan los sistemas de seguimiento del origen de los datos para reconstruir cómo se mueven los datos.

2. Análisis sintáctico de transformación

Para que el linaje muestre qué ha ocurrido con los datos en cada paso, el sistema debe analizar la lógica de transformación. En el caso de las transformaciones basadas en SQL, las herramientas de linaje analizan las consultas para identificar las tablas y columnas de origen, las relaciones de unión, los filtros, las agregaciones y las columnas derivadas. En el caso de las transformaciones basadas en flujos de trabajo, analizan los archivos de configuración y los registros de ejecución para extraer la misma información.

El resultado es un gráfico compuesto por nodos (activos de datos) y aristas (transformaciones) que representa la cadena completa de linaje, desde el origen hasta el consumo.

3. Creación y almacenamiento de gráficos

Los metadatos extraídos y la lógica de transformación analizada se agrupan en un gráfico de linaje que se almacena en el repositorio de metadatos. Cada nodo representa un activo de datos: una tabla, una columna, un archivo, un flujo o un modelo. Cada arista representa una relación: una transformación, una ejecución de un proceso, una unión o una copia. El gráfico permite realizar consultas: partiendo de cualquier activo, el sistema puede recorrer el gráfico hacia arriba para encontrar sus fuentes o hacia abajo para encontrar todo aquello que depende de él.

4. Actualización continua

Los diagramas de linaje estáticos, que se crean una sola vez y nunca se actualizan, pierden su precisión en cuestión de días, a medida que cambian los flujos de trabajo y evolucionan los datos. Los sistemas de linaje modernos se actualizan de forma continua: cuando se ejecuta un flujo de trabajo, el gráfico de linaje se actualiza. Cuando cambia un esquema, se marcan los enlaces afectados en el gráfico. Cuando se conecta una nueva fuente, su linaje se añade automáticamente. El linaje activo refleja el estado actual del conjunto de datos, en lugar de una instantánea de un momento concreto.


¿Quién utiliza el linaje de datos y cómo?

Ingeniero de datos: Utiliza el linaje para realizar un análisis de impacto antes de introducir cambios. Antes de modificar el esquema de una tabla de origen, el ingeniero consulta el linaje para ver todas las tablas, canalizaciones, informes y modelos posteriores que dependen de cualquier columna de dicha tabla. Los cambios que podrían afectar a los consumidores posteriores se identifican y se corrigen antes de su implementación, en lugar de detectarse una vez que ya han provocado fallos.

Cuando falla un proceso de procesamiento de datos o un informe muestra valores inesperados, el ingeniero rastrea el linaje hacia arriba desde el resultado afectado para localizar el paso de transformación en el que se introdujo el problema. La investigación de la causa raíz, que antes requería horas de revisión manual de consultas, ahora se realiza en cuestión de minutos.

Analista de datos: Utiliza el linaje para confiar en los datos de los informes y los paneles de control. Cuando una métrica parece incorrecta, el analista sigue el linaje desde el campo del panel de control, pasando por la lógica de transformación, hasta la tabla de origen para comprender cómo se ha obtenido esa cifra. Cuando el linaje muestra una ruta clara y bien gestionada desde una fuente certificada, el analista confía en la cifra sin necesidad de remitir el asunto al equipo de datos.

Responsable de datos:utilizael linaje para comprender el impacto en las fases posteriores de los problemas de calidad de los datos. Cuando una comprobación de calidad detecta una anomalía en un conjunto de datos de origen, el responsable sigue el linaje hacia las fases posteriores para identificar todos los informes, modelos y sistemas operativos que puedan haberse visto afectados. Esta evaluación determina la gravedad del incidente y el alcance de las medidas correctoras necesarias.

Responsable de cumplimiento normativo: Utiliza el linaje para responder a preguntas normativas sin necesidad de realizar investigaciones manuales. ¿De dónde procede esta cifra que figura en nuestra presentación reglamentaria? ¿Qué sistemas contienen los datos personales de este cliente? ¿Qué transformaciones sufrió este conjunto de datos antes de utilizarse para entrenar este modelo? El linaje responde a cada una de estas preguntas a partir de registros mantenidos automáticamente, en lugar de recopilados bajo la presión de una auditoría.

Científico de datos:utilizael linaje para documentar la procedencia de los datos de entrenamiento. Cada conjunto de datos utilizado para entrenar o ajustar un modelo cuenta con un registro de linaje que muestra su origen, las transformaciones a las que se ha sometido, la certificación de calidad y el historial de acceso. Este registro hace que el entrenamiento del modelo sea reproducible —gracias al registro de linaje, cualquier sesión de entrenamiento puede reconstruirse con exactitud— y auditable a efectos normativos.

Director de Datos:Utilizael linaje como indicador del estado de la gobernanza. La cobertura del linaje —el porcentaje de activos de datos con un linaje completo y automatizado— es un indicador adelantado de la madurez del programa de gobernanza. Una cobertura baja en un ámbito concreto indica que los flujos de datos de ese ámbito no están documentados ni sujetos a gobernanza.


Origen de los datos y gobernanza de los datos

El linaje es la columna vertebral operativa de la gobernanza de datos. Las políticas de gobernanza exigen que se aplique y se audite el linaje.

Requisito de gobernanza Cómo lo respalda el linaje
Registros de auditoría de cumplimiento Lineage proporciona el historial completo de datos que exigen las autoridades reguladoras: origen, historial de transformaciones, registros de acceso y consumo.
Análisis de las causas fundamentales de la calidad de los datos El seguimiento del origen permite identificar las causas de los fallos de calidad, lo que permite aplicar medidas correctoras específicas en lugar de llevar a cabo una investigación generalizada.
Análisis de impacto La función «Lineage» muestra todos los activos posteriores afectados por un cambio antes de que este se lleve a cabo.
Certificación de datos Los activos certificados deben contar con un historial documentado como requisito para su certificación; los usuarios confían en los activos certificados, en parte, porque se puede rastrear su procedencia.
Gobernanza del acceso El historial muestra quién ha accedido a los datos en cada etapa, lo que facilita la revisión y la auditoría de los accesos.
Gobernanza de los datos de entrenamiento de la IA Lineage documenta la procedencia de cada conjunto de datos de entrenamiento, cumpliendo así con los requisitos normativos y de reproducibilidad de los modelos.
Cumplimiento del derecho al olvido Lineage identifica todos los sistemas en los que existen datos de una persona concreta, lo que permite su eliminación completa en todos los sistemas.

Para obtener información sobre la supervisión continua del estado de la canalización que complemente el seguimiento del linaje, consulta nuestra guía sobreobservabilidad de datos.

El linaje de los datos en los sectores regulados

Servicios financieros:Lanorma BCBS239 exige a los bancos que demuestren que los datos de riesgo son precisos y que su trazabilidad desde la fuente hasta su presentación a las autoridades reguladoras sea documentada y pueda seguirse. La documentación manual de la trazabilidad elaborada trimestralmente resulta insuficiente: las autoridades reguladoras esperan que la trazabilidad se mantenga de forma continua y esté disponible cuando se solicite. El cumplimiento de la ley SOX exige registros de auditoría para los datos de información financiera, cuya trazabilidad se realiza de forma automatizada como resultado de las operaciones del proceso.

Sanidad:La HIPAAexige que se documente la trazabilidad de la información médica protegida (PHI): su origen, su recorrido, quién ha accedido a ella y para qué se ha utilizado. Lineage proporciona esta documentación de forma automática para cada conjunto de datos de PHI del entorno de datos. Cuando una investigación sobre una violación de seguridad requiere identificar todos los sistemas que han tenido contacto con el historial de un paciente concreto, Lineage responde a la pregunta en cuestión de minutos.

Productos farmacéuticos: La norma 21 CFR Parte 11 de la FDA y las normativas GxP exigen la documentación de la integridad de los datos clínicos y de fabricación. Lineage realiza un seguimiento de la procedencia de cada conjunto de datos utilizado en las presentaciones reglamentarias, demostrando que los datos de origen no se han alterado sin documentación y que cada transformación es trazable.

Seguros:Los modelos actuarialesque sirven de base para los cálculos de capital regulatorio deben contar con un historial demostrable que abarque desde los datos brutos introducidos, pasando por todas las transformaciones, hasta el resultado final del modelo. Este historial permite que dichos modelos sean auditables y que sus datos de entrada sean reproducibles.

Comercio minorista y comercio electrónico:Los datos de los clientesque alimentan los modelos de personalización, los algoritmos de fijación de precios y los sistemas de detección de fraudes requieren un historial de origen para cumplir con el RGPD y la CCPA. Cuando un cliente presenta una solicitud de derecho al olvido, el historial de origen identifica todos los sistemas del entorno de datos que contienen datos derivados de los registros de ese cliente.


El linaje de los datos y la IA

La gobernanza de la IA está dando lugar a nuevos requisitos en materia de trazabilidad para los que las herramientas tradicionales de trazabilidad no estaban diseñadas.

Registro de origen de los datos de entrenamiento:Cadaconjunto de datos utilizado para entrenar o ajustar un modelo requiere un registro de origen que incluya: el sistema de origen, el historial de transformaciones, la certificación de calidad en el momento del entrenamiento, la revisión de la clasificación de la información de carácter personal (PII) y la identidad del responsable que lo certificó. Sin este registro, no es posible reproducir el entrenamiento del modelo ni llevar a cabo las auditorías del mismo.

Linaje de los procesos de ingeniería de características: Los procesos de ingeniería de características transforman los datos sin procesar en las características que utilizan los modelos. El linaje a nivel de columna a través de los procesos de características muestra exactamente qué campos de origen han contribuido a cada característica del modelo, lo que permite realizar análisis de impacto cuando cambian los esquemas de origen y proporciona la documentación necesaria para las auditorías de IA.

Historial de versiones del modelo: Cada versión del modelo es el resultado de versiones específicas de datos de entrenamiento, versiones específicas del proceso de extracción de características e hiperparámetros específicos. El linaje del modelo realiza un seguimiento de todos estos elementos para que cualquier versión del modelo pueda reproducirse exactamente y se pueda comprender con precisión la diferencia entre dos versiones del modelo.

Historial del proceso RAG: Los procesos de generación aumentada mediante recuperación incorporan documentos y conjuntos de datos a las ventanas de contexto de los modelos de lenguaje a gran escala (LLM) en el momento de la consulta. El historial registra qué documentos y conjuntos de datos de origen son aptos para la recuperación, cuáles se utilizaron en respuestas a consultas específicas y qué controles de acceso regulaban cada recuperación: el registro de auditoría que exigen los programas de gobernanza de la IA y las normativas emergentes.

Los contratos de datos entre los almacenes de características y los flujos de trabajo de entrenamiento de modelos funcionan junto con el linaje para gestionar las entradas de IA. Consulta nuestraguía sobre contratos de datos.


Mejores prácticas para implantar el linaje de datos

Empieza por los procesos de mayor riesgo: Comienza la implementación del linaje con los flujos de trabajo que alimentan los informes reglamentarios, los paneles de control críticos para el negocio y los modelos de IA en producción. Lograr una cobertura completa del linaje en todo el patrimonio de datos lleva tiempo. Empezar por donde hay más en juego genera valor de gobernanza de forma inmediata.

Automatizar desde el principio: La documentación manual del linaje —redactada por los ingenieros en wikis y hojas de cálculo— pierde precisión en cuestión de semanas a medida que cambian los flujos de trabajo. El linaje automatizado, que recoge los metadatos de ejecución de los flujos de trabajo directamente de las herramientas de orquestación, las bases de datos y las plataformas de BI, se mantiene actualizado sin necesidad de intervención humana.

Exigir el linaje a nivel de columna para los datos regulados:el linaje a nivel de tablaresulta insuficiente para la trazabilidad normativa y el análisis de impacto en entornos complejos. Definir el linaje a nivel de columna como un requisito para todos los flujos de trabajo que manejen datos regulados y para todos aquellos que alimenten informes críticos para el negocio o modelos de inteligencia artificial.

Integrar el linaje en el catálogo de datos: El linaje almacenado en una herramienta independiente del catálogo de metadatos obliga a los usuarios a consultar dos sistemas. El linaje integrado en el catálogo de datos aparece junto a la definición del activo, su puntuación de calidad y su titularidad en una única vista, lo que lo hace accesible a analistas y usuarios empresariales, y no solo a los ingenieros.

Hacer visible el linaje a los usuarios de negocio: Los diagramas técnicos de linaje que muestran las uniones SQL y las configuraciones de los flujos de datos son útiles para los ingenieros, pero no para los analistas y los administradores. Las vistas de linaje empresarial, que traducen las dependencias técnicas en relaciones en términos empresariales, hacen que el linaje resulte útil para todo el abanico de personas que necesitan confiar en los datos y actuar en función de ellos.

Supervisar la cobertura del linaje como indicador clave de rendimiento (KPI) de gobernanza:realizar un seguimientodel porcentaje de activos de datos que cuentan con documentación automatizada del linaje como métrica del programa de gobernanza. Una baja cobertura en un ámbito es un indicador adelantado de que los flujos de trabajo de ese ámbito no están documentados y de que las políticas de gobernanza para dichos activos no pueden aplicarse ni auditarse.

Preguntas frecuentes

El linaje de datos rastrea el flujo y la transformación de los datos a través de los sistemas. La gobernanza de datos define las políticas, normas y controles sobre cómo deben gestionarse y protegerse los datos. Dentro de una plataforma de inteligencia de datos, el linaje pone en práctica la gobernanza al proporcionar visibilidad sobre cómo se utilizan realmente los datos gobernados en los flujos de trabajo de análisis e inteligencia artificial.

El linaje de los datos es el registro completo del origen de un dato, lo que le ha ocurrido a lo largo del proceso y dónde ha acabado. Responde a la pregunta: si estoy viendo esta cifra en un informe, ¿de dónde procede exactamente y cómo se ha calculado?

La procedencia de los datos es el concepto más amplio que consiste en documentar el origen y el historial de los datos: de dónde proceden y cómo se han generado. El linaje de los datos es la aplicación específica del seguimiento de la procedencia en el contexto de un flujo de datos: el mapa de extremo a extremo que muestra cómo fluyen los datos a través de los sistemas y cómo se transforman a lo largo del proceso. El linaje es la forma operativa de la procedencia en los entornos de datos empresariales.

El linaje a nivel de tabla muestra qué tablas alimentan a qué tablas e informes posteriores. El linaje a nivel de columna muestra qué campos concretos de tablas específicas se sometieron a qué transformaciones específicas para generar cada campo de salida. El linaje a nivel de columna es necesario para la trazabilidad normativa, el análisis de impactos graves y la gobernanza de los datos de entrenamiento de la IA. El linaje a nivel de tabla resulta útil para trazar dependencias a alto nivel, pero es insuficiente en entornos complejos.

Un catálogo de datos es un inventario consultable de activos de datos que incluye metadatos: definiciones, titularidad, índices de calidad e información de acceso. El linaje de datos es uno de los componentes de un catálogo de datos: el registro de cómo se ha generado cada activo y de qué elementos dependen de él. El linaje sin un catálogo carece de una interfaz para los usuarios empresariales. Un catálogo sin linaje carece de la información de procedencia que hace que los activos sean fiables y auditables.

Las herramientas automatizadas de linaje se conectan a plataformas de orquestación como Airflow y dbt, bases de datos y almacenes de datos, herramientas de BI y plataformas de integración de datos. Extraen metadatos de los registros de consultas, los registros de ejecución de los flujos de trabajo, los historiales de llamadas a la API y los archivos de configuración. El análisis sintáctico de SQL extrae la lógica de transformación a nivel de columna de las consultas. Los metadatos extraídos se agrupan en un gráfico de linaje que se actualiza continuamente a medida que se ejecutan los flujos de trabajo.

El análisis de impacto es el proceso de identificar todos los activos situados en las fases posteriores que se verán afectados por un cambio en una fuente de datos o en un canal de datos. A partir de un gráfico de linaje, el análisis de impacto recorre todos los enlaces situados en las fases posteriores al punto de cambio propuesto para generar una lista completa de las tablas, informes, paneles de control y modelos afectados. Esto permite a los ingenieros evaluar el riesgo y el alcance de un cambio antes de que se lleve a cabo, en lugar de descubrir los fallos tras la implementación.

El RGPD exige a las organizaciones saber dónde se encuentran los datos personales, cómo circulan y cómo eliminarlos cuando se solicite. El seguimiento del origen e historial (lineage) identifica todos los sistemas del entorno de datos que contienen datos personales o datos derivados de ellos, rastrea cómo se han desplazado desde su origen a través de cada transformación y documenta cada evento de acceso. Cuando se recibe una solicitud de derecho al olvido, el seguimiento del origen e historial identifica todos los sistemas en los que es necesario proceder a la eliminación y confirma que esta se ha llevado a cabo en su totalidad.

El linaje de datos de IA amplía el linaje tradicional para abarcar los sistemas de IA: qué conjuntos de datos de entrenamiento alimentaron cada modelo, qué procesos de ingeniería de características transformaron los datos brutos en entradas para los modelos, qué hiperparámetros y criterios de evaluación dieron lugar a cada versión del modelo, y qué documentos o conjuntos de datos de origen se recuperaron en las respuestas del proceso RAG. El linaje de IA permite que el entrenamiento de los modelos sea reproducible, que las auditorías de los modelos puedan completarse y que los programas de gobernanza de la IA sean defendibles.

El linaje y la calidad son capacidades de gobernanza complementarias. La supervisión de la calidad detecta anomalías en los datos. El linaje identifica el origen de dichas anomalías. Cuando un control de calidad señala una tasa de valores nulos inesperada en una tabla de informes, el linaje rastrea el problema hasta la tabla de origen específica o el paso de transformación que lo provocó, lo que permite una corrección específica en lugar de una investigación generalizada.