¿Qué es el linaje de los datos?
El linaje de los datos es el registro completo del recorrido que sigue un activo de datos desde su fuente original, pasando por cada transformación, cada paso del proceso de tratamiento y cada sistema, hasta su destino final en un informe, un modelo, un panel de control o una aplicación operativa.
Lineage responde a cinco preguntas sobre cualquier activo de datos:
- ¿De dónde procede? El sistema de origen, la base de datos, la API o el feed de donde proceden los datos.
- ¿Qué le ha pasado? Todas las transformaciones aplicadas: uniones SQL, agregaciones, filtros, cálculos y conversiones de formato.
- ¿A dónde va? A todos los informes, paneles de control, modelos y sistemas posteriores que dependen de él.
- ¿Cuándo tuvo lugar cada paso? Marcas de tiempo para cada movimiento y transformación en la cadena de linaje.
- ¿Quién lo ha consultado? Los canales, las tareas y los usuarios que accedieron a los datos o los modificaron en cada paso.
Definición del linaje de los datos
El linaje de los datos es la visibilidad de principio a fin de los datos a medida que circulan por los sistemas de una organización. Proporciona un registro trazable del origen de los datos, su historial de transformación y su uso, lo que permite confiar en los datos, auditarlos y gestionarlos a gran escala.
Un registro de linaje no es un diagrama estático que se dibuja una vez y luego se olvida. El linaje moderno se recoge automáticamente mediante la observación de la ejecución de los flujos de trabajo, el análisis de las transformaciones SQL y la supervisión de los cambios en los esquemas. Se actualiza continuamente a medida que los datos se mueven y se ejecutan los flujos de trabajo, por lo que el registro de linaje refleja el estado actual del conjunto de datos, en lugar de una instantánea de hace meses.
Tipos de linaje de datos
| Tipo | Qué datos recopila | Caso de uso principal |
|---|---|---|
| Línea técnica | Movimiento de datos a través de canalizaciones, tareas ETL, consultas SQL y sistemas | Depuración, análisis de impacto, documentación del proceso |
| Tradición empresarial | Cómo se relacionan los conjuntos de datos con los términos empresariales, los indicadores clave de rendimiento (KPI) y los informes | Confianza en los análisis, alineación de las partes interesadas, coherencia de las métricas |
| Linaje a nivel de columna | ¿Qué campos concretos se sometieron a qué transformaciones para generar cada campo de salida? | Trazabilidad del cumplimiento normativo, seguimiento de la información de carácter personal, análisis preciso del impacto |
| Linaje a nivel de conjunto de datos | Relaciones entre tablas y conjuntos de datos | Mapeo y detección de dependencias de alto nivel |
| Linaje temporal | Versiones históricas y cambios en el esquema a lo largo del tiempo | Historial de auditorías, análisis de reversiones, detección de desviaciones en el esquema |
| Línea de IA/ML | Conjuntos de datos de entrenamiento, procesos de extracción de características e historial de versiones de los modelos | Reproducibilidad de los modelos, gobernanza de la IA, cumplimiento normativo |
A nivel de columna frente a nivel de conjunto de datos: El linaje a nivel de conjunto de datos muestra que la tabla A alimenta a la tabla B. El linaje a nivel de columna muestra que la net_revenue El campo de la tabla B se calcula a partir de gross_revenue menos discount_amount en la tabla A, filtrado por transaction_status = 'completed'. En entornos regulados y para análisis complejos, es necesario disponer de un historial a nivel de columna; el historial a nivel de conjunto de datos, por sí solo, no permite realizar registros de auditoría a nivel de campo ni análisis de impacto precisos.
Cómo se registra el linaje de los datos
El linaje de datos moderno se registra automáticamente mediante tres mecanismos:
Extracción de metadatos:Las herramientas de linajese conectan a fuentes de datos, plataformas de orquestación, herramientas de BI y almacenes de datos, y extraen los metadatos que describen el movimiento de los datos: registros de consultas, registros de ejecución de flujos de trabajo, definiciones de esquemas e historiales de llamadas a la API. Estos metadatos constituyen la materia prima para la reconstrucción del linaje.
Análisis sintáctico de SQL y transformaciones: En el caso de las transformaciones basadas en SQL, las herramientas de linaje analizan las consultas para identificar las tablas de origen, las columnas de origen, las relaciones de unión, los filtros, las agregaciones y las columnas derivadas. De este modo, se obtiene el linaje a nivel de columna a partir de la propia lógica de transformación, sin que los ingenieros tengan que documentarlo manualmente.
Actualizaciones impulsadas por eventos:cuandose ejecuta un proceso, se modifica un esquema o se conecta una nueva fuente, el gráfico de linaje se actualiza automáticamente. El linaje activo refleja el estado actual del conjunto de datos de forma continua, en lugar de mediante una actualización por lotes programada.
Cómo se aplica el linaje de datos en la práctica
Un analista encuentra una cifra inesperada en un panel de control. Con linaje: el analista abre el campo del panel de control en el catálogo de datos, sigue el linaje hacia atrás hasta la transformación que lo generó, identifica la tabla de origen de la que procede y comprueba que dicha tabla se actualizó con seis horas de retraso debido a un retraso en el proceso de tratamiento de datos. Tiempo total de investigación: cinco minutos. Sin linaje: el analista remite el caso al equipo de datos, que rastrea manualmente la cifra a través de los historiales de consultas y los registros del proceso de tratamiento de datos. Tiempo total de investigación: de dos a cuatro horas.
Un ingeniero se dispone a modificar el esquema de una tabla de origen.Conel linaje: el ingeniero consulta el gráfico de linaje para ver todas las tablas, canalizaciones, informes y modelos posteriores que dependen de cualquier columna de la tabla que se va a modificar. Tres informes posteriores y una canalización de características de aprendizaje automático dejarían de funcionar. El ingeniero coordina las correcciones antes de que se implemente el cambio. Sin el linaje: se implementa el cambio, tres informes dejan de funcionar y la canalización de aprendizaje automático genera características incorrectas durante 48 horas antes de que se localice y resuelva el problema.
Un responsable de cumplimiento responde a una solicitud de derecho al olvido en virtud del RGPD. Con Lineage: el responsable consulta el gráfico de Lineage para cada activo derivado del registro de cliente del interesado. Lineage devuelve una lista completa de los seis sistemas en menos de un minuto. Los seis se actualizan y se confirma la supresión. Sin Lineage: el responsable se pone en contacto manualmente con cada responsable de sistema para preguntar si disponen de los datos del interesado. Tres semanas después, la investigación aún no ha concluido.
El linaje de los datos frente a conceptos relacionados
Linaje de datos frente a procedencia de datos: La procedencia de los datos es el concepto más amplio que consiste en documentar el origen y el historial de los datos. El linaje de los datos es la implementación operativa específica de la procedencia en el contexto de un flujo de trabajo: el mapa de extremo a extremo que muestra cómo fluyen los datos a través de los sistemas y cómo se transforman. El linaje es la procedencia que se puede consultar y automatizar.
Linaje de datos frente a catalogación de datos:uncatálogo de datos es un inventario consultable de activos de datos que incluye metadatos: definiciones, titularidad, índices de calidad e información de acceso. El linaje de datos es un componente del catálogo: el registro de cómo se ha generado cada activo y de qué elementos dependen de él. El linaje sin un catálogo carece de una interfaz para los usuarios empresariales. Un catálogo sin linaje carece de la información de procedencia que hace que los activos sean fiables y auditables.
Linaje de datos frente a observabilidad de datos:la observabilidad de datos supervisa el estado de los datos en tiempo real, detectando anomalías, cambios en el esquema y fallos en los flujos de datos. El linaje de datos proporciona el contexto para esas observaciones: cuando se activa una alerta de observabilidad ante una anomalía, el linaje identifica dónde se originó la anomalía y qué activos posteriores se ven afectados. Ambas capacidades son complementarias: la observabilidad detecta el problema y el linaje lo explica.
Preguntas frecuentes
El linaje de los datos es el registro que recoge de dónde procede un dato, qué ha ocurrido con él a lo largo del proceso y dónde ha acabado. Si estás analizando una cifra en un informe y quieres saber cómo se ha calculado y cuál es el origen de los datos subyacentes, el linaje de los datos responde a esa pregunta.
El informe semanal de ingresos de una empresa minorista muestra una caída inesperada. Un analista de datos abre el campo de ingresos en el catálogo de datos y sigue su linaje hacia arriba. El linaje muestra que el campo se calcula a partir de una tabla de transacciones que se ha unido a una tabla de precios de productos. La tabla de precios se actualizó hace dos días y se añadió una nueva categoría de descuento que el cálculo de ingresos no estaba diseñado para gestionar. El linaje identificó el origen de la discrepancia en cuestión de minutos, en lugar de horas.
El seguimiento del linaje a nivel de columna registra qué campos concretos de las tablas de origen se sometieron a qué transformaciones específicas para generar cada campo de las tablas posteriores. Se trata de una forma de seguimiento del linaje más detallada y costosa que el seguimiento a nivel de conjunto de datos, pero es necesaria para la trazabilidad normativa, el análisis preciso del impacto, el seguimiento de la información de carácter personal (PII) y la gobernanza de los datos de entrenamiento de la inteligencia artificial.
La gobernanza de datos es el marco de políticas, funciones y normas que determina cómo se gestionan los datos. El linaje de datos es una de las capacidades operativas que hace posible la gobernanza: proporciona los registros de auditoría que exige el cumplimiento normativo, el análisis de impacto del que depende la gestión del cambio y los registros de procedencia que requiere la certificación de datos. El linaje es un componente de la gobernanza, no un sustituto de la misma.
Las herramientas automatizadas de linaje se conectan a plataformas de orquestación como Airflow y dbt, a bases de datos y almacenes de datos, a herramientas de inteligencia empresarial y a plataformas de integración de datos. Extraen metadatos de los registros de consultas, de los registros de ejecución de los flujos de trabajo y de las definiciones de esquemas. El análisis sintáctico de SQL extrae la lógica de transformación a nivel de columna de las consultas. Los metadatos extraídos se agrupan en un gráfico de linaje que se actualiza continuamente a medida que se ejecutan los flujos de trabajo.
Los modelos de IA requieren datos de entrenamiento trazables y regulados. El linaje de los datos documenta qué conjuntos de datos se utilizaron para entrenar cada modelo, qué transformaciones se aplicaron para generar los datos de entrenamiento y qué estándares de calidad cumplían los datos en el momento del entrenamiento. Sin linaje, no es posible reproducir el entrenamiento de los modelos ni llevar a cabo auditorías de los mismos. A medida que maduran las normativas sobre gobernanza de la IA, el linaje de los datos de entrenamiento se está convirtiendo en un requisito de cumplimiento normativo, más que en una buena práctica.
El análisis de impacto es el proceso de identificar todos los activos posteriores que se verán afectados por un cambio propuesto en una fuente de datos o un canal de datos. A partir de un gráfico de linaje, el análisis de impacto recorre todos los enlaces posteriores desde el punto de cambio para generar una lista completa de las tablas, informes, paneles de control y modelos afectados. Esto permite a los ingenieros evaluar el riesgo antes de que se implemente un cambio, en lugar de descubrir fallos una vez en producción.