Resumen

  • El linaje de los datos es la trayectoria documentada que siguen los datos desde su origen, pasando por cada transformación, capa de almacenamiento y uso final.
  • Ayuda a las organizaciones a comprender de dónde proceden los datos, qué ha ocurrido con ellos, dónde se utilizan y quién depende de ellos.
  • En el ejemplo, una métrica de ingresos de comercio electrónico pasa de la base de datos de transacciones a la extracción ETL, las tablas de preparación, los modelos analíticos, los agregados diarios, las definiciones de métricas y, por último, a un panel de control ejecutivo.
  • El historial es importante porque refuerza la confianza, agiliza la resolución de problemas, facilita el cumplimiento normativo y hace que sea más fácil gestionar el impacto de los cambios.
  • El ejemplo también pone de manifiesto la importancia tanto del linaje técnico —que realiza un seguimiento de los sistemas y las transformaciones— como del linaje empresarial, que explica cómo se definen y utilizan métricas como los ingresos.

Los datos circulan constantemente por todo el ecosistema de información de una organización. Se recogen de los clientes, se generan mediante los sistemas, se transforman con herramientas de análisis y, en última instancia, se utilizan para tomar decisiones que afectan a los ingresos, al cumplimiento normativo y a la estrategia. Sin embargo, a muchos equipos les cuesta responder a una pregunta que, aunque parezca sencilla, no lo es: ¿De dónde proceden estos datos y cómo han llegado hasta aquí? Aquí es donde el linaje de datos cobra una importancia fundamental.

El linaje de datos ofrece visibilidad sobre el ciclo de vida de los datos, desde su origen hasta su destino final, pasando por todas las transformaciones y traspasos. Convierte el flujo de datos en un activo transparente y trazable. Para comprender por qué es importante y cómo funciona en la práctica, resulta útil analizar un ejemplo concreto de principio a fin.

¿Qué es el linaje de los datos?

El linaje de los datos es la trayectoria documentada que siguen los datos a medida que circulan por los sistemas, los procesos y las transformaciones. Describe:

  • Sistemas de origen de donde proceden los datos.
  • Transformaciones aplicadas a los datos (como la limpieza, la agregación o el enriquecimiento).
  • Capas intermedias de almacenamiento o procesamiento.
  • Destinos finales como informes, paneles de control o modelos de aprendizaje automático.

El linaje puede representarse de forma visual (mediante diagramas de flujo), técnica (como metadatos recopilados por herramientas) o narrativa (como documentación). En esencia, el linaje de datos responde a cuatro preguntas fundamentales:

  1. ¿De dónde proceden los datos?
  2. ¿Qué le pasó por el camino?
  3. ¿Dónde se utiliza actualmente?
  4. ¿Quién o qué depende de ello?

Por qué es importante el linaje de los datos

Antes de entrar en el ejemplo, conviene sentar las bases del debate explicando por qué el linaje de datos es esencial.

  • Confianza y precisión: Los analistas y los directivos tienden a confiar más en los informes cuando pueden comprobar que las cifras proceden de fuentes fidedignas.
  • Depuración y análisis de impacto: Cuando una métrica parece incorrecta, el linaje ayuda a los equipos a identificar rápidamente dónde pueden haberse producido los errores.
  • Cumplimiento normativo y auditorías: La normativa suele exigir a las organizaciones que demuestren cómo se gestionan los datos sensibles o regulados.
  • Gestión del cambio: Cuando cambia un sistema de origen o una transformación, el linaje revela qué activos posteriores se verán afectados.

Teniendo en cuenta estas ventajas, veamos un ejemplo práctico.

Ejemplo de linaje: una empresa de comercio electrónico

Imagina una empresa de comercio electrónico que vende productos por Internet. El equipo directivo revisa un panel de control diario en el que se muestra Ingresos totales diarios, el número de pedidosy valor medio por pedido. Estas métricas influyen en el gasto en marketing, la planificación de existencias y la elaboración de informes para la dirección.

Detrás de este panel de control se esconde un complejo proceso de tratamiento de datos. Vamos a seguir el recorrido de una métrica, los «Ingresos diarios totales», desde su fuente sin procesar hasta el panel de control ejecutivo.

Paso 1: Origen de los datos en el sistema fuente

El historial comienza en el momento en que se crean los datos por primera vez.

Sistema de origen: Base de datos de transacciones en línea

Cuando un cliente realiza un pedido en la página web, la transacción se registra en una base de datos relacional que da soporte a la aplicación de comercio electrónico. Esta base de datos incluye una tabla denominada «pedidos» con campos como:

  • id_pedido
  • id_cliente
  • fecha_y_hora_del_pedido
  • total_pedido
  • moneda
  • estado_del_pedido

En esta fase, los datos son sin procesar y de carácter operativo. Reflejan la actividad empresarial en tiempo real y están optimizados para el procesamiento de transacciones, no para el análisis.

Nota sobre el linaje

La fuente oficial de datos sobre ingresos es el campo «orders.order_total» de la base de datos de transacciones.

Paso 2: Extracción de datos mediante ETL o ELT

Rara vez se consultan directamente los sistemas operativos con fines analíticos. En su lugar, los datos se extraen y se transfieren a un entorno analítico.

Proceso de extracción

Cada hora, una tarea ETL (Extract, Transform, Load) automatizada extrae los registros nuevos y actualizados de la tabla de pedidos. La lógica de extracción incluye:

  • Selección de pedidos creados o actualizados desde la última ejecución.
  • Filtrar las transacciones de prueba.
  • Recopilar metadatos como, por ejemplo, la hora de extracción.

Los datos extraídos se guardan en un área de almacenamiento temporal de un almacén de datos en la nube.

Nota sobre el linaje

En este paso se introduce la primera transformación: filtrar los pedidos de prueba. Los registros de linaje deben reflejar qué lógica se aplicó y cuándo.

Paso 3: Capa de preparación en el almacén de datos

En el almacén de datos, los datos extraídos se almacenan en una tabla de transición, que suele llamarse algo así como «stg_orders».

Finalidad de la capa de preparación

La capa de preparación actúa como una copia prácticamente sin procesar de los datos de origen, con una transformación mínima. Ofrece:

  • Una instantánea estable de los datos de origen.
  • Un intermediario entre los sistemas operativos y la lógica analítica.
  • Un lugar para estandarizar los formatos básicos.

En este ejemplo, el proceso de preparación podría:

  • Convertir las marcas de tiempo a UTC.
  • Normaliza los códigos de divisas a mayúsculas.
  • Asegúrate de que los campos numéricos utilicen tipos de datos coherentes.

Nota sobre el linaje

El historial, en esta fase, vincula los pedidos del sistema de origen con la tabla «stg_orders» del almacén, incluyendo detalles sobre los pasos de estandarización.

Paso 4: Transformación en un modelo analítico limpio

A continuación, los datos se transforman en un modelo diseñado para el análisis y la elaboración de informes.

Lógica empresarial aplicada

Un trabajo de transformación crea una tabla denominada «fact_orders». Este proceso aplica reglas de negocio más complejas, tales como:

  • Incluyendo únicamente los pedidos con el estado «COMPLETADO» o «ENVIADO».
  • Convertir todos los totales de los pedidos a una única moneda de referencia (por ejemplo, USD) utilizando los tipos de cambio.
  • Redondeo de valores monetarios a dos decimales.

En esta fase, «order_total» pasa a llamarse «order_total_usd».

Nota sobre el linaje

Este es un punto clave en el seguimiento de pedidos. La cifra de ingresos depende ahora no solo del importe total del pedido original, sino también de las tablas de tipos de cambio y los filtros de estado. El sistema de seguimiento de pedidos debe documentar estas dependencias con claridad.

Paso 5: Agregación de métricas diarias

Los directivos no analizan los pedidos individuales, sino los resúmenes.

Lógica de agregación

Otra transformación agrupa los datos de la tabla «fact_orders» en una tabla de resumen diario denominada «daily_revenue».

Este proceso:

  • Ordena los pedidos por fecha (derivada de «order_timestamp»)
  • Suma el valor de «order_total_usd» de cada día
  • Cuenta los valores distintos de «order_id»

La tabla resultante incluye campos como:

  • fecha_pedido
  • ingresos_totales_diarios
  • total_pedidos

Nota sobre el linaje

Lineage muestra ahora que «total_daily_revenue» se obtiene a partir de la suma de «order_total_usd», que a su vez procede del campo original «order_total» al que se le han aplicado varias transformaciones.

Paso 6: Capa semántica y definiciones de negocio

Para que los datos sean accesibles a los usuarios sin conocimientos técnicos, muchas organizaciones incorporan una capa semántica o de métricas.

Definición métrica

En la herramienta de inteligencia empresarial, los «Ingresos diarios totales» se definen como:

La suma de «total_daily_revenue» de la tabla «daily_revenue», filtrada según el intervalo de fechas seleccionado.

Esta definición se almacena junto con metadatos como:

  • Titular de la métrica
  • Descripción
  • Frecuencia de actualización

Nota sobre el linaje

El linaje va más allá de las tablas y las columnas, y se extiende a las métricas y las definiciones. Esto garantiza que todo el mundo comprenda cómo se calcula un KPI.

Paso 7: Visualización en un panel de control ejecutivo

Por último, la métrica aparece en un panel de control ejecutivo.

Uso del panel de control

El panel de control muestra:

  • Un gráfico de series temporales de los ingresos diarios totales.
  • Comparaciones con períodos anteriores.
  • Avisas cuando los ingresos caen por debajo de un umbral.

Los directivos pueden tomar decisiones basadas en estas cifras tan solo unos minutos después de consultar el panel de control.

Nota sobre el linaje

El último paso del linaje vincula la visualización del panel de control con la definición de la métrica, la tabla agregada y, en última instancia, con los registros de transacciones originales.

Visualización del linaje completo de los datos

Si resumimos el ejemplo de forma gráfica, el linaje podría tener este aspecto:

  1. tabla de pedidos (base de datos de transacciones)
  2. Tarea de extracción ETL
  3. stg_orders (capa de preparación)
  4. fact_orders (modelo analítico depurado y enriquecido)
  5. ingresos_diarios (tabla agregada)
  6. Definición de la métrica «Ingresos diarios totales»
  7. Visualización del cuadro de mando ejecutivo

Cada flecha entre estos pasos representa una transformación o una dependencia que debería documentarse y, a ser posible, registrarse automáticamente.

Cómo ayuda Lineage cuando surge algún problema

Imaginemos una situación en la que los directivos observan que los ingresos diarios totales caen repentinamente un 20 % de la noche a la mañana.

Sin el historial, los equipos pueden perder horas haciendo conjeturas. Con el historial:

  • Los analistas rastrean el indicador hasta la tabla «daily_revenue» y observan que hay menos registros correspondientes a la fecha en cuestión.
  • Siguen el rastro hacia el origen y descubren que se han actualizado los estados de filtrado de la tarea ETL.
  • La actualización excluyó por error un valor de estado válido introducido por la aplicación de comercio electrónico.

Dado que el historial muestra claramente las dependencias, la causa raíz se identifica rápidamente y se soluciona con seguridad.

Origen técnico frente a origen empresarial

Este ejemplo pone de relieve dos tipos de linaje complementarios:

  • Línea técnica: Correspondencias y transformaciones de tabla a tabla y de columna a columna.
  • Conceptos empresariales: Cómo se definen y utilizan en los informes conceptos empresariales como «ingresos» o «pedidos».

Ambos son necesarios. El linaje técnico ayuda a los ingenieros a mantener los flujos de trabajo, mientras que el linaje empresarial ayuda a las partes interesadas a confiar en los datos e interpretarlos.

Herramientas y automatización

En la práctica, es posible determinar el linaje:

  • De forma manual, mediante documentación (propenso a errores y difícil de mantener).
  • De forma semiautomática, utilizando metadatos de herramientas de ETL y BI.
  • De forma totalmente automática, utilizando modernas plataformas de linaje de datos y catálogos de datos.

Cuanto más automatizado esté el linaje, más probable será que mantenga su precisión a medida que los sistemas evolucionen.

Cómo la plataforma de inteligencia de datos de Actian facilita el seguimiento del origen de los datos

Este ejemplo de linaje de datos muestra que incluso una métrica aparentemente sencilla, como los «Ingresos diarios totales», depende de una larga cadena de sistemas, transformaciones y definiciones. El linaje de datos hace visible esta cadena. Al rastrear los datos desde su origen en una base de datos transaccional hasta su presentación final en un panel de control ejecutivo, el linaje de datos genera confianza, agiliza la resolución de problemas, favorece el cumplimiento normativo y permite una toma de decisiones más inteligente.

Para descubrir cómo la plataforma Actian Data Intelligence ayuda a mantener las políticas de gobernanza de datos y facilita el seguimiento del linaje de los datos, solicita hoy mismo una demostración personalizada.