Resumen

  • El linaje de datos permite realizar un seguimiento del ciclo de vida de los datos, incluyendo su origen, sus transformaciones y sus destinos finales a lo largo del tiempo.
  • El auge del Big Data ha complicado el seguimiento centralizado, lo que ha hecho necesarias nuevas herramientas, como los catálogos de datos, para mantener la visibilidad.
  • El historial a nivel de conjunto de datos pone de relieve los procesos y las fuentes específicos que dan lugar a las tablas o directorios finales.
  • El historial a nivel de columna ofrece información detallada, mostrando cómo se modifican los campos individuales a través de diversas acciones.

El linaje de datos se define como un tipo de ciclo de vida de los datos. Se trata de una representación detallada de cualquier dato a lo largo del tiempo: su origen, sus procesos y sus transformaciones. Aunque no se trata de un concepto totalmente nuevo, se está produciendo un cambio de paradigma.

Obtener el linaje de los datos de un almacén de datos, por ejemplo, era una tarea bastante sencilla. Este sistema de almacenamiento centralizado permitía, «por su propio diseño», obtener el linaje de los datos a partir de los datos almacenados en ese mismo lugar.

El ecosistema de datos ha ido evolucionando a un ritmo muy rápido desde la aparición del Big Data, debido a la irrupción de diversas tecnologías y sistemas de almacenamiento que complican los sistemas de información de las empresas.

Se ha vuelto imposible mantener e imponer una única herramienta centralizada en las organizaciones. El software y los métodos utilizados por los urbanistas y los arquitectos de sistemas de información del «viejo mundo» son cada vez más difíciles de mantener, lo que hace que su trabajo resulte obsoleto e ilegible.

Entonces, ¿cómo se puede visualizar un linaje de datos eficaz en un entorno de big data?

Para obtener una visión global de los datos de los sistemas de información de una empresa, están surgiendo nuevas herramientas. Nos referimos al catálogo de datos. Este permite gestionar la máxima cantidad posible de metadatos procedentes de todos los almacenes de datos a través de una interfaz intuitiva. Al centralizar toda esta información, es posible crear un linaje de datos en un entorno de Big Data a diferentes niveles:

A nivel de conjuntos de datos

Puede tratarse de una tabla en Oracle, un tema en Kafka o incluso un directorio en el lago de datos. Un catálogo de datos destaca los procesos y los conjuntos de datos que han permitido crear el conjunto de datos final.

Sin embargo, esta norma sobre el linaje de los datos, por sí sola, no permite a los usuarios de los datos responder a todas sus preguntas. Entre otras, siguen sin respuesta las siguientes: ¿Qué ocurre con los datos sensibles? ¿Qué columnas se crearon y mediante qué procesos? etc.

A nivel de columna

Una forma más detallada de abordar este tema consiste en representar las diferentes etapas de transformación de un conjunto de datos en una línea temporal de acciones o eventos. Al seleccionar un campo concreto, los usuarios podrán ver qué columnas y acciones lo han generado.