Blog | Estrategia de datos y análisis | | 6 minutos de lectura

Todo lo que necesitas saber sobre una estructura de datos

Tejido de datos

Resumen

  • Data Fabric es un enfoque de diseño que conecta y utiliza metadatos, procesos y herramientas existentes para mejorar la gestión y el uso de los datos.
  • Su objetivo es reducir el trabajo manual relacionado con los datos, eliminar los silos y hacer que los datos sean más accesibles y útiles en toda la organización.
  • Un catálogo de datos es un pilar fundamental de una estructura de datos, ya que identifica, recopila y organiza los metadatos.
  • Los grafos de conocimiento, la activación de metadatos y la integración dinámica de datos contribuyen a convertir esa base en un entorno de datos más inteligente y conectado.
  • No existe una única herramienta que ofrezca una estructura de datos completa; esta debe construirse mediante herramientas interoperables y un enfoque por fases.

Ya en 2019, Gartner identificó el concepto de «Data Fabric» como una de las principales tendencias tecnológicas para 2022. Detrás de este término de moda se esconde un objetivo importante: maximizar el valor de tus datos y acelerar tu transformación digital. Descubre cómo hacerlo siguiendo esta guía.

Poner orden en tus datos es lo que promete un «Data Fabric». Sin embargo, no se trata simplemente de una solución para organizar o estructurar la información. Un «Data Fabric» es una herramienta diseñada para aportar valor a tus datos. De hecho, el volumen de datos que generan las empresas está creciendo de forma exponencial. Cada segundo hay más y más datos que explotar y que permiten a las organizaciones ser más eficientes y estar más en sintonía con su mercado o con sus clientes. Las cifras hablan por sí solas: IDC estima que, para 2025, el volumen de datos generados a nivel mundial alcanzará los 175 zettabytes. Un volumen tan grande que, si se almacenara en discos Blu-ray, representaría una pila de discos 23 veces la distancia que hay entre la Tierra y la Luna.

¿Qué es Data Fabric?

Gartner define el «Data Fabric» como «un concepto de diseño que actúa como una capa integrada de datos y procesos de conexión». En otras palabras, un «Data Fabric» analiza continuamente combinaciones de activos de metadatos existentes, accesibles e inferidos para proporcionar información más inteligente y facilitar las tareas de gestión de datos de forma más eficiente. A continuación, un «Data Fabric» utiliza todo este análisis de metadatos para diseñar nuevos procesos y establecer un acceso estandarizado a los datos para todos los perfiles profesionales de la empresa: desarrolladores de aplicaciones, analistas, científicos de datos, etc.

Por lo tanto, un «Data Fabric» es un conjunto de procesos que leen, recogen, integran y distribuyen datos basándose en el conocimiento de quién los utiliza, la clasificación de los tipos de uso y el seguimiento de los cambios en los patrones de uso de los datos.

Las ventajas de una estructura de datos para las empresas

Gartner explica que, para 2024, la implantación de Data Fabrics en las organizaciones cuadruplicará la eficiencia en el aprovechamiento de los datos, al tiempo que reducirá a la mitad las tareas de gestión de datos realizadas por personas. En este sentido, el instituto identifica tres áreas principales de oportunidad que ofrece un Data Fabric:

  1. Una reducción del 70 % en las tareas de identificación, análisis e integración de datos para los equipos de datos;
  2. El aumento del número de usuarios de datos, mediante la reutilización de los datos para un mayor número de casos de uso;
  3. La capacidad de sacar más partido a una mayor cantidad de datos acelerando significativamente la incorporación y el aprovechamiento de datos secundarios y de terceros.

Desde un punto de vista tecnológico, un «Data Fabric» se adapta a las herramientas que ya existen en una organización. Puede desarrollarse a partir de las herramientas de integración y control de calidad existentes, así como de las plataformas de gestión de datos y gobernanza (como, por ejemplo, un catálogo de datos —ya volveremos sobre este tema—). En este sentido, su modelo de diseño es ideal, ya que aprovecha la tecnología existente al tiempo que persigue un cambio estratégico en la gestión global de los datos.

Por último, una «Data Fabric» ayuda a las empresas a eliminar los silos de datos. De este modo, se pueden reducir los costes y el esfuerzo de los equipos de datos, que se ven obligados a fusionar, reestructurar y reimplementar constantemente los silos de gestión de datos con otros nuevos.

La contribución de un catálogo de datos a una estructura de datos

Si partimos de la concepto de «capa integrada» de la definición de Data Fabric , así como el diagrama propuesto por Gartner (a continuación) como guía, observamos que un catálogo de datos desempeña un papel fundamental en la constitución de un Data Fabric. De hecho, influye en las capas superiores que conforman un Data Fabric eficiente.

Capa 1: Acceso a todo tipo de metadatos

Un catálogo de datos es la base de una estructura de Data Fabric: constituye la primera capa (gris). Permite identificar, recopilar y analizar todas las fuentes de datos y todos los tipos de metadatos. El catálogo de datos es el punto de partida de una estructura de Data Fabric.

Capa 2: Habilitación de metadatos y el gráfico de conocimiento

En la segunda capa de un «Data Fabric» (amarilla), Garner se centra en la activación de metadatos. Esta activación implica el análisis continuo de los metadatos para calcular indicadores clave. Este análisis se ve facilitado por el uso de la inteligencia artificial (IA), el aprendizaje automático (ML) y la integración automatizada de datos.

Los patrones y las conexiones detectados se incorporan posteriormente al catálogo de datos y a otras herramientas de gestión de datos para ofrecer recomendaciones a las personas y máquinas implicadas en la gestión e integración de datos. Esto requiere un análisis continuo a partir de un gráfico de conocimiento conectado —el medio para crear y visualizar las relaciones existentes entre activos de datos de diferentes tipos, darles sentido desde el punto de vista empresarial y hacer que este conjunto de relaciones sea fácil de descubrir y explorar para todos los usuarios de la organización—.

Capa 3: Integración dinámica de datos

La tercera capa de Gartner (azul) se dirige principalmente a los usuarios técnicos de los datos en las organizaciones. Esta capa del «Data Fabric» hace referencia a la necesidad de preparar, integrar, explorar y transformar datos. El reto aquí consiste en hacer que los activos de datos procedentes de una amplia gama de herramientas sean accesibles para una amplia variedad de usuarios empresariales. Las palabras clave en este caso son flexibilidad y compatibilidad para romper los silos de datos, con las siguientes características:

    • Un sistema de gestión de conjuntos de permisos de datos: el Data Fabric debe automatizar el acceso del usuario.
    • Aprovisionamiento automatizado: Cualquier persona de la organización debería poder solicitar acceso a un conjunto de datos desde Data Fabric, mediante la creación de un ticket con funciones integradas de gobernanza de datos.
    • Una herramienta de exploración de datos: El Data Fabric debería permitir a los usuarios explorar los datos (no solo los metadatos) sin tener que salir del propio Data Fabric.

La orquestación automatizada de datos —tal y como se describe en la parte superior de esta tercera capa del diagrama— hace referencia a DataOps. Se trata de una práctica colaborativa de gestión de datos cuyo objetivo es mejorar la comunicación, la integración y la automatización de los flujos de datos entre los gestores y los usuarios de datos dentro de una organización. Puedes obtener más información al respecto en este artículo.

¿Existe una única herramienta para implementar una estructura de datos?

Tal y como señala Gartner, no existe una única herramienta que dé soporte a todas las capas del «data fabric» de forma integral. En este sentido, ningún proveedor por sí solo es capaz de ofrecer una estructura de datos que pueda equipararse a una «Data Fabric» completa. La solución reside en la interacción entre las diferentes capas. La clave está en una plataforma abierta, y las empresas deben dotarse de las mejores herramientas de datos interconectadas para lograr una «Data Fabric» digna de ese nombre. La creación de una «Data Fabric» debe considerarse una maratón, no un sprint, y abordarse por etapas, siendo el catálogo de datos la primera de ellas.

Creación de una estructura de datos

Las empresas que han adoptado nuestro Smart Data Catalog ya han sentado las bases de su Data Fabric. De hecho, además de la identificación, recopilación y análisis de todas las fuentes de datos, así como de todo tipo de metadatos (primera capa), la plataforma Actian Data Intelligence ofrece todas las funcionalidades necesarias para la activación de los metadatos a través de su núcleo —mediante un gráfico de conocimiento segunda capa)—. Por último, nuestro catálogo aborda la tercera capa: por un lado, mediante la integración de normas de gobernanza de datos; por otro, a través de la aplicación Actian Explorer, que actúa como un auténtico mercado de datos para que cada usuario empresarial pueda acceder fácilmente a los conjuntos de datos clave que le interesan y, de este modo, generar rápidamente valor a partir de los datos disponibles.

Para obtener más información sobre nuestro Catálogo de datos inteligente, ponte en contacto con nosotros: