Blog | Estrategia de datos y análisis | | 8 minutos de lectura

Márquez: La solución de detección de metadatos en WeWork

Marquez v2 ES

Resumen

  • WeWork creó Marquez, una plataforma de metadatos de código abierto para gestionar y visualizar su ecosistema de datos.
  • Los metadatos son esenciales para la calidad de los datos, su trazabilidad y para facilitar el acceso autónomo a los datos.
  • Marquez centraliza los metadatos a través de un repositorio, una API y una interfaz de usuario.
  • Mejora la búsqueda de datos mediante la indexación de conjuntos de datos en función de factores contextuales, como la propiedad y la documentación.
  • La plataforma fomenta una cultura de datos escalable y de autoservicio en la que los usuarios pueden explorar los datos y confiar en ellos.

Fundada en 2010, WeWork es una empresa internacional dedicada al alquiler de oficinas y espacios de trabajo. Su objetivo es ofrecer espacios en los que puedan colaborar equipos de cualquier tamaño, desde startups y pymes hasta grandes empresas. Para lograrlo, la oferta de WeWork se puede dividir en tres categorías diferentes:

  • Espacio: Para garantizar que las empresas dispongan del espacio óptimo, WeWork debe proporcionar la infraestructura adecuada, lo que consiste en reservar salas para entrevistas o reuniones individuales, o incluso edificios enteros para grandes corporaciones. También debe asegurarse de que estén equipadas con las instalaciones adecuadas, como cocinas para la comida y las pausas para el café, aseos, etc.
  • Comunidad: A través de la aplicación interna de WeWork, la empresa permite a los miembros de WeWork conectarse entre sí, ya sea a nivel local, dentro de su propio espacio de WeWork, o a nivel global. Por ejemplo, si una empresa necesita opiniones sobre un proyecto por parte de profesionales con perfiles específicos (como un desarrollador o un diseñador de experiencia de usuario), puede solicitar directamente opiniones y sugerencias a través de la aplicación a cualquier miembro, independientemente de su ubicación.
  • Servicios: WeWork también ofrece a sus miembros servicios informáticos completos en caso de que surja algún problema, así como otros servicios, como la gestión de nóminas, el pago de suministros, etc.

En 2020, WeWork representó:

  • Más de 600 000 socios.
  • Establecimientos en 127 ciudades de 33 países diferentes.
  • 850 oficinas en todo el mundo.
  • Generó unos ingresos de 1.82 mil millones de dólares.

Está claro que WeWork maneja todo tipo de datos de su personal y de sus clientes, ya sean particulares o empresas. Por ello, esta gran empresa necesitaba una plataforma en la que sus expertos en datos pudieran consultar, recopilar, agregar y visualizar los metadatos de su ecosistema de datos. Esto se resolvió con la creación de Marquez.

Este artículo se centrará en la implementación de Marquez por parte de WeWork, basándose principalmente en la documentación gratuita y accesible disponible en diversos sitios web, con el fin de ilustrar la importancia de contar con una plataforma de metadatos para toda la empresa que permita convertirse verdaderamente en una organización basada en los datos.  

¿Por qué gestionar y utilizar los metadatos?

En su ponencia«Un servicio de metadatos para la abstracción de datos, el linaje de datos y los desencadenantes basados en eventos», impartida en el Data Council en 2018, Willy Lulciuc, ingeniero de software del proyecto Márquez en WeWork, explicó que los metadatos son fundamentales por tres razones:

  • Garantizar la calidad de los datos: Cuando los datos carecen de contexto, a los usuarios de datos les cuesta confiar en sus activos de datos: ¿faltan campos? ¿Está actualizada la documentación? ¿Quién es el propietario de los datos y sigue siéndolo? Estas preguntas se resuelven mediante el uso de metadatos.
  • Comprender el linaje de los datos: Conocer el origen y las transformaciones de los datos es fundamental para poder saber realmente por qué etapas han pasado a lo largo del tiempo.
  • Democratización de los conjuntos de datos: Según Willy Lulciuc, ¡la democratización de los datos en la empresa es fundamental! Disponer de un portal central o una interfaz de usuario que permita a los usuarios buscar y explorar sus conjuntos de datos es una de las formas más importantes en que las empresas pueden crear verdaderamente una cultura de datos de autoservicio.

En resumen: crear un ecosistema de datos saludable.Willy explica que la capacidad de gestionar y utilizar los metadatos da lugar a una cultura de datos sostenible en la que las personas ya no necesitan pedir ayuda para encontrar y trabajar con los datos que necesitan. En su diapositiva, repasa tres categorías diferentes que conforman un ecosistema de datos saludable:

  1. Al tratarse de un ecosistema de autoservicio, en el que los usuarios de datos y los usuarios empresariales tienen la posibilidad de descubrir los datos y metadatos que necesitan, así como de explorar los activos de datos de la empresa cuando no saben exactamente qué están buscando. Proporcionar datos con contexto permite a todos los usuarios y «ciudadanos de datos» trabajar de forma eficaz en sus casos de uso de datos.
  2. Ser autosuficiente, permitiendo a los usuarios de datos la libertad de experimentar con sus conjuntos de datos, así como la flexibilidad necesaria para trabajar en todos los aspectos de los mismos, ya sea en la introducción o en la extracción de datos, por ejemplo.
  3. Y, por último, en lugar de depender de determinadas personas o grupos, un ecosistema de datos saludable permite que todos los empleados se hagan responsables de sus propios datos. Cada usuario tiene la responsabilidad de conocer sus datos, sus costes (¿están estos datos generando suficiente valor?) y de llevar un control de la documentación de los mismos, con el fin de generar confianza en torno a sus conjuntos de datos.

Proceso de reserva de habitaciones: antes

Como se ha mencionado anteriormente, el uso de metadatos es fundamental para que los usuarios puedan encontrar los datos que necesitan. En su presentación, Willy compartió un caso real para demostrar que los metadatos son esenciales: el proceso de tratamiento de datos de WeWork para reservar una sala.

Para un «WeWorker», los pasos son los siguientes:

  1. Busca una ubicación (en el ejemplo se trataba de un complejo de edificios en San Francisco).
  2. Elige el tamaño adecuado de la sala (normalmente se calcula en función del número de asistentes; en este caso, eligieron una sala con capacidad para entre 1 y 4 personas).
  3. Elige la fecha en la que se realizará la reserva.
  4. Decide el horario para el que se reserva la sala, así como la duración de la reunión.
  5. Confirma la reserva.

Ahora que tenemos un ejemplo de cómo funciona su proceso de reservas, Willy pasa a mostrar cómo actuaría un equipo de datos típico a la hora de extraer datos sobre las reservas de WeWork. En este caso, el ejercicio de ejemplo consistía en encontrar el edificio con más reservas de salas y extraer esos datos para enviárselos a la dirección. Los pasos que indicó fueron los siguientes:

  • Lee las reservas de habitaciones desde una fuente de datos (normalmente desconocida).
  • Suma todas las reservas de habitaciones y muestra las ubicaciones más solicitadas.
  • Una vez calculada la ubicación superior, el siguiente paso consiste en escribirla en alguna fuente de datos de salida.
  • Ejecuta la tarea una vez cada hora.
  • Procesa los datos mediante archivos .csv y guárdalos en algún sitio.

Sin embargo, Willy señaló que, aunque estas medidas parezcan suficientes, suelen surgir problemas. Repasa tres tipos de problemas que pueden surgir durante el proceso de trabajo:

  1. ¿Dónde puedo encontrar el conjunto de datos de la tarea?
  2. ¿Tiene el conjunto de datos un propietario? ¿Quién es?
  3. ¿Con qué frecuencia se actualiza el conjunto de datos?

La mayoría de estas preguntas son difíciles de responder, y los proyectos acaban fracasando. Sin tener certeza y sin confiar en esta información, puede resultar complicado presentar cifras a la dirección. Este tipo de problemas y dificultades son los que llevaron a WeWork a desarrollar Marquez.

¿Qué es Márquez?

Willy define la plataforma como una «solución de código abierto para la agregación, recopilación y visualización de metadatos del ecosistema de datos [de WeWork]». De hecho, Marquez es un sistema modular y se diseñó como una solución altamente escalable y extensible, independiente de la plataforma, para la gestión de metadatos. Se compone de los siguientes componentes:

  • Repositorio de metadatos: Almacena todos los metadatos de los trabajos y los conjuntos de datos, incluido un historial completo de las ejecuciones de los trabajos y estadísticas a nivel de trabajo (es decir, número total de ejecuciones, tiempos de ejecución medios, éxitos/fallos, etc.).
  • API de metadatos: API RESTful que permite a una amplia variedad de clientes comenzar a recopilar metadatos relacionados con la producción y el uso de conjuntos de datos.
  • Interfaz de usuario de metadatos: se utiliza para la búsqueda de conjuntos de datos, la conexión de varios conjuntos de datos y la exploración de su grafo de dependencias.

El diseño de Márquez

Marquez ofrece clientes específicos para cada lenguaje que implementan la API de metadatos. Esto permite que una amplia variedad de aplicaciones de procesamiento de datos puedan crear una colección de metadatos. En su versión inicial, ofrecían compatibilidad tanto con Java como con Python.

La API de metadatos extrae información relativa a la producción y el uso de conjuntos de datos. Se trata de una capa sin estado encargada de especificar tanto la persistencia como la agregación de los metadatos. La API permite a los clientes recopilar y/u obtener información sobre conjuntos de datos desde el repositorio de metadatos.

Los metadatos deben recopilarse, organizarse y almacenarse de tal forma que permitan realizar consultas exploratorias exhaustivas a través de la interfaz de usuario de metadatos. El repositorio de metadatos actúa como un catálogo de información sobre conjuntos de datos, encapsulada y abstraída de forma clara por la API de metadatos.

Según Willy, lo que hace que un ecosistema de datos sea muy sólido es la capacidad de buscar información y conjuntos de datos. Los conjuntos de datos de Marquez se indexan y clasifican mediante el uso de palabras clave o frases a través de un motor de búsqueda, así como a través de la documentación del conjunto de datos: cuanto más contexto tenga un conjunto de datos, más probable será que aparezca en primer lugar en los resultados de búsqueda. Algunos ejemplos de la documentación de un conjunto de datos son su descripción, su propietario, su esquema, sus etiquetas, etc.

Puedes consultar más detalles sobre el modelo de datos de Márquez en la propia presentación, disponible aquí: https://www.youtube.com/watch?v=dRaRKob-lRQ&ab_channel=DataCouncil

El futuro de la gestión de datos en WeWork

Dos años después del inicio del proyecto, Márquez ha demostrado ser de gran ayuda para la gran empresa de leasing. Su plan a largo plazo consiste en centrarse exclusivamente en la interfaz de usuario de su solución, incorporando más visualizaciones y representaciones gráficas con el fin de ofrecer a los usuarios formas más sencillas y divertidas de interactuar con sus datos.

Además, ofrecen diversas comunidades en línea a través de su página de GitHub, así como grupos en LinkedIn para que quienes estén interesados en Marquez puedan plantear preguntas, recibir consejos o incluso informar de problemas relacionados con la versión actual de Marquez.

Fuentes

Un servicio de metadatos para la abstracción de datos, el linaje de datos y los desencadenantes basados en eventos, WeWork. YouTube: https://www.youtube.com/watch?v=dRaRKob-lRQ&ab_channel=DataCouncil

Marquez: Recopilar, agregar y visualizar los metadatos de un ecosistema de datos, https://marquezproject.github.io/marquez/