Marquez: Die Metadaten bei WeWork
Zusammenfassung
- WeWork hat Marquez entwickelt, eine Open Metadaten zur verwalten Visualisierung seines Datenökosystems.
- Metadaten für die Datenqualität, die Rückverfolgbarkeit und die Ermöglichung Self-Service von entscheidender Bedeutung.
- Marquez zentralisiert Metadaten einen Lager, eine API und Nutzer .
- Es verbessert Daten-Discovery es Datensätze anhand von Kontextinformationen wie Eigentumsverhältnissen und Dokumentation indexiert.
- Die Plattform unterstützt eine skalierbar Self-Service , in der Nutzer Daten erkunden und ihnen vertrauen können.
Created in 2010, WeWork is a global office and workspace leasing company. Their objective is to provide space for teams of any size, including startups, SMEs, and major corporations, to collaborate. To achieve this, what WeWork provides can be broken down into three different categories:
- Space: To ensure companies have optimal space, WeWork must provide the appropriate infrastructure, which consists of booking rooms for interviews / one-on-ones or even entire buildings for huge corporations. They also must make sure they are equipped with the appropriate facilities, such as kitchens for lunch and coffee breaks, bathrooms, etc.
- Community: Via WeWork’s internal application, the firm enables WeWork members to connect with one another, whether it’s local within their own WeWork space or globally. For example, if a company is in need of feedback for a project from specific job titles (such as a developer or UX designer), they can directly ask for feedback and suggestions via the application to any member, regardless of their location.
- Services: WeWork also provides its members with full IT services if there are any problems, as well as other services such as payroll services, utility services, etc
In 2020, WeWork represented:
- Mehr als 600.000 Mitgliedschaften.
- Standorte in 127 Städten in 33 verschiedenen Ländern.
- 850 Büros weltweit.
- Erwirtschaftete 1,82 Milliarden Dollar an Einnahmen.
Es ist klar, dass WeWork mit allen Arten von Daten seiner Mitarbeiter und Kunden arbeitet, egal ob es sich dabei um Einzelpersonen oder Unternehmen handelt. Das große Unternehmen benötigte daher eine Plattform, auf der seine Datenexperten die Metadaten ihres Datenökosystems anzeigen, sammeln, aggregieren und visualisieren konnten. Diese Aufgabe wurde durch die Gründung von Marquez gelöst.
Dieser Artikel wird sich auf die Implementierung von Marquez durch WeWork konzentrieren, hauptsächlich durch die frei zugängliche Dokumentation, die auf verschiedenen Websites zur Verfügung gestellt wird, um die Bedeutung einer unternehmensweiten Metadaten zu veranschaulichen, um wirklich data-driven zu werden.
Warum Metadaten verwalten und nutzen?
In seinem Vortrag "A Metadaten Service for Data Abstraction, Data Lineage & Event-Based Triggers" auf dem Data Council im Jahr 2018 erklärte Willy Lulciuc, Software Engineer für das Marquez-Projekt bei WeWork, dass Metadaten aus drei Gründen entscheidend ist:
- Sicherstellung der Datenqualität: Wenn Daten keinen Kontext haben, ist es für die Bürger schwer, ihren Datenbeständen zu vertrauen: Fehlen Felder? Ist die Dokumentation auf dem neuesten Stand? Wer ist der Eigentümer der Daten und ist er es noch? Diese Fragen werden durch den Einsatz von Metadaten beantwortet.
- Verstehen der Datenherkunft: Die Kenntnis der Datenherkunft und -umwandlung ist der Schlüssel, um wirklich zu wissen, welche Phasen Ihre Daten im Laufe der Zeit durchlaufen haben.
- Demokratisierung von Datensätzen: Laut Willy Lulciuc ist die Demokratisierung von Daten im Unternehmen entscheidend! Ein zentrales Portal oder eine zentrale Benutzeroberfläche, über die Nutzer ihre Daten suchen und erkunden können, ist eine der wichtigsten Möglichkeiten für Unternehmen, eine echte Self-Service zu schaffen.
Zusammengefasst: Schaffung eines gesunden Datenökosystems. Willy erklärt, dass die Fähigkeit, Metadaten verwalten und zu nutzen, eine nachhaltige Datenkultur schafft, in der die Menschen nicht mehr um Hilfe bitten müssen, um die benötigten Daten zu finden und damit zu arbeiten. In seiner Folie geht er auf drei verschiedene Kategorien ein, die ein gesundes Daten-Ökosystem ausmachen:
- Ein Self-Service-Ökosystem zu sein, in dem Daten- und Geschäftsnutzer die Möglichkeit haben, die von ihnen benötigten Daten und Metadaten zu entdecken und die Datenbestände des Unternehmens zu erkunden, wenn sie nicht genau wissen, wonach sie suchen. Die Bereitstellung von Daten mit Kontext gibt allen Nutzern und Datenbürgern die Möglichkeit, effektiv an ihren Daten zu arbeiten.
- Selbstständigkeit, indem den Datennutzern die Freiheit gegeben wird, mit ihren Datensätzen zu experimentieren, und indem sie die Flexibilität haben, jeden Aspekt ihrer Datensätze zu bearbeiten, egal ob es sich beispielsweise um Eingabe- oder Ausgabedatensätze handelt.
- Und schließlich, anstatt sich auf bestimmte Personen oder Gruppen zu verlassen, ermöglicht ein gesundes Datenökosystem allen Mitarbeitern, für ihre eigenen Daten verantwortlich zu sein. Jeder Nutzer ist dafür verantwortlich, seine Daten und deren Kosten zu kennen (bringen diese Daten genug Wert?) und die Dokumentation seiner Daten im Auge zu behalten, um Vertrauen in seine Datensätze aufzubauen.
Zimmerbuchungs-Pipeline Vorher
Wie bereits erwähnt, ist die Verwendung von Metadaten von entscheidender Bedeutung für Datenbenutzer, um die von ihnen benötigten Daten zu finden. In seiner Präsentation teilte Willy eine reale Situation, um zu beweisen, dass Metadaten unerlässlich sind: Die Datenpipeline von WeWork für die Buchung eines Zimmers.
Für einen "WeWorker" sind die Schritte wie folgt:
- Finden Sie einen Standort (das Beispiel war ein Gebäudekomplex in San Francisco).
- Choose the appropriate room size (usually split into the number of attendees – in this case, they chose a room that could accommodate 1 – 4 people).
- Wählen Sie das Datum, an dem die Buchung stattfinden soll.
- Legen Sie das Zeitfenster fest, für das der Raum gebucht wird, sowie die Dauer der Sitzung.
- Bestätigen Sie die Buchung.
Nachdem wir nun ein Beispiel dafür haben, wie die Buchungspipeline funktioniert, demonstriert Willy, wie ein typisches Datenteam vorgehen würde, wenn es Daten über die Buchungen von WeWork auslesen wollte. In diesem Fall bestand die Beispielübung darin, das Gebäude mit den meisten Raumbuchungen zu finden und diese Daten zu extrahieren, um sie an das Management zu senden. Die Schritte, die er nannte, waren die folgenden:
- Lesen Sie die Raumbuchungen aus einer (meist unbekannten) Datenquelle.
- Fassen Sie alle Zimmerbuchungen zusammen und geben Sie die besten Standorte an.
- Sobald die oberste Position berechnet ist, besteht der nächste Schritt darin, sie in eine Ausgabedatenquelle zu schreiben.
- Run the job once an hour.
- Verarbeiten Sie die Daten über .csv-Dateien und speichern Sie sie irgendwo.
Willy erklärte jedoch, dass, auch wenn diese Schritte gut genug zu sein scheinen, in der Regel doch Probleme auftreten. Er geht auf drei Arten von Problemen während des Arbeitsprozesses ein:
- Wo finde ich den Datensatz des Job-Inputs?
- Hat der Datensatz einen Eigentümer? Wer ist es?
- Wie oft wird der Datensatz aktualisiert?
Most of these questions are difficult to answer, and jobs end up failing. Without being sure and trusting this information, it can be hard to present numbers to management. These sorts of problems and issues are what made WeWork develop Marquez.
Was ist Marquez?
Willy definiert die Plattform als eine "Open-Source-Lösung für die Aggregation, Sammlung und Visualisierung von Metadaten des Datenökosystems von [WeWork]". In der Tat ist Marquez ein modulares System und wurde als hoch skalierbar, hochgradig erweiterbare, plattformunabhängige Lösung für das Metadaten konzipiert. Es besteht aus den folgenden Komponenten:
- Metadata Repository: Stores all job and dataset metadata, including a complete history of job runs and job-level statistics (i.e., total runs, average runtimes, success/failures, etc).
- Metadaten API: RESTful API, die es einer Vielzahl von Kunden ermöglicht, Metadaten rund um die Datensatz und -nutzung zu sammeln.
- Metadata UI: Used for dataset discovery, connecting multiple datasets, and exploring their dependency graph.
Marquez's Entwurf
Marquez provides language-specific clients that implement the Metadata API. This enables a diverse set of data processing applications to build a metadata collection. In their initial release, they provided support for both Java and Python.
Die Metadaten extrahiert Informationen über die Produktion und den Verbrauch von Datensätzen. Es handelt sich um eine zustandslose Schicht, die für die Spezifikation der Persistenz und Aggregation von Metadaten verantwortlich ist. Die API ermöglicht es den Clients, Datensatz zu sammeln und/oder aus demLager zu beziehen.
Metadaten müssen so gesammelt, organisiert und gespeichert werden, dass sie über die Metadaten UI abgefragt werden können. DasLager dient als Katalog von Datensatz , die von der Metadaten gekapselt und sauber abstrahiert werden.
According to Willy, what makes a very strong data ecosystem is the ability to search for information and datasets. Datasets in Marquez are indexed and ranked through the use of a search engine-based keyword or phrase, as well as the documentation of a dataset: the more a dataset has context, the more it is likely to appear first in the search results. Examples of a dataset’s documentation are its description, owner, schema, tag, etc.
You can see more details of Marquez’s data model in the presentation itself here: https://www.youtube.com/watch?v=dRaRKob-lRQ&ab_channel=DataCouncil

Die Zukunft des Datenmanagement bei WeWork
Zwei Jahre nach dem Projekt hat sich Marquez als große Hilfe für die riesige Leasingfirma erwiesen. Die langfristige Roadmap des Unternehmens sieht vor, sich ausschließlich auf die Benutzeroberfläche der Lösung zu konzentrieren und mehr Visualisierungen und grafische Darstellungen einzubeziehen, um den Benutzern einfachere und unterhaltsamere Möglichkeiten zur Interaktion mit ihren Daten zu bieten.
Sie bieten auch verschiedene Online-Communities über ihre Github-Seite sowie Gruppen auf LinkedIn für diejenigen, die sich für Marquez interessieren, um Fragen zu stellen, Ratschläge zu erhalten oder sogar Probleme mit der aktuellen Marquez-Version zu melden.
Quellen
Ein Metadaten für Datenabstraktion, Data Lineage & ereignisbasierte Auslöser, WeWork. Youtube: https://www.youtube.com/watch?v=dRaRKob-lRQ&ab_channel=DataCouncil
Marquez: Collect, aggregate, and visualize a data ecosystem’s metadata, https://marquezproject.github.io/marquez/