Was ist der Daten-Lake und warum ist er wichtig? Ein Daten-Lake ist ein Lager , das von IT-Abteilungen privater Unternehmen oder öffentlichen Cloud Anbietern für die Speicherung, Verarbeitung und Pflege von Daten in jedem Format und aus jeder Quelle, wie z. B. Video, Newsfeeds, Ihre Anwendungen, Web Scraping, IoT, Data Marts, Data Warehouses oder mobile Geräte. Im Jahr 2010 stellte der damalige CTO von Pentaho, James Dixon, Data Marts und Data Lakes gegenüber. Data Marts oder Data Warehouses speicherten und ermöglichten die Datenanalyse auf der Grundlage bekannter Schemaattribute. Im Gegensatz dazu ermöglicht ein Daten-Lake die Abfrage auf der Grundlage einer beliebigen Anzahl von Details, die in den erfassten Daten enthalten sind. Daten-Lake können Sie fast jede Art und Größe von Daten speichern und anschließend nach etwas suchen, ohne sicher sein zu können, was Sie finden werden oder welches Format die Daten haben.
Daten-Lake Storage in einer modernen Datenarchitektur
Die Konzeption und Verwaltung der Datenspeicherung waren in der Vergangenheit der kostspieligste und anspruchsvollste Aspekt der IT. Da die Vielfalt der Datentypen und -quellen zugenommen hat – insbesondere da die meisten Unternehmen ihre Dienste digital über das Internet anbieten –, hat diese Komplexität zu einer Modernisierung der Datenarchitektur (Mitarbeiter, Prozesse und Tools) geführt. Man bedenke, dass vor einigen Jahren alle Daten noch einem starren Schema entsprechen mussten und daher stark strukturiert waren, während Daten heute halb- oder unstrukturiert und daher oft unformatiert sind.
Vor fünfundzwanzig Jahren benötigte man für 1 TB Datenspeicher drei große Racks mit Festplattenlaufwerken, die jeweils die Größe einer kleinen Waschmaschine hatten. Heute bietet die Daten-Lake die Möglichkeit, Petabytes an Daten zur Verfügung zu haben - entweder physisch in einem kleinen Desktop-Gehäuse oder eher virtualisiert in der Cloud. Eine gute Nachricht oder ein Albtraum für Sicherheit und Verwaltung? Welche Informationen möchte das Unternehmen aus den gespeicherten Daten extrahieren, wenn diese analysiert werden? Die Informationen, die in diesen gespeicherten Daten enthalten sind, helfen den Unternehmen dabei, ihren Kunden außergewöhnliche Produkte zu bieten, aber das Verständnis, welche Daten das Unternehmen hat, wie, wo und wann sie erworben wurden und wer darauf zugreifen kann, sind wichtige architektonische Überlegungen.
Bewährte Verfahren für eine moderne Daten-Lake sind:
- Sie wissen, was Sie haben, indem Sie eine Kombination von Katalogen verwenden (denken Sie an das Bibliothekskartensystem), wobei jede Aufzeichnung aus Metadaten besteht, die jedes Datenelement innerhalb des Sees, seine Quelle, das Erfassungsdatum und andere Attribute schnell definieren, um die Datenabfrage und Archivierung zu vereinfachen.
- Audit-Software und aktive Verwaltung dessen, was Sie haben, warum Sie es haben, ob die Art und Weise, wie Sie es haben oder erhalten haben, legal ist, wer es verwendet und wann Sie es löschen können.
- Zugriffskontrolllisten (Access Control Lists, ACL) und andere Sicherheitspraktiken werden für jeden Daten-Lake entwickelt und geregelt (weitere Informationen finden Sie im Abschnitt über Microsoft Azure Daten-Lake ).
- Cloud Data Lakes verschlüsseln Daten als Teil ihrer ersten Aufnahme. Die Fähigkeit, diese Informationen zu verwenden oder sie in einem verschlüsselten Zustand zu übertragen, erfordert spezielle Softwarekenntnisse und Änderungen an Anwendungen und Dienstdesigns. Dies gilt nicht nur für die Eigentümer des Daten-Lake , sondern auch für alle Partner oder Kunden, die Informationen und Sicherheits-Token weitergeben. Wo die Token gespeichert werden und wer Zugriff darauf hat, ist eine der Prioritäten der modernen Daten-Lake .
Was ist der Unterschied zwischen einem Daten-Lake und einem Data Warehouse?
Die Speicherung in Data Warehouses war die ursprüngliche Strategie für Speicheroptionen, bei der man wusste, was man hatte, wie es aussah und welche spezifischen Daten jede Anwendung, Datenbank, jeder Data Mart und andere Quellsysteme dorthin lieferten oder daraus abrufen mussten. Da sich Data Warehouses auf die Aggregation strukturierter Daten aus operativen Abteilungsdatenbanken konzentrierten, waren sie ebenfalls sehr strukturiert. Und obwohl sie ein oder zwei Größenordnungen größer sein konnten als die größte Datenbank, aus der sie Daten bezogen, betrugen selbst die Gesamt Datensatz en nicht mehr als einige Dutzend Terabyte, wenn überhaupt. Im Laufe der Zeit, als neue Datentypen eine historische Aggregation erforderten – Web-Klickstreams, archivierte Dokumente, Videoüberwachungsdaten und andere Datentypen und -quellen –, schienen Data Warehouses ungeeignet, da sie die mit diesen nicht-traditionellen Datenquellen verbundenen enormen Datenmengen nicht aufnehmen konnten. Zudem waren andere abteilungsbezogene Datenrepositorien in ihren Funktionen zu eng gefasst: Dokumentenmanagementsysteme funktionierten nur für Dokumente, Videoüberwachungssysteme nur für die Speicherung von Videos und so weiter. Die Suche nach einem zentralisierten und dennoch vielseitigen Daten Lager , dem der Speicherplatz nicht ausgehen würde, führte zur Einführung virtueller Speicherlösungen (VMWare, NetApp usw.) und ermöglichte die Schaffung von „ Cloud “-Datenspeicher- und „ Daten-Lake “-Optionen.
Um Data Lakes zu verstehen, müssen Sie in das Jahr 1992 zurückgehen, als Ralph Kimball und Bill Inmon den Begriff Data Warehouse prägten, um die Regeln und Schemata zu beschreiben, die in den kommenden Jahrzehnten die Architektur von Data Warehouses bestimmen sollten.
Die Wikipedia-Definition eines Data Warehouse verdeutlicht dessen Nutzen und Schwächen: "Zentrale Speicher für integrierte Daten aus einer oder mehreren unterschiedlichen Quellen. Sie speichern aktuelle und historische Daten und werden für die Erstellung von Trendberichten für die Berichterstattung der Geschäftsleitung, wie z. B. Jahres- und Quartalsvergleiche, verwendet.
Die folgende Tabelle zeigt die wichtigsten Unterschiede zwischen Data-Warehouse-Speicherung und Daten-Lake :
| Attribute | Data Warehouse | Daten-Lake |
| Dateneigenschaften |
|
|
| Datenverwendung | Berichte, Transaktionsmanagement, Business Intelligence, Dashboards | Analyse und Modellierung, künstliche Intelligenz, Profiling |
| Kosten, Geschwindigkeit, Zuverlässigkeit | Schnellste abfragen unter Verwendung von teurerem Speicher | Die Abfrageergebnisse sind schneller als bei anderen Speicheroptionen, aber der See kann zu einem Sumpf werden, wenn er nicht richtig verwaltet wird, was die Leistung beeinträchtigt Fähigkeiten |
| Datenqualität | Hochgradig kuratierte Daten, die als zentrale Version der Wahrheit dienen | Alle Daten, die kuratiert sein können oder auch nicht (d. h. Rohdaten) |
| Nutzer von Daten | Unternehmensanalysten, Power-User aus dem Geschäftsbereich | Datenwissenschaftler, Datenentwickler und Unternehmensanalysten (unter Verwendung kuratierter Daten) |
| Erforderliche Fähigkeiten zur Nutzung von Daten | Dateningenieure für Architektur, EDW-Standup-Meetings und laufende Verwaltung; Datenbankadministratoren für die Erstellung von Skripten, verwalten , Konfiguration und Optimierung | Gesucht werden Dateningenieure für Architektur, Lake-Standup-Meetings und die laufende Verwaltung sowie Entwickler, Datenanalysten und Modellierer zur Erfassung, Verarbeitung und Analyse von Daten |
| Herausforderungen | Es ist schwierig, Schemata oder Berichte zu ändern, ohne die Struktur des Data Warehouse zu verändern. |
|
Tatsächlich werden Sie sowohl Data Warehouses als auch Data Lakes benötigen und nutzen. Standardisierte, schnelle und wiederholbare Abfragen aus einer bekannten und klar definierten Datenquelle ( Datensatz ,Nutzen ) erfolgen über die Datenplattform ( Fähigkeiten ) eines Data Warehouse. Für Analysen und Modellierungen, bei denen die Datenquellen heterogen sind, ist ein Data Lake( Daten-Lake) erforderlich. Bedenken Sie jedoch: Im Jahr 2017 führte Aberdeen eine Umfrage durch, die zeigte, dass Unternehmen, die Data Lakes nutzten, ihre Wettbewerber um 9 % übertrafen. Die Erstellung und Nutzung von Data Lakes ist zwar mit einigen Einschränkungen verbunden, doch die Vorteile überwiegen die Risiken.
Die Actian Data Platform ist darauf ausgelegt, hohe Leistung und Skalierbarkeit in allen Bereichen zu bieten – sowohl hinsichtlich der „ Datenvolumen “ als auch der Anzahl der gleichzeitigen Benutzer und der Komplexität der „ abfragen “.
Microsoft Azure Daten-Lake
Microsoft Azure Daten-Lake Storage Gen1 (ADLS Gen1) war die Antwort auf den Bedarf von Kunden, die eine Möglichkeit suchten, Informationen in verschiedenen Formaten für Analysezwecke zu speichern. ADLS Gen1 bot:
- Elastische, skalierbare Lagerung.
- Azure HDInsight stellt Apache Hadoop-, Spark-, HBase- und Storm-Cluster bereit.
- Integrierte Ausfallsicherheit (auch wenn Azure „ Daten-Lake “ Gen1 diese nicht in demselben Umfang bot wie Azure Blob Storage oder andere Azure-Datenspeicheroptionen).
- Es gibt keine Einschränkungen hinsichtlich der Art der Daten, die im Azure- Daten-Lake -Speicher abgelegt werden können.
- Verschlüsselter Master Key oder Data Block Key Speicherung im ADLS Master Key Vault.
- Einfache Integration mit den meisten anderen Azure-Angeboten.
- Analysesoftware auf Basis von Apache YARN mit On-Demand-Verarbeitungsleistung.
- Integrierte Azure Active Directory-Dateidienste, die OAuth 2.0, Multi-Faktor-Authentifizierung, Zugriffskontrolllisten, rollenbasierte Zugriffslisten und POSIX unterstützen.
- Automatisierte Ereignisverwaltung zur Auslösung von Analysen oder anderen programmatischen Aktivitäten.
Microsoft Azure „ Daten-Lake “ Storage verursacht keine Vorabkosten; stattdessen können Sie für große Speicherkapazitäten weniger bezahlen als üblich und gleichzeitig die Transaktionskosten für das Lesen und Schreiben dieser Daten senken. ADLS basiert auf einem Pay-as-you-go-Modell, doch angesichts dieser Flexibilität muss das System überwacht werden, um die Kosten im Verhältnis zum Nutzen von ADLS zu kontrollieren.
Microsoft Azure Daten-Lake Storage Gen2
Anfang 2019 veröffentlichte Microsoft den Azure- Daten-Lake -Speicher Gen2 (ADLS Gen2) mit unbegrenztem Speicherplatz, der mit leistungsstarker Analysesoftware verknüpft ist, die unabhängig vom Datentyp parallele Suchvorgänge durchführen kann. ADLS Gen2 eignet sich besonders gut für die Analyse von BLOB-Dateien (Binary Large Object) oder Videodateien in Kombination mit anderen Datentypen. Azure Daten-Lake Storage Gen2 verfügt über alle Funktionen von ADLS Gen1 sowie zusätzlich über:
- Azure Active Directory (AAD).
- Hierarchisches Dateisystem (HFS) zur Gruppierung von Dateien innerhalb einer beliebigen Anzahl von Betriebssystemen.
- Georedundanter Speicher mit Lesezugriff zur Verbesserung der Geschäftskontinuität.
- BLOB-Stufen für Hot-, Cool- und Archivspeicher zur Erfüllung der Anforderungen an die Geschäftskontinuität.
- Reduzierung der Speicherkosten um bis zu 50 % gegenüber ADLS Gen1 oder Azure Blob.
- Vereinfachung des Übergangs von ADLS Gen1 zu ADLS Gen2 durch die Möglichkeit, den Wechsel über ein ADLS Gen2-Steuerungsmenü vorzunehmen.
- Erhebliche Steigerung der abfragen und Datenladeleistung durch die Verwendung von Metadaten zur Verfolgung jeder Instanz und jedes Attributs von Informationen (man denke nur daran, wie die Suche nach einem Buch in einer Bibliothek durch die Automatisierung der Buchkataloge erleichtert wurde).
- Sicherung von Daten auf Verzeichnis- und Dateiebene, entweder durch POSIX-Konformität oder mithilfe von Zugriffskontrolllisten, rollenbasiertem Zugriff (RBAC) und anderen bewährten Verfahren.
- Integrierte Verschlüsselung für Data-at-Rest oder im Transit in Verbindung mit vom Kunden verwalteten Schlüsseln oder solchen, die in Microsoft Key Vault verwaltet werden.
Planung für Microsoft Azure Daten-Lake Storage Gen2
Es gibt zahlreiche Methoden zur Datenerfassung und -aufnahme und eine Vielzahl von Verwendungszwecken für eine globale Kundengemeinschaft. Die Herausforderung besteht darin, nur einen Daten-Lake zu unterhalten, um jede analytische Anforderung zu erfüllen, oder eine Umgebung mit mehreren Daten-Lake zu schaffen.
Die Kosten für ADLS Gen2 setzen sich aus Speicher- und Transaktionskosten zusammen. Weitere Informationen finden Sie hier oder erhalten Sie beim technischen Support von Microsoft Azure. Viele Azure-Dienste wie Azure Stream Analytics, IoT Hub, Power BI und Azure Data Factory sind nun Teil von Azure Daten-Lake Storage Gen2.
Datensicherheit hat oberste Priorität. ADLS Gen2 ist ISO-konform und unterstützt die meisten Firewalls und Netzwerkkonfigurationen, wie aus den Microsoft-Leitfäden hervorgeht. Eine weitere wichtige Best Practice für „ Datenmanagement “ besteht darin, sicherzustellen, dass die Daten unabhängig von einem Kontinuitätsvorfall zugänglich sind. In ADLS Gen2 gespeicherte Daten werden dreifach repliziert, und die Ausfallsicherheit lässt sich durch die Auswahl der folgenden Optionen verbessern, wie auf der Microsoft- Webseite zur Redundanz von Azure Storage beschrieben:
- Lokal-redundante Speicherung (LRS).
- Zone-redundante Speicherung (ZRS).
- Georedundanter Speicher (GRS).
- Georedundanter Speicher mit Lesezugriff (RA-GRS).
Google und AWS Daten-Lake Storage
Dieser Artikel hat sich zwar auf Azure konzentriert, aber auch Google und AWS bieten hervorragende Alternativen.
Google Cloud Daten-Lake bietet eine skalierbar -Lösung auf Basis von Google Cloud Storage an. Es gibt zwei Dateneingang -Dienste: Dataflow für die automatisierte Datenübertragung und -bereitstellung sowie Cloud Data Fusion, das Ihre Dateneingang und Governance vollständig verwaltet. Um schnelle Analysen zu ermöglichen, nutzt Googles Daten-Lake -Speicher Dataproc zur Modernisierung der Datenarchitektur, von ETL-Prozessen und Open-Source-Produkten auf Apache Spark. Das primäre Analysewerkzeug ist BigQuery für Maschinelles Lernen (ML) oder die Auswertung von Petabytes an Daten über ANSI-SQL.
Die AWS- Daten-Lake -Speicherangebote umfassen, ähnlich wie bei Google und Microsoft Azure, Managed Services sowie verschiedene Optionen für Speicher- und Analysetools Cloud . Amazon S3 (S3 steht für „Simple Storage Service“) bildet die zentrale elastische Speicher Lager für Amazon Daten-Lake Storage und wird häufig als externer Cloud Daten Lager genutzt – nicht nur für Amazon Data Lakes, sondern auch für nahezu jedes Cloud Data Warehouse als Plattform für die Datenvorbereitung und -erfassung. Mithilfe einer Konsolenoberfläche können Nutzer Data Lakes im Handumdrehen erstellen und Daten aus verschiedenen Quellen an einem einzigen S3- Cloud -Speicherort zusammenführen. AWS Daten-Lake unterstützt AWS Lambda vollständig. Data Lakes erfordern eine leistungsstarke Suchmaschine zum Auffinden von Informationen, was über den Amazon OpenSearch Service erfolgt. Sicherheits-, Authentifizierungs- und Governance-Managementsysteme werden von Amazon Cognito bereitgestellt. Die Datentransformation und -analyse erfolgt über Amazon Glue und Amazon Athena.
Data Warehouses dienen der schnellen, spaltenorientierten oder strukturierten Daten Datenmanagement s und -analyse. Data Lakes sind Cloud Speicheroptionen für verschiedene Daten, einschließlich Data Warehouses, die zur Vereinfachung der Verwaltung mit Metadaten gekennzeichnet sind. Die Entscheidung, welches Daten-Lake gewählt werden soll, ist leider nicht eindeutig und hängt von den Anforderungen Ihres Unternehmens ab. Es empfiehlt sich, die Alternativen in einem Pilotprojekt zu testen oder eine gründliche Analyse anhand von Anwendungsszenarien durchzuführen, um sicherzustellen, dass die Lösung Ihren digitalen und analytischen Anforderungen entspricht.
Actian und die Data Intelligence Platform
DieActianData Intelligence Platformwurde speziell entwickelt, um Unternehmen dabei zu unterstützen, ihre Daten in hybriden Umgebungen zu vereinheitlichen, verwalten und zu verstehen. Sie vereint Metadaten , Governance, Datenherkunft, Qualitätsüberwachung und Automatisierung auf einer einzigen Plattform. So können Teams nachvollziehen, woher Daten stammen, wie sie genutzt werden und ob sie internen und externen Anforderungen entsprechen.
Über seine zentralisierte Schnittstelle ermöglicht Actian Erkenntnis Datenstrukturen und -flüsse, wodurch die Umsetzung von Richtlinien, die Behebung von Problemen und die abteilungsübergreifende Zusammenarbeit vereinfacht werden. Die Plattform hilft zudem dabei, Daten mit dem geschäftlichen Kontext zu verknüpfen, sodass Teams Daten effektiver und verantwortungsbewusster nutzen können. Die Plattform von Actian ist darauf ausgelegt, mit sich entwickelnden Datenökosystemen mitzuwachsen und eine konsistente, intelligente und sichere Datennutzung im gesamten Unternehmen zu unterstützen.Fordern Sie Ihre persönliche Demo an.
FAQ
Ein Daten-Lake ein Lager die Speicherung, Verarbeitung und Pflege von Daten in jedem beliebigen Format und aus jeder beliebigen Quelle, einschließlich Videos, Newsfeeds, Anwendungen, Web-Scraping, IoT, Data Marts, Data Warehouses oder Mobilgeräten.
Data Warehouses speichern hochstrukturierte, kuratierte Daten aus bekannten Quellen und dienen als zentrale Informationsquelle, während Data Lakes jede Art von Daten aufnehmen: strukturierte, semistrukturierte oder unstrukturierte Rohdaten aus unterschiedlichen Quellen.
Data Lakes bieten elastischen und skalierbar für Petabytes an Daten, unterstützen vielfältige Datentypen und -formate, ermöglichen Abrechnung als Pay-as-you-go kostengünstige Abrechnung als Pay-as-you-go und bieten Fähigkeiten Advanced Analytics KI Fähigkeiten Unternehmen dabei helfen, sich von der Konkurrenz abzuheben.
Data Lakes werden für Analysen und Modellierungen, künstliche Intelligenz, Datenprofilierung, die Auswertung von Daten IoT , die Verarbeitung von Daten aus Websites und mobilen Apps sowie die Integration von Informationen aus social media Unternehmensanwendungen genutzt.
Azure Daten-Lake Gen2 bietet unbegrenzten Speicherplatz, Kosteneinsparungen von bis zu 50 %, hierarchische Dateisysteme, geo-redundanten Speicher mit Lesezugriff, verbesserte abfragen Datenladeleistung durch Metadaten sowie erhöhte Sicherheit auf Verzeichnis- und Dateiebene.
Für Data Lakes werden Dateningenieure für die Architektur und die laufende Verwaltung benötigt, sowie Entwickler, Datenanalysten und Modellierer, um die im Data Lake gespeicherten Rohdaten zu profilieren, zu verarbeiten und zu analysieren.
Data Lakes können sich zu einem „Sumpf“ entwickeln, wenn sie nicht ordnungsgemäß verwaltet werden; ihre Absicherung ist schwieriger als die von Data Warehouses, ihre effektive Nutzung erfordert erheblichen technischen Support, und es kann leichter zu unbeabsichtigten Verstößen gegen gesetzliche Vorschriften kommen.
Ja, beides ist notwendig. Data Warehouses eignen sich hervorragend für standardisierte, schnelle und wiederholbare Abfragen aus klar definierten Datensätzen, während Data Lakes für Analysen und Modellierungen unverzichtbar sind, bei denen die Datenquellen unterschiedlich sind und die Formate variieren.