Qu'est-ce que le stockage dans un lac de données et pourquoi est-ce important ? Un lac de données est un dépôt construit par des départements informatiques d'organisations privées ou des fournisseurs de cloud public pour le stockage, le traitement et la maintenance de données dans n'importe quel format et à partir de n'importe quelle source, comme la vidéo, les flux d'actualités, vos applications, le web scraping, l'IoT, les data marts, les entrepôts de données ou les appareils mobiles. En 2010, James Dixon, alors directeur technique de Pentaho, a opposé les data marts et les data lakes. Les data marts ou entrepôts de données stockaient et permettaient d'analyser les données sur la base d'attributs de schéma connus. En revanche, un lac de données permet d'interroger les données sur la base de n'importe quel détail contenu dans les données acquises. Le stockage dans un lac de données vous permet de stocker la plupart des types et tailles de données et de rechercher ensuite quelque chose sans être sûr de ce que votre recherche trouvera ni du format exact des données.
Stockage de lac de données dans une architecture de données moderne
La conception et la gestion du stockage des données ont toujours constitué l’aspect le plus coûteux et le plus complexe de l’informatique. À mesure que la diversité des types et des sources de données s’est accrue, notamment avec la généralisation des services numériques proposés par la plupart des organisations sur Internet, cette complexité a conduit à une modernisation de l’architecture des données (personnes, processus et outils). Il suffit de penser qu’il y a quelques années, toutes les données devaient s’inscrire dans un schéma rigide et étaient donc hautement structurées, alors qu’aujourd’hui, les données sont semi-structurées ou non structurées, et donc souvent non formatées.
Il y a vingt-cinq ans, le stockage de 1 To de données nécessitait trois grands racks de disques, chacun de la taille d'une petite machine à laver. Aujourd'hui, le stockage en lac de données permet de disposer de pétaoctets de données, soit physiquement dans un petit boîtier de bureau, soit plus probablement virtualisées dans le nuage. Bonne nouvelle ou cauchemar en matière de sécurité et de gestion ? Quelles informations l'organisation souhaite-t-elle extraire de ses données stockées lorsqu'elles sont analysées ? Les informations contenues dans ces données stockées aident les entreprises à offrir à leurs clients des produits exceptionnels, mais comprendre quelles sont les données dont dispose l'organisation, comment, où et quand elles ont été acquises, et qui peut y accéder, sont des considérations architecturales essentielles.
Les meilleures pratiques pour une architecture moderne de stockage de lac de données sont les suivantes :
- Sachez ce que vous avez en utilisant une combinaison de catalogues (pensez au système de cartes de bibliothèque) avec chaque enregistrement composé de métadonnées définissant rapidement chaque élément de données dans le lac, sa source, sa date d'acquisition et d'autres attributs pour simplifier les requêtes de données et l'archivage.
- Logiciel d'audit et gouvernance active de ce que vous possédez, de la raison pour laquelle vous le possédez, de la légalité de la manière dont vous l'avez obtenu ou reçu, des personnes qui l'utilisent et de la date à laquelle vous pouvez l'effacer.
- Les listes de contrôle d'accès (ACL) et autres pratiques de sécurité sont conçues et régies pour chaque lac de données (voir la section sur le stockage des lacs de données Microsoft Azure pour plus d'informations).
- Les lacs de données en nuage chiffrent les données dans le cadre de leur admission initiale. Les compétences requises pour utiliser ces informations ou les transférer dans un état crypté nécessitent des compétences logicielles spécialisées et des modifications des applications et de la conception des services. Non seulement pour les propriétaires du lac de données, mais aussi pour tout partenaire ou client qui partage des informations et des jetons de sécurité. L'endroit où les jetons seront stockés et qui y aura accès est une priorité de conception de l'architecture de stockage du lac de données moderne.
Quelle est la différence entre un lac de données et un entrepôt de données ?
Le stockage en entrepôt de données constituait à l’origine la stratégie de stockage par excellence : on savait exactement ce dont on disposait, à quoi cela ressemblait, et quelles données spécifiques chaque application, base de données, data mart et autres systèmes sources y fournissaient ou devaient y récupérer. Comme les entrepôts de données se concentraient sur l’agrégation de données structurées issues des bases de données opérationnelles des différents services, ils étaient eux-mêmes très structurés. Et bien qu’ils puissent être d’un ou deux ordres de grandeur plus volumineux que la plus grande base de données dont ils extrayaient des données, même les tailles d’ jeu de données s agrégées ne dépassaient pas quelques dizaines de téraoctets, voire moins. Au fil du temps, à mesure que de nouveaux types de données nécessitaient une agrégation historique — flux de clics Web, documents archivés, données de vidéosurveillance et autres types et sources de données —, les entrepôts de données sont apparus comme inadaptés, car ils ne pouvaient pas absorber les volumes massifs de données associés à ces sources de données non traditionnelles. De plus, les autres référentiels de données départementaux avaient des fonctions trop restreintes : les systèmes de gestion documentaire ne fonctionnaient que pour les documents, les systèmes de vidéosurveillance uniquement pour le stockage vidéo, et ainsi de suite. La recherche d’une « dépôt » de données centralisée mais polyvalente, qui ne serait pas à court d’espace de stockage, a conduit à l’introduction du stockage virtuel (VMWare, NetApp, etc.) et a facilité la création d’options de stockage de données dans le cloud et de lacs de données.
Pour comprendre les lacs de données, il faut remonter à 1992, lorsque Ralph Kimball et Bill Inmon ont inventé le terme d'entrepôt de données pour décrire les règles et les schémas qui allaient régir les conceptions d'architecture d'entrepôt de données pendant les décennies à venir.
La définition d'un entrepôt de données donnée par Wikipedia met en évidence son utilisation et ses faiblesses : "des dépôts centraux de données intégrées provenant d'une ou de plusieurs sources disparates. Ils stockent des données actuelles et historiques et sont utilisés pour créer des rapports sur les tendances à l'intention des cadres supérieurs, tels que des comparaisons annuelles et trimestrielles".
Le tableau suivant met en évidence les principales différences entre le stockage en entrepôt de données et le stockage en lac de données :
| Attributs | Entrepôt de données | Data Lake |
| Caractéristiques des données |
|
|
| Utilisation des données | Rapports, gestion des transactions, informatique décisionnelle, tableaux de bord | Analyse et modélisation, intelligence artificielle, profilage |
| Coût, rapidité, fiabilité | Résultats des requête les plus rapides en utilisant un stockage plus coûteux | Les résultats des requête sont plus rapides qu'avec d'autres options de stockage, mais le lac peut devenir un marécage s'il n'est pas correctement géré, ce qui réduit les performances Fonctionnalités |
| Qualité des données | Des données hautement conservées qui servent de version centrale de la vérité | Toute donnée, qu'elle ait été ou non traitée (c'est-à-dire les données brutes) |
| Utilisateurs de données | Analystes d'entreprise, utilisateurs de lignes de métier | Data scientists, développeurs de données et analystes commerciaux (utilisant des données cataloguées) |
| Compétences nécessaires pour utiliser les données | Ingénieurs de données pour l'architecture, la mise en place de l'EDW et la gestion courante ; administrateurs de bases de données chargés de créer des scripts, de gérer les utilisateurs, la configuration et l'optimisation | Nous recherchons des ingénieurs de données pour l'architecture, les réunions quotidiennes du lac de données et la gestion courante, ainsi que des développeurs, Data analysts et des modélisateurs pour le profilage, le traitement et l'analyse des données |
| Défis | Difficile de modifier les schémas ou les rapports sans changer la structure de l'entrepôt de données |
|
En réalité, vous aurez besoin à la fois d’entrepôts de données et de lacs de données, et vous les utiliserez tous les deux. Les requêtes standard, rapides et reproductibles sur un ensemble de données connu et bien défini jeu de données avantage relèvent des capacités d’un entrepôt de données. L’analyse et la modélisation impliquant des sources de données disparates nécessiteront quant à elles un lac de données. Mais notez qu’en 2017, Aberdeen a mené une enquête qui a montré que les entreprises utilisant des lacs de données surpassaient leurs concurrents de 9 %. La création et l’utilisation des lacs de données comportent certes certaines mises en garde, mais les avantages l’emportent sur les risques.
La plateforme de données Actian est conçu pour offrir des performances élevées et une évolutivité optimale à tous les niveaux : volume de données, nombre d'utilisateurs simultanés et requête complexité.
Microsoft Azure Data Lake Storage
Microsoft Azure Data Lake Storage Gen1 (ADLS Gen1) a été conçu pour répondre aux besoins des clients qui cherchaient un moyen de stocker des informations dans divers formats à des fins d'analyse. ADLS Gen1 offrait :
- Stockage élastique, évolutif .
- Azure HDInsight propose des clusters Apache Hadoop, Spark, HBase et Storm.
- Résilience intégrée (même si Azure Data Lake Gen1 n'offrait pas cette fonctionnalité dans la même mesure qu'Azure Blob Storage ou d'autres options de stockage de données Azure).
- Il n'y a aucune restriction quant au type de données pouvant être stockées dans Azure Data Lake Storage.
- Stockage crypté de la clé principale ou de la clé de bloc de données dans le coffre-fort de la clé principale d'ADLS.
- Intégration facile avec la plupart des autres offres Azure.
- Logiciel d'analyse basé sur Apache YARN avec une puissance de traitement à la demande.
- Services de fichiers Azure Active Directory intégrés prenant en charge OAuth 2.0, l'authentification multifactorielle, les listes de contrôle d'accès, les listes d'accès basées sur les rôles et POSIX.
- Gestion automatisée des événements pour déclencher des analyses ou d'autres activités programmatiques.
Microsoft Azure Data Lake Storage n'implique aucun coût initial ; il vous permet au contraire de payer moins cher que d'habitude pour de grands volumes de stockage, tout en réduisant les coûts de transaction (lecture et écriture) liés à ces données. ADLS fonctionne selon un modèle de facturation à l'utilisation, mais compte tenu de cette flexibilité, il est nécessaire d'en assurer le suivi afin de contrôler le rapport coûts/bénéfices de la solution.
Microsoft Azure Data Lake Storage Gen2
Début 2019, Microsoft a lancé Azure Data Lake Storage Gen2 (ADLS Gen2), offrant un espace de stockage illimité associé à un puissant logiciel d’analyse capable d’effectuer des recherches en parallèle, quel que soit le type de données. ADLS Gen2 est particulièrement utile pour analyser des fichiers BLOB (Binary Large Object) ou vidéo combinés à d’autres types de données. Azure Data Lake Storage Gen2 dispose de toutes les fonctionnalités d’ADLS Gen1, auxquelles s’ajoutent :
- Azure Active Directory (AAD).
- Système de fichiers hiérarchiques (HFS) pour regrouper les fichiers dans n'importe quel système d'exploitation.
- Stockage géo-redondant à accès en lecture pour améliorer la continuité des activités.
- Niveaux BLOB de stockage à chaud, à froid et d'archivage pour répondre aux exigences de continuité de l'activité.
- Réduction des coûts de stockage jusqu'à 50 % par rapport à ADLS Gen1 ou Azure Blob.
- Simplifier la transition de l'ADLS Gen1 vers l'ADLS Gen2 en permettant d'effectuer cette transition à partir d'un menu de commande de l'ADLS Gen2.
- Augmentation considérable des performances des requête et des chargements de données grâce à l'utilisation de métadonnées pour suivre chaque instance et attribut d'information (pensez à la façon dont la recherche d'un livre dans une bibliothèque a été facilitée par l'automatisation des catalogues de livres).
- Sécuriser les données au niveau des répertoires et des fichiers, en les rendant conformes à la norme POSIX ou via des listes de contrôle d'accès, un accès basé sur les rôles (RBAC) et d'autres méthodes recommandées.
- Cryptage intégré pour les données au repos ou en transit liées aux clés gérées par le client ou à celles conservées dans Microsoft Key Vault.
Planification pour Microsoft Azure Data Lake Storage Gen2
Il existe de nombreuses méthodes d'acquisition et d'ingestion des données et une grande variété d'utilisations au service d'une communauté mondiale de clients. Le défi consiste à ne maintenir qu'un seul lac de données pour répondre à toute demande analytique ou à créer un environnement de stockage de lacs de données multiples.
Les coûts liés à ADLS Gen2 correspondent à la somme des coûts de stockage et des coûts de transaction. Vous trouverez des informations à ce sujet ici ou en contactant l'support e technique de Microsoft Azure. De nombreux services Azure, tels qu'Azure Stream Analytics, IoT Hub, Power BI et Azure Data Factory, font désormais partie d'Azure Data Lake Storage Gen2.
La sécurité des données est primordiale ; ADLS Gen2 est conforme aux normes ISO et prend en charge la plupart des pare-feu et des configurations réseau, comme l’indiquent les documents d’orientation de Microsoft. Une autre bonne pratique essentielle en matière d’ gestion des données , consiste à garantir l’accessibilité des données, quel que soit l’incident affectant la continuité des activités. Les données stockées dans ADLS Gen2 sont répliquées trois fois, et la résilience peut être améliorée en choisissant les options suivantes, comme indiqué sur la page Web de Microsoft consacrée à la redondance du stockage Azure:
- Stockage à redondance locale (LRS).
- Stockage redondant par zone (ZRS).
- Stockage géo-redondant (GRS).
- Stockage géo-redondant à accès en lecture (RA-GRS).
Stockage des lacs de données Google et AWS
Bien que cet article se concentre sur Azure, Google et AWS offrent d'excellentes alternatives.
Le lac de données Google Cloud propose une solution « évolutif » basée sur Google Cloud Storage. Il existe deux services « ingestion de données » : Dataflow, pour le transfert et la mise à disposition automatisés des données, et Cloud Data Fusion, qui gère entièrement vos ingestion de données et gouvernance. Afin de faciliter une analyse rapide, le stockage du lac de données de Google utilise Dataproc pour moderniser l’architecture des données, l’ETL et les produits open source sur Apache Spark. L’outil d’analyse principal est BigQuery, destiné à l’apprentissage automatique (ML) ou à l’exploration de pétaoctets de données via ANSI SQL.
Les offres de stockage de lacs de données AWS, à l’instar de celles de Google et de Microsoft Azure, comprennent des services gérés ainsi que diverses options d’outils de stockage et d’analyse dans le cloud. Amazon S3 (S3 signifie « Simple Storage Service ») fournit l’ dépôt de stockage élastique centrale pour Amazon Data Lake Storage et est largement utilisé comme dépôt de données cloud externe, non seulement pour les lacs de données Amazon, mais aussi pour la quasi-totalité des entrepôt de données cloud en tant que plateforme de mise en attente et d’ingestion de données. Grâce à une interface console, les utilisateurs peuvent créer des lacs de données à la volée, en intégrant des données provenant de plusieurs sources au sein d’un même emplacement cloud S3. Le lac de données AWS prend entièrement en charge AWS Lambda. Les lacs de données nécessitent un moteur de recherche puissant pour trouver des informations, ce qui est assuré par Amazon OpenSearch Service. Les systèmes de sécurité, d’authentification et de gestion de l’ gouvernance sont gérés par Amazon Cognito. La transformation et l’analyse des données sont assurées par Amazon Glue et Amazon Athena.
Les entrepôts de données ont pour fonction de permettre l'gestion des données et l'exploration rapides de données organisées en colonnes ou structurées. Les lacs de données sont des solutions de stockage dans le cloud destinées à divers types de données, y compris celles des entrepôts de données, qui sont étiquetées à l'aide d'métadonnées s afin de faciliter leur gestion. Le choix d'un lac de données n'est malheureusement pas évident et dépend des besoins de votre organisation. Les bonnes pratiques recommandent de tester les différentes options ou de mener une analyse approfondie de scénarios d'utilisation à l'aide d'exemples concrets afin de vous assurer que la solution répond à vos besoins en matière de transformation numérique et d'analyse.
Actian et la plateforme d'intelligence des données
La plateformeActianData Intelligencea été spécialement conçue pour aider les organisations à unifier, gérer et comprendre leurs données dans des environnements hybrides. Elle regroupe métadonnées , gouvernance, la traçabilité, le contrôle de la qualité et l'automatisation au sein d'une seule et même plateforme. Cela permet aux équipes de savoir d'où proviennent les données, comment elles sont utilisées et si elles répondent aux exigences internes et externes.
Grâce à son interface centralisée, Actian offre insight en temps réel insight les structures et les flux de données, ce qui facilite l'application des politiques, la résolution des problèmes et la collaboration entre les services. La plateforme aide également à replacer les données dans leur contexte métier, permettant ainsi aux équipes de les exploiter de manière plus efficace et responsable. La plateforme Actian est conçue pour s'adapter à l'évolution des écosystèmes de données, garantissant une utilisation cohérente, intelligente et sécurisée des données à l'échelle de l'entreprise.Demandez votre démonstration personnalisée.
FAQ
Un lac de données est un dépôt stocker, traiter et conserver des données dans n'importe quel format et provenant de n'importe quelle source, y compris des vidéos, des flux d'actualités, des applications, le web scraping, l'IoT, les data marts, les entrepôts de données ou les appareils mobiles.
Les entrepôts de données stockent des données hautement structurées et sélectionnées provenant de sources connues et servent de source centrale de vérité, tandis que les lacs de données acceptent tout type de données : structurées, semi-structurées ou non structurées sous leur forme brute provenant de sources disparates.
Les lacs de données offrent évolutif élastique et évolutif pour des pétaoctets de données, support types et formats de données, proposent tarification à l’usage économique et permettent Fonctionnalités analytique avancée d'IA Fonctionnalités aident les entreprises à surpasser leurs concurrents.
Les lacs de données sont utilisés pour l'analyse et la modélisation, l'intelligence artificielle, le profilage des données, l'analyse des données des appareils IoT, le traitement des données des sites web et des applications mobiles, et l'intégration des informations provenant réseaux sociaux des applications d'entreprise.
Azure Data Lake Storage Gen2 offre un stockage illimité, des coûts réduits jusqu'à 50 %, des systèmes de fichiers hiérarchiques, un stockage géo-redondant en lecture, des performances améliorées requête matière requête de chargement de données grâce métadonnées , ainsi qu'une sécurité renforcée au niveau des répertoires et des fichiers.
Les lacs de données nécessitent des ingénieurs de données pour l'architecture et la gestion continue, ainsi que des développeurs, data analysts et des modélisateurs pour profiler, traiter et analyser les données brutes stockées dans le lac.
Les lacs de données peuvent devenir un « marécage » s'ils ne sont pas correctement gérés, sont plus difficiles à sécuriser que les entrepôts, nécessitent support technique important support être utilisés efficacement et facilitent le non-respect involontaire des règles réglementaires.
Oui, les deux sont nécessaires. Les entrepôts de données excellent dans les requêtes standard, rapides et reproductibles à partir de jeux de données bien définis, tandis que les lacs de données sont essentiels pour l'analyse et la modélisation lorsque les sources de données sont disparates et les formats variés.