¿Qué es el almacenamiento en un lago de datos y por qué es importante? Un lago de datos es un repositorio construido por departamentos de TI de organizaciones privadas o proveedores de nubes públicas para el almacenamiento, procesamiento y mantenimiento de datos en cualquier formato y de cualquier fuente, como vídeo, newsfeeds, sus aplicaciones, web scraping, IoT, data marts, almacenes de datos o dispositivos móviles. En 2010, el entonces CTO de Pentaho, James Dixon, contrastó los data marts y los data lakes. Los data marts o almacenes de datos almacenaban y permitían el análisis de datos basándose en atributos de esquemas conocidos. Por otro lado, un lago de datos permite la interrogación basada en cualquier número de detalles contenidos en los datos adquiridos. El almacenamiento en lagos de datos permite almacenar casi cualquier tipo y tamaño de datos y, posteriormente, buscar algo sin estar seguro de lo que encontrará la búsqueda ni de cuál será exactamente el formato de los datos.
Almacenamiento en lagos de datos en una arquitectura de datos moderna
El diseño y la gestión del almacenamiento de datos han sido, históricamente, el aspecto más costoso y complejo de las tecnologías de la información. A medida que ha aumentado la variedad de tipos y fuentes de datos —especialmente ahora que la mayoría de las organizaciones ofrecen sus servicios de forma digital a través de Internet—, esta complejidad ha llevado a la modernización de la arquitectura de datos (personas, procesos y herramientas). Hay que tener en cuenta que, hace unos años, cualquier dato tenía que ajustarse a un esquema rígido y, por lo tanto, estaba muy estructurado, mientras que hoy en día los datos son semiestructurados o no estructurados y, por lo tanto, a menudo carecen de formato.
Hace veinticinco años, 1 TB de almacenamiento de datos requería tres grandes bastidores de unidades de disco, cada uno del tamaño de una lavadora pequeña. Hoy en día, el almacenamiento en lagos de datos ofrece la oportunidad de disponer de petabytes de datos, ya sea físicamente en una pequeña caja de escritorio o, más probablemente, virtualizados en la nube. ¿Una buena noticia o una pesadilla para la seguridad y la gestión? ¿Qué información quiere extraer la organización de sus datos almacenados cuando los analiza? La información contenida en estos datos almacenados ayuda a las empresas a dar servicio a los clientes con productos excepcionales, pero entender qué datos tiene la organización, cómo, dónde y cuándo se adquirieron, y quién puede acceder a ellos son consideraciones arquitectónicas clave.
Las mejores prácticas para una arquitectura moderna de almacenamiento de lago de datos son:
- Sepa lo que tiene utilizando una combinación de catálogos (piense en el sistema de carnés de biblioteca) con cada registro compuesto de métadonnées que definen rápidamente cada dato dentro del lago, su fuente, fecha de adquisición y otros atributos para simplificar las consultas de datos y el archivo.
- Audite el software y gouvernance activamente lo que tiene, por qué lo tiene, si es legal la forma en que lo tiene o lo recibió, quién lo utiliza y cuándo puede eliminarlo.
- Las listas de control de acceso (ACL) y otras prácticas de seguridad se diseñan y rigen para cada lago de datos (para obtener más información, consulte la sección sobre almacenamiento en el lago de datos de Microsoft Azure).
- Los lagos de datos en la nube cifran los datos como parte de su admisión inicial. La habilidad necesaria para utilizar esta información o transferirla en un estado cifrado requiere conocimientos especializados de software y cambios en las aplicaciones y diseños de servicios. No sólo para los propietarios del lago de datos, sino también para cualquier socio o cliente que comparta información y tokens de seguridad. Dónde se almacenarán los tokens y quién tendrá acceso es una prioridad del diseño de la arquitectura de almacenamiento del lago de datos moderno.
¿Cuál es la diferencia entre un lago de datos y un almacén de datos?
El almacenamiento en un almacén de datos era la estrategia de almacenamiento original en la que se sabía qué se tenía, cómo era y qué datos específicos cada aplicación, base de datos, data mart y otros sistemas fuente le proporcionaban o necesitaban recuperar de él. Dado que los almacenes de datos se centraban en la agregación de datos estructurados procedentes de bases de datos operativas departamentales, también eran muy estructurados. Y aunque podían ser uno o dos órdenes de magnitud más grandes que la mayor base de datos de la que extraían datos, ni siquiera los tamaños de los conjuntos de datos agregados superaban las decenas de terabytes, si es que llegaban a tanto. Con el tiempo, a medida que surgieron nuevos tipos de datos que requerían una agregación histórica —flujos de clics web, documentos archivados, datos de videovigilancia y otros tipos y fuentes de datos—, los almacenes de datos parecían poco adecuados, ya que no podían absorber el enorme volumen de datos asociado a estas fuentes de datos no tradicionales. Además, otros repositorios de datos departamentales tenían unas funciones demasiado limitadas: los sistemas de gestión de documentos solo funcionaban para documentos, los sistemas de videovigilancia solo para el almacenamiento de vídeo, y así sucesivamente. La búsqueda de un repositorio de datos centralizado, pero a la vez polifacético, que no se quedara sin espacio de almacenamiento, condujo a la introducción del almacenamiento virtual (VMWare, NetApp, etc.) y facilitó la creación de opciones de almacenamiento de datos en la nube y de «lagos de datos».
Para entender los lagos de datos, hay que volver a 1992, cuando Ralph Kimball y Bill Inmon acuñaron el término almacén de datos para describir las reglas y esquemas que controlarían los diseños de arquitectura de los almacenes de datos en las décadas venideras.
La definición de Wikipedia de almacén de datos destaca su uso y sus puntos débiles: "depósitos centrales de datos integrados procedentes de una o varias fuentes dispares. Almacenan datos actuales e históricos y se utilizan para crear informes de tendencias para informes de alta dirección, como comparaciones anuales y trimestrales."
En la siguiente tabla se destacan las principales diferencias entre el almacenamiento en almacenes de datos y el almacenamiento en lagos de datos:
| Atributos | Almacén de datos | Lago de datos |
| Rasgos de los datos |
|
|
| Uso de datos | Informes, gestión de transacciones, informatique décisionnelle, cuadros de mando | Análisis y modelización, inteligencia artificial, elaboración de perfiles |
| Coste, rapidez, fiabilidad | Resultados de consulta más rápidos utilizando un almacenamiento de mayor coste | Los resultados de las consultas son más rápidos que utilizando otras opciones de almacenamiento, pero el lago puede convertirse en un pantano si no se gestiona correctamente, anulando las capacidades de rendimiento. |
| Calidad de los datos | Datos muy curados que sirven como versión central de la verdad | Cualquier dato, ya sea que haya sido procesado o no (es decir, datos sin procesar) |
| Usuarios de datos | Analistas empresariales, usuarios avanzados de líneas de negocio | Científicos de datos, desarrolladores de datos y analistas de negocio (utilizando datos curados) |
| Habilidades necesarias para utilizar los datos | Se buscan ingenieros de datos para la arquitectura, reuniones de estado del EDW y la gestión continua; se necesitan administradores de bases de datos para crear scripts, gestionar usuarios, realizar configuraciones y ajustes. | Se buscan ingenieros de datos para la arquitectura, las reuniones diarias del lago de datos y la gestión continua, así como desarrolladores, analistas de datos y modeladores para perfilar, procesar y analizar datos |
| Desafíos | Dificultad para modificar esquemas o informes sin cambiar la estructura del almacén de datos. |
|
La verdad es que necesitarás y utilizarás tanto los almacenes de datos como los lagos de datos. Las consultas estándar, rápidas y repetibles a partir de un conjunto de datos conocido y bien definido se benefician de las capacidades de un almacén de datos. Los análisis y la modelización en los que las fuentes de datos son dispares requerirán un lago de datos. Pero ten en cuenta que, en 2017, Aberdeen realizó una encuesta que demostró que las empresas que utilizaban lagos de datos superaban a sus competidores en un 9 %. Existen algunas salvedades a la hora de crear y utilizar lagos de datos, pero las ventajas superan a los riesgos.
Actian Data Platform está diseñada para ofrecer un alto rendimiento y escalabilidad en todos los aspectos: volumen de datos, número de usuarios simultáneos y complejidad de las consultas.
Almacenamiento en Microsoft Azure Data Lake
Microsoft Azure Data Lake Storage Gen1 (ADLS Gen1) fue la respuesta a las necesidades de los clientes que buscaban una forma de almacenar información en diversos formatos con fines analíticos. ADLS Gen1 ofrecía:
- Almacenamiento elástico y escalable.
- Azure HDInsight ofrece clústeres de Apache Hadoop, Spark, HBase y Storm.
- Resiliencia integrada (aunque Azure Data Lake Gen1 no ofrecía esta característica en la misma medida que Azure Blob Storage u otras opciones de almacenamiento de datos de Azure).
- No hay restricciones en cuanto al tipo de datos que se pueden almacenar en Azure Data Lake Storage.
- Almacenamiento cifrado de claves maestras o claves de bloque de datos en la bóveda de claves maestras de ADLS.
- Fácil integración con la mayoría de las demás ofertas de Azure.
- Software de análisis basado en Apache YARN con potencia de procesamiento bajo demanda.
- Servicios de archivos Azure Active Directory integrados compatibles con OAuth 2.0, autenticación multifactor, listas de control de acceso, listas de acceso basadas en funciones y POSIX.
- Gestión automatizada de eventos para activar análisis u otras actividades programáticas.
Microsoft Azure Data Lake Storage no tiene costes iniciales; en cambio, te permite pagar menos de lo que pagarías normalmente por grandes cantidades de almacenamiento, al tiempo que reduce los costes de transacción —lectura y escritura— de esos datos. ADLS se basa en un modelo de pago por uso, pero, dada esta flexibilidad, es necesario supervisarlo para controlar los costes frente a los beneficios que ofrece.
Microsoft Azure Data Lake Storage Gen2
A principios de 2019, Microsoft lanzó Azure Data Lake Storage Gen2 (ADLS Gen2), con almacenamiento ilimitado vinculado a un potente software de análisis capaz de realizar búsquedas en paralelo independientemente del tipo de datos. ADLS Gen2 resulta especialmente útil para analizar archivos BLOB (objetos binarios de gran tamaño) o de vídeo combinados con otros tipos de datos. Azure Data Lake Storage Gen2 cuenta con todas las características de ADLS Gen1, además de:
- Azure Active Directory (AAD).
- Sistema de archivos jerárquico (HFS) para agrupar archivos en cualquier número de sistemas operativos.
- Almacenamiento georredundante de acceso de lectura para mejorar la continuidad del negocio.
- Niveles BLOB de almacenamiento Hot, Cool y Archive para cumplir los requisitos de continuidad de negocio.
- Reducción de los costes de almacenamiento hasta en un 50% con respecto a ADLS Gen1 o Azure Blob.
- Simplificar la transición de ADLS Gen1 a ADLS Gen2 permitiendo el cambio desde un menú de control de ADLS Gen2.
- Aumentar enormemente el rendimiento de las consultas y la carga de datos mediante el uso de métadonnées para rastrear cada instancia y atributo de la información (piense en cómo se facilitó la búsqueda de un libro en una biblioteca al automatizarse los catálogos de libros).
- Proteger los datos a nivel de directorios y archivos, ya sea garantizando su compatibilidad con POSIX o mediante listas de control de acceso, acceso basado en roles (control de acceso según roles) y otras prácticas recomendadas.
- Cifrado integrado para données au repos o en tránsito vinculado a claves gestionadas por el cliente o mantenidas en Microsoft Key Vault.
Planificación para Microsoft Azure Data Lake Storage Gen2
Existen numerosos métodos de adquisición e ingestión de datos y una gran variedad de usos al servicio de una comunidad de clientes global. El reto consiste en mantener un único lago de datos para satisfacer cualquier petición analítica o crear un entorno de almacenamiento de múltiples lagos de datos.
Los costes de ADLS Gen2 son una combinación de costes de almacenamiento y de transacciones. Puedes consultar la guía aquí o ponerte en contacto con el servicio de asistencia técnica de Microsoft Azure. Muchos servicios de Azure, como Azure Stream Analytics, IoT Hub, Power BI y Azure Data Factory, forman ahora parte de Azure Data Lake Storage Gen2.
La seguridad de los datos es fundamental, y ADLS Gen2 cumple con la norma ISO y es compatible con la mayoría de los cortafuegos o configuraciones de red, tal y como se indica en los materiales de orientación de Microsoft. Otra práctica recomendada crucial en la gestión de datos es garantizar que se pueda acceder a ellos, independientemente de que se produzca un incidente que afecte a la continuidad del servicio. Los datos almacenados en ADLS Gen2 se replican tres veces, y la resiliencia puede mejorarse seleccionando las siguientes opciones, tal y como se indica en la página web de Microsoft sobre redundancia de Azure Storage:
- Almacenamiento redundante local (LRS).
- Almacenamiento redundante por zonas (ZRS).
- Almacenamiento georredundante (GRS).
- Almacenamiento georredundante de acceso de lectura (RA-GRS).
Almacenamiento en lagos de datos de Google y AWS
Aunque este artículo se ha centrado en Azure, Google y AWS ofrecen excelentes alternativas.
El lago de datos de Google Cloud ofrece una solución escalable basada en Google Cloud Storage. Existen dos servicios de ingesta de datos: Dataflow, para la transferencia y el aprovisionamiento automatizados de datos, y Cloud Data Fusion, que gestiona íntegramente la ingesta y la gobernanza de los datos. Para facilitar un análisis rápido, el almacenamiento del lago de datos de Google utiliza Dataproc para modernizar la arquitectura de datos, el proceso ETL y los productos de código abierto basados en Apache Spark. La principal herramienta de análisis es BigQuery, destinada al aprendizaje automático (ML) o a la investigación de petabytes de datos mediante ANSI SQL.
Las ofertas de almacenamiento de lagos de datos de AWS, similares a las de Google y Microsoft Azure, incluyen servicios gestionados y diversas opciones de almacenamiento en la nube y herramientas de análisis. Amazon S3 (S3 son las siglas de Simple Storage Service) proporciona el repositorio de almacenamiento elástico principal para Amazon Data Lake Storage y se utiliza ampliamente como repositorio externo de datos en la nube, no solo para los lagos de datos de Amazon, sino también para casi cualquier almacén de datos en la nube como plataforma de preparación e ingestión de datos. Mediante una consola, los usuarios pueden crear lagos de datos sobre la marcha, integrando datos de varias fuentes en una única ubicación en la nube de S3. El lago de datos de AWS es totalmente compatible con AWS Lambda. Los lagos de datos requieren un potente motor de búsqueda para localizar información, lo cual se lleva a cabo a través de Amazon OpenSearch Service. Los sistemas de seguridad, autenticación y gestión del cumplimiento normativo se gestionan mediante Amazon Cognito. La transformación y el análisis de datos se realizan a través de Amazon Glue y Amazon Athena.
Los almacenes de datos cumplen la función de gestionar y consultar datos de forma rápida, en formato columnar o estructurado. Los lagos de datos son opciones de almacenamiento en la nube para diversos tipos de datos, incluidos los almacenes de datos, que se etiquetan con metadatos para facilitar su gestión. La elección del lago de datos adecuado no es, lamentablemente, tan sencilla y depende de los requisitos de su organización. Las mejores prácticas sugieren que se prueben las alternativas o se analice un conjunto exhaustivo de ejemplos de casos de uso para garantizar que la solución se adapta a sus necesidades digitales y analíticas.
Actian y la plataforma de inteligencia de datos
La plataformaActianData Intelligenceha sido diseñada específicamente para ayudar a las organizaciones a unificar, gestionar y comprender sus datos en entornos híbridos. Reúne la gestión de metadatos, la gobernanza, el linaje, el control de calidad y la automatización en una única plataforma. Esto permite a los equipos saber de dónde proceden los datos, cómo se utilizan y si cumplen los requisitos internos y externos.
A través de su interfaz centralizada, Actian ofrece información en tiempo real sobre las estructuras y los flujos de datos, lo que facilita la aplicación de políticas, la resolución de problemas y la colaboración entre departamentos. La plataforma también ayuda a vincular los datos con el contexto empresarial, lo que permite a los equipos utilizarlos de forma más eficaz y responsable. La plataforma de Actian está diseñada para adaptarse a los ecosistemas de datos en constante evolución, lo que garantiza un uso coherente, inteligente y seguro de los datos en toda la empresa.Solicita tu demostración personalizada.
Preguntas frecuentes
Un lago de datos es un repositorio para almacenar, procesar y mantener datos en cualquier formato y de cualquier fuente, incluyendo vídeos, fuentes de noticias, aplicaciones, web scraping, IoT, data marts, almacenes de datos o dispositivos móviles.
Los almacenes de datos almacenan datos altamente estructurados y seleccionados procedentes de fuentes conocidas y sirven como versión centralizada de la verdad, mientras que los lagos de datos aceptan cualquier tipo de datos: estructurados, semiestructurados o no estructurados en su forma original, procedentes de fuentes dispares.
Los lagos de datos proporcionan un almacenamiento elástico y escalable para petabytes de datos, admiten diversos tipos y formatos de datos, ofrecen precios rentables de pago por uso y permiten realizar análisis avanzados y utilizar capacidades de inteligencia artificial que ayudan a las empresas a superar a sus competidores.
Los lagos de datos se utilizan para el análisis y la modelización, la inteligencia artificial, la creación de perfiles de datos, el análisis de datos de dispositivos IoT, el procesamiento de datos de sitios web y aplicaciones móviles, y la integración de información procedente de redes sociales y aplicaciones corporativas.
Azure Data Lake Storage Gen2 ofrece almacenamiento ilimitado, reducción de costes de hasta un 50 %, sistemas de archivos jerárquicos, almacenamiento con redundancia geográfica de acceso de lectura, rendimiento mejorado de consultas y carga de datos mediante el seguimiento de metadatos, y seguridad mejorada a nivel de directorio y archivo.
Los lagos de datos requieren ingenieros de datos para la arquitectura y la gestión continua, además de desarrolladores, analistas de datos y modeladores para perfilar, procesar y analizar los datos sin procesar almacenados en el lago.
Los lagos de datos pueden convertirse en un «pantano» si no se gestionan adecuadamente, son más difíciles de proteger que los almacenes, requieren un importante soporte técnico para utilizarlos de forma eficaz y facilitan el incumplimiento involuntario de las normas reglamentarias.
Sí, ambos son necesarios. Los almacenes de datos destacan en consultas estándar, rápidas y repetibles a partir de conjuntos de datos bien definidos, mientras que los lagos de datos son esenciales para el análisis y la modelización cuando las fuentes de datos son dispares y los formatos varían.