Descubrimiento de datos: un glosario completo para equipos de datos y análisis
Introducción
Encontrar datos en una empresa moderna no es un problema de búsqueda. Es un problema de confianza. Cualquier analista que disponga de una herramienta de consulta puede localizar una tabla. Lo que no puede hacer fácilmente es determinar si esa tabla es precisa, quién es su propietario, cuándo se actualizó por última vez, de dónde procede o si está autorizado a utilizarla. El descubrimiento de datos es la práctica de resolver ese problema de forma sistemática, vinculando los conjuntos de datos con los metadatos, el linaje, los indicadores de calidad y el contexto de gobernanza que los hacen utilizables. Los términos de este glosario definen las capacidades y los componentes que hacen que el descubrimiento de datos empresariales sea fiable a gran escala.
Concepto fundamental
¿Qué es el descubrimiento de datos?
El descubrimiento de datos es el proceso de localizar, comprender y evaluar los activos de datos en los sistemas, plataformas y ámbitos de negocio de una organización. Permite a los analistas, ingenieros y usuarios de negocio localizar conjuntos de datos relevantes, evaluar su calidad y su linaje, y determinar si un activo concreto es adecuado para un caso de uso específico —análisis, elaboración de informes, aprendizaje automático o cumplimiento normativo—.
En entornos de datos más pequeños, la búsqueda de información era informal. Un ingeniero de datos sabía dónde estaba todo. Se utilizaba una hoja de cálculo para llevar un registro de las tablas importantes. Un analista enviaba un mensaje por Slack cuando necesitaba ayuda para encontrar algo. Ese modelo deja de funcionar más o menos cuando una organización supera los unos cientos de conjuntos de datos y un puñado de fuentes de datos. A partir de ahí, el enfoque informal genera incoherencias: equipos diferentes que utilizan versiones distintas de la misma métrica, informes elaborados a partir de datos que nadie ha consultado en dos años, decisiones tomadas basándose en cifras cuyo origen nadie puede explicar.
La búsqueda de datos en las empresas modernas se basa en cuatro capas interconectadas. Los metadatos proporcionan el contexto descriptivo sobre qué es un conjunto de datos. El linaje registra su origen y cómo ha evolucionado. Los indicadores de calidad indican a los usuarios si los datos están en buen estado. El contexto de gobernanza les indica si pueden utilizarlos y en qué condiciones. Cuando estas capas se integran y se mantienen actualizadas, la búsqueda de datos pasa de ser una tarea manual a convertirse en una experiencia guiada y contextual.
El resultado empresarial es un sistema de análisis de autoservicio que realmente se adapta a las necesidades de la empresa. Los equipos encuentran los datos sin necesidad de abrir un ticket. Los problemas relacionados con los datos salen a la luz antes de que lleguen al informe. El equipo central de datos deja de dedicar la mitad de su tiempo a responder preguntas sobre dónde se encuentran las cosas.
El descubrimiento no es una capacidad independiente. Es la parte visible de una arquitectura de inteligencia de datos más amplia, y su eficacia depende en gran medida de la calidad de los metadatos, el linaje, la calidad y la infraestructura de gobernanza que lo sustentan.
Términos del glosario
Metadatos activos
Metadatos que se actualizan, enriquecen y procesan de forma continua y en tiempo real a medida que los datos circulan por los flujos y los sistemas. A diferencia de los metadatos estáticos o pasivos —que se recogen en un momento determinado y se actualizan manualmente—, los metadatos activos reflejan el estado actual de un activo de datos: su actualidad, su nivel de calidad, sus patrones de uso recientes y su relación con otros activos.
En la práctica, los metadatos activos son los que hacen que un catálogo sea útil y no meramente decorativo. Un catálogo basado en metadatos pasivos te indica dónde se encuentra una tabla. Un catálogo basado en metadatos activos te indica dónde se encuentra, si se ha actualizado esta mañana, quién la consultó la semana pasada y si su esquema ha cambiado de tal forma que ha provocado un error en un informe posterior.
Los metadatos activos son el mecanismo que permite las recomendaciones inteligentes, las alertas de calidad automatizadas y la clasificación de los resultados de búsqueda en función del uso. Son lo que distingue a un catálogo dinámico de un inventario indexado.
Términos relacionados: metadatos, gestión de metadatos, catálogo de datos, observabilidad de los datos
Glosario empresarial
Un repositorio compartido de definiciones consensuadas de términos y conceptos empresariales, gestionado a nivel organizativo. Un glosario empresarial define qué significan términos como «cliente activo», «ingresos» o «tasa de abandono» para una organización concreta, y vincula esas definiciones a los conjuntos de datos técnicos y a las columnas que los implementan.
El glosario es el puente de traducción entre el lenguaje que utilizan los equipos de datos (nombres de tablas, identificadores de columnas, estructuras de esquemas) y el lenguaje que utilizan los usuarios de negocio (indicadores clave de rendimiento, dimensiones, entidades de negocio). Sin él, la función de búsqueda genera resultados que los analistas no pueden interpretar sin ayuda adicional, y un mismo término de negocio se define de forma diferente según el equipo.
Un glosario empresarial bien mantenido reduce el coste de la incorporación de nuevos analistas, limita la proliferación de métricas contradictorias y hace que las políticas de gobernanza sean comprensibles para las personas encargadas de cumplirlas. En las organizaciones que aplican el modelo «data mesh» o la gobernanza federada, el glosario empresarial se convierte en el contrato compartido que garantiza la coherencia de los productos de datos específicos de cada ámbito en toda la empresa.
Términos relacionados: gestión de metadatos, gobernanza de datos, administración de datos, catálogo de datos
Catálogo de datos
El sistema que permite el descubrimiento de datos. Un catálogo de datos indexa los activos de datos —tablas, archivos, paneles de control, API, modelos y flujos de datos—, junto con sus metadatos, titularidad, relaciones y estado de gobernanza, y permite buscarlos y explorarlos en toda la organización.
Para obtener una explicación detallada sobre cómo se crean los catálogos y qué es lo que indexan, consulta «¿Qué es un catálogo de datos?».
Los catálogos tradicionales eran, en esencia, inventarios: listas de recursos con descripciones, que un pequeño equipo actualizaba manualmente. La limitación era evidente. La gestión manual no es escalable, las descripciones quedan obsoletas y un inventario sin contexto relacional indica a los usuarios lo que existe, pero no qué significa ni si es fiable.
Los catálogos de datos modernos se basan en la ingesta automatizada de metadatos, la asignación de relaciones, los metadatos activos y la integración de la gobernanza. Vinculan los conjuntos de datos con términos empresariales, responsables, gráficos de linaje, puntuaciones de calidad y políticas de acceso. El catálogo no sustituye al descubrimiento: es la infraestructura sobre la que se ejecuta el descubrimiento.
Conviene tener presente la distinción entre un catálogo y la búsqueda. El catálogo es el sistema. La búsqueda es la funcionalidad que permite dicho sistema. Una organización puede disponer de un catálogo y, aun así, tener un sistema de búsqueda deficiente si el catálogo está incompleto, desactualizado o desconectado de los criterios de gobernanza y calidad.
Términos relacionados: descubrimiento de datos, metadatos, gestión de metadatos, metadatos activos, gobernanza de datos
Clasificación de datos
Proceso que consiste en etiquetar los activos de datos o las columnas según su tipo de contenido, nivel de confidencialidad o uso previsto. La clasificación etiqueta los datos como información de carácter personal (PII), datos financieros, historiales médicos, información empresarial confidencial o información pública, entre otras categorías.
La clasificación contribuye directamente al proceso de descubrimiento, ya que muestra información sobre la gobernanza y el contexto de acceso junto con los resultados de la búsqueda. Cuando un usuario encuentra un conjunto de datos, la clasificación le indica de inmediato si contiene datos sensibles, qué controles de acceso se aplican y si su caso de uso está permitido.
La clasificación automatizada utiliza la comparación de patrones, el aprendizaje automático y las señales de metadatos para etiquetar los datos en el momento de su ingesta, en lugar de requerir una revisión manual. Esto es importante a escala empresarial: las organizaciones con miles de tablas y docenas de fuentes de datos no pueden clasificar los activos uno por uno. Sin la clasificación automatizada, los datos confidenciales suelen acabar en flujos de trabajo de análisis donde no deberían estar, y los equipos de gobernanza no disponen de una forma fiable de saber qué activos necesitan protección.
Términos relacionados: gobernanza de datos, gestión de metadatos, administración de datos, catálogo de datos
Contratos de datos
Acuerdos formales entre los productores y los consumidores de datos que especifican la estructura, la semántica, los estándares de calidad y la frecuencia de actualización de un activo de datos. Un contrato de datos define qué es un conjunto de datos, qué forma adopta, qué calidad garantiza y qué ocurre cuando cambia.
En el proceso de búsqueda de datos, los contratos de datos aportan un nivel de compromiso explícito que los metadatos por sí solos no pueden ofrecer. Los metadatos describen cómo es un conjunto de datos en la actualidad. Un contrato especifica cómo debe ser, quién es responsable de su mantenimiento y cómo se notificará a los usuarios en caso de que sufra cambios. Los usuarios que encuentran un conjunto de datos con un contrato activo saben que están trabajando con un activo gestionado, y no con una tabla olvidada que alguien creó para un proyecto puntual.
Los contratos de datos se han vuelto más habituales a medida que las organizaciones adoptan patrones de «data mesh», en los que los equipos de dominio se encargan de publicar productos de datos para el resto de la organización. Sin contratos, esos productos no son más que promesas sin documentar. Con ellos, se convierten en una infraestructura fiable.
Términos relacionados: gobernanza de datos, gestión de datos, calidad de los datos, malla de datos, productos de datos
Estructura de datos
Un patrón arquitectónico que conecta los datos entre sistemas, fuentes y entornos distribuidos a través de una capa unificada de metadatos, integración y gobernanza. Una «data fabric» no traslada todos los datos a una única ubicación, sino que conecta los datos allí donde se encuentran, lo que permite acceder a ellos y gestionarlos de forma unificada en entornos en la nube, locales e híbridos.
En el contexto de una estructura de datos, el descubrimiento significa que los usuarios pueden encontrar y utilizar los datos independientemente de dónde se encuentren físicamente. La estructura proporciona el tejido conectivo: metadatos coherentes, políticas de gobernanza compartidas, linaje integrado y búsqueda entre entornos. Sin ella, el descubrimiento en un entorno distribuido requiere navegar por cada sistema de forma individual, sin un contexto compartido entre ellos.
El «data fabric» y el «data mesh» están relacionados, pero son conceptos distintos. El «data fabric» es una arquitectura tecnológica. El «data mesh» es un modelo organizativo y de propiedad. Una organización puede utilizar un «data fabric» para implementar un «data mesh», pero no son lo mismo.
Términos relacionados: catálogo de datos, gestión de metadatos, gobernanza de datos, malla de datos, linaje de datos
Gobernanza de datos
Las políticas, normas, funciones y procesos que definen cómo se gestionan, protegen y utilizan los datos en toda una organización. La gobernanza especifica quién es el titular de los datos, quién puede acceder a ellos, durante cuánto tiempo se conservan y qué normas de calidad deben cumplir.
La gobernanza y la búsqueda de datos son conceptos inseparables en una organización de datos que funcione correctamente. La búsqueda de datos sin gobernanza indica a los usuarios dónde se encuentran los datos, pero no si están autorizados a utilizarlos ni si cumplen con los estándares que exige su caso de uso. La gobernanza sin búsqueda de datos significa que las políticas existen sobre el papel, pero no pueden aplicarse de forma coherente porque nadie tiene una visión completa de los activos de datos existentes.
La gobernanza integrada en un contexto de búsqueda significa que las políticas de acceso, las etiquetas de cumplimiento, las normas de conservación y la información sobre la titularidad aparecen directamente en los resultados de búsqueda y en las páginas de activos. Los usuarios se encuentran con el contexto de gobernanza como parte de la experiencia de búsqueda, y no como un proceso independiente que tengan que consultar posteriormente. Esta es la diferencia entre una gobernanza que protege los datos y una que facilita su uso.
Términos relacionados: gestión de datos, clasificación de datos, catálogo de datos, glosario empresarial, contratos de datos
Linaje de datos
Un registro del origen, el movimiento y la transformación de un activo de datos a lo largo del tiempo. El linaje de datos responde a las siguientes preguntas: ¿de dónde proceden estos datos?, ¿qué ha ocurrido con ellos? y ¿qué depende de ellos en la actualidad?
Un gráfico de linaje completo muestra los sistemas de origen que alimentaron un conjunto de datos, los flujos de trabajo y las transformaciones por las que pasó, la lógica aplicada en cada paso y los informes, paneles de control y modelos posteriores que lo utilizan. Este registro es la base de la confianza en los datos: sin el linaje, los usuarios no pueden evaluar si un conjunto de datos refleja lo que dice reflejar, y los equipos de datos no pueden diagnosticar la causa raíz de un problema de calidad sin rastrear manualmente los sistemas.
El linaje tiene dos direcciones. El linaje ascendente indica de dónde proceden los datos, lo cual es importante cuando se necesita comprender la definición de una métrica o rastrear el origen de una anomalía. El linaje descendente indica qué elementos dependen de un conjunto de datos, lo cual es importante cuando se necesita evaluar el impacto de un cambio en el esquema o de un problema de calidad antes de que llegue a un informe.
El linaje a nivel de columna es la forma más precisa: en lugar de realizar un seguimiento de los datos a nivel de tabla, rastrea la transformación de campos individuales desde la fuente hasta el resultado. Este nivel de detalle resulta especialmente valioso en flujos de trabajo complejos, en los que una única columna de salida se deriva de múltiples fuentes previas mediante una serie de uniones y cálculos.
Términos relacionados: observabilidad de los datos, calidad de los datos, metadatos, catálogo de datos, gobernanza de los datos
Malla de datos
Un modelo organizativo y arquitectónico para gestionar datos a gran escala, en el que la responsabilidad sobre los productos de datos se distribuye entre los equipos de dominio que los generan, en lugar de centralizarse en un único equipo de ingeniería de datos o de plataforma. Cada equipo de dominio es responsable de publicar, documentar y mantener los productos de datos que corresponden a su ámbito.
La «data mesh» transforma el problema del descubrimiento de datos de dos maneras. Por un lado, aumenta el número de productores de datos, lo que implica que hay más activos que localizar. Por otro lado, descentraliza la titularidad, lo que significa que el descubrimiento debe poner de manifiesto el contexto de titularidad y responsabilidad junto con los propios datos. Los usuarios no solo necesitan saber que existe un conjunto de datos, sino también qué equipo es el responsable del mismo y cómo ponerse en contacto con él.
La gobernanza federada es el mecanismo que garantiza la coherencia de una red de datos. Si bien los equipos de cada ámbito tienen autonomía sobre sus productos de datos, las normas de gobernanza compartidas, los requisitos de interoperabilidad y una capa central de metadatos garantizan que la búsqueda funcione entre los distintos ámbitos y que se cumplan de forma coherente los requisitos de cumplimiento normativo.
Términos relacionados: productos de datos, contratos de datos, gobernanza de datos, gobernanza federada, catálogo de datos
Observabilidad de datos
Supervisión continua de los flujos de datos, los conjuntos de datos y los sistemas para detectar anomalías, cambios en los esquemas, problemas de actualidad y deterioro de la calidad en tiempo real. La observabilidad de los datos ofrece a los equipos de datos visibilidad sobre el estado de su infraestructura de datos sin necesidad de realizar comprobaciones manuales.
Mientras que la calidad de los datos se refiere a si un conjunto de datos cumple con los estándares definidos, la observabilidad de los datos consiste en saber cuándo deja de cumplirlos. Un sistema de observabilidad detecta las señales que indican que algo ha cambiado: una tabla que normalmente se actualiza cada hora lleva seis horas sin actualizarse; una columna que nunca debería contener valores nulos tiene un 30 % de valores nulos; el número de filas se ha reducido a la mitad en comparación con el mismo periodo de la semana pasada.
En la fase de descubrimiento,la observabilidad de los datosproporciona al catálogo información sobre la calidad en tiempo real. Cuando un usuario encuentra un conjunto de datos, puede ver su estado actual, las anomalías recientes y si hay algún incidente activo que le afecte. Esta es la diferencia entre un catálogo que muestra lo que existe y uno que muestra lo que es fiable en este momento.
Términos relacionados: calidad de los datos, linaje de los datos, metadatos activos, catálogo de datos, gestión de metadatos
Productos de datos
Recursos de datos seleccionados y documentados, publicados para su uso en toda la organización, tratados con el mismo rigor que los productos de software. Un producto de datos cuenta con un responsable definido, un esquema documentado, un estándar de calidad establecido, una política de versiones y un proceso para gestionar los cambios y comunicarlos a los usuarios.
El concepto de «producto de datos» tiene su origen en el «data mesh», donde los equipos de cada ámbito son responsables de generar y mantener los datos que genera su ámbito. Sin embargo, el concepto tiene una aplicación más amplia: cualquier conjunto de datos que se publique para su uso compartido, que esté documentado con suficiente contexto para que los usuarios puedan evaluarlo y utilizarlo de forma independiente, y que se mantenga según unos estándares definidos, es, en la práctica, un producto de datos.
Los productos de datos son las unidades de descubrimiento en una organización de datos madura. En lugar de buscar en tablas y archivos sin clasificar, los usuarios descubren y se suscriben a productos, con la seguridad de que lo que consumen está gestionado y cuenta con soporte técnico.
La plataforma a través de la cual se publican, se encuentran y se utilizan productos de datos a gran escala es unmercado de datos.
Términos relacionados: malla de datos, contratos de datos, catálogo de datos, gobernanza de datos, gestión de datos
Perfilado de datos
El proceso de análisis del contenido de un conjunto de datos para generar resúmenes estadísticos y evaluaciones de calidad: recuento de filas, tasas de valores nulos, distribuciones de valores, cardinalidad, valores mínimos y máximos, comparación de patrones para formatos como fechas y direcciones de correo electrónico, y desviación respecto a los rangos esperados.
La elaboración de perfiles genera los datos brutos a partir de los cuales se calculan los índices de calidad. Sin la elaboración de perfiles, la calidad es una simple afirmación. Con ella, la calidad se convierte en una medida. Un conjunto de datos que afirme ser completo y preciso puede evaluarse en función de sus índices reales de valores nulos, la frecuencia de valores atípicos y la coherencia del formato.
En la fase de exploración, los resultados de la análisis de perfiles aparecen como indicadores de calidad en las páginas de activos. Un usuario que evalúe un conjunto de datos de clientes puede ver de inmediato que el 12 % de la columna de correo electrónico contiene formatos no válidos y que el 3 % de la columna de ID de transacción está en blanco, y decidir si esos porcentajes son aceptables para su caso de uso antes de comprometerse con el conjunto de datos.
La creación automática de perfiles en el momento de la ingesta garantiza que la información sobre la calidad esté siempre actualizada, sin depender de que alguien realice una comprobación manual.
Términos relacionados: calidad de los datos, observabilidad de los datos, metadatos, catálogo de datos, metadatos activos
Calidad de los datos
El grado en que un conjunto de datos es preciso, completo, coherente, actualizado y adecuado para el uso previsto. La calidad no es un único indicador, sino un conjunto de aspectos que se evalúan en relación con un caso de uso específico y una norma definida.
Las cinco dimensiones estándar de calidad son la precisión (¿reflejan los datos lo que pretenden reflejar?), la exhaustividad (¿se han rellenado los campos obligatorios?), la coherencia (¿concuerdan los datos entre sí y con las fuentes relacionadas?), la actualidad (¿son los datos lo suficientemente actuales para el caso de uso?) y la validez (¿se ajustan los datos a los formatos y rangos esperados?). Un conjunto de datos puede obtener una buena puntuación en algunas dimensiones y una mala en otras, por lo que las evaluaciones de calidad a nivel de columna y de conjunto de datos resultan más útiles que una simple calificación de «aprobado» o «suspenso».
La calidad es tanto un requisito previo para el descubrimiento como un resultado del mismo. Como requisito previo, determina si un conjunto de datos es utilizable. Como resultado, las puntuaciones de calidad y los resúmenes de perfiles que figuran en el catálogo proporcionan a los usuarios la información que necesitan para tomar esa decisión por sí mismos, sin necesidad de recurrir a un ingeniero de datos en cada evaluación.
Una vez superada la fase de descubrimiento, los problemas de calidad son una de las fuentes más habituales de errores analíticos. Un informe elaborado a partir de un conjunto de datos que presenta problemas ocultos de calidad genera cifras que parecen correctas, pero que en realidad no lo son. El coste no radica en el informe en sí, sino en las decisiones que se toman basándose en él.
Términos relacionados: perfilado de datos, observabilidad de datos, linaje de datos, gestión de metadatos, gobernanza de datos
Administración de datos
La asignación de la responsabilidad sobre activos de datos específicos a personas o equipos designados, junto con las prácticas y responsabilidades que conlleva dicha función. Los gestores de datos velan por la exactitud de los metadatos, resuelven problemas de calidad, gestionan las solicitudes de acceso, comunican los cambios a los usuarios y actúan como punto de contacto para cualquier consulta sobre los activos de los que son responsables.
La gestión responsable es lo que hace que la gobernanza sea operativa. Una política de gobernanza que especifica las normas de titularidad de los datos es un documento. La gestión responsable es la práctica que la pone en marcha: una persona designada revisa el activo, actualiza sus descripciones, gestiona la cola de acceso y da el visto bueno a los cambios en el esquema.
En el proceso de descubrimiento, la gestión responsable garantiza la fiabilidad de los resultados de búsqueda. Un recurso con un responsable activo cuenta con un propietario documentado, una descripción actualizada, un estado de calidad vigente y una persona de contacto para resolver dudas. Un recurso sin responsable puede tener metadatos precisos, o bien descripciones redactadas hace tres años y que nunca se han revisado. Los usuarios no pueden saber cuál de las dos situaciones se da si la información sobre la gestión responsable no aparece directamente en el catálogo.
Términos relacionados: gobernanza de datos, glosario empresarial, gestión de metadatos, productos de datos, catálogo de datos
Gobernanza federada
Un modelo de gobernanza en el que se aplican normas, políticas y requisitos de interoperabilidad comunes en toda la organización, mientras que los distintos ámbitos conservan la autonomía sobre sus propios activos de datos y productos. La gobernanza federada es el mecanismo organizativo que garantiza la coherencia de las arquitecturas de datos distribuidas.
En un modelo de gobernanza centralizado, un único equipo define y garantiza el cumplimiento de todas las normas relativas a los datos. Esto funciona a pequeña escala, pero falla a gran escala: el equipo central no puede hacer frente al volumen de datos, al número de ámbitos y a la rapidez con la que cambian las cosas. La gobernanza federada distribuye la responsabilidad de garantizar el cumplimiento entre los equipos de cada ámbito, al tiempo que mantiene una capa común de normas compartidas que todos los ámbitos deben cumplir.
En lo que respecta a la búsqueda, la gobernanza federada significa que un usuario que realice búsquedas en distintos dominios puede confiar en que los estándares de metadatos, las definiciones de calidad, los esquemas de clasificación y los modelos de control de acceso son coherentes, aunque los equipos que gestionan los datos subyacentes sean diferentes. Sin esa coherencia, la búsqueda entre dominios arroja resultados que son estructuralmente incompatibles y, en la práctica, poco fiables.
Términos relacionados: gobernanza de datos, malla de datos, gestión de datos, contratos de datos, catálogo de datos
Gráfico de conocimiento
Una estructura de red que representa entidades y las relaciones entre ellas. En la gestión de datos, un gráfico de conocimiento conjuntos de datos, términos empresariales, usuarios, políticas, rutas de linaje y conceptos de dominio en un gráfico consultable en el que las relaciones son tan significativas como los propios nodos.
El valor de un gráfico de conocimiento la búsqueda de información radica en que permite una navegación contextual, en lugar de una búsqueda por palabras clave. Un usuario que busque datos de clientes en un catálogo basado en palabras clave obtiene una lista de tablas que incluyen la palabra «cliente» en su nombre. Un usuario que realice una búsqueda en un catálogo gráfico de conocimiento puede seguir las relaciones: este conjunto de datos es propiedad del equipo de CRM, implementa el término empresarial «cliente activo», alimenta el informe de ingresos trimestral y se rige por la política de datos de información de identificación personal (PII). El gráfico revela un contexto que ninguna cantidad de coincidencias de palabras clave puede ofrecer.
Los grafos de conocimiento también sirven de base para las recomendaciones y el análisis de impacto. Cuando se propone un cambio en el esquema, el grafo puede rastrear a todos los usuarios que lo utilizan posteriormente. Cuando un usuario consulta un conjunto de datos, el grafo puede mostrar los recursos relacionados que probablemente necesite. Estas capacidades no serían posibles sin una representación estructurada de las relaciones.
Términos relacionados: metadatos, gestión de metadatos, catálogo de datos, metadatos activos, linaje de datos
Metadatos
Información descriptiva sobre un activo de datos. Los metadatos indican a los usuarios y a los sistemas qué es un conjunto de datos, de dónde procede, quién es su propietario, qué formato tiene, cuándo se actualizó por última vez, cómo se relaciona con otros activos y cuál es su estado en cuanto a calidad y gobernanza.
Existen varias categorías de metadatos relevantes para la búsqueda de datos. Los metadatos técnicos abarcan las propiedades estructurales de un activo: esquema, tipos de datos, número de filas, tamaño del archivo y ubicación de almacenamiento. Los metadatos operativos abarcan el comportamiento en tiempo de ejecución: marca de tiempo de la última actualización, historial de ejecuciones del proceso, tiempo de procesamiento y estado del trabajo. Los metadatos empresariales abarcan el significado y la propiedad: descripciones de los activos, enlaces a términos empresariales, asignaciones de propiedad y notas de uso. Los metadatos sociales abarcan el comportamiento observado: frecuencia de las consultas, valoraciones de los usuarios, registros de acceso y uso posterior.
Cuantas más categorías de metadatos se rellenen y se mantengan actualizadas, más útil resulta la búsqueda. Un conjunto de datos que solo contenga metadatos técnicos indica a los usuarios dónde se encuentran los datos y qué formato tienen. Un conjunto de datos con metadatos completos en las cuatro categorías indica a los usuarios qué significan, si pueden utilizarlos, si se encuentran en buen estado actualmente y si otros equipos los han encontrado útiles. La diferencia entre esas dos experiencias es lo que distingue la búsqueda funcional de la catalogación meramente decorativa.
Términos relacionados: gestión de metadatos, metadatos activos, catálogo de datos, linaje de datos, perfilado de datos
Gestión de metadatos
La práctica de recopilar, organizar, mantener y gestionar los metadatos en el entorno de datos de una empresa. La gestión de metadatos abarca cómo se recogen los metadatos de los sistemas de origen, cómo se enriquecen con el contexto empresarial, cómo se mantienen actualizados a medida que cambian los sistemas y cómo se gestionan para garantizar su exactitud e integridad.
El principal reto de la gestión de metadatos es la escala. Una empresa con docenas de sistemas fuente, miles de tablas y cientos de flujos de datos activos genera metadatos de forma continua. La gestión manual de ese volumen no es sostenible: las descripciones quedan obsoletas, las asignaciones de propiedad pierden precisión y la información sobre la calidad va por detrás del estado real de los datos. La ingesta automatizada de metadatos, los flujos de metadatos activos y la detección de cambios son los mecanismos que mantienen los metadatos actualizados sin necesidad de que un equipo específico los actualice manualmente.
La gestión de metadatos también regula los propios metadatos: define normas sobre cómo deben describirse los activos, quién es responsable de mantener las descripciones en cada ámbito y cómo se resuelven los conflictos entre los metadatos generados por el sistema y los curados por personas. Sin una gestión adecuada de la capa de metadatos, un catálogo se convierte en una colección incoherente de activos descritos parcialmente, sin una forma fiable de distinguir los datos fiables de los obsoletos.
Términos relacionados: metadatos, metadatos activos, catálogo de datos, gestión de datos, gobernanza de datos
Capa semántica
Una capa de traducción entre las estructuras de datos sin procesar y los conceptos empresariales que dichas estructuras representan. La capa semántica define las métricas, dimensiones y jerarquías empresariales en términos comprensibles para los usuarios empresariales, y las asocia a las tablas, columnas y uniones subyacentes que las implementan.
En el proceso de descubrimiento, la capa semántica determina si los usuarios de negocio pueden encontrar y comprender los datos sin tener que traducirlos ellos mismos. Un usuario que busque «ingresos recurrentes mensuales» debería encontrar no solo la tabla de suscripciones sin procesar, sino también la definición de la métrica, la lógica utilizada para calcularla y el informe o modelo en el que se aplica. La capa semántica proporciona esa conexión.
La capa semántica está estrechamente relacionada con el glosario empresarial, pero opera a un nivel diferente. El glosario empresarial define los términos. La capa semántica los implementa de forma que los motores de consulta puedan ejecutarlos. Una organización puede tener un glosario empresarial sin una capa semántica —y muchas lo tienen—, pero los usuarios seguirán teniendo que traducir ellos mismos las definiciones empresariales a SQL.
Términos relacionados: glosario empresarial, metadatos, catálogo de datos, gestión de metadatos, productos de datos
Análisis de autoservicio
La capacidad de los usuarios empresariales para buscar, acceder y analizar datos de forma independiente, sin tener que canalizar las solicitudes a través de un equipo central de datos. El análisis de autoservicio es el resultado organizativo que se pretende lograr mediante un descubrimiento de datos eficaz.
La relación entre el descubrimiento y el autoservicio es directa: los analistas solo pueden trabajar de forma independiente si son capaces de encontrar datos, evaluar su calidad y su linaje, comprender su significado empresarial y confirmar su acceso, todo ello sin necesidad de abrir un ticket. Cada uno de esos pasos depende de una capacidad de descubrimiento. La búsqueda y el filtrado permiten localizar el activo. Las puntuaciones de calidad y el contexto del linaje facilitan la evaluación. El glosario empresarial y la capa semántica aportan significado. La integración de la gobernanza muestra el estado del acceso.
Cuando falta alguna de estas capas o esta no es fiable, el autoservicio se interrumpe en ese paso. Los analistas que no pueden evaluar la calidad dejarán de utilizar los datos o los utilizarán sin saber si son fiables. Los analistas que no puedan encontrarles sentido recurrirán a un ingeniero de datos. Los analistas que no puedan determinar su acceso abrirán un ticket. El equipo de datos acaba dedicando tiempo a responder a las preguntas que la capa de descubrimiento debería resolver por sí misma.
Para que el auténtico autoservicio a gran escala funcione, es necesario que todos los componentes de este glosario interactúen entre sí y se mantengan actualizados. Se trata de un resultado arquitectónico, no de una característica del producto.
Términos relacionados: catálogo de datos, gobernanza de datos, gestión de metadatos, calidad de los datos, glosario empresarial
Comparaciones clave
Descubrimiento de datos frente a catálogo de datos
| Descubrimiento de datos | Catálogo de datos | |
|---|---|---|
| Qué es | Una capacidad: la habilidad para localizar, evaluar y comprender los activos de datos | Un sistema: la tecnología que hace posible el descubrimiento |
| Función principal | Ayuda a los usuarios a localizar datos relevantes y a evaluar su idoneidad para su uso | Indexa activos, metadatos, relaciones y el contexto de gobernanza |
| Experiencia del usuario | Buscar, explorar, filtrar, evaluar, analizar relaciones | La interfaz y la infraestructura a través de las cuales se lleva a cabo la búsqueda |
| Depende de | Metadatos, linaje, indicadores de calidad, integración de la gobernanza | Ingesta de metadatos, metadatos activos, mapeo de relaciones |
| Puede existir sin el otro | No: la búsqueda sin un catálogo carece de infraestructura. | Sí: un catálogo puede ofrecer una experiencia de búsqueda deficiente o inexistente si los metadatos son escasos o están desactualizados. |
Metadatos activos frente a metadatos pasivos
| Metadatos activos | Metadatos pasivos | |
|---|---|---|
| Cómo se actualiza | De forma continua, en tiempo real, a medida que cambian los datos | De forma manual, en el momento de la importación o de forma programada |
| Refleja la situación actual | Sí | A menudo no |
| Ejemplos | Puntuaciones de calidad en tiempo real, registros de uso recientes, estado de ejecución de los procesos y detección de cambios en los esquemas | Descripciones estáticas, etiquetas asignadas manualmente, resultados de perfiles únicos |
| El valor del descubrimiento | Analiza la situación actual en materia de salud y el contexto, y formula recomendaciones | Proporciona una estructura básica y definiciones |
| Riesgo cuando está en mal estado | Bajo — se actualiza automáticamente | Alto: los metadatos pasivos obsoletos son una de las causas más habituales del abandono del catálogo |
Preguntas frecuentes
El descubrimiento de datos es el proceso de localizar, comprender y evaluar los activos de datos en los distintos sistemas y plataformas de una organización. Va más allá de la simple búsqueda e incluye la evaluación de la calidad, el seguimiento del linaje, la determinación de la titularidad y la confirmación del estado de gobernanza: es decir, toda la información que un usuario necesita para decidir si un conjunto de datos es adecuado para su caso de uso.
Un catálogo de datos es el sistema. El descubrimiento de datos es la capacidad que ofrece dicho sistema. Un catálogo bien diseñado y mantenido de forma activa permite un buen descubrimiento. Un catálogo incompleto, desactualizado o desconectado de los procesos de calidad y gobernanza da lugar a un descubrimiento deficiente, independientemente de la tecnología en la que se base.
Los metadatos son lo que hace que un conjunto de datos sea interpretable, y no solo localizable. Los metadatos técnicos indican a los usuarios qué es un conjunto de datos. Los metadatos de negocio les indican qué significa. Los metadatos operativos les indican si está actualizado. Los metadatos de gobernanza les indican si pueden utilizarlo. La búsqueda sin metadatos detallados ofrece resultados de búsqueda. La búsqueda con metadatos detallados ofrece respuestas.
Los metadatos activos son aquellos que se actualizan continuamente a medida que los datos circulan por los sistemas. Reflejan el estado actual de un activo, en lugar de su estado en el momento de la última actualización manual. En la práctica, es la diferencia entre un catálogo que muestra lo que existe y otro que muestra lo que actualmente funciona correctamente, se ha utilizado recientemente y se mantiene de forma activa.
El linaje es el pilar de la confianza en el proceso de descubrimiento. Cuando un usuario encuentra un conjunto de datos, el linaje le indica de dónde procede y cómo se ha transformado, lo que determina si las cifras que contiene reflejan realmente lo que se afirma que reflejan. El linaje también revela el impacto: si un conjunto de datos de origen cambia, el linaje muestra qué informes y modelos posteriores se ven afectados antes de que nadie detecte el problema en un informe.
La gobernanza proporciona el contexto que hace que el descubrimiento de datos sea seguro a la hora de actuar en consecuencia. Indica a los usuarios si están autorizados a utilizar un conjunto de datos, qué requisitos de cumplimiento se le aplican y a qué normas debe ajustarse. El descubrimiento sin gobernanza saca a la luz los datos. El descubrimiento con gobernanza saca a la luz datos que los usuarios pueden utilizar realmente sin generar riesgos de incumplimiento normativo.
La gobernanza federada es un modelo en el que se aplican normas y políticas comunes en toda la organización, mientras que los distintos dominios conservan la autonomía sobre sus propios datos. Es el mecanismo que garantiza la coherencia de la búsqueda entre dominios en las organizaciones que utilizan arquitecturas distribuidas, como la «data mesh», en las que ningún equipo es el único responsable de todos los datos.
El análisis de autoservicio es la capacidad de los usuarios empresariales para encontrar y utilizar datos sin necesidad de recurrir a un equipo central de datos. El descubrimiento de datos es el requisito previo. Los usuarios solo pueden trabajar de forma independiente si son capaces de encontrar datos, evaluar su calidad, comprender su significado y confirmar su acceso, todo ello por sí mismos. El descubrimiento proporciona la infraestructura necesaria para cada uno de esos pasos. Cuando falta alguna capa o esta no es fiable, los usuarios se ven obligados a abrir incidencias.