Resumen

  • La integridad de los datos consiste en garantizar que estos sean precisos, coherentes, completos y fiables a lo largo de todo su ciclo de vida.
  • Tiene dos dimensiones principales: la integridad física, que protege los datos frente a fallos de hardware, accidentes y ataques, y la integridad lógica, que garantiza su corrección durante su uso.
  • La integridad lógica incluye la integridad de entidades, la integridad referencial, la integridad de dominio y la integridad definida por el usuario.
  • La integridad de los datos es fundamental tanto para el cumplimiento normativo como para un uso fiable de los datos en el día a día.
  • La seguridad de los datos ayuda a protegerlos contra el acceso no autorizado, mientras que la integridad de los datos garantiza que estos sigan siendo correctos y fiables.

Dado que nos encontramos en un mundo en el que los datos son el activo más valioso de tu empresa, la calidad, la seguridad y el buen estado de tus datos son fundamentales. Para garantizarlo, debes velar por su integridad en todo momento. ¿Te gustaría conocer las reglas fundamentales de la integridad de los datos para que tu empresa pueda aprovechar los datos de forma tranquila y fiable? Sigue esta guía.

Aunque la noción de integridad se menciona a menudo cuando se habla de seguridad y de datos comprometidos, no debe confundirse con la Integridad de los Datos, que es una disciplina por sí misma en el complejo y exigente mundo de la explotación de datos.

La definición exacta de «integridad de los datos» es mantener y garantizar la exactitud y la coherencia de los datos a lo largo de todo su ciclo de vida.

Garantizar la integridad de los datos significa garantizar que la información almacenada en una base de datos se mantenga completa, precisa y fiable. Y ello independientemente del tiempo que permanezca almacenada, de la frecuencia con la que se acceda a ella o de cómo se procese.

Los distintos tipos de integridad de los datos

El concepto de integridad de los datos es complejo, ya que adopta múltiples formas y significados. Más allá de un enfoque general de la integridad de los datos, es importante comprender que existen diferentes tipos de integridad de los datos. Estos diferentes tipos no se contraponen entre sí, sino que, más bien, se complementan y combinan entre sí para garantizar la calidad y la seguridad de sus activos de datos.

Garantizar la integridad de los datos, en todas sus dimensiones, no es solo una cuestión de cumplimiento normativo, sino también de aprovechamiento óptimo de la información disponible. Existen dos tipos principales de integridad de los datos: la integridad física, por un lado, y la integridad lógica, por otro.

Integridad física

Proteger la integridad física de los datos significa evitar exponerlos a errores humanos y fallos de hardware (como averías del servidor de almacenamiento, por ejemplo).

También significa asegurarse de que los datos no puedan ser distorsionados por los programadores del sistema, por ejemplo. Del mismo modo, la integridad física de los datos se pone en entredicho cuando un fallo eléctrico o un incendio afectan a una base de datos.

Por último, la integridad física también se ve comprometida cuando un pirata informático consigue acceder a los datos.

Integridad lógica

Garantizar la integridad lógica de sus datos significa asegurarse de que los datos permanezcan inalterados en cualquier circunstancia. Aunque, al igual que la integridad física, la integridad lógica tiene por objeto proteger los datos de manipulaciones y errores humanos, se ejerce de manera diferente y sobre cuatro ejes distintos:

Integridad de las entidades

La integridad de las entidades es el principio de asociar claves primarias a los datos recogidos. Estos valores únicos identifican todos sus elementos de datos. Es una garantía eficaz contra los duplicados, por ejemplo, porque cada dato sólo figura una vez.

Integridad referencial

El principio de integridad referencial describe la serie de procesos que garantizan que los datos se almacenan y utilizan de manera uniforme y coherente.. El modo repositorio es su mejor garantía de que sólo se realizan los cambios, adiciones o supresiones de datos apropiados y autorizados. La integridad referencial permite definir reglas para erradicar entradas duplicadas o verificar la exactitud de los datos introducidos en tiempo real.

Integridad del dominio

La integridad del dominio se refiere al conjunto de procesos que garantizan la exactitud de los datos asociados a un dominio. Un dominio se caracteriza por un conjunto de valores que se consideran aceptables y que puede contener una columna. Puede incluir distintas reglas para definir el formato o el tipo de los datos o la cantidad de información que puede introducirse.

Integridad definida por el usuario

La integridad definida por el usuario consiste en reglas creadas por el usuario para satisfacer sus necesidades relacionadas con su propio uso. Al añadir una serie de reglas de negocio específicas a las medidas de integridad de los datos, es posible complementar la gestión de la integridad de entidades, la integridad referencial y la integridad de dominio.

¿Por qué es importante garantizar la integridad de los datos?

La integridad de los datos es importante por dos razones fundamentales:

El primero se refiere a la conformidad de los datos. Dado que el RGPD establece normas estrictas y prevé sanciones severas, garantizar la integridad de los datos en todo momento es una cuestión fundamental.

La segunda se refiere al uso de tus datos. Cuando se preserva la integridad, tienes la certeza de que la información disponible es fiable y de calidad y, sobre todo, se ajusta a la realidad.

Cómo mantener la integridad de los datos

Mantener la integridad de los datos requiere algo más que proteger una base de datos frente a modificaciones no autorizadas. Las organizaciones necesitan controles que ayuden a mantener la información precisa, completa, coherente y fiable a medida que se transfiere entre aplicaciones, flujos de trabajo, bases de datos y sistemas de análisis.

Empieza por establecer unas reglas de validación claras. Los campos obligatorios, los formatos aceptados, los rangos de valores y las reglas de relación pueden evitar, desde el principio, que se introduzcan datos incorrectos en los sistemas. Las restricciones de la base de datos, como las claves primarias, las claves externas y los valores únicos, proporcionan otra capa de protección al garantizar la forma en que los registros se relacionan entre sí.

Los controles de acceso son igualmente importantes. Limitar quién puede crear, modificar o eliminar información confidencial reduce el riesgo de que se produzcan cambios accidentales o no autorizados. Las organizaciones también deben mantener registros de auditoría para que los equipos puedan identificar cuándo se modificó la información, quién la modificó y qué sistema o proceso fue el responsable.

La supervisión automatizada de la calidad de los datos puede ayudar a detectar problemas que los controles tradicionales de las bases de datos quizá no detecten. Los cambios en las tasas de valores nulos, los volúmenes de registros, las distribuciones, la actualidad de los datos o el esquema pueden indicar que algo ha fallado en las fases previas. Detectar estos cambios a tiempo ayuda a evitar que la información poco fiable llegue a los informes, las aplicaciones o los sistemas de inteligencia artificial.

Por último, los equipos necesitan conocer cómo se mueven los datos. El linaje de los datos puede mostrar dónde se originó la información, cómo se transformó y qué sistemas posteriores dependen de ella. Cuando surge un problema, este contexto facilita la identificación del origen y la comprensión del posible impacto en el negocio.

Integridad de los datos frente a calidad de los datos

La integridad de los datos y la calidad de los datos están estrechamente relacionadas, pero no son lo mismo.

La integridad de los datos se centra en garantizar que la información se mantenga precisa, coherente y fiable a lo largo de todo su ciclo de vida. Incluye las normas y los controles que protegen las relaciones, los formatos y los registros para evitar que se corrompan o se vuelvan incoherentes.

La calidad de los datos se centra, en términos generales, en si la información es adecuada para el uso previsto. Entre los aspectos más comunes de la calidad de los datos se incluyen la exactitud, la exhaustividad, la coherencia, la puntualidad, la validez y la unicidad.

Por ejemplo, un registro de cliente puede cumplir las normas de integridad de la base de datos porque tiene una clave primaria válida y sigue el formato requerido. Sin embargo, si la dirección está desactualizada desde hace cinco años, la información puede seguir siendo de mala calidad.

Las organizaciones necesitan ambas cosas. La integridad establece los controles estructurales y operativos que protegen la información, mientras que la calidad de los datos ayuda a determinar si dicha información es adecuada para el análisis, las operaciones, la presentación de informes reglamentarios y la inteligencia artificial.

Diferencias entre integridad y seguridad de los datos

La seguridad de los datos es una disciplina que agrupa todas las medidas que se aplican para evitar la corrupción de los datos. Se basa en el uso de sistemas, procesos y procedimientos que restringen el acceso no autorizado a tus datos.

La integridad de los datos, por su parte, abarca todas las técnicas y soluciones que garantizan la preservación de la integridad y la exactitud de la información a lo largo de todo su ciclo de vida.

En otras palabras, la seguridad de los datos es uno de los componentes que contribuyen a la integridad de los datos.