Blog | Stratégie et analyses de données | | 5 min de lecture

Les révolutions des données : vers une vision entrepreneuriale des données

révolutions des données

Résumé

  • Les données d'entreprise ont évolué des silos vers les entrepôts de données, puis vers les lacs de données, pour aboutir à gouvernance.
  • Les lacs de données ont permis un stockage à moindre coût, mais ont également engendré des risques tels que les « marécages de données ».
  • La centralisation ne suffit pas à elle seule sans gestion des données adéquate gestion des données.
  • gouvernance des données gouvernance métadonnées essentielles à découverte de données à simplicité d'utilisation.
  • Les catalogues de données offrent une vue unifiée et consultable qui permet d'exploiter les données.

L'utilisation des mégadonnées par les géants d'Internet dans les années 2000 a été un signal d'alarme pour les entreprises : le Big Data est un levier de croissance et de compétitivité qui favorise l'innovation. Aujourd'hui, les entreprises se réorganisent autour de leurs données pour adopter une approche « axée sur les données ». C'est une histoire aux nombreux rebondissements qui semble enfin trouver une issue.

Cet article passe en revue les différentes révolutions en matière de données d'entreprise menées ces dernières années jusqu'à aujourd'hui dans le but de optimiser la valeur commerciale des données.

en silo

Dans les années 80, les systèmes d'information ont connu un essor considérable. Des applications métier ont été développées, des langages de programmation avancés ont vu le jour et les bases de données relationnelles ont fait leur apparition. Toutes ces applications restaient cantonnées plateformes de leurs propriétaires, isolées du reste de l'écosystème informatique. 

Pour ces raisons historiques et technologiques, les données internes d’une entreprise étaient réparties entre diverses technologies et dans des formats hétérogènes. Outre les problèmes d’organisation, on parle alors d’« effet tribal ». Chaque service informatique dispose de ses propres outils et gère implicitement ses données pour son usage exclusif. On assiste ainsi à une forme de accaparement des données au sein des organisations. Pour étayer ces observations, on invoque souvent la loi de Conway : « Toute architecture reflète l’organisation qui l’a créée. » Ainsi, cette organisation, que l’on appelle « silos », rend le complexe et fastidieux le recoupement de données provenant de deux systèmes différents.

La recherche d'une vision centralisée et globale des données d'une entreprise mènera les systèmes d'information vers une nouvelle révolution.

Le concept d'entrepôt de données

À la fin des années 90, informatique décisionnelle son plein. À des fins d'analyse et dans le but d'apporter des réponses à toutes les questions stratégiques, le concept d'entrepôt de données a fait son apparition. 

Pour ce faire, nous extrairons les données des mainframes ou des bases de données relationnelles et les transférerons vers un outil ETL (Extract Transform Loader). Présentées sous un format dit « pivot », les données ainsi collectées et mises en forme permettront aux analystes et aux décideurs d'y accéder afin de répondre à des questions prédéfinies et d'étudier des cas de réflexion spécifiques. À partir de la question, nous obtenons un modèle de données.

Cette révolution s'accompagne toujours de certains problèmes. L'utilisation d'outils ETL a un certain coût, sans parler du matériel nécessaire. Le délai entre la formalisation du besoin et la réception du rapport est long. C'est une révolution coûteuse pour une efficacité perfectible.

La nouvelle révolution du lac de données

L'avènement des lacs de données renverse le raisonnement précédent. Un lac de données permet aux organisations de centraliser l'ensemble de leurs stockages de données utiles, quelles que soient leur source ou leur format, à un coût très faible. Nous stockons les données d'une entreprise sans présumer de leur utilisation dans le cadre d'un futur cas d'usage. Ce n'est qu'en fonction d'un usage spécifique que nous sélectionnerons ces données brutes et les transformerons en informations stratégiques.

Nous passons d'une logique « a priori » à une logique « a posteriori ». Cette révolution du lac de données met l’accent sur de nouvelles compétences et connaissances : data scientists les ingénieurs de données sont capables de lancer le traitement des données et d’obtenir des résultats bien plus rapidement qu’avec les entrepôts de données.

Un autre avantage de cette « terre promise » réside dans son prix. Souvent proposés sous licence open source, les lacs de données sont peu coûteux, y compris le matériel qui les accompagne. On parle souvent de « matériel communautaire ».

… ou plutôt, un marécage de données

La révolution des lacs de données présente certes certains avantages, mais elle s'accompagne également de nouveaux défis. L'expertise nécessaire à la mise en place et à la maintenance de ces lacs de données est rare et, par conséquent, coûteuse pour les entreprises. De plus, le fait d'alimenter un lac de données jour après jour sans gestion ni organisation efficaces comporte un risque sérieux de rendre l'infrastructure inutilisable. Les données se perdent alors inévitablement dans la masse.

Cette gestion des données de nouveaux enjeux liés à la réglementation en matière de données (RGPD, CNIL, etc.) et à la sécurité des données : des sujets qui font déjà partie intégrante de l'univers des entrepôts de données. Trouver les bonnes données pour le bon usage n’est pas encore une mince affaire.

« The Settlement » : Mettre en place gouvernance des données

Les géants d'Internet ont compris que la centralisation de ces données constituait une première étape, même si elle reste insuffisante. La dernière pièce du puzzle nécessaire pour évoluer vers une approche « axée sur les données » consiste à mettre en place gouvernance des données. Innover grâce aux données nécessite une meilleure connaissance de ces dernières. Où mes données sont-elles stockées ? Qui les utilise ? Dans quel but ? Comment sont-elles utilisées ?

Pour aider les professionnels des données à cartographier et à visualiser le cycle de vie des données, de nouveaux outils ont vu le jour : on les appelleles «catalogues de données ». Situés au-dessus des infrastructures de données, ils permettent de créer un métadonnées consultable. Ils permettent d’acquérir une vision métier et des compétences en matière de données en centralisant toutes les informations collectées. De la même manière que Google ne stocke pas les pages web mais plutôt leurs métadonnées y faire référence, les entreprises doivent également stocker métadonnées de leurs données métadonnées d’en faciliter l’exploitation et la découverte. Gartner le confirme dans son étude intitulée «catalogue de données la nouvelle tendance » : si les données de votre lac de données ne font pas l’objet métadonnées et gouvernance, elles seront considérées comme inefficaces.

Grâce à ces nouveaux outils, les données deviennent un atout pour tous les collaborateurs. L’interface conviviale ne nécessite aucune compétence technique et offre ainsi un moyen simple de consulter, d’organiser et de gérer ces données. Le catalogue de données l’ outil collaboratif de référence au sein de l’entreprise.

Obtenir une vue d'ensemble de ces données et mettre en place gouvernance des données gouvernance  stimuler la génération d'idées devient ainsi possible.