Pourquoi l'IA à elle seule ne suffit pas pour l'analyse de données d'entreprise
Résumé
- L'analyse basée sur l'IA ne se limite pas à l'accès aux données, car les termes métier, les indicateurs, les relations et les autorisations nécessitent un contexte.
- Le fait de connecter directement un LLM aux données brutes peut entraîner des ambiguïtés, des jointures incorrectes, des risques de sécurité et des réponses incohérentes.
- Une couche sémantique régie fournit à l'IA des définitions, des indicateurs, des modèles, des relations, des contrôles d'accès et une traçabilité communs.
- Ce contexte métier permet à l'IA de générer des réponses cohérentes, explicables et conformes aux règles de l'entreprise.
- Actian AI Analyst associe un contexte contrôlé à l'analyse conversationnelle pour fournir des réponses fiables sans recourir à des inférences génériques issues de l'IA.
L'analyse basée sur l'IA est une perspective séduisante : quelques frappes suffisent pour obtenir des réponses à vos questions, sans aucun tracas.
L'IA (et plus précisément les modèles de langage à grande échelle comme Claude, ChatGPT et Gemini) excelle dans la génération de réponses à partir d'Internet. Or, votre entreprise dispose de bien moins de données qu'Internet. Il vous suffit donc de mettre en place quelques serveurs MCP, de connecter votre modèle de langage à vos données, et vous aurez peut-être l'impression d'être prêt à démarrer votre activité.
Malheureusement, ce n'est pas le cas.
De nombreux défis spécifiques se dressent entre vous et la réussite en matière d'analyse commerciale basée sur l'IA. Ces défis sont bien réels, mais ils ne sont pas insurmontables. Voici en quoi ils consistent et comment vous pouvez les surmonter.
L'analyse de données d'entreprise ne peut pas se fonder sur des connaissances générales
Demandez à une IA non supervisée d'analyser le « taux de désabonnement », et il y a une probabilité non nulle que sa réponse porte sur la production de beurre plutôt que sur la fidélisation de la clientèle.
Et même si le modèle d'IA retient effectivement la même définition du « taux de désabonnement » que celle que vous avez en tête, il reste encore de nombreuses nuances de sens à préciser :
- Définitions des indicateurs : Comment votre entreprise, plus précisément, calcule-t-elle le « taux de désabonnement » ?
- Définitions commerciales : Si le taux de désabonnement est calculé sur la base des clients actifs, les utilisateurs bénéficiant d’un essai gratuit sont-ils considérés comme des clients ? Un poste individuel au sein d’une licence d’entreprise est-il considéré comme un client, ou est-ce l’entreprise qui est le client ? Le statut « actif » est-il déterminé par le statut du compte du client ou par son utilisation du produit ?
- Relations entre les données : Quelle source de données stocke les informations clients ? Comment ces fiches clients doivent-elles être mises en correspondance avec les fiches d'activité produit ?
- Règles organisationnelles : Qui est chargé de définir un terme ou de gérer une « jeu de données » ?
- Droits d'accès : Êtes-vous seulement autorisé à connaître le taux de désabonnement de l'entreprise ?
Chacune de ces questions peut avoir une réponse différente, mais tout à fait valable, selon l'organisation.
Il est impossible de garantir que votre modèle de langage de grande échelle (LLM) parviendra à déduire la réponse exacte et spécifique à votre entreprise pour chacune de ces questions, en se basant uniquement sur des informations générales issues d’ apprentissage s glanées sur Internet. Et il est impossible de savoir quelles déductions votre LLM a effectivement faites. La précision et la transparence indispensables à l’analyse de données d’entreprise font tout simplement défaut.
L'accès aux données ne suffit pas à lui seul
Si les « informations générales provenant d'apprentissage s sur Internet » ne fournissent pas suffisamment de contexte au modèle de langage de grande échelle (LLM), le fait de le relier à vos propres données permettra-t-il d'y parvenir ?
Non. Vos données brutes ne fournissent pas suffisamment de contexte pour que votre modèle de langage de grande capacité (LLM) puisse en déduire les bonnes réponses.
Ambiguïté
Lorsque vous vous surprenez à vous demander « où », « pourquoi » et « comment », cela signifie que les données de votre organisation manquent de clarté.
Cela se manifeste de toutes sortes de façons.
Par exemple, les calculs métriques peuvent présenter des incohérences pour les raisons suivantes :
- Il n'existe aucune documentation expliquant comment calculer cet indicateur.
- Un indicateur a été documenté par plusieurs divisions, et les calculs indiqués sont tous différents.
- Un indicateur est documenté à un seul endroit, mais les différentes unités opérationnelles extraient les données nécessaires à son calcul à partir de sources diverses.
Il se peut également que votre organisation ait des interprétations contradictoires de certains concepts commerciaux. Repensez à l'exemple précédent : « Les utilisateurs en période d'essai gratuit sont-ils des clients actifs ? » Il est évident qu'une unité opérationnelle pourrait répondre « oui », qu'une autre pourrait répondre « non, ce ne sont pas des clients », et qu'une troisième pourrait répondre « non, ils ne sont pas actifs ».
L'ambiguïté dans les concepts commerciaux peut être encore plus fondamentale : lorsqu'on parle de « cette année », s'agit-il de l'année civile ou de l'exercice fiscal ?
Le simple fait de connecter un LLM à votre base de données ne va pas clarifier la situation.
À long terme, cela ne fera qu’empirer les choses : l’IA est, comme chacun sait, toujours sûre d’elle dans ses réponses. Cette fausse assurance, prise au pied de la lettre, masquera dans un premier temps le caractère incertain et incohérent de vos données et de vos analyses, puis sapera la confiance à mesure que les décisions fondées sur des résultats erronés échoueront.
Gartner estime que, d’ici deux ans, 60 % des projets d’analyse agentique reposant exclusivement sur le MCP échoueront en raison de l’absence d’une couche cohérente — en d’autres termes, ils échoueront parce que la connexion entre l’IA et les données ne disposera d’aucun élément pour la guider.
Jointures incorrectes
L'une des raisons pour lesquelles l'analyse de données d'entreprise est si complexe tient au fait que, pour obtenir les données dont on a besoin, il faut presque toujours les extraire de plusieurs tables, généralement réparties sur plusieurs systèmes.
Si seulement chaque enregistrement disposait d’une clé primaire parfaite et si toutes les clés secondaires étaient comparables d’un système à l’autre. Mais comme nous et nos données évoluons dans le monde réel, il est loin d’être aussi simple de joindre de manière fiable des données provenant de plusieurs sources.
Au contraire, chaque fois que vous rassemblez des données, vous devez savoir :
- Quelle est la clé appropriée pour cette jointure ?
- Quelle est la cardinalité de la jointure ?
- La cardinalité est-elle directionnelle ?
- Quel type de jointure convient le mieux à l'analyse que vous vous apprêtez à effectuer ?
Le simple fait de donner à une agents IA l'accès aux noms de vos colonnes ne permettra pas de répondre à ces questions.
Problèmes de sécurité
Les données constituent l'un des actifs les plus précieux de votre entreprise, et elles soulèvent des questions de sécurité à la hauteur de leur importance. Lorsque vous accordez à un « agents IA » l'accès à vos sources de données, vous devez prendre en compte toute une série de facteurs.
utilisateur contrôle d'accès
L'un des attraits de l'analyse basée sur l'IA réside dans sa capacité à élargir considérablement l'accès à l'analyse au sein de votre entreprise. Cependant, rendre l'analyse plus largement accessible a pour conséquence de rendre vos données plus largement accessibles, et rares sont les organisations qui accordent à chaque employé un accès illimité à tous les systèmes.
Il est bien plus courant que les employés disposent de niveaux d'accès différents selon les types et les sources de données. Mais à moins de créer une « déploiement » d'IA distincte pour chaque variante d'accès aux données — ce qui est une mauvaise idée pour diverses raisons —, votre modèle d'IA aura accès à des données qu'un « utilisateur » donné n'est pas autorisé à consulter.
Le fait de connecter une « agents IA » à votre source de données ne lui fournit aucune information sur ce à quoi une « utilisateur » spécifique a ou n'a pas le droit d'accéder.
Conformité et questions contractuelles
Si vous relevez du RGPD, vous devez vous assurer que vos nouveaux outils d'analyse basés sur l'IA ne vous exposeront pas à des poursuites pour avoir fait appel à un sous-traitant non autorisé.
Et il ne s'agit pas seulement de réglementations telles que le RGPD, la norme BCBS 239 ou la loi européenne sur l'IA : il faut également tenir compte de tous les accords relatifs au stockage, à l'utilisation et à la conservation des données que vous avez conclus avec vos clients, vos partenaires et vos fournisseurs.
La connexion d'une application « agents IA » à une source de données ne fournit en soi aucune information permettant de vous aider à respecter vos obligations réglementaires et légales.
Souveraineté des données
La souveraineté des données ne se résume pas à la simple question de savoir « où se trouvent géographiquement les serveurs sur lesquels sont stockées mes données », même si cet aspect en fait bien sûr partie. Il faut également tenir compte des mouvements de vos données. De nombreux éléments de votre écosystème de données — notamment les pipelines de données, les applications SaaS, les outils d’IA et les services « outils bi» — sont susceptibles de rendre vos données accessibles ailleurs que sur la ou les sources où vous les stockez.
Accorder à une « agents IA » l’accès à vos sources de données peut entraîner d’énormes risques en matière de souveraineté des données, à moins que vous ne preniez des mesures supplémentaires.
Comment rendre l'IA exploitable pour l'analyse de données
Vous ne pouvez pas vous fier aux connaissances générales d’un LLM, issues d’Internet apprentissage, et le fait de le connecter à vos données ne résout pas le problème. Que devez-vous donc faire d’autre pour obtenir les analyses basées sur l’IA dont vous rêvez ?
La réponse est le contexte.
Contexte expliquant la signification des termes métier. Comment les indicateurs doivent être calculés. Qui doit avoir accès à vos données, où et quand.
On peut décrire ce contexte à travers cinq exigences clés :
- Définitions communes des termes commerciaux
- Métriques gouvernées
- Modèles et relations définis
- Contrôle des accès
- Traçabilité
En établissant ce contexte, puis en vous en servant pour ancrer votre modèle d'IA, vous pouvez créer une solution d'analyse basée sur l'IA qui fonctionne réellement.
Définitions métier communes et indicateurs réglementés
Si votre IA n'est pas capable de déduire le bon calcul, la bonne définition ou la bonne relation à partir d'Internet en général, la solution consiste à ne pas lui permettre d'accéder à Internet en général.
Les fondements d’un définition d’un terme commercial repose sur une explication en langage clair, à la manière d’un dictionnaire, mais ce n’est qu’un début. Pour créer un véritable contexte, il faut également enregistrement:
- Liste de synonymes
- Relations hiérarchiques (le cas échéant) avec d'autres termes métier
- Le propriétaire du terme
- Si ce terme a été approuvé par des groupes ou dans le cadre de procédures spécifiques, et, le cas échéant, à quelle date
- Le domaine de ce terme
- L'importance cruciale de ce terme
- Lieux où ce terme est utilisé
De même, un métrique régie est bien plus qu'une simple expression mathématique. Elle doit également inclure :
- Nombre de décimales spécifié pour la réponse
- Unités de mesure
- Le modèle sur lequel repose l'indicateur
- Jointures obligatoires, le cas échéant
- Définitions autorisées pour la clause « GROUP BY »
- Filtres, par défaut et facultatifs
- La dimension temporelle qui définit le champ d'application du calcul de la métrique, ainsi que les niveaux de granularité temporelle autorisés pour cette définition
À ce stade, vous vous dites peut-être : s'agit-il simplement de décrire une « catalogue de données » et un glossaire ? La réponse est oui. Cet élément de votre contexte ne se contentera pas d’ avantage r vos analyses d’IA : il peut améliorer l’ensemble de vos initiatives en matière de données et de vos communications en offrant à toute votre organisation un point de référence unique et partagé.
Modèles et relations définis
Une fois vos termes métier et vos indicateurs définis, vous devez expliquer à votre IA comment ces concepts se rapportent aux données réelles présentes dans vos systèmes, sinon vous ne serez guère mieux lotis qu'auparavant.
Modèles de données complets structurent les données selon les mêmes concepts métier que ceux utilisés par votre organisation pour mesurer les performances.
Il est essentiel que vos modèles intègrent des relations explicitement définies. Il n'est pas rare qu'une même entité dispose de données dans plusieurs systèmes sources, et pour éviter tous les risques que nous avons évoqués dans la section « Jointures incorrectes », vous devez indiquer à votre IA quelle est la joints joints corrects.
Contrôle des accès
Il n'est pas envisageable de créer une « déploiement » d'IA distincte pour chaque combinaison possible des droits d'accès à utilisateur , mais heureusement, cela n'est pas nécessaire.
Au lieu d'accorder aux utilisateurs un accès illimité à l'ensemble de votre modèle d'IA, filtrez leur accès aux analyses basées sur l'IA à l'aide d'agents définis et dont le champ d'application est bien délimité.
Un bon moyen de déterminer les agents dont vous avez besoin consiste à reproduire les rôles métier principaux et/ou les fonctions analytiques que vous souhaitez voir assumer par vos utilisateurs. Définissez leur périmètre d'action en accordant à chaque agent l'autorisation d'accéder uniquement à la source de données et aux colonnes autorisées pour ce rôle ou cette fonction.
Désormais, pour personnaliser les autorisations de certaines personnes, il vous suffit de préciser avec quels agents elles sont autorisées à travailler ; la configuration des agents que vous avez déjà mise en place se chargera du reste en matière de sécurité.
Traçabilité
Pour tout ce que fait chacun de vos agents IA.
Résumé
Comme nous l'avons vu dans cet article, tous les problèmes liés à l'analyse basée sur l'IA ont des solutions. Mais ce ne sont pas des solutions que l'on peut trouver avec un simple abonnement à un LLM générique, ni même avec quelques personnalisations.
Il vous faut plutôt une solution d'analyse basée sur l'IA qui offre :
- Contexte métier partagé. La codification de l’expertise humaine relative à votre entreprise, à ses opérations et à ses données garantit que les réponses fournies par l’IA s’appuient sur la réalité de votre entreprise. Cela profite également à vos activités liées aux données hors IA : au fur et à mesure que vous construisez cette couche sémantique, vous devrez résoudre des conflits internes concernant les définitions sémantiques et les calculs métriques.
- Données contrôlées. Disposer d’un catalogue répertoriant les données dont vous disposez, leur fiabilité et leur signification (au-delà de la simple mention « ce sont des dates ») est essentiel pour que les analyses soient fiables, quels que soient ceux qui les calculent. Sans accès à vos informations d’ gouvernance , un agents IA ne peut pas produire de résultats analytiques sur lesquels vous pouvez vous appuyer.
- Raisonnement de l'IA. En précisant les méthodologies privilégiées, les sources de données à privilégier et les documents de référence incontournables, vous guidez votre solution d’IA afin qu’elle applique les connaissances de votre organisation à vos données gérées, conformément à vos intentions.
En codifiant l'expertise et les connaissances humaines afin de les rendre accessibles à l'IA, et en limitant le modèle d'IA à l'utilisation exclusive de ce référentiel, vous pouvez avantage tirer parti de la rapidité de calcul et de l'accessibilité généralisée qu'offre une solution d'analyse basée sur l'IA, tout en vous assurant que les résultats sont exploitables et fiables.
AI Analyst intègre d'emblée tous ces avantages :
- Une couche sémantique comprenant des modèles, des indicateurs, des termes de glossaire et des relations régis par des règles.
- Des réponses cohérentes, fondées sur des définitions métier communes.
- Une génération d'requête s transparente et des flux de travail analytiques explicables.
- Contrôles d'accès très précis et accès aux données réglementé.
- Analyse des conversations, rapports et analyses programmées s'appuyant sur un même contexte métier.
En savoir plus sur AI Analyst
Réservez une démonstration ou suivez la visite guidée du produit pour découvrir comment Actian AI Analyst fournit des réponses cohérentes grâce à l'analyse conversationnelle et à un contexte métier réglementé.
Découvrir AI Analyst