Présentation de la recherche vectorielle native avec HCL Informix® VectorBlade
Résumé
- Grâce à ce lancement, HCL Informix® VectorBlade est désormais disponible gratuitement pour Informix 15.0.1.9 et les versions ultérieures.
- Il ajoute support native des vecteurs support Informix, notamment les vecteurs en lecture/écriture, la recherche par similarité, les index HNSW et IVF, ainsi que transactions acid.
- Le principal avantage réside dans le fait que les vecteurs coexistent avec les données opérationnelles, ce qui permet aux équipes d'éviter de recourir à des systèmes de vecteurs distincts, à des pipelines de synchronisation supplémentaires et à des modèles de sécurité redondants.
- Cet article met en avant des cas d'utilisation dans les domaines de la recherche de produits, des opérations industrielles, support, des dossiers réglementés et de l'analyse des incidents dans le secteur des télécommunications.
- Le message essentiel est que la recherche vectorielle doit faire partie intégrante de la base de données opérationnelle, et non constituer un système parallèle distinct.
HCL Informix® VectorBlade est désormais disponible
Je te l'avais dit, HCL Informix® n'était pas encore au point. Aujourd'hui, il est gratuit, disponible et à vous.
Il y a quelques mois, j'ai écrit qu'il n'était pas nécessaire de créer une nouvelle base de données pour l'IA. Il vous faut celle dont vous disposez déjà pour en faire davantage.
Aujourd’hui, grâce aux efforts remarquables de l’équipe d’ingénieurs HCL Informix®, je n’ai plus à dire « à venir ».
HCL Informix VectorBlade est désormais disponible gratuitement pour HCL Informix 15.0.1.9 et les versions ultérieures. Aucun composant supplémentaire à déployer. Aucun système secondaire à sécuriser. Aucune nouvelle ligne de licence sur la facture. Il suffit de l'activer pour que votre base de données prenne en charge les vecteurs.
Voici ce que vous obtenez concrètement :
- Vecteurs entièrement accessibles en lecture et en écriture. Insérez, mettez à jour et supprimez des représentations comme n'importe quelle autre colonne.
- Indexation HNSW et IVF, expédition aujourd'hui. Ce n'est pas un aperçu en avant-première. Ce n'est pas une étape d'un plan d'action. C'est aujourd'hui.
- Recherche par similarité dans le langage SQL que vous maîtrisez déjà. Vous souhaitez obtenir un centroïde par locataire ? SELECT tenant_id, AVG(embedding) FROM docs GROUP BY tenant_id. C'est tout. Pas de nouveau requête . Pas de formalités liées aux fonctions utilisateur.
- ACID sur les vecteurs. La cohérence de vos représentations dépend de celle de la transaction qui les a créées.
- Réplication, sauvegarde, restauration. Tout cela, en travaillant sur des vecteurs, dès le premier jour.
- RAG sans la « plomberie ». Les intégrations coexistent avec les lignes qu’elles décrivent. Une seule transaction. Un seul modèle de sécurité. Rien à synchroniser. Rien ne peut dériver.
Quelles possibilités cela ouvre-t-il donc ?
Découverte des produits gagne en intelligence sans quitter le catalogue. Un client peut rechercher un « casque confortable pour les longs appels professionnels » et trouver la référence adéquate, même si la description du produit indique « casque ANC circum-auriculaire ». Ces informations s’affichent à côté du prix, du stock et de la disponibilité, ce qui permet à la recherche sémantique de continuer à croiser ces données avec les informations pertinentes.
Les opérations industrielles peuvent effectuer des recherches par profil, et pas seulement par seuil. Embarquer fenêtre de relevés de capteurs, de textes d’alerte ou de notes de maintenance, et vous pourrez déterminer si la signature vibratoire d’aujourd’hui ressemble à la défaillance de roulement que vous avez constatée en mars dernier. Les séries chronologiques et la recherche par similarité sont réunies au sein d’un même moteur.
Support peut peuvent cesser de résoudre le même problème de cinq façons différentes. Un nouveau ticket peut être mis en correspondance avec d’anciens tickets décrivant le même problème dans une autre langue, acheminé vers l’équipe qui l’avait déjà résolu et s’appuyer sur des solutions qui ont réellement fonctionné.
Documents soumis à réglementation peuvent faire l'objet de recherches sémantiques tout en restant soumis aux mêmes contrôles. Les notes cliniques, les demandes de remboursement, les contrats, les dossiers KYC, les documents relatifs à la lutte contre le blanchiment d'argent et les dossiers médicaux peuvent faire l'objet de recherches sémantiques sans que les données les plus sensibles de l'entreprise ne soient dupliquées ailleurs.
Les équipes des télécommunications peuvent recouper les alarmes, les journaux, les relevés détaillés des appels et les schémas de fraude avec l'historique des incidents. Les règles permettent de détecter ce que vous savez déjà décrire. La recherche par similarité aide à repérer les variantes qui semblent familières mais qui ne correspondent pas exactement à la règle.
Des secteurs différents, mais un même principe : la valeur se révèle lorsque les vecteurs côtoient les données opérationnelles qu’ils décrivent. Les fiches produits à côté des stocks. Les signatures des capteurs à côté des séries chronologiques. Les tickets à côté des résolutions. Les documents réglementaires à côté des politiques correspondantes. Les événements réseau à côté des systèmes qui y réagissent.
C'est justement là le problème : les vecteurs ne constituent pas un projet scientifique isolé. Ils ont leur place dans la base de données opérationnelle, aux côtés des lignes, des transactions, des politiques et de l'historique qu'ils décrivent.
Et voici ce que j’adore : il n’y a pas de « engine fork », pas de copie hors base de données. Vos vecteurs transitent par le même pool de tampons, les mêmes verrous et les mêmes journaux que toutes les autres lignes du système. Ce n’est pas une diapositive. C’est l’architecture Informix que nous adorons.
Tout cela n'est pas une nouveauté pour HCL Informix. À la fin des années 1990 déjà, l'Excalibur Image DataBlade extrayait des vecteurs de caractéristiques à partir d'images à l'aide de réseaux neuronaux et classait les résultats en fonction de la distance vectorielle au sein d'une base de données relationnelle, bien avant que quiconque n'ait songé à parler de « base de données vectorielle ». Le VectorBlade ne constitue donc pas une nouvelle orientation audacieuse. C'est plutôt un retour aux sources pour Informix.
On dit qu'on ne peut pas apprendre de nouveaux tours à un vieux chien. C'est qu'ils n'ont pas encore rencontré celui-là (et comme j'ai moi-même des chiens âgés, je peux vous assurer que c'est tout à fait possible !)
Informix est une marque déposée d'IBM Corporation dans au moins une juridiction et est utilisée sous licence.
Télécharger le livre blanc VectorBlade