Zilliz x Galileo : la puissance des embeddings vectoriels
Les données non structurées sont partout. L’IDC a estimé que nous aurons plus de 175 zettaoctets (21 zéros) de données d’ici 2025. 80 % de celles-ci sont des données non structurées. Les données non structurées sont des données qui ne correspondent à aucun format prédéterminé — elles ne suivent pas de modèle de données ni de schéma prédéfini. Elles prennent couramment la forme de texte, d’images, d’audio et de vidéos, mais peuvent gérer diverses autres conditions.
Qu’est-ce qu’un embedding vectoriel ?
Au niveau le plus fondamental, les embeddings vectoriels sont une représentation numérique des données. Un embedding vectoriel se compose généralement de centaines ou de milliers de nombres à virgule flottante. La haute dimensionnalité permet aux embeddings vectoriels de stocker des données complexes telles que des images, de l’audio et du texte. Vous pouvez extraire des embeddings vectoriels à partir de modèles de machine learning entraînés. La plupart des réseaux de neurones utilisés en production comportent de nombreuses couches, chacune avec des centaines de neurones. Lorsqu’un point de données passe par la fonction de propagation avant du réseau neuronal, chaque couche produit une sortie. Généralement, ces réseaux effectuent une classification créée par la dernière couche du réseau. L’embedding vectoriel représentant les données est la sortie de la dernière couche cachée, ce qui désigne généralement l’avant-dernière couche.
Comment travailler avec les embeddings vectoriels ?
Les embeddings vectoriels sont la méthode de facto pour travailler avec des données non structurées. Si vous avez des données que vous souhaitez comparer, nous vous recommandons de le faire à l’aide d’embeddings vectoriels. Les embeddings vectoriels sont générés à partir de réseaux de neurones en prenant la sortie de l’avant-dernière couche d’un réseau neuronal et en l’utilisant comme embedding vectoriel de l’entrée. Lors de la génération de vecteurs d’embedding, plusieurs facteurs doivent être pris en compte. Vos principales considérations sont la taille des embeddings, les données pour l’entraînement du modèle et la qualité des données. Vous devez vous assurer que vos vecteurs ont une taille pertinente.
Utiliser les embeddings vectoriels pour déboguer vos données d’entraînement
Trouver les erreurs de données
La phase initiale du développement de modèles est principalement consacrée à la résolution des défis liés à la "curation des données". L’objectif principal durant cette phase est de construire un jeu de données optimal pour l’entraînement et l’évaluation du modèle. Galileo, une plateforme algorithmique LLM Ops pour l’entreprise, utilise des embeddings pour détecter les erreurs de données grâce au clustering.
Galileo possède une capacité unique à afficher les erreurs avec un score appelé Data Error Potential (DEP). DEP fournit un outil permettant de trier rapidement et de faire remonter les données les plus difficiles et les plus intéressantes à explorer lorsque vous analysez les erreurs de votre modèle.
Lorsqu’il s’agit de déboguer vos erreurs de données, il existe deux types de solutions.
Trouver les échantillons absents de vos données d’entraînement
Une fois le modèle déployé et en interaction avec des données réelles, les schémas de trafic évoluent. Galileo peut détecter la dérive du modèle en exploitant les embeddings pour surveiller en continu les performances des modèles ML. Les échantillons ayant dérivé peuvent être annotés et ajoutés aux données d’entraînement pour des performances plus robustes.
Trouver les hallucinations dans les données
L’hallucination de l’IA désigne les situations où l’IA génère des informations qui peuvent sembler plausibles, mais qui sont incorrectes ou sans rapport avec le contexte. Ce problème survient généralement en raison de biais de conception de l’IA, d’une compréhension insuffisante du monde réel ou de données d’entraînement incomplètes.
Pour résoudre ce problème, Galileo participe activement à des techniques fondées sur les embeddings afin d’identifier les cas d’hallucination de l’IA. Cette approche aide à détecter les erreurs dans les données et contribue à entraîner des modèles d’IA plus précis et plus fiables.
Trouver les erreurs dans la génération augmentée par récupération
(RAG)Génération augmentée par récupération (RAG) est une technique populaire pour développer des systèmes de questions-réponses et des chatbots. Cependant, un problème courant avec cette approche est la mauvaise récupération, qui conduit à fournir des réponses incorrectes. Galileo développe un score de pertinence du contexte pour détecter le mauvais contexte à l’aide de techniques fondées sur les embeddings afin de résoudre ce problème. Parfois, même lorsque la pertinence est correcte, la génération peut contenir des hallucinations. Galileo fournira un score de groundedness, mesurant si la réponse du modèle était fondée sur les informations fournies au modèle dans la fenêtre de contexte.
Les puissants algorithmes de Galileo peuvent montrer les erreurs au niveau des tokens, ce qui peut aider les applications à cesser de produire des hallucinations.
Indexer, stocker et interroger les embeddings vectoriels
S’il est excellent de disposer d’embeddings, vous devez pouvoir les utiliser. Il serait préférable d’avoir quelque chose pour indexer, stocker et interroger vos vecteurs. C’est tout l’intérêt des bases de données vectorielles. Les bases de données vectorielles sont spécialement conçues pour indexer, stocker et interroger des données vectorielles. Le fait de pouvoir indexer, stocker et interroger fait des bases de données vectorielles de solides candidates pour une utilisation dans les applications LLM. Elles sont parfaites pour stocker la signification sémantique des documents et des requêtes, ainsi que comme cache pour les FAQ. Un exemple parfait d’utilisation des embeddings vectoriels avec des applications LLM est OSSChat, une application qui vous permet de « discuter » avec la documentation de logiciels open source.
L’un des aspects les plus importants pour disposer d’une application Q/R pratique est l’utilisation d’embeddings vectoriels adaptés. Pour interroger les documents, nous avons besoin de l’espace vectoriel latent des requêtes. Nous utilisons un LLM comme ChatGPT pour générer des questions à partir d’un ensemble de documents. Ensuite, nous indexons et stockons ces embeddings afin de les interroger lorsque l’utilisateur pose des questions.
Résumé de la puissance des embeddings vectoriels
Les données non structurées sont le type de données le plus courant au monde. Traditionnellement, il a été difficile de travailler avec des données non structurées parce qu’elles ne se conforment pas à une structure prédéterminée. L’apprentissage profond est devenu plus puissant et plus répandu, et a donc produit une solution pour travailler avec des données non structurées en les transformant en vecteurs.
Les embeddings vectoriels vous permettent de faire des calculs sur des choses qui ne sont pas à l’origine des nombres. Dans cet article, nous avons présenté les embeddings vectoriels, la manière de travailler avec eux, ainsi que quatre façons concrètes d’utiliser les vecteurs dans le paradigme actuel de l’apprentissage automatique. Vous pouvez utiliser les embeddings vectoriels pour trouver des erreurs de données, trouver des échantillons absents de vos données d’entraînement, détecter des hallucinations et corriger les erreurs dans la génération augmentée par récupération.
La puissance des embeddings vectoriels se manifeste dans cette vaste gamme de cas d’utilisation. La manière la plus efficace de travailler avec eux est d’utiliser une base de données vectorielle comme Milvus ou Zilliz Cloud pour stocker, indexer et interroger les vecteurs.
Rejoignez notre prochain webinaire animé par Galileo
Rejoignez Vikram Chatterji de Galileo et Yujian Tang de Zilliz le 12 octobre pour une exploration approfondie de RAG et de la gestion des LLM. Ce webinaire vous fournira des informations exploitables et des méthodes pour améliorer vos pipelines LLM et la qualité de vos résultats. Il promet d’être une session informative pour tous les data scientists et ingénieurs en apprentissage automatique à la recherche de frameworks et d’outils pour optimiser les performances de RAG et des LLM.
Continuer à lire

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

Zilliz Cloud Audit Logs Goes GA: Security, Compliance, and Transparency at Scale
Zilliz Cloud Audit Logs are now GA, giving enterprises real-time visibility, compliance-ready trails, and stronger security across AWS, GCP, and Azure.

Vector Databases vs. Graph Databases
Use a vector database for AI-powered similarity search; use a graph database for complex relationship-based queries and network analysis.



