Utiliser la recherche vectorielle pour mieux comprendre les données de vision par ordinateur
À quel point de mauvaises données peuvent-elles nuire à votre IA ? Voyez par vous-même :
Problèmes de qualité des données
De mauvaises données peuvent saboter votre application et vos workflows alimentés par l’IA, avec des conséquences sérieuses qui vont au-delà d’un simple utilisateur frustré, mais ce n’est pas une surprise.
Beaucoup d’entre nous ont imaginé exploiter la commodité et la polyvalence des grands modèles de langage multimodaux (LLMs) pour puiser dans la richesse des informations contenues dans les images et les vidéos. Faire des merveilles, passer au niveau supérieur, comme le veut le cliché. La vision par ordinateur offre ce type d’opportunité illimitée pour de nouveaux services plus satisfaisants. Mais des défis jalonnent le parcours.
L’un des défis critiques consiste à sélectionner de meilleures données pour le bon modèle afin d’obtenir de meilleurs résultats. Il y a beaucoup d’ajustement fin, d’essais-erreurs par force brute dans l’obscurité en raison de la complexité des modèles et de la grande dimensionnalité des données, ce qui détourne les ressources de l’innovation.
Et si nous pouvions apporter transparence et clarté aux workflows d’IA visuelle, en les rendant rapides et même amusants ? Voxel51 en a fait sa mission et l’a accomplie !
Comme l’a démontré Jacob Marks, ingénieur en machine learning et développeur évangéliste chez Voxel51 lors du SF Unstructured Data Meetup.
Faire de l’IA visuelle une réalité
L’explosion de nouvelles applications et de nouveaux services alimentés par l’IA générative et le machine learning a révélé l’importance d’exploiter les données non structurées et le rôle des bases de données vectorielles comme véritable révolution. Jacob Marks a montré dans sa présentation comment l’intégration des bases de données vectorielles avec des outils comme Voxel51, et son projet open source FiftyOne, révolutionne l’exploration, la visualisation et la curation des données visuelles afin de créer des applications alimentées par l’IA plus efficacement et plus fiablement. Elle vous permet de tester et d’évaluer des modèles en leur fournissant les jeux de données exacts dont ils ont besoin pour garantir des résultats robustes et précis.
Tout commence par la qualité des données
Pourquoi ? Parce que de meilleures données mènent à de meilleurs modèles, accélérant le chemin vers le succès.
« Rien n’entrave davantage le succès des systèmes de machine learning que des données de mauvaise qualité », déclare Jacob. Préparer les données et trouver le bon modèle peut être chronophage et inefficace sans les bons outils. Même les ingénieurs ML expérimentés ont besoin de bons outils pour créer des jeux de données et des modèles de haute qualité.
FiftyOne simplifie la gestion des données visuelles, ce qui rend plus facile et plus rapide la compréhension des opérations, des ajustements et des résultats.
Vous pouvez visualiser des étiquettes complexes, évaluer des modèles, explorer des scénarios d’intérêt, identifier des modes de défaillance et trouver des erreurs d’annotation, entre autres tâches. Cela est réalisé grâce à des chaînes de LLM fonctionnant en arrière-plan, générant des embeddings et interrogeant une base de données vectorielle.
Maintenant, allons droit au but !
De RAG à la richesse : la puissance de la recherche vectorielle
RAG est l’une des raisons qui ont rendu les bases de données vectorielles populaires.
La Retrieval-Augmented Generation (RAG) a popularisé la recherche vectorielle en améliorant la précision des grands modèles de langage. Elle combine des modèles basés sur la recherche et des modèles génératifs pour améliorer la qualité et la pertinence du texte généré.
Cette technique utilise un LLM pour convertir le prompt de l’utilisateur en embeddings et les comparer aux embeddings vectoriels, permettant une recherche par similarité sémantique pour des réponses plus précises et riches en contexte.
RAG
Vous pouvez comparer plusieurs vecteurs pour déterminer leur similarité avec les entrées de données. Ainsi, si vous prenez deux entrées textuelles, les vectorisez et les intégrez, vous pouvez examiner leur proximité, indépendamment des métriques utilisées, distance euclidienne, similarité cosinus ou produit scalaire.
Similarité vectorielle
Vous pouvez également utiliser des embeddings multimodaux pour gérer ensemble différents types de données, comme des textes, des images et des vidéos dans ce type d’espace.
Vector embeddings
Recherche vectorielle pour la vision par ordinateur
Voxel51 a intégré Milvus en utilisant Zilliz Cloud afin de libérer les capacités de recherche vectorielle sur des jeux de données visuels. Voici quelques cas d’utilisation puissants :
Similarité d’image : La recherche de similarité est un cas d’utilisation courant, et elle est rendue encore plus facile avec Voxel51.
Il suffit de sélectionner l’image qui vous intéresse dans votre jeu de données et de l’utiliser pour rechercher des images similaires. Toutes les étapes d’embedding et de requête sont effectuées en arrière-plan. L’expérience visuelle reste très intuitive et cliquable. Par exemple, vous pouvez définir les attributs tels que la métrique et la valeur k en les sélectionnant dans l’interface graphique.
Image similarity search
Tout aussi facilement, vous pouvez également effectuer une recherche inversée à l’aide d’une image externe.
Disons que vous voulez savoir si vous avez un chien cane corso dans votre jeu de données visuel. Il suffit de fournir l’URI de l’image ; elle sera automatiquement vectorisée et interrogée par similarité par rapport au jeu de données visuel dans l’espace vectoriel.
Reverse image search
Recherche d’objets : Au-delà des images entières, les bases de données vectorielles peuvent gérer des patchs de détection d’objets, permettant des recherches plus précises au sein de sous-images. Cela est utile pour des tâches comme la reconnaissance faciale ou l’identification d’objets dans de grands jeux de données.
Object similarity search
Comme l’objet ciblé par la recherche n’est très probablement pas l’image entière, calculer des embeddings pour l’image entière peut être moins efficace, car ils ne seront pas toujours similaires aux embeddings de l’objet.
Recherche OCR : Un autre cas d’utilisation est le document interactif de reconnaissance optique de caractères (OCR). Vous pouvez interagir visuellement avec les embeddings de texte. Vous pouvez voir d’où proviennent ces résultats sur chacune des pages de vos documents.
Robust OCR document search
Récupération intermodale : Des outils comme CLIP d’OpenAI et ImageBind de Meta permettent de combiner des embeddings de texte et d’image. Cela permet la récupération intermodale, où les utilisateurs peuvent rechercher des images à l’aide d’embeddings de descriptions textuelles, d’embeddings audio, etc., ou inversement. Dans son exemple, un extrait audio d’un train a été intégré, puis comparé à toutes les images afin de trouver des trains dans le jeu de données.
Cross-modal retrieval
Similarité perceptuelle : La similarité perceptuelle nous permet de comprendre comment différents modèles perçoivent le monde en comparant les représentations des modèles dans l’espace vectoriel. Certains modèles sont très sémantiques, capturant des détails et concepts de haut niveau, mais pas la palette de l’image au niveau des pixels, comme dans l’image ci-dessous :
Probing perceptual similarity
La vision par ordinateur plus traditionnelle, mise en œuvre avec des réseaux neuronaux computationnels, prend en compte chaque pixel et chaque patch, mais ne saisit aucunement le sens correctement, comme vous pouvez le voir dans l’image ci-dessous.
Probing perceptual similarity-2
Vous pouvez comparer les représentations de modèles dans l’espace vectoriel en observant la distribution des résultats dans l’espace vectoriel. Certains modèles ont des résultats regroupés, tandis que d’autres non. Ils voient le monde différemment, et comprendre quand appliquer ces différentes perspectives est fondamental pour la qualité de votre IA.
D’autres innovations arrivent dans la recherche vectorielle visuelle
Interpolation de concepts : L’interpolation de concepts prend deux concepts textuels et interpole les résultats entre eux. Dans l’exemple, les embeddings initiaux pour un husky et un chihuahua ont été fournis afin de rechercher tout ce qui pourrait se situer entre eux, y compris un chat !
interpolation de concepts
Parcours de l’espace des concepts : avec le parcours de l’espace des concepts, les utilisateurs peuvent combiner et manipuler des embeddings afin de réguler des attributs dans l’espace des embeddings possibles, comme dans l’exemple, où les attributs de santé et de richesse des couleurs sont régulés dans la recherche.
Parcours de l’espace des concepts
Beaucoup de choses se passent en arrière-plan pour que la recherche combine des embeddings pour le texte, les images et d’autres modalités avec les bons attributs au niveau souhaité afin de rendre l’espace de recherche plus dynamiquement explorable, et tout ce qu’il vous reste à faire est de cliquer ou de faire glisser jusqu’à votre sélection. Aussi simple que cela !
Conclusion
Les bases de données vectorielles sont indispensables en vision par ordinateur, offrant un moteur puissant aux outils de jeux de données visuelles pour l’exploration des données, l’évaluation des modèles et la recherche innovante à l’aide d’embeddings multimodaux, de l’interpolation de concepts et du parcours. À mesure que l’IA continue d’évoluer, l’intégration des bases de données vectorielles jouera un rôle crucial dans la définition de l’avenir des technologies pilotées par des données non structurées.
Le ciel est limité, comme le dit Jacob. Passez à la pratique et amusez-vous avec l’IA visuelle alimentée par une base de données vectorielle grâce à ce tutoriel.
Si vous souhaitez en savoir plus ou lancer votre projet de vision par ordinateur, par exemple, n’hésitez pas à rejoindre notre canal Discord. Nous fournissons une multitude de ressources et une communauté bienveillante pour vous aider à démarrer.
Continuer à lire

3 Easiest Ways to Use Claude Code on Your Mobile Phone
Run Claude Code from your phone with Remote Control, Happy Coder, or SSH + Tailscale. Comparison table, setup steps, and tools for typing, memory, and parallel tasks.

Zilliz Cloud Launches in AWS Australia, Expanding Global Reach to Australia and Neighboring Markets
We're thrilled to announce that Zilliz Cloud is now available in the AWS Sydney, Australia region (ap-southeast-2).

Why Not All VectorDBs Are Agent-Ready
Explore why choosing the right vector database is critical for scaling AI agents, and why traditional solutions fall short in production.



