La recherche de similarité vectorielle se cache à la vue de tous
L’intelligence artificielle (IA) a le potentiel de changer la manière dont même les choses les plus obscures sont réalisées. Par exemple, chaque année (avant la COVID, en tout cas), plus de 73 000 personnes se rassemblent pour participer au marathon de Hong Kong. Afin de détecter et d’enregistrer correctement les temps d’arrivée de tous les participants à la course, les organisateurs distribuent 73 000 puces RFID de chronométrage à attacher à chaque coureur. Le chronométrage par puce est une entreprise complexe qui présente des inconvénients évidents. Le matériel (puces et dispositifs de lecture électroniques) doit être acheté ou loué auprès d’entreprises de chronométrage, et une zone d’inscription doit être dotée en personnel pour que les coureurs puissent récupérer les puces le jour de la course. De plus, si des capteurs ne sont installés qu’aux lignes de départ et d’arrivée, il est possible pour des coureurs peu scrupuleux de couper le parcours.
Chronométrer les coureurs de marathon est un défi logistique auquel peu de gens pensent.
Imaginez maintenant une application de vidéo IA capable d’identifier automatiquement des coureurs individuels à partir d’images capturées à la ligne d’arrivée en utilisant une seule photo. Plutôt que d’attacher des puces de chronométrage à chaque participant, les coureurs téléchargent simplement une photo d’eux-mêmes via une application après avoir franchi la ligne d’arrivée. Instantanément, un montage personnalisé des meilleurs moments, des statistiques de course et d’autres informations pertinentes est fourni. Des caméras installées à différents points tout au long de la course peuvent capturer des images supplémentaires des participants et s’assurer que chaque coureur parcourt l’intégralité du parcours. Quelle solution semble plus facile et plus rentable à mettre en œuvre ?
Bien que le marathon de Hong Kong n’exploite pas (encore) le machine learning pour remplacer les puces de chronométrage, cet exemple illustre le potentiel qu’a l’IA de transformer radicalement tout ce qui nous entoure. Pour le chronométrage des courses, elle réduit des dizaines de milliers de puces à quelques caméras associées à des algorithmes de machine learning. Mais la vidéo IA n’est qu’une des nombreuses applications de la recherche de similarité vectorielle, un processus qui utilise l’intelligence artificielle pour analyser d’immenses ensembles de données non structurées à l’échelle du billion. Cet article donne un aperçu de la technologie de recherche vectorielle, notamment ce qu’elle est, comment elle peut être utilisée, ainsi que les logiciels et ressources open source qui la rendent plus accessible que jamais.
Aller à :
Quelles sont certaines applications de la recherche de similarité vectorielle ?
Logiciels et ressources open source de recherche de similarité vectorielle.
Qu’est-ce que la recherche de similarité vectorielle ?
Les données vidéo sont incroyablement détaillées et de plus en plus courantes ; il semble donc logique qu’elles constituent un excellent signal d’apprentissage non supervisé pour créer de la vidéo IA. En réalité, ce n’est pas le cas. Le traitement et l’analyse des données vidéo, en particulier en grands volumes, restent un défi pour l’intelligence artificielle. Les progrès récents dans ce domaine, comme une grande partie des progrès réalisés dans l’analyse des données non structurées, sont dus en grande partie à la recherche de similarité vectorielle.
Le problème de la vidéo, comme de toutes les données non structurées, est qu’elle ne suit pas de modèle prédéfini ni de structure organisationnelle, ce qui la rend difficile à traiter et à analyser à grande échelle. Les données non structurées comprennent des éléments tels que les images, l’audio, le comportement sur les réseaux sociaux et les documents, représentant collectivement, selon les estimations, plus de 80 à 90 % de toutes les données. Les entreprises sont de plus en plus conscientes des informations critiques pour leur activité enfouies dans d’immenses ensembles de données non structurées énigmatiques, ce qui stimule la demande d’applications d’IA capables d’exploiter ce potentiel inexploité.
Grâce aux réseaux neuronaux tels que CNN, RNN et BERT, les données non structurées peuvent être converties en vecteurs de caractéristiques (aussi appelés embeddings), un format de données numériques lisible par machine. Des algorithmes sont ensuite utilisés pour calculer la similarité entre les vecteurs à l’aide de mesures comme la similarité cosinus ou la distance euclidienne. L’intégration vectorielle et la recherche de similarité permettent d’analyser et de créer des applications d’apprentissage automatique à partir de jeux de données auparavant indiscernables.
La similarité vectorielle est calculée à l’aide d’algorithmes établis ; cependant, les jeux de données non structurées sont généralement massifs. Cela signifie qu’une recherche efficace et précise nécessite d’immenses capacités de stockage et de calcul. Pour accélérer la recherche de similarité et réduire les besoins en ressources, on utilise des algorithmes de recherche approximative des plus proches voisins (ANN). En regroupant les vecteurs similaires, les algorithmes ANN permettent d’envoyer les requêtes aux clusters de vecteurs les plus susceptibles de contenir des vecteurs similaires, plutôt que de parcourir l’ensemble du jeu de données. Bien que cette approche soit plus rapide, elle sacrifie un certain degré de précision. L’exploitation des algorithmes ANN permet à la recherche vectorielle de parcourir des milliards d’informations issues de modèles d’apprentissage profond en quelques millisecondes.
Quelles sont les applications de la recherche de similarité vectorielle ?
La recherche de similarité vectorielle a des applications couvrant une grande variété de scénarios d’intelligence artificielle, d’apprentissage profond et de calcul vectoriel traditionnel. Ce qui suit fournit un aperçu général de diverses applications de la recherche de similarité vectorielle :
E-commerce : La recherche de similarité vectorielle a une large applicabilité dans l’e-commerce, notamment les moteurs de recherche d’images inversée qui permettent aux acheteurs de rechercher des produits à l’aide d’une image prise avec leur smartphone ou trouvée en ligne. De plus, des recommandations personnalisées basées sur le comportement des utilisateurs, leurs centres d’intérêt, leur historique d’achat, etc., peuvent être fournies par des systèmes de recommandation spécialisés qui s’appuient sur la recherche vectorielle.
Sécurité physique et cybersécurité : L’IA vidéo n’est qu’une des nombreuses applications de la recherche de similarité vectorielle dans le domaine de la sécurité. D’autres scénarios incluent la reconnaissance faciale, le suivi des comportements, l’authentification d’identité, le contrôle d’accès intelligent, et plus encore. De plus, la recherche de similarité vectorielle joue un rôle important dans la prévention des cyberattaques de plus en plus courantes et sophistiquées. Par exemple, la recherche de similarité de code peut être utilisée pour identifier les risques de sécurité en comparant un logiciel à une base de données de vulnérabilités connues ou de logiciels malveillants.
Moteurs de recommandation : Les moteurs de recommandation sont des systèmes qui utilisent l’apprentissage automatique et l’analyse de données pour suggérer des produits, des services, du contenu et des informations aux utilisateurs. Le comportement des utilisateurs, le comportement d’utilisateurs similaires et d’autres données sont traités à l’aide de méthodes d’apprentissage profond pour générer des recommandations. Avec suffisamment de données, les algorithmes peuvent être entraînés à comprendre les relations entre les entités et à inventer des façons de les représenter de manière autonome. Les systèmes de recommandation ont une large applicabilité et sont déjà utilisés quotidiennement par les utilisateurs, notamment les recommandations de contenu sur Netflix, les recommandations d’achat sur Amazon et les fils d’actualité sur Facebook.
Chatbots : Traditionnellement, les chatbots sont construits à l’aide d’un graphe de connaissances classique qui nécessite un grand jeu de données d’entraînement. Cependant, les chatbots construits à l’aide de modèles d’apprentissage profond n’ont pas besoin de prétraiter les données : à la place, une correspondance entre les questions fréquentes et les réponses est créée. À l’aide d’un modèle de traitement du langage naturel (NLP) préentraîné, des vecteurs de caractéristiques peuvent être extraits des questions, puis stockés et interrogés au moyen d’une plateforme de gestion de données vectorielles.
Recherche d’images ou de vidéos : Les réseaux d’apprentissage profond sont utilisés pour reconnaître des motifs visuels depuis la fin des années 1970, et les tendances technologiques modernes ont rendu la recherche d’images et de vidéos plus puissante et plus accessible que jamais.
Recherche de similarité chimique : La similarité chimique est essentielle pour prédire les propriétés des composés chimiques et trouver des substances chimiques présentant des attributs spécifiques, ce qui la rend indispensable au développement de nouveaux médicaments. Des empreintes représentées par des vecteurs de caractéristiques sont créées pour chaque molécule, puis les distances entre les vecteurs sont utilisées pour mesurer la similarité. L’utilisation de l’IA pour la découverte de nouveaux médicaments prend de l’ampleur dans l’industrie technologique, ByteDance (la société mère chinoise de TikTok) commençant à recruter des talents dans ce domaine.
Logiciels et ressources open source de recherche de similarité vectorielle.
La loi de Moore, le cloud computing et la baisse des coûts des ressources sont des tendances macroéconomiques qui ont rendu l’intelligence artificielle plus accessible que jamais. Grâce aux logiciels open source et à d’autres ressources accessibles au public, la création d’applications d’IA/ML n’est plus réservée aux grandes entreprises technologiques. Ci-dessous, nous fournissons un bref aperçu de Milvus, une plateforme open source de gestion de données vectorielles, et mettons également en évidence quelques jeux de données accessibles au public qui contribuent à mettre l’IA à la portée de tous.
Milvus, une plateforme open source de gestion de données vectorielles
Milvus est une plateforme open source de gestion de données vectorielles (alias base de données vectorielle conçue spécifiquement pour les données vectorielles à très grande échelle. Alimenté par Facebook AI Similarity Search (Faiss), Non-Metric Space Library (NMSLIB) et Annoy, Milvus réunit une variété d’outils puissants au sein d’une plateforme unique tout en étendant leurs fonctionnalités autonomes. Le système a été conçu spécifiquement pour stocker, traiter et analyser de grands jeux de données vectorielles, et peut être utilisé pour créer toutes les applications d’IA (et plus encore) mentionnées ci-dessus.
Vous trouverez plus d’informations sur Milvus sur son site web. Des tutoriels, des instructions pour configurer Milvus, des tests de référence et des informations sur la création de diverses applications sont disponibles dans le bootcamp Milvus. Les développeurs souhaitant contribuer au projet peuvent rejoindre la communauté open source de Milvus sur GitHub.
Jeux de données publics pour l’intelligence artificielle et l’apprentissage automatique
Ce n’est un secret pour personne que les géants de la technologie comme Google et Facebook disposent d’un avantage en matière de données par rapport aux plus petits acteurs, certains experts préconisant même un « mandat progressif de partage des données » qui obligerait les entreprises dépassant une certaine taille à partager certaines données anonymisées avec des concurrents plus petits. Heureusement, il existe des milliers de jeux de données accessibles au public qui peuvent être utilisés pour des projets d’IA/ML :
The People’s Speech Dataset : Ce jeu de données de ML Commons propose le plus grand jeu de données vocales au monde, avec plus de 87 000 heures de parole transcrite dans 59 langues différentes.
UC Irvine Machine Learning Repository : L’Université de Californie à Irvine maintient des centaines de jeux de données publics dans le but d’aider la communauté de l’apprentissage automatique.
Data.gov : Le gouvernement américain propose des centaines de milliers de jeux de données ouverts couvrant l’éducation, le climat, la COVID-19 et bien plus encore.
Eurostat : L’office statistique de l’Union européenne fournit des jeux de données ouverts couvrant une variété de secteurs, de l’économie et la finance à la population et aux conditions sociales.
Harvard Dataverse : The Harvard Dataverse Repository est un référentiel de données gratuit ouvert aux chercheurs de toutes disciplines. De nombreux ensembles de données sont publics, tandis que d’autres sont soumis à des conditions d’utilisation plus restrictives.
Bien que cette liste ne soit en aucun cas exhaustive, elle constitue un bon point de départ pour découvrir la variété étonnamment large d’ensembles de données ouverts. Pour plus d’informations sur les ensembles de données publics ainsi que sur le choix des bonnes données pour votre prochain projet de ML ou de science des données, consultez cet article Medium.
Pour en savoir plus sur la recherche de similarité vectorielle, consultez les ressources suivantes :
Continuer à lire

How to Install and Run OpenClaw (Previously Clawdbot/Moltbot) on Mac
Turn your Mac into an AI gateway for WhatsApp, Telegram, Discord, iMessage, and more — in under 5 minutes.

Zilliz Cloud Enterprise Vector Search Powers High-Performance AI on AWS
Zilliz Cloud on AWS powers secure, scalable, ultra-fast vector search for enterprise AI apps, with BYOC, sub-10ms latency, and zero-DevOps simplicity.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.



