Améliorer l’expérience utilisateur grâce aux recommandations de mode basées sur l’image
La vente au détail de mode est un secteur qui évolue rapidement, avec des préférences des consommateurs et des comportements d’achat en constante évolution. Pour rester compétitives, les marques doivent offrir des expériences d’achat personnalisées répondant aux goûts individuels.
Lors d’une récente conférence, Joan Kusuma a partagé son approche innovante pour améliorer l’expérience de vente au détail de mode grâce à des recommandations basées sur l’image. Forte de son expérience dans la vente au détail de mode et l’IA, Joan a démontré comment les réseaux de neurones convolutifs (CNN) et les embeddings visuels peuvent être utilisés pour créer un système de recommandation de tenues personnalisé.
Regarder la conférence de Joan Kusuma
Cet article explore les concepts et l’architecture, en soulignant comment l’IA peut transformer l’industrie de la mode. Nous commencerons par expliquer les embeddings visuels, qui sont essentiels pour comprendre l’article. Ensuite, nous détaillerons comment Joan a construit et stocké des images dans une base de données vectorielle comme Milvus. Enfin, nous décrirons le processus étape par étape par lequel le modèle génère des recommandations.
Comprendre les embeddings visuels et leur rôle dans un système de recommandation
Les embeddings visuels sont un concept fondamental dans les systèmes de recommandation basés sur l’image. Ces embeddings sont des représentations vectorielles (numériques) d’images qui capturent les caractéristiques et attributs essentiels des articles représentés.
En convertissant les images en embeddings, les modèles d’IA peuvent analyser et comparer efficacement leur similarité. Dans l’exemple ci-dessous, l’encodeur attribue différentes valeurs à diverses caractéristiques d’articles vestimentaires, telles que les trois spectres de couleurs (rouge, bleu, vert) et diverses caractéristiques de forme, en fonction des attributs spécifiques du vêtement.
Dans la présentation de Joan, elle a utilisé un modèle d’autoencodeur PyTorch pour générer des embeddings visuels pour les articles vestimentaires. De plus, Joan a choisi YOLOv5 (You Only Look Once), un réseau de neurones convolutif, pour la détection d’objets en temps réel. YOLOv5 traite une image entière en un seul passage, identifiant et classant les objets avec une rapidité et une précision remarquables. Une fois les embeddings générés, ils sont stockés dans une base de données vectorielle comme Milvus et utilisés pour la récupération par similarité.
Comment les systèmes de recommandation fonctionnent avec les embeddings
Pour comprendre comment les embeddings visuels sont utilisés dans les systèmes de recommandation, décomposons le processus en plusieurs étapes clés :
Prétraitement des images : La première étape consiste à prétraiter les images afin d’assurer la cohérence de la taille, de la résolution et du format. Cette étape de prétraitement est essentielle pour maintenir l’exactitude des embeddings.
Embedding d’image (extraction de caractéristiques) : À l’aide du modèle d’autoencodeur Pytorch, le système extrait des caractéristiques des images prétraitées. Ces caractéristiques sont ensuite converties en embeddings stockés dans une base de données vectorielle.
Recherche vectorielle avec des bases de données vectorielles : Les bases de données vectorielles constituent une partie cruciale du système. Elles stockent les embeddings de tous les articles vestimentaires, permettant une récupération rapide et efficace d’articles similaires. Joan a expérimenté avec FAISS, une bibliothèque de recherche vectorielle créée par Facebook.
Indexation : La construction d’un index des embeddings consiste à organiser les vecteurs afin de permettre des recherches de similarité rapides et efficaces. Cet index aide à naviguer dans l’espace de grande dimension pour trouver des articles visuellement similaires à une image de requête donnée. L’index choisi par Joan pour la base de données vectorielle est l’algorithme de recherche Approximate Nearest Neighbor (ANN).
Le modèle de recommandation d’images en action
Ci-dessous se trouve une illustration de l’architecture du système de recherche visuelle et de recommandation présenté par Joan.
Le système comprend plusieurs étapes clés. Examinons-les une par une pour comprendre l’ensemble du processus.
Étape 1 : L’utilisateur fournit une image de vêtement
Le processus commence lorsqu’un utilisateur téléverse ou sélectionne une image d’un article vestimentaire qui l’intéresse. Cette image sert de requête pour le système de recommandation, lançant la recherche d’articles visuellement similaires.
Étape 2 : Embedding d’image (extraction de caractéristiques)
L’image téléversée est convertie en un embedding visuel, une représentation numérique de ses caractéristiques essentielles. Ce processus d’embedding garantit que nous pouvons comparer l’image de requête aux embeddings préenregistrés dans la base de données vectorielle, ce qui facilite la recherche d’articles similaires.
Étape 3 : Recherche de similarité
L’embedding généré de l’image de requête est utilisé pour effectuer une recherche de similarité dans la base de données vectorielle. Joan emploie un algorithme de recherche de voisins les plus proches approximatifs (ANN) pour trouver efficacement les embeddings de la base de données les plus proches de l’embedding de requête. Cet algorithme identifie rapidement les images les plus similaires sans recherche exhaustive.
Étape 4 : Moteur de recommandation
Le moteur de recommandation est le composant final du système. Il filtre et classe les résultats de recherche en fonction de critères supplémentaires tels que les préférences de l’utilisateur, les tendances saisonnières et la disponibilité des stocks. Cette étape garantit que les recommandations sont visuellement similaires à l’image de requête, mais aussi pertinentes et personnalisées, offrant à l’utilisateur une expérience d’achat sur mesure.
Recherche de voisins les plus proches approximatifs
Un aspect clé du système de recommandation de Joan consiste à utiliser une recherche de voisins les plus proches approximatifs (ANN) dans la base de données vectorielle afin de renvoyer des résultats pertinents rapidement et précisément. Les algorithmes de recherche ANN trouvent, dans un espace à haute dimension, les points les plus proches d’un point de requête donné.
Contrairement aux recherches exactes de voisins les plus proches, qui peuvent être coûteuses en calcul, les recherches ANN équilibrent vitesse et précision, ce qui les rend idéales pour les ensembles de données à grande échelle.
Dans le contexte des recommandations de mode basées sur l’image, la recherche ANN est utilisée pour identifier les articles vestimentaires dont les embeddings sont similaires à l’embedding de l’image de requête.
Ce processus comporte plusieurs étapes :
Construction de l’index : La première étape consiste à construire un index des embeddings stockés dans la base de données vectorielle. Cet index permet au système de naviguer efficacement dans l’espace à haute dimension et de localiser des articles similaires.
Traitement de la requête : Lorsqu’un utilisateur téléverse une image, le système génère son embedding et utilise l’algorithme de recherche ANN pour trouver dans l’index les embeddings les plus proches de l’embedding de requête.
Classement des résultats : Les résultats de recherche sont ensuite classés en fonction des scores de similarité. Des critères supplémentaires de filtrage et de classement, tels que les préférences de l’utilisateur et la disponibilité des stocks, peuvent être appliqués pour affiner davantage les recommandations.
Application web de démonstration
Joan a développé une application web de démonstration entièrement fonctionnelle afin de présenter son produit final et sa capacité de recommandation basée sur l’image. L’application permet aux utilisateurs de téléverser des images d’articles vestimentaires et de recevoir des recommandations personnalisées en temps réel.
L’application propose une interface simple et intuitive en deux étapes simples, ce qui permet aux utilisateurs de téléverser facilement des images et de consulter les recommandations. De plus, elle offre un traitement en temps réel pour des recommandations d’images en temps réel.
Étape 1 : Téléverser une image de vêtement
Étape 2 : Le modèle renvoie des articles vestimentaires de style similaire
Conclusion
Le travail de Joan Kusuma démontre le potentiel de l’IA dans la transformation du commerce de détail de la mode. Elle a développé des systèmes de recommandation qui fournissent des suggestions de tenues personnalisées à l’aide d’embeddings visuels et de bases de données vectorielles. En combinant l’autoencodeur de PyTorch pour l’extraction de caractéristiques avec YOLOv5 pour la détection d’objets en temps réel, et en utilisant la rapidité et la précision de la recherche approximative de plus proches voisins dans les bases de données vectorielles, son système garantit des recommandations rapides et précises.
Joan a également présenté son application web de démonstration, mettant en avant ces capacités et offrant une plateforme conviviale pour des conseils de mode personnalisés en temps réel. Cette approche améliore l’expérience d’achat des clients et établit une nouvelle norme pour la personnalisation pilotée par l’IA, stimulant la croissance des détaillants de mode.
Continuer à lire

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.

Bringing AI to Legal Tech: The Role of Vector Databases in Enhancing LLM Guardrails
Discover how vector databases enhance AI reliability in legal tech, ensuring accurate, compliant, and trustworthy AI-powered legal solutions.


