Elevando la experiencia del usuario con recomendaciones de moda basadas en imágenes
El comercio minorista de moda es una industria que evoluciona rápidamente, con preferencias de los consumidores y comportamientos de compra en constante cambio. Para mantenerse competitivas, las marcas deben ofrecer experiencias de compra personalizadas que se adapten a los gustos individuales.
En una charla reciente, Joan Kusuma compartió su enfoque innovador para mejorar la experiencia del comercio minorista de moda utilizando recomendaciones basadas en imágenes. A partir de su experiencia en comercio minorista de moda e IA, Joan demostró cómo las redes neuronales convolucionales (CNNs) y los embeddings visuales pueden utilizarse para crear un sistema personalizado de recomendación de conjuntos.
Este artículo explora los conceptos y la arquitectura, destacando cómo la IA puede transformar la industria de la moda. Comenzaremos explicando los embeddings visuales, que son cruciales para comprender el artículo. Luego, detallaremos cómo Joan creó y almacenó imágenes en una base de datos vectorial como Milvus. Finalmente, describiremos el proceso paso a paso de cómo el modelo genera recomendaciones.
Comprender los embeddings visuales y su papel en un recomendador
Los embeddings visuales son un concepto fundamental en los sistemas de recomendación basados en imágenes. Estos embeddings son representaciones vectoriales (numéricas) de imágenes que capturan las características y rasgos esenciales de los artículos representados.
Al convertir imágenes en embeddings, los modelos de IA pueden analizar y comparar su similitud de manera eficiente. En el ejemplo siguiente, el codificador asigna diferentes valores a varias características de las prendas, como los tres espectros de color (rojo, azul, verde) y diversas características de forma, dependiendo de los atributos específicos de la prenda.
En la presentación de Joan, ella utilizó un modelo de autoencoder de PyTorch para generar embeddings visuales para prendas de vestir. Además, Joan eligió YOLOv5 (You Only Look Once), una red neuronal convolucional, para la detección de objetos en tiempo real. YOLOv5 procesa una imagen completa en una sola pasada, identificando y clasificando objetos con una velocidad y precisión notables. Una vez que generamos embeddings, se almacenan en una base de datos vectorial como Milvus y se utilizan para la recuperación por similitud.
Cómo funcionan los recomendadores con embeddings
Para comprender cómo se utilizan los embeddings visuales en los sistemas de recomendación, desglosaremos el proceso en varios pasos clave:
Preprocesamiento de imágenes: El primer paso consiste en preprocesar las imágenes para garantizar la coherencia en tamaño, resolución y formato. Este paso de preprocesamiento es esencial para mantener la precisión de los embeddings.
Embedding de imágenes (extracción de características): Usando el modelo de autoencoder de Pytorch, el sistema extrae características de las imágenes preprocesadas. Estas características se convierten luego en embeddings almacenados en una base de datos vectorial.
Búsqueda vectorial con bases de datos vectoriales: Las bases de datos vectoriales son una parte crucial del sistema. Almacenan los embeddings de todas las prendas, lo que permite una recuperación rápida y eficiente de artículos similares. Joan experimentó con FAISS, una biblioteca de búsqueda vectorial creada por Facebook.
Indexación: Construir un índice de los embeddings implica organizar los vectores para permitir búsquedas de similitud rápidas y eficientes. Este índice ayuda a navegar por el espacio de alta dimensionalidad para encontrar artículos visualmente similares a una imagen de consulta determinada. El índice elegido por Joan para la base de datos vectorial es el algoritmo de búsqueda de vecinos más cercanos aproximados (ANN).
Modelo de recomendación de imágenes en acción
A continuación se muestra una ilustración de la arquitectura del sistema de búsqueda visual y recomendación que presentó Joan.
El sistema comprende varios pasos clave. Cubrámoslos uno por uno para entender el panorama completo.
Paso 1: El usuario introduce una imagen de ropa
El proceso comienza cuando un usuario sube o selecciona una imagen de una prenda de vestir que le interesa. Esta imagen sirve como consulta para el sistema de recomendación, iniciando la búsqueda de artículos visualmente similares.
Paso 2: Incrustación de imagen (extracción de características)
La imagen subida se convierte en una incrustación visual, una representación numérica de sus características esenciales. Este proceso de incrustación garantiza que podamos comparar la imagen de consulta con las incrustaciones almacenadas previamente en la base de datos vectorial, lo que facilita la búsqueda de artículos similares.
Paso 3: Búsqueda por similitud
La incrustación generada de la imagen de consulta se utiliza para realizar una búsqueda por similitud dentro de la base de datos vectorial. Joan emplea un algoritmo de búsqueda de Vecino Más Cercano Aproximado (ANN) para encontrar eficientemente las incrustaciones en la base de datos que están más cerca de la incrustación de consulta. Este algoritmo identifica rápidamente las imágenes más similares sin una búsqueda exhaustiva.
Paso 4: Motor de recomendación
El motor de recomendación es el componente final del sistema. Filtra y clasifica los resultados de búsqueda en función de criterios adicionales como las preferencias del usuario, las tendencias estacionales y la disponibilidad de inventario. Este paso garantiza que las recomendaciones sean visualmente similares a la imagen de consulta y relevantes y personalizadas, proporcionando una experiencia de compra a medida para el usuario.
Búsqueda de Vecino Más Cercano Aproximado
Un aspecto clave del sistema de recomendación de Joan es utilizar una búsqueda de vecino más cercano aproximado (ANN) dentro de la base de datos vectorial para devolver resultados relevantes de forma rápida y precisa. Los algoritmos de búsqueda ANN encuentran puntos en un espacio de alta dimensión que están más cerca de un punto de consulta dado.
A diferencia de las búsquedas exactas de vecinos más cercanos, que pueden ser costosas computacionalmente, las búsquedas ANN equilibran velocidad y precisión, lo que las hace ideales para conjuntos de datos a gran escala.
En el contexto de las recomendaciones de moda basadas en imágenes, la búsqueda ANN se utiliza para identificar prendas de vestir con incrustaciones similares a la incrustación de la imagen de consulta.
Este proceso implica varios pasos:
Construcción del índice: El primer paso es construir un índice de las incrustaciones almacenadas en la base de datos vectorial. Este índice permite que el sistema navegue eficientemente por el espacio de alta dimensión y localice artículos similares.
Procesamiento de consultas: Cuando un usuario sube una imagen, el sistema genera su incrustación y utiliza el algoritmo de búsqueda ANN para encontrar incrustaciones en el índice más cercanas a la incrustación de consulta.
Clasificación de resultados: Los resultados de búsqueda se clasifican luego en función de las puntuaciones de similitud. Se pueden aplicar criterios adicionales de filtrado y clasificación, como las preferencias del usuario y la disponibilidad de inventario, para refinar aún más las recomendaciones.
Aplicación web de demostración
Joan desarrolló una aplicación web de demostración completamente funcional para mostrar su producto final y su capacidad de recomendación basada en imágenes. La aplicación permite a los usuarios subir imágenes de prendas de vestir y recibir recomendaciones personalizadas en tiempo real.
La aplicación cuenta con una interfaz simple e intuitiva con dos pasos sencillos, lo que facilita a los usuarios subir imágenes y ver recomendaciones. Además, ofrece procesamiento en tiempo real para recomendaciones de imágenes en tiempo real.
Paso 1: Subir imagen de ropa
Paso 2: El modelo devuelve prendas de estilo similar
Conclusión
El trabajo de Joan Kusuma demuestra el potencial de la IA para transformar el comercio minorista de moda. Desarrolló recomendadores que ofrecen sugerencias de conjuntos personalizadas mediante embeddings visuales y bases de datos vectoriales. Al combinar el autoencoder de PyTorch para la extracción de características con YOLOv5 para la detección de objetos en tiempo real y utilizar la velocidad y precisión de la búsqueda aproximada de vecinos más cercanos en bases de datos vectoriales, su sistema garantiza recomendaciones rápidas y precisas.
Joan también mostró su aplicación web de demostración, exhibiendo estas capacidades y proporcionando una plataforma fácil de usar para obtener asesoramiento de moda personalizado en tiempo real. Este enfoque mejora la experiencia de compra del cliente y establece un nuevo estándar para la personalización impulsada por IA, impulsando el crecimiento de los minoristas de moda.
Sigue leyendo

Zilliz Cloud Now Available in AWS Asia Pacific (Seoul)
Zilliz Cloud is now available in AWS Seoul — low-latency vector search, in-country data residency, and one-step migration for Korean AI teams. 31 regions across 5 clouds.

3 Easiest Ways to Use Claude Code on Your Mobile Phone
Run Claude Code from your phone with Remote Control, Happy Coder, or SSH + Tailscale. Comparison table, setup steps, and tools for typing, memory, and parallel tasks.

Vector Databases vs. Key-Value Databases
Use a vector database for AI-powered similarity search; use a key-value database for high-throughput, low-latency simple data lookups.


