Elevando a experiência do usuário com recomendações de moda baseadas em imagens
O varejo de moda é um setor em rápida evolução, com preferências dos consumidores e comportamentos de compra em constante mudança. Para se manterem competitivas, as marcas devem oferecer experiências de compra personalizadas que atendam aos gostos individuais.
Em uma palestra recente, Joan Kusuma compartilhou sua abordagem inovadora para aprimorar a experiência no varejo de moda usando recomendações baseadas em imagens. Com sua experiência em varejo de moda e IA, Joan demonstrou como redes neurais convolucionais (CNNs) e embeddings visuais podem ser utilizados para criar um sistema personalizado de recomendação de looks.
Assista à palestra de Joan Kusuma
Este artigo explora os conceitos e a arquitetura, destacando como a IA pode transformar a indústria da moda. Começaremos explicando os embeddings visuais, que são cruciais para entender o artigo. Em seguida, detalharemos como Joan construiu e armazenou imagens em um banco de dados vetorial como o Milvus. Por fim, descreveremos o processo passo a passo de como o modelo gera recomendações.
Entendendo os embeddings visuais e seu papel em um sistema de recomendação
Embeddings visuais são um conceito fundamental em sistemas de recomendação baseados em imagens. Esses embeddings são representações vetoriais (numéricas) de imagens que capturam os recursos e características essenciais dos itens retratados.
Ao converter imagens em embeddings, os modelos de IA podem analisar e comparar sua similaridade de forma eficiente. No exemplo abaixo, o codificador atribui valores diferentes a vários recursos de itens de vestuário, como os três espectros de cores (vermelho, azul, verde) e várias características de forma, dependendo dos atributos específicos da peça de roupa.
Na apresentação de Joan, ela usou um modelo autoencoder do PyTorch para gerar embeddings visuais para itens de vestuário. Além disso, Joan escolheu o YOLOv5 (You Only Look Once), uma rede neural convolucional, para detecção de objetos em tempo real. O YOLOv5 processa uma imagem inteira em uma única passagem, identificando e classificando objetos com velocidade e precisão notáveis. Depois que geramos embeddings, eles são armazenados em um banco de dados vetorial como o Milvus e usados para recuperação por similaridade.
Como os sistemas de recomendação funcionam com embeddings
Para entender como os embeddings visuais são utilizados em sistemas de recomendação, vamos dividir o processo em várias etapas principais:
Pré-processamento de imagens: A primeira etapa envolve pré-processar as imagens para garantir consistência em tamanho, resolução e formato. Essa etapa de pré-processamento é essencial para manter a precisão dos embeddings.
Embedding de imagens (extração de recursos): Usando o modelo autoencoder do Pytorch, o sistema extrai recursos das imagens pré-processadas. Esses recursos são então convertidos em embeddings armazenados em um banco de dados vetorial.
Busca vetorial com bancos de dados vetoriais: Bancos de dados vetoriais são uma parte crucial do sistema. Eles armazenam os embeddings de todos os itens de vestuário, permitindo a recuperação rápida e eficiente de itens semelhantes. Joan experimentou o FAISS, uma biblioteca de busca vetorial criada pelo Facebook.
Indexação: Construir um índice dos embeddings envolve organizar os vetores para permitir buscas por similaridade rápidas e eficientes. Esse índice ajuda a navegar pelo espaço de alta dimensionalidade para encontrar itens visualmente semelhantes a uma determinada imagem de consulta. O índice escolhido por Joan para o banco de dados vetorial é o algoritmo de busca de vizinho mais próximo aproximado (ANN).
Modelo de recomendação de imagens em ação
Abaixo está uma ilustração da arquitetura do sistema de busca visual e recomendação apresentado por Joan.
O sistema compreende várias etapas principais. Vamos abordá-las uma a uma para entender o panorama completo.
Etapa 1: O usuário insere uma imagem de roupa
O processo começa quando um usuário carrega ou seleciona uma imagem de uma peça de roupa na qual está interessado. Essa imagem serve como a consulta para o sistema de recomendação, iniciando a busca por itens visualmente semelhantes.
Etapa 2: Incorporação da imagem (extração de características)
A imagem carregada é convertida em uma incorporação visual, uma representação numérica de suas características essenciais. Esse processo de incorporação garante que possamos comparar a imagem de consulta com as incorporações pré-armazenadas no banco de dados vetorial, facilitando a busca por itens semelhantes.
Etapa 3: Busca por similaridade
A incorporação gerada da imagem de consulta é usada para realizar uma busca por similaridade dentro do banco de dados vetorial. Joan emprega um algoritmo de busca Approximate Nearest Neighbor (ANN) para encontrar com eficiência as incorporações no banco de dados que estão mais próximas da incorporação de consulta. Esse algoritmo identifica rapidamente as imagens mais semelhantes sem uma busca exaustiva.
Etapa 4: Mecanismo de recomendação
O mecanismo de recomendação é o componente final do sistema. Ele filtra e classifica os resultados da busca com base em critérios adicionais, como preferências do usuário, tendências sazonais e disponibilidade em estoque. Essa etapa garante que as recomendações sejam visualmente semelhantes à imagem de consulta, além de relevantes e personalizadas, proporcionando uma experiência de compra sob medida para o usuário.
Busca aproximada pelo vizinho mais próximo
Um aspecto fundamental do sistema de recomendação de Joan é usar uma busca aproximada pelo vizinho mais próximo (ANN) dentro do banco de dados vetorial para retornar resultados relevantes de forma rápida e precisa. Algoritmos de busca ANN encontram pontos em um espaço de alta dimensão que estão mais próximos de um determinado ponto de consulta.
Ao contrário das buscas exatas pelo vizinho mais próximo, que podem ser computacionalmente caras, as buscas ANN equilibram velocidade e precisão, tornando-as ideais para conjuntos de dados em larga escala.
No contexto de recomendações de moda baseadas em imagem, a busca ANN é usada para identificar peças de roupa com incorporações semelhantes à incorporação da imagem de consulta.
Esse processo envolve várias etapas:
Construção do índice: A primeira etapa é construir um índice das incorporações armazenadas no banco de dados vetorial. Esse índice permite que o sistema navegue com eficiência pelo espaço de alta dimensão e localize itens semelhantes.
Processamento da consulta: Quando um usuário carrega uma imagem, o sistema gera sua incorporação e usa o algoritmo de busca ANN para encontrar incorporações no índice mais próximas da incorporação de consulta.
Classificação dos resultados: Os resultados da busca são então classificados com base nas pontuações de similaridade. Critérios adicionais de filtragem e classificação, como preferências do usuário e disponibilidade em estoque, podem ser aplicados para refinar ainda mais as recomendações.
Aplicativo de demonstração web
Joan desenvolveu um aplicativo de demonstração web totalmente funcional para apresentar seu produto final e sua capacidade de recomendação baseada em imagem. O aplicativo permite que os usuários carreguem imagens de peças de roupa e recebam recomendações personalizadas em tempo real.
O aplicativo apresenta uma interface simples e intuitiva com duas etapas simples, facilitando para os usuários carregar imagens e visualizar recomendações. Além disso, oferece processamento em tempo real para recomendações de imagens em tempo real.
Etapa 1: Carregar imagem de roupa
Etapa 2: O modelo retorna peças de roupa com estilo semelhante
Conclusão
O trabalho de Joan Kusuma demonstra o potencial da IA na transformação do varejo de moda. Ela desenvolveu sistemas de recomendação que oferecem sugestões de looks personalizadas usando embeddings visuais e bancos de dados vetoriais. Ao combinar o autoencoder do PyTorch para extração de características com o YOLOv5 para detecção de objetos em tempo real e utilizar a velocidade e a precisão da busca aproximada por vizinhos mais próximos em bancos de dados vetoriais, seu sistema garante recomendações rápidas e precisas.
Joan também apresentou seu aplicativo web de demonstração, exibindo esses recursos e oferecendo uma plataforma fácil de usar para aconselhamento de moda personalizado e em tempo real. Essa abordagem aprimora a experiência de compra do cliente e estabelece um novo padrão para a personalização orientada por IA, impulsionando o crescimento dos varejistas de moda.
Continue lendo

How Zilliz Ended Up at the Center of NVIDIA’s Unstructured Data Story at GTC 2026
If unstructured data is the context of AI, then the ceiling of AI applications will be set not just by models, but by how mature the infrastructure for unstructured data becomes.

Introducing Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud
We're announcing the general availability of Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud.

Migrating from S3 Vectors to Zilliz Cloud: Unlocking the Power of Tiered Storage
Learn how Zilliz Cloud bridges cost and performance with tiered storage and enterprise-grade features, and how to migrate data from AWS S3 Vectors to Zilliz Cloud.


