Повышение качества пользовательского опыта с помощью рекомендаций моды на основе изображений
Fashion retail — это быстро развивающаяся индустрия с постоянно меняющимися потребительскими предпочтениями и покупательским поведением. Чтобы оставаться конкурентоспособными, бренды должны предлагать персонализированный покупательский опыт, учитывающий индивидуальные вкусы.
В недавнем выступлении Joan Kusuma поделилась своим инновационным подходом к улучшению опыта fashion retail с помощью рекомендаций на основе изображений. Опираясь на свой опыт в fashion retail и AI, Joan показала, как сверточные нейронные сети (CNN) и визуальные эмбеддинги можно использовать для создания персонализированной системы рекомендаций образов.
Посмотреть выступление Joan Kusuma
В этой статье рассматриваются концепции и архитектура, показывая, как AI может трансформировать индустрию моды. Мы начнем с объяснения визуальных эмбеддингов, которые имеют ключевое значение для понимания статьи. Затем подробно разберем, как Joan создавала и хранила изображения в векторной базе данных, такой как Milvus. Наконец, мы опишем пошаговый процесс того, как модель генерирует рекомендации.
Понимание визуальных эмбеддингов и их роли в рекомендательной системе
Визуальные эмбеддинги — это фундаментальная концепция в рекомендательных системах на основе изображений. Эти эмбеддинги представляют собой векторные (числовые) представления изображений, которые отражают основные признаки и характеристики показанных предметов.
Преобразуя изображения в эмбеддинги, AI-модели могут эффективно анализировать и сравнивать их сходство. В примере ниже энкодер присваивает разные значения различным признакам предметов одежды, таким как три цветовых спектра (Red, Blue, Green) и различные характеристики формы, в зависимости от конкретных атрибутов одежды.
В своей презентации Joan использовала модель автоэнкодера PyTorch для генерации визуальных эмбеддингов предметов одежды. Кроме того, Joan выбрала YOLOv5 (You Only Look Once), сверточную нейронную сеть, для обнаружения объектов в реальном времени. YOLOv5 обрабатывает всё изображение за один проход, идентифицируя и классифицируя объекты с поразительной скоростью и точностью. После генерации эмбеддингов они сохраняются в векторной базе данных, такой как Milvus, и используются для поиска по сходству.
Как рекомендательные системы работают с эмбеддингами
Чтобы понять, как визуальные эмбеддинги используются в рекомендательных системах, давайте разобьем процесс на несколько ключевых шагов:
Предобработка изображений: Первый шаг включает предобработку изображений, чтобы обеспечить согласованность размера, разрешения и формата. Этот этап предобработки необходим для сохранения точности эмбеддингов.
Эмбеддинг изображений (извлечение признаков): Используя модель автоэнкодера Pytorch, система извлекает признаки из предварительно обработанных изображений. Затем эти признаки преобразуются в эмбеддинги, которые хранятся в векторной базе данных.
Векторный поиск с помощью векторных баз данных: Векторные базы данных являются важнейшей частью системы. Они хранят эмбеддинги всех предметов одежды, обеспечивая быстрый и эффективный поиск похожих предметов. Joan экспериментировала с FAISS, библиотекой векторного поиска, созданной Facebook.
Индексирование: Построение индекса эмбеддингов предполагает организацию векторов таким образом, чтобы обеспечить быстрый и эффективный поиск по сходству. Этот индекс помогает ориентироваться в многомерном пространстве, чтобы находить визуально похожие предметы для заданного изображения-запроса. Индекс, выбранный Joan для векторной базы данных, — это алгоритм поиска Approximate Nearest Neighbor (ANN).
Модель рекомендаций изображений в действии
Ниже приведена иллюстрация архитектуры системы визуального поиска и рекомендаций, которую представила Joan.
Система включает несколько ключевых шагов. Давайте рассмотрим их по одному, чтобы понять полную картину.
Шаг 1: Пользователь вводит изображение одежды
Процесс начинается, когда пользователь загружает или выбирает изображение предмета одежды, который его интересует. Это изображение служит запросом для рекомендательной системы, инициируя поиск визуально похожих товаров.
Шаг 2: Встраивание изображения (извлечение признаков)
Загруженное изображение преобразуется в визуальное встраивание — числовое представление его основных признаков. Этот процесс встраивания гарантирует, что мы можем сравнить изображение-запрос с заранее сохраненными встраиваниями в векторной базе данных, что упрощает поиск похожих товаров.
Шаг 3: Поиск по сходству
Сгенерированное встраивание изображения-запроса используется для выполнения поиска по сходству в векторной базе данных. Joan использует алгоритм поиска Approximate Nearest Neighbor (ANN), чтобы эффективно находить встраивания в базе данных, наиболее близкие к встраиванию запроса. Этот алгоритм быстро определяет наиболее похожие изображения без полного перебора.
Шаг 4: Рекомендательный механизм
Рекомендательный механизм является финальным компонентом системы. Он фильтрует и ранжирует результаты поиска на основе дополнительных критериев, таких как предпочтения пользователя, сезонные тренды и наличие товаров на складе. Этот шаг гарантирует, что рекомендации будут визуально похожи на изображение-запрос, а также релевантны и персонализированы, обеспечивая индивидуальный опыт покупок для пользователя.
Поиск Approximate Nearest Neighbor
Ключевым аспектом рекомендательной системы Joan является использование поиска approximate nearest neighbor (ANN) в векторной базе данных для быстрого и точного возврата релевантных результатов. Алгоритмы ANN-поиска находят точки в многомерном пространстве, которые находятся ближе всего к заданной точке запроса.
В отличие от точного поиска ближайших соседей, который может быть вычислительно затратным, ANN-поиск балансирует скорость и точность, что делает его идеальным для крупномасштабных наборов данных.
В контексте модных рекомендаций на основе изображений ANN-поиск используется для выявления предметов одежды с встраиваниями, похожими на встраивание изображения-запроса.
Этот процесс включает несколько шагов:
Построение индекса: Первый шаг — построение индекса встраиваний, хранящихся в векторной базе данных. Этот индекс позволяет системе эффективно перемещаться по многомерному пространству и находить похожие товары.
Обработка запроса: Когда пользователь загружает изображение, система генерирует его встраивание и использует алгоритм ANN-поиска, чтобы найти в индексе встраивания, наиболее близкие к встраиванию запроса.
Ранжирование результатов: Затем результаты поиска ранжируются на основе оценок сходства. Дополнительные критерии фильтрации и ранжирования, такие как предпочтения пользователя и наличие товаров на складе, могут применяться для дальнейшего уточнения рекомендаций.
Веб-демо-приложение
Joan разработала полностью функциональное веб-демо-приложение, чтобы продемонстрировать свой финальный продукт и его возможность рекомендаций на основе изображений. Приложение позволяет пользователям загружать изображения предметов одежды и получать персонализированные рекомендации в реальном времени.
Приложение имеет простой и интуитивно понятный интерфейс с двумя простыми шагами, что позволяет пользователям легко загружать изображения и просматривать рекомендации. Кроме того, оно предлагает обработку в реальном времени для рекомендаций изображений в реальном времени.
Шаг 1: Загрузить изображение одежды
Шаг 2: Модель возвращает предметы одежды в похожем стиле
Заключение
Работа Джоан Кусумы демонстрирует потенциал ИИ в трансформации розничной торговли модной одеждой. Она разработала рекомендательные системы, которые предоставляют персонализированные предложения образов с использованием визуальных эмбеддингов и векторных баз данных. Объединив автоэнкодер PyTorch для извлечения признаков с YOLOv5 для обнаружения объектов в реальном времени и используя скорость и точность приближённого поиска ближайших соседей в векторных базах данных, её система обеспечивает быстрые и точные рекомендации.
Джоан также показала своё демо веб-приложения, демонстрирующее эти возможности и предоставляющее удобную платформу для персонализированных советов по моде в реальном времени. Такой подход улучшает покупательский опыт клиентов и устанавливает новый стандарт персонализации на основе ИИ, стимулируя рост для ритейлеров модной одежды.
Читать далее

The Great AI Agent Protocol Race: Function Calling vs. MCP vs. A2A
Compare Function Calling, MCP, and A2A protocols for AI agents. Learn which standard best fits your development needs and future-proof your applications.

Similarity Metrics for Vector Search
Exploring five similarity metrics for vector search: L2 or Euclidean distance, cosine distance, inner product, and hamming distance.

Milvus WebUI: A Visual Management Tool for Your Vector Database
Explore Milvus WebUI to monitor, manage, and optimize your vector database with real-time insights, performance tracking, and system health monitoring.


