Повышение качества пользовательского опыта с помощью рекомендаций моды на основе изображений
Fashion retail — это быстро развивающаяся индустрия с постоянно меняющимися потребительскими предпочтениями и покупательским поведением. Чтобы оставаться конкурентоспособными, бренды должны предлагать персонализированный покупательский опыт, учитывающий индивидуальные вкусы.
В недавнем выступлении Joan Kusuma поделилась своим инновационным подходом к улучшению опыта fashion retail с помощью рекомендаций на основе изображений. Опираясь на свой опыт в fashion retail и AI, Joan показала, как сверточные нейронные сети (CNN) и визуальные эмбеддинги можно использовать для создания персонализированной системы рекомендаций образов.
Посмотреть выступление Joan Kusuma
В этой статье рассматриваются концепции и архитектура, показывая, как AI может трансформировать индустрию моды. Мы начнем с объяснения визуальных эмбеддингов, которые имеют ключевое значение для понимания статьи. Затем подробно разберем, как Joan создавала и хранила изображения в векторной базе данных, такой как Milvus. Наконец, мы опишем пошаговый процесс того, как модель генерирует рекомендации.
Понимание визуальных эмбеддингов и их роли в рекомендательной системе
Визуальные эмбеддинги — это фундаментальная концепция в рекомендательных системах на основе изображений. Эти эмбеддинги представляют собой векторные (числовые) представления изображений, которые отражают основные признаки и характеристики показанных предметов.
Преобразуя изображения в эмбеддинги, AI-модели могут эффективно анализировать и сравнивать их сходство. В примере ниже энкодер присваивает разные значения различным признакам предметов одежды, таким как три цветовых спектра (Red, Blue, Green) и различные характеристики формы, в зависимости от конкретных атрибутов одежды.
В своей презентации Joan использовала модель автоэнкодера PyTorch для генерации визуальных эмбеддингов предметов одежды. Кроме того, Joan выбрала YOLOv5 (You Only Look Once), сверточную нейронную сеть, для обнаружения объектов в реальном времени. YOLOv5 обрабатывает всё изображение за один проход, идентифицируя и классифицируя объекты с поразительной скоростью и точностью. После генерации эмбеддингов они сохраняются в векторной базе данных, такой как Milvus, и используются для поиска по сходству.
Как рекомендательные системы работают с эмбеддингами
Чтобы понять, как визуальные эмбеддинги используются в рекомендательных системах, давайте разобьем процесс на несколько ключевых шагов:
Предобработка изображений: Первый шаг включает предобработку изображений, чтобы обеспечить согласованность размера, разрешения и формата. Этот этап предобработки необходим для сохранения точности эмбеддингов.
Эмбеддинг изображений (извлечение признаков): Используя модель автоэнкодера Pytorch, система извлекает признаки из предварительно обработанных изображений. Затем эти признаки преобразуются в эмбеддинги, которые хранятся в векторной базе данных.
Векторный поиск с помощью векторных баз данных: Векторные базы данных являются важнейшей частью системы. Они хранят эмбеддинги всех предметов одежды, обеспечивая быстрый и эффективный поиск похожих предметов. Joan экспериментировала с FAISS, библиотекой векторного поиска, созданной Facebook.
Индексирование: Построение индекса эмбеддингов предполагает организацию векторов таким образом, чтобы обеспечить быстрый и эффективный поиск по сходству. Этот индекс помогает ориентироваться в многомерном пространстве, чтобы находить визуально похожие предметы для заданного изображения-запроса. Индекс, выбранный Joan для векторной базы данных, — это алгоритм поиска Approximate Nearest Neighbor (ANN).
Модель рекомендаций изображений в действии
Ниже приведена иллюстрация архитектуры системы визуального поиска и рекомендаций, которую представила Joan.
Система включает несколько ключевых шагов. Давайте рассмотрим их по одному, чтобы понять полную картину.
Шаг 1: Пользователь вводит изображение одежды
Процесс начинается, когда пользователь загружает или выбирает изображение предмета одежды, который его интересует. Это изображение служит запросом для рекомендательной системы, инициируя поиск визуально похожих товаров.
Шаг 2: Встраивание изображения (извлечение признаков)
Загруженное изображение преобразуется в визуальное встраивание — числовое представление его основных признаков. Этот процесс встраивания гарантирует, что мы можем сравнить изображение-запрос с заранее сохраненными встраиваниями в векторной базе данных, что упрощает поиск похожих товаров.
Шаг 3: Поиск по сходству
Сгенерированное встраивание изображения-запроса используется для выполнения поиска по сходству в векторной базе данных. Joan использует алгоритм поиска Approximate Nearest Neighbor (ANN), чтобы эффективно находить встраивания в базе данных, наиболее близкие к встраиванию запроса. Этот алгоритм быстро определяет наиболее похожие изображения без полного перебора.
Шаг 4: Рекомендательный механизм
Рекомендательный механизм является финальным компонентом системы. Он фильтрует и ранжирует результаты поиска на основе дополнительных критериев, таких как предпочтения пользователя, сезонные тренды и наличие товаров на складе. Этот шаг гарантирует, что рекомендации будут визуально похожи на изображение-запрос, а также релевантны и персонализированы, обеспечивая индивидуальный опыт покупок для пользователя.
Поиск Approximate Nearest Neighbor
Ключевым аспектом рекомендательной системы Joan является использование поиска approximate nearest neighbor (ANN) в векторной базе данных для быстрого и точного возврата релевантных результатов. Алгоритмы ANN-поиска находят точки в многомерном пространстве, которые находятся ближе всего к заданной точке запроса.
В отличие от точного поиска ближайших соседей, который может быть вычислительно затратным, ANN-поиск балансирует скорость и точность, что делает его идеальным для крупномасштабных наборов данных.
В контексте модных рекомендаций на основе изображений ANN-поиск используется для выявления предметов одежды с встраиваниями, похожими на встраивание изображения-запроса.
Этот процесс включает несколько шагов:
Построение индекса: Первый шаг — построение индекса встраиваний, хранящихся в векторной базе данных. Этот индекс позволяет системе эффективно перемещаться по многомерному пространству и находить похожие товары.
Обработка запроса: Когда пользователь загружает изображение, система генерирует его встраивание и использует алгоритм ANN-поиска, чтобы найти в индексе встраивания, наиболее близкие к встраиванию запроса.
Ранжирование результатов: Затем результаты поиска ранжируются на основе оценок сходства. Дополнительные критерии фильтрации и ранжирования, такие как предпочтения пользователя и наличие товаров на складе, могут применяться для дальнейшего уточнения рекомендаций.
Веб-демо-приложение
Joan разработала полностью функциональное веб-демо-приложение, чтобы продемонстрировать свой финальный продукт и его возможность рекомендаций на основе изображений. Приложение позволяет пользователям загружать изображения предметов одежды и получать персонализированные рекомендации в реальном времени.
Приложение имеет простой и интуитивно понятный интерфейс с двумя простыми шагами, что позволяет пользователям легко загружать изображения и просматривать рекомендации. Кроме того, оно предлагает обработку в реальном времени для рекомендаций изображений в реальном времени.
Шаг 1: Загрузить изображение одежды
Шаг 2: Модель возвращает предметы одежды в похожем стиле
Заключение
Работа Джоан Кусумы демонстрирует потенциал ИИ в трансформации розничной торговли модной одеждой. Она разработала рекомендательные системы, которые предоставляют персонализированные предложения образов с использованием визуальных эмбеддингов и векторных баз данных. Объединив автоэнкодер PyTorch для извлечения признаков с YOLOv5 для обнаружения объектов в реальном времени и используя скорость и точность приближённого поиска ближайших соседей в векторных базах данных, её система обеспечивает быстрые и точные рекомендации.
Джоан также показала своё демо веб-приложения, демонстрирующее эти возможности и предоставляющее удобную платформу для персонализированных советов по моде в реальном времени. Такой подход улучшает покупательский опыт клиентов и устанавливает новый стандарт персонализации на основе ИИ, стимулируя рост для ритейлеров модной одежды.
Читать далее

Notion's Vector Search Is Excellent. Their Next Problem Is Harder.
Notion solved vector search scaling in two years. The next bottleneck — offline context engineering, unified data, and the real-time/offline gap — is harder.

Introducing Zilliz Cloud Global Cluster: Region-Level Resilience for Mission-Critical AI
Zilliz Cloud Global Cluster delivers multi-region resilience, automatic failover, and fast global AI search with built-in security and compliance.

Why Not All VectorDBs Are Agent-Ready
Explore why choosing the right vector database is critical for scaling AI agents, and why traditional solutions fall short in production.


