이미지와 텍스트를 함께 결합하기: 멀티모달 검색이 검색을 혁신하는 방식
멀티모달 모델의 부상
2024년 대규모 언어 모델 (LLMs)의 빠른 발전을 되돌아보면, AI가 증가하는 혁신과 투자를 통해 계속 발전하고 있음이 분명합니다. 풍부한 텍스트 데이터가 제공되고 있지만, 연구자들은 인간이 여러 감각을 통해 세상을 이해한다는 점을 인식했고, 이에 따라 이미지, 오디오, 비디오와 같은 다른 데이터 유형을 활용하는 방향으로 전환이 이루어졌습니다. 이러한 변화는 여러 소스의 데이터를 처리하고 이해할 수 있는 멀티모달 AI 모델의 부상을 이끌었으며, 이를 통해 정보를 더 풍부하고 복잡하게 해석할 수 있게 되었습니다.
2024년 상반기에는 OpenAI의 GPT-4o, Anthropic의 Claude 3, Google의 Gemini 1.5 Pro, Apple의 Ferret-UI와 같은 중요한 멀티모달 모델 출시를 목격했습니다. 이러한 모델은 AI의 역량을 텍스트 너머로 확장하여 창작 산업, 생산성 도구, 더 상호작용적인 시스템에서 새로운 애플리케이션을 열어주고 있습니다. 한때 틈새 학술 개념이었던 것이 이제는 주류가 되었으며, 개발자들은 이러한 API를 활용해 AI를 다양한 미디어와 통합하는 애플리케이션을 구축하고, 혁신의 새로운 가능성을 열고 있습니다.
OpenAI 과학자들이 새롭게 출시한 GPT-40의 멀티모달 기능을 보여주는 모습.png
그림: OpenAI 과학자들이 새롭게 출시한 GPT-40의 멀티모달 기능을 보여주는 모습
멀티모달 검색과 구성 이미지 검색(CIR)
멀티모달 모델이 발전함에 따라, 일반적으로 텍스트와 이미지를 비롯한 여러 모달리티의 입력을 결합하는 멀티모달 검색이 점점 더 인기를 얻고 있습니다. 이 접근 방식은 두 모달리티의 강점을 활용하여 사용자의 검색 의도를 더 섬세하고 정확하게 포착할 수 있게 합니다.
멀티모달 검색에서 가장 일반적인 작업 중 하나는 구성 이미지 검색(Composed Image Retrieval, CIR)으로, 사용자가 참조 이미지와 설명 캡션을 함께 포함한 쿼리를 제공합니다. 이 이중 입력 접근 방식은 시각적 콘텐츠와 텍스트 지시를 결합하여 특정 이미지를 검색할 수 있게 하며, 더 상세하고 정확한 쿼리를 만들어냅니다.
전통적인 이미지 검색은 주로 시각적 유사도 지표에 의존하며, 이는 많은 범용 쿼리에 효과적입니다. 그러나 단일 참조 이미지가 사용자의 의도를 완전히 표현하지 못하는 경우에는 텍스트 입력이 필수적인 보완 요소가 됩니다. 텍스트는 이미지 단독으로는 부족할 수 있는 맥락과 정확성을 더해 사용자가 검색 쿼리를 세밀하게 조정할 수 있게 합니다. 이러한 모달리티의 융합은 개발자가 더 견고하고 유연한 검색 시스템을 만들 수 있게 하며, 사용자가 복잡한 쿼리를 자연스럽고 더 높은 정확도로 표현할 수 있도록 합니다.
다음 섹션에서는 구성 이미지 검색의 주요 모델과 기법, 그 방법론, 그리고 FashionIQ, CIRR, CIRCO와 같은 인기 데이터셋을 사용해 평가한 다양한 도메인에서의 성능을 살펴보겠습니다. 이러한 평가는 실제 애플리케이션에서 다양한 CIR 접근 방식의 강점과 한계를 부각할 것입니다.
인기 있는 구성 이미지 검색 방법 개요
최근 몇 년 동안 멀티모달 검색 기법은 제로샷 범용성을 향해 발전해 왔으며, 특히 두 모달리티에 대해 공유 임베딩 공간을 사용하여 강력한 텍스트-이미지 검색을 가능하게 하는 CLIP과 같은 모델이 대표적입니다. 이러한 기법은 사용 가능한 리소스에 따라 사전 학습된 임베딩 또는 미세 조정된 주석 데이터셋을 활용하여 검색 성능과 데이터 품질을 크게 향상시킵니다.
다음 표는 인기 있는 합성 이미지 검색(CIR) 기법, 핵심 방법론, 그리고 검색을 위해 생성하고 사용하는 임베딩 유형에 대한 개요를 제공합니다:
| 기법 | 설명 | 생성된 임베딩 | 검색 임베딩 |
| Pic2Word | 이미지를 텍스트 내에 포함된 토큰으로 변환하여 유연한 이미지-텍스트 검색을 가능하게 합니다. | CLIP Text Embedding | CLIP Visual Embedding |
| CompoDiff | CLIP 시각 임베딩에 노이즈를 적용한 다음, 디노이징 과정에서 텍스트를 사용해 조건부 CLIP 시각 임베딩을 재구성합니다. | CLIP Visual Embedding | CLIP Visual Embedding |
| CIReVL | 이미지를 설명 텍스트로 변환하고, 대상과 일치하도록 설명을 수정한 뒤, 새로운 표현을 생성합니다. | CLIP Text Embedding | CLIP Visual Embedding |
| MagicLens | 이미지와 텍스트 데이터를 동시에 처리하는 Transformer 모델을 사용하여 통합 벡터 임베딩을 생성합니다. | MagicLens Embedding | MagicLens Embedding |
Pic2Word: 제로샷 합성 이미지 검색을 위한 그림을 단어로 매핑하기
Pic2Word는 대규모 레이블링 데이터셋 없이도 이미지와 텍스트를 입력 쿼리로 사용해 이미지를 검색하는 것을 목표로 하는 제로샷 합성 이미지 검색(ZS-CIR) 방법입니다. 사전 학습된 CLIP 모델을 사용하여 Pic2Word는 이미지의 시각 임베딩을 텍스트 공간에서 이미지를 나타내는 의사 단어 토큰으로 매핑합니다. 이를 통해 모델은 이미지 특징을 텍스트 설명과 결합하여 텍스트에 지정된 수정 사항(예: 객체의 색상과 같은 이미지 속성 변경)에 기반해 대상 이미지를 검색할 수 있습니다.
Left-the process of training the Pic2word mapping network; Right-the process of composed image retrieval..png
그림: 왼쪽: Pic2word 매핑 네트워크의 학습 과정; 오른쪽: 합성 이미지 검색 과정.
Pic2Word 작동 방식
위 이미지는 Pic2Word 매핑 네트워크의 학습과 합성 이미지 검색 과정을 보여줍니다. 학습 과정에서 이미지(예: 고양이 사진)는 동결된 Visual Encoder를 통과하여 시각 임베딩 를 생성합니다. 동시에 "A photo of"와 같은 토큰화된 텍스트 프롬프트는 Text Encoder를 통과하여 해당 텍스트 임베딩 를 생성합니다. 매핑 네트워크 의 목표는 이미지 임베딩 를 텍스트 프롬프트에 통합될 수 있는 의사 토큰 로 매핑하여 "A photo of [s]."라는 구문을 형성하는 것입니다.
이 매핑된 토큰은 동결된 Text Encoder를 통과할 때 원본 이미지 임베딩 와 밀접하게 정렬되는 텍스트 임베딩 를 생성해야 합니다. 네트워크는 대조 손실 함수를 사용해 학습되며, 이는 시각 임베딩 와 텍스트 임베딩 사이의 거리를 최소화하여 이미지가 단어와 유사한 토큰으로 정확하게 표현되도록 보장합니다.
매핑 네트워크가 학습되면 합성 이미지 검색 작업에 사용할 수 있습니다. 이 단계에서 사용자는 이미지(예: 개)와 텍스트 쿼리(예: "in a pool")를 입력합니다. 이미지는 Visual Encoder를 통해 처리되고, 텍스트는 Text Encoder를 통해 처리됩니다. 학습된 의사 토큰은 쿼리를 향상시켜 시스템이 이미지와 텍스트의 구성을 이해할 수 있게 합니다.
이미지와 텍스트 표현을 결합한 쿼리 특징은 후보 이미지 데이터베이스와 비교됩니다. 그런 다음 시스템은 가장 잘 일치하는 이미지(예: 수영장에서 수영하는 개)를 검색하여, 제공된 텍스트 설명을 기반으로 입력 이미지를 효과적으로 수정합니다.
CompoDiff: 잠재 확산을 활용한 다목적 합성 이미지 검색
CompoDiff 는 제로샷 합성 이미지 검색(ZS-CIR)을 위해 설계된 확산 기반 모델입니다. 이는 텍스트-이미지 생성의 기술인 확산 모델을 사용하여 이미지 편집 및 검색의 유연성과 정밀도를 크게 향상시킵니다. 이러한 모델은 단순히 텍스트를 참조하는 것을 넘어, 생성된 이미지가 학습 중 관찰된 패턴과 일치하도록 보장합니다. 확산 모델을 사용함으로써 CompoDiff는 입력 텍스트, 참조 이미지, 마스크를 병합하는 임베딩을 생성하여 CLIP 시각 임베딩 분포와 일치하는 벡터를 생성합니다.
그렇다면 확산 모델의 메커니즘은 어떻게 이해할 수 있을까요? 시간이 지남에 따라 점점 더 노이즈가 많아지는 사진을 생각해 보세요. 선명하고 또렷한 사진으로 시작한 다음, 오래된 TV의 정전기 화면과 비슷하게 무작위 노이즈를 점진적으로 추가한다고 상상해 보세요. 이미지는 점점 더 흐려져 거의 알아볼 수 없게 되고, 순수한 노이즈처럼 보이는 것으로 변합니다. 이것이 순방향 확산 과정입니다.
하지만 더 흥미로운 부분은 역방향 과정입니다. 확산 모델의 목표는 그 노이즈가 많은 이미지에서 시작하여 단계별로 천천히 "노이즈를 제거"하는 것입니다. 모델이 노이즈를 제거하면서 원본 이미지를 재구성합니다(또는 텍스트 프롬프트를 기반으로 새 이미지를 생성합니다). 이 과정을 통해 모델은 특정 텍스트 설명이나 참조 이미지와 같은 특정 조건을 따르는 고품질 이미지를 생성할 수 있습니다.
텍스트를 임베딩할 때도 동일한 방식으로 작동합니다. CompoDiff는 가우시안 노이즈 임베딩의 노이즈를 점진적으로 제거하여 CLIP 시각 임베딩의 신호 대 잡음비와 일치할 때까지 이를 향상시킵니다. 텍스트와 이미지는 이 변환을 제어하며, 마스크는 수정할 이미지 영역에 대한 추가 지침을 제공합니다.
How CompoDiff Works.png
그림: CompoDiff 작동 방식
CompoDiff의 추론 과정
CompoDiff의 추론 단계에서는 그림에 나타난 것처럼, 과정이 입력 이미지(예: 에펠탑)로 시작되며, 이 이미지는 CLIP Image Encoder를 통해 잠재 공간으로 인코딩되어 초기 시각 임베딩 을 생성합니다. 이 임베딩은 순방향 확산 과정을 거치며, 여기에 노이즈가 추가되어 더 노이즈가 많은 버전인 으로 변환되며, 이는 원본 이미지의 열화된 버전을 나타냅니다.
다음으로 Denoising Transformer가 적용되어 여러 단계( 회 반복)에서 노이즈를 점진적으로 제거하여 더 깨끗한 이미지 임베딩을 복원합니다. 노이즈 제거 과정은 이미지가 어떻게 재구성되어야 하는지에 영향을 미치는 조건에 의해 안내됩니다. 이러한 조건에는 다음이 포함됩니다:
텍스트 조건 : 이 경우 텍스트 프롬프트 "Balloon"은 Text Encoder(CLIP 또는 T5와 같은 기타 텍스트 모델)를 통해 인코딩되어 텍스트 임베딩 를 생성합니다. 이 임베딩은 노이즈 제거 과정에 문맥적 가이드를 추가하여 최종 이미지가 "Balloon"의 설명과 일치하도록 보장합니다.
마스크 조건 : 마스크가 제공되면 다층 퍼셉트론(MLP)을 통해 처리되어 마스크 임베딩 을 생성하며, 이는 이미지의 특정 영역, 예를 들어 특정 영역에서 풍선과 같은 요소를 수정하거나 추가하는 데 디노이징이 집중되도록 안내합니다.
텍스트 및 마스크 조건은 노이즈가 있는 시각 임베딩과 결합되어 디노이징 트랜스포머를 통과하며, 이 트랜스포머는 Classifier-Free Guidance (CFG)를 사용해 이러한 조건들의 강도를 조정합니다. 마스크나 조건이 제공되지 않으면 원활한 동작을 보장하기 위해 기본 영벡터가 사용됩니다.
특히, 이 과정에서는 출력을 정제하기 위해 부정 텍스트 조건도 도입됩니다. 예를 들어, "multiple balloons"와 같은 부정 조건을 적용하여 두 개 이상의 풍선이 생성되는 것을 방지함으로써, 최종 이미지가 에펠탑 근처의 단일 풍선을 반영하도록 할 수 있습니다.
여러 번의 디노이징 반복 후, 결과 이미지 임베딩은 CLIP 시각 특징과 정렬되며, 그런 다음 검색 데이터베이스와 비교되어 가장 잘 일치하는 이미지를 찾거나 생성합니다. 이 경우에는 하늘에 풍선이 있는 에펠탑 이미지가 됩니다.
CompoDiff의 학습 과정
학습은 두 단계로 진행됩니다:
CompoDiff’s Training Process.png
그림: CompoDiff의 학습 과정
****
1단계: LAION-2B로 학습
첫 번째 단계에서는 이미지-텍스트 쌍의 대규모 컬렉션을 포함하는 LAION-2B 데이터셋으로 모델을 학습합니다. 이 단계의 주요 목표는 텍스트 설명을 지침으로 사용하여 노이즈가 있는 입력으로부터 CLIP 시각 임베딩을 생성하는 방법을 학습하는 것입니다.
과정은 이미지(예: 새)를 CLIP 시각 임베딩 로 인코딩하는 것에서 시작됩니다. 이 임베딩은 확산 과정을 거치며, 여러 단계에 걸쳐 노이즈가 점진적으로 추가되어 식별 가능한 정보가 거의 없거나 전혀 없는 매우 노이즈가 많은 버전 가 됩니다. 동시에, "A chickadee sitting on a wooden surface next to flowers,"와 같은 해당 텍스트 설명은 CLIP 텍스트 임베딩 로 인코딩됩니다. 그런 다음 노이즈가 있는 시각 임베딩과 텍스트 임베딩은 디노이징 트랜스포머에 입력되며, 이 트랜스포머는 텍스트의 안내를 받아 단계적으로 노이즈를 제거합니다. 트랜스포머는 이미지의 깨끗한 시각 임베딩을 점진적으로 재구성하는 것을 목표로 합니다. 이 단계의 목적은 텍스트를 안내 기준으로 사용하여 노이즈가 있는 시각 임베딩과 재구성된 임베딩 간의 차이를 최소화하는 것입니다. 이를 통해 모델은 시각 정보와 텍스트 정보를 정렬하는 법을 배우며, 생성된 이미지 특징이 텍스트 설명과 일치하도록 보장합니다.
2단계: SynthTriplets18M 데이터셋에서 파인튜닝
2단계에서는 모델을 LAION-2B와 합성 SynthTriplet18M 데이터셋 모두에서 파인튜닝하여, 더 복잡한 시나리오를 처리하는 능력을 향상시킵니다.
이 단계에서 모델은 텍스트 설명뿐만 아니라 수정할 영역을 나타내는 참조 이미지와 마스크 조건을 통합하여 특정 이미지를 생성하는 법을 학습합니다. 학습은 1단계와 마찬가지로 입력 이미지를 인코딩하는 것에서 시작하지만, 이제 참조 이미지도 제공되어 자체 시각 임베딩으로 인코딩됩니다. 참조 이미지는 모델이 입력 이미지를 수정하도록 안내합니다. 또한 마스크 조건이 도입되어 이미지에서 수정이 필요한 특정 영역을 강조합니다. 마스크는 MLP(다층 퍼셉트론)를 사용하여 임베딩으로 처리되며, 텍스트 임베딩(예: "Change the chickadee to a rooster")과 함께 작동하여 디노이징 과정을 안내합니다.
모델은 두 가지 목표를 번갈아 수행합니다. 하나는 텍스트와 마스크 조건을 기반으로 대상 이미지의 특정 영역을 가리는 방법을 학습하는 것이고, 다른 하나는 제공된 참조, 마스크, 텍스트를 기반으로 입력 이미지를 대상 이미지로 변환하는 능력을 개선하는 것입니다. 이러한 교대 학습 과정을 통해 모델은 시각 정보와 텍스트 정보를 결합하여 이미지를 정확하고 유연하게 수정하는 방법을 학습합니다. 이 두 단계를 마치면 CompoDiff는 복잡한 composed image retrieval 작업을 처리할 수 있게 되며, 여러 조건을 기반으로 이미지가 생성되고 수정되는 방식을 세밀하게 제어할 수 있습니다. 이를 통해 모델은 상세한 텍스트 지침에 부합하고, 참조 이미지의 특징을 통합하며, 특정 영역을 선택적으로 수정하는 이미지를 생성할 수 있습니다.
CIReVL: Training-Free Compositional Image Retrieval을 위한 Vision-by-Language
대부분의 compositional image retrieval(CIR) 모델은 주석이 달린 데이터셋과 작업별 모델 학습에 의존하는데, 이는 비용이 많이 들고 과적합이 발생하기 쉽습니다. 이는 모델이 학습 분포와 다른 이미지를 접했을 때 성능이 저하되는 경향이 있음을 의미합니다. 이러한 문제는 입력의 다양성이 방대하고 예측 불가능할 수 있는 실제 애플리케이션에서 특히 문제가 됩니다. 대규모 언어 모델(LLMs)과 비전-언어 모델(VLMs) 같은 대규모 모델의 발전과 함께, 모델이 명시적으로 학습되지 않은 작업을 수행하는 zero-shot learning 패러다임이 큰 주목을 받고 있습니다. CIReVL은 추가 학습 없이도 강력한 성능을 달성하는 대표적인 zero-shot CIR 모델입니다.
How CIReVL works.png
그림: CIReVL 작동 방식
더 구체적으로, CIReVL(Compositional Image Retrieval through Vision-by-Language)은 VLMs 및 LLMs와 같은 기존의 사전 학습된 모델을 활용하는 compositional image retrieval을 위한 학습이 필요 없는 접근 방식입니다. 그 목표는 query image와 textual modifier(예: "사람이 없고 밤의 에펠탑")를 결합하여 데이터베이스에서 대상 이미지를 검색하는 것입니다. CIReVL이 돋보이는 점은 지도 학습의 필요성을 완전히 우회할 수 있어 CIR 작업에 더 유연하고 효율적인 솔루션을 제공한다는 것입니다.
이 방법은 각각 강력한 일반화 능력을 갖춘 세 가지 핵심 구성 요소를 기반으로 합니다. 첫째, 비전-언어 모델(예: BLIP2)이 입력 이미지에 대한 설명 캡션을 생성합니다. 둘째, 대규모 언어 모델(예: GPT-3.5 또는 GPT-4)이 제공된 텍스트 지침(예: "사람을 제거하고 시간을 밤으로 변경")을 기반으로 캡션을 수정합니다. 마지막으로, 수정된 캡션은 CLIP과 같은 텍스트-이미지 인코더를 사용해 텍스트 임베딩으로 변환되며, 이를 통해 데이터베이스에서 실제 이미지 검색이 수행됩니다. 이 과정은 매우 모듈식이며 순수하게 언어 도메인에서 작동하므로 더 직관적인 제어와 사용자 개입이 가능합니다. 이러한 간단한 파이프라인은 CIReVL을 확장 가능하고 적응성 있게 만듭니다.
MagicLens: 개방형 지침을 활용한 Self-Supervised Image Retrieval
이전 방법들을 되돌아보면, Composed Image Retrieval (CIR)에서 가장 큰 과제 중 하나는 다양한 맥락에서 잘 일반화되는 모델을 학습시키기 위해 고품질의 실제 데이터를 수집하고 주석을 다는 것임을 알 수 있습니다. 모델은 복잡한 이미지 관계를 이해해야 하지만, 이러한 유형의 학습에 필요한 데이터는 종종 비용이 많이 들고 확보하기 어렵습니다. 이 문제를 해결하기 위해 DeepMind와 Ohio State University 연구진은 open-ended instructions를 사용하는 self-supervised image retrieval 모델인 MagicLens를 소개했습니다. 핵심 혁신은 전통적인 시각적 유사성을 넘어 더 미묘한 의미적 관계를 기반으로 이미지를 검색할 수 있는 능력에 있습니다.
MagicLens는 CLIP이나 CoCa와 같은 사전 학습된 비전-언어 모델(VLM)과 PaLM2와 같은 대규모 언어 모델(LLM)을 기반으로 합니다. 이러한 결합을 통해 MagicLens는 복잡한 검색 쿼리를 처리할 수 있으며, 사용자는 이미지와 유연한 텍스트 프롬프트(예: "다른 각도에서" 또는 "내부 모습")를 입력하여 시각적 콘텐츠와 의미적 관계 모두에 부합하는 이미지를 검색할 수 있습니다.
이 모델은 동일한 웹 페이지의 이미지들이 객체의 다른 모습이나 객체 간 상호작용과 같은 암묵적 관계를 공유하는 경우가 많다는 통찰을 활용합니다. MagicLens는 웹 페이지에서 이러한 이미지 쌍을 마이닝하고, 이를 사용해 방대한 학습 트리플릿 데이터셋을 생성합니다. 각 트리플릿은 쿼리 이미지, 텍스트 지시문, 타깃 이미지로 구성됩니다. 이러한 트리플릿은 MagicLens의 자기 지도 학습 과정의 기반을 제공하며, 모델은 제공된 지시문을 바탕으로 이미지들을 연결하는 방법을 학습합니다.
Magiclends 작동 방식.png
그림: Magiclends 작동 방식
이러한 트리플릿을 수집하고 큐레이션하기 위해 MagicLens는 정교한 데이터 파이프라인을 사용합니다:
웹 페이지: 이미지들은 동일한 URL에서 수집되며, 서로 관련되어 있을 가능성이 높다는 가정에 기반합니다. 이를 통해 모델은 Common Crawl에서 방대한 양의 데이터를 수집할 수 있습니다.
그룹화 및 정제: 수집된 이미지들은 URL별로 그룹화된 다음, 저해상도, 중복 또는 관련 없는(예: 광고) 이미지를 제거하도록 필터링됩니다.
메타데이터 확장: 이해도를 높이기 위해 각 이미지에 대한 메타데이터가 생성됩니다. 이 메타데이터에는 다음이 포함됩니다:
기본 객체 식별을 위한 ICA 레이블(Google Vision API를 통해 생성).
Alt-text(웹 페이지의 대체 텍스트 설명).
Google의 PaLI 모델을 사용해 생성된 캡션.
점수화 및 필터링: CLIP의 이미지-이미지 및 텍스트-텍스트 점수화를 사용해 MagicLens는 약하게 관련된 이미지 쌍을 추가로 걸러내며, 고품질 쌍만 남도록 보장합니다.
지시문 생성: 쌍을 이룬 이미지들의 메타데이터를 기반으로 Google의 PaLM2는 쿼리 이미지와 타깃 이미지 간의 관계를 설명하는 개방형 텍스트 지시문을 생성합니다.
데이터 파이프라인.png
그림: 데이터 파이프라인
이 파이프라인을 통해 MagicLens는 3,670만 개의 트리플릿(참조 이미지, 텍스트 지시문, 타깃 이미지) 데이터셋을 생성하며, 이는 모델 학습의 기반을 제공합니다. 이 방대한 데이터셋 덕분에 MagicLens는 수동 주석 없이도 효과적으로 학습할 수 있으며, 다양한 검색 작업 전반에서 견고한 모델로 이어집니다.
합성 이미지 검색(CIR) 모델 평가
합성 이미지 검색(CIR) 모델의 성능을 평가하기 위해 FashionIQ, CIRR, CIRCO를 포함한 여러 벤치마크 데이터셋이 일반적으로 사용됩니다. 이러한 데이터셋은 패션 이미지 검색부터 자연 이미지 검색에 이르기까지 다양한 검색 작업을 포괄하므로, 여러 도메인에서 다양한 모델을 평가하는 데 이상적입니다.
FashionIQ는 세밀한 패션 이미지 검색에 초점을 맞추며, 특정 의류 품목(예: 드레스, 셔츠 등)과 관련된 작업을 포함합니다. 2005개의 쿼리와 5179개의 인덱스 이미지를 포함합니다.
CIRR은 실제 이미지에 중점을 두며, 광범위한 이미지 관계(예: 공간적 또는 구성적 변화)를 다룹니다. 4148개의 쿼리와 2316개의 인덱스 이미지를 보유합니다.
CIRCO는 120,000개 이상의 자연 이미지를 포함하는 대규모 데이터셋으로, 각 쿼리는 여러 개의 올바른 타깃 이미지를 가질 수 있습니다.
CIR 벤치마크에서의 모델 성능
다음 표는 이러한 데이터셋에서 여러 주요 CIR 모델의 성능을 강조합니다. 모델은 FashionIQ와 CIRR의 Recall@10 (R@10), CIRCO의 Mean Average Precision at 5 (mAP@5)와 같은 다양한 지표를 사용해 평가됩니다. 이러한 지표는 모델이 시각적 입력과 텍스트 지시의 조합을 기반으로 관련 이미지를 얼마나 잘 검색할 수 있는지 평가합니다.
| Publication | Params | Fashion IQ R@10 | CIRR R@1 | CIRCO mAP@5 | |
| Pic2Word | CVPR 2023 | 429M | 24.7 | 23.9 | 8.7 |
| CompoDiff | CVPRW 2024 | 568M | 36.0 | 18.2 | 12.6 |
| CIReVL | ICLR 2024 | 12.5B | 28.6 | 24.6 | 18.6 |
| MagicLens-L | ICML 2024 | 613M | 38.0 | 33.3 | 34.1 |
주요 인사이트:
FashionIQ 성능: MagicLens-L은 Recall@10 38.0으로 다른 모델을 능가하며, 패션 검색 작업에서의 효과를 보여줍니다. CompoDiff는 36.0으로 근소하게 뒤따르며, 패션 관련 CIR에서의 강점을 보여줍니다.
CIRR 성능: MagicLens-L은 CIRR에서도 Recall@1 33.3을 달성하며 선두를 차지하고, 이는 다른 모델보다 현저히 높습니다. CIReVL은 24.6으로 견고한 성능을 보이며, 실제 이미지 검색에서의 역량을 입증합니다.
CIRCO 성능: MagicLens-L은 대규모 자연 이미지 검색 작업에서도 mean Average Precision at 5 (mAP@5) 34.1로 돋보이며, 다른 모델들을 크게 앞섭니다. 이는 여러 개의 정답 타깃이 있는 복잡한 대규모 데이터셋을 처리하는 데 강점이 있음을 보여줍니다.
전반적으로 MagicLens-L은 모든 데이터셋에서 최고의 전반적 성능을 보이며, CIReVL에 비해 더 적은 파라미터를 가지고 있음에도 패션 및 대규모 자연 이미지 검색 작업 모두에서 특히 뛰어난 성과를 나타냅니다.
요약
이 글에서는 검색 의도를 더 유연하고 정확하게 포착할 수 있는 방법을 제공하기 위해 텍스트, 이미지 및 기타 여러 데이터 유형의 검색을 결합하는 멀티모달 검색 방법의 채택 증가에 대해 살펴보았습니다. 이 분야의 일반적인 작업은 composed image retrieval (CIR)로, 사용자가 참조 이미지와 함께 텍스트 설명을 사용하여 이미지 검색을 세분화하는 방식입니다.
CIR을 이끄는 주요 모델과 기술로 Pic2Word, CompoDiff, CIReVL, MagicLens를 다루었습니다. 이들 각각은 CLIP의 기반 역량 위에 구축되며, 검색을 개선하기 위해 서로 다른 접근 방식을 채택합니다.
Pic2Word는 이미지를 텍스트 기반 검색에 삽입된 텍스트 토큰으로 변환하여, CLIP 텍스트 임베딩을 활용해 매우 다재다능한 텍스트 기반 이미지 검색을 가능하게 합니다.
CompoDiff는 텍스트 유도 노이즈 제거를 사용하여 텍스트 입력으로 노이즈가 있는 시각 임베딩을 정제하고, image embeddings를 조건부로 재구성함으로써 검색 정밀도를 향상시킵니다.
CIReVL은 타깃 이미지와 더 잘 일치하도록 텍스트 설명을 수정하고 새로운 시각 임베딩을 재생성하여, 텍스트 수정 사항을 참조 이미지와 정렬함으로써 더 정확한 검색 결과를 제공합니다.
MagicLens는 Transformer models를 사용해 텍스트와 이미지를 병렬로 처리하고, 두 모달리티를 모두 포착하는 통합 임베딩을 생성하여 검색 성능을 향상시킵니다.
멀티모달 검색 데모를 살펴보세요!
저희는 Milvus vector database로 구동되는 멀티모달 검색용 online demo를 개발했습니다. 이 데모에서는 이미지를 업로드하고 텍스트 지시를 입력할 수 있으며, 이는 composed image retrieval 모델에 의해 처리되어 시각적 입력과 텍스트 입력 모두를 기반으로 일치하는 이미지를 찾습니다.
이 데모의 핵심에는 MagicLens 임베딩 모델이 있으며, 이 모델은 GPT-4o 기반 재랭킹 시스템과 함께 작동하여 사용자 의도에 따라 검색 결과를 정교하게 다듬습니다. 이러한 조합은 멀티모달 모델이 현대적인 검색 시스템을 어떻게 혁신하여 더 정확하고 직관적인 검색 경험을 제공할 수 있는지를 보여줍니다.
멀티모달 검색의 미래를 직접 탐색하고 경험해 보시기 바랍니다!
멀티모달 검색 모델의 검색 결과.png
그림: 멀티모달 검색 모델의 검색 결과
데모 사용해 보기: Multimodal Image Search
추가 리소스
MagicLens GitHub 페이지: https://open-vision-language.github.io/MagicLens/
CIReVL GitHub 페이지: https://github.com/ExplainableML/Vision_by_Language
CompoDiff GitHub 페이지: https://github.com/navervision/CompoDiff
Milvus 데모: https://milvus.io/milvus-demos
계속 읽기

What Is a Vector Lakebase?
A Vector Lakebase is a unified, lake-native data architecture for AI that combines vector-database-grade serving with open lake storage, reusable lake-level indexes, and a shared semantic layer.

How to Build an Enterprise-Ready RAG Pipeline on AWS with Bedrock, Zilliz Cloud, and LangChain
Build production-ready enterprise RAG with AWS Bedrock, Nova models, Zilliz Cloud, and LangChain. Complete tutorial with deployable code.

Zilliz Cloud Launches in AWS Australia, Expanding Global Reach to Australia and Neighboring Markets
We're thrilled to announce that Zilliz Cloud is now available in the AWS Sydney, Australia region (ap-southeast-2).



