다른 관점: 검색 최적화 임베딩 모델
현대 데이터 검색 시스템에서 사용자는 쿼리에서 단 하나의 결과만을 요구하는 경우가 드뭅니다. 이들은 쿼리 맥락에 기반해 순위가 매겨진 여러 관련 결과를 기대합니다. 이러한 기대는 일반적으로 이진 관계에 초점을 맞추는 기존 임베딩 모델에 과제를 제기합니다. 최근 SF Unstructured Data Meetup에서 Robertson Taylor는 Marqo의 솔루션 아키텍트로서 Generalized Contrastive Learning(GCL)을 소개했습니다. 이 접근 방식은 모델 학습 과정에 순위 및 쿼리 인식을 통합함으로써 이진 페어링을 넘어섭니다.
SF의 8월 Unstructured Data Meetup에서 발표 중인 Robertson
이 블로그에서는 Robertson의 발표에서 얻은 핵심 인사이트를 살펴보고, GCL을 선도적인 벡터 데이터베이스인 Milvus와 통합하여 최적화된 Retrieval-Augmented Generation(RAG) 시스템을 만드는 방법을 보여줍니다. Marqo는 벡터 저장 및 검색 솔루션을 제공하지만, 이 블로그에서는 Milvus 사용자가 Marqo 파인튜닝 플랫폼인 Marqtune으로 파인튜닝된 GCL 모델을 활용해 검색 역량을 강화하는 방법에 초점을 맞춥니다.
GCL이 이러한 과제를 어떻게 해결하는지 더 잘 이해하기 위해, 먼저 CLIP과 같은 기존 임베딩 모델의 한계를 살펴보겠습니다.
YouTube에서 Robertson의 발표 다시 보기를 시청하세요.
임베딩 모델과 그 한계
CLIP(Contrastive Language-Image Pretraining)과 같은 기존 임베딩 모델은 이미지 검색과 같은 작업에 널리 사용됩니다. 이러한 모델은 캡션과 이미지처럼 짝을 이루는 항목 간의 거리를 최소화하도록 설계되었습니다. 이 접근 방식은 단순한 이진 관계에는 잘 작동하지만, 순위가 매겨진 멀티모달 결과를 필요로 하는 검색 시스템의 더 복잡한 요구를 충족하는 데는 어려움을 겪습니다.
Robertson은 기존 모델과 관련된 여러 과제를 다루며 발표를 시작했습니다:
이진 관계: CLIP과 같은 모델은 텍스트와 이미지의 쌍에서 학습하므로 특정 작업에는 효율적이지만, 사용자 쿼리를 기반으로 여러 결과의 순위를 매길 때는 충분하지 않습니다.
순위 및 쿼리 인식 부족: 많은 임베딩 모델은 사용자 행동이나 상호작용 데이터를 기반으로 결과를 조정하지 않고 모든 쿼리를 동일하게 취급합니다.
제한적인 멀티모달 기능: 대부분의 모델은 텍스트 또는 이미지 중 하나를 다루는 데는 뛰어나지만, 이러한 데이터 유형을 효과적으로 결합하는 데는 어려움을 겪습니다.
비효율적인 교차 필드 결합: 기존 모델은 제목, 설명, 리뷰와 같은 여러 필드의 정보를 단일 벡터 표현으로 효과적으로 결합하지 못하는 경우가 많습니다.
이러한 한계는 기존 모델이 통제된 환경에서는 충분히 잘 작동하더라도, 순위 지정과 멀티모달 기능이 중요한 실제 시나리오에서는 종종 기대에 미치지 못한다는 것을 의미합니다.
CLIP 모델이 일반적으로 어떻게 학습되는지 설명하기 위해 다음 다이어그램을 살펴보겠습니다:
그림 1: CLIP 학습 방식
CLIP은 텍스트 인코더와 이미지 인코더를 갖춘 투 타워 아키텍처를 사용합니다. 이 모델은 양성 쌍(일치하는 텍스트와 이미지) 사이의 거리를 최소화하고 다른 모든 쌍 사이의 거리를 최대화하도록 학습됩니다. 이 접근 방식은 특정 작업에는 효과적이지만, 실제 검색 시나리오의 복잡성을 고려하지는 않습니다. 바로 여기서 GCL이 등장합니다.
일반화된 대조 학습(GCL): 검색 최적화를 위한 솔루션
기존 모델의 한계를 해결하기 위해 Marqo는 일반화된 대조 학습(GCL)을 도입했습니다. 이 접근 방식은 학습 과정에 순위 인식과 쿼리 인식을 통합하여 임베딩 모델을 향상시키며, 이를 통해 검색 결과의 관련성과 순위가 크게 개선됩니다.
GCL은 여러 핵심 혁신을 통해 이러한 과제를 해결합니다:
순위 인식: GCL은 클릭 및 장바구니 추가 동작과 같은 사용자 상호작용 데이터를 학습 과정에 통합하여 이를 해결합니다. 이를 통해 모델은 사용자 선호도에 기반해 결과의 순위를 매기는 방법을 학습할 수 있습니다.
쿼리 인식: 모든 쿼리를 동일하게 취급하는 대신, GCL은 쿼리의 맥락을 고려하도록 임베딩을 미세 조정합니다. 예를 들어 사용자가 SLR 카메라를 검색할 때, GCL은 해당 쿼리가 고급 장비를 찾는 전문 사진작가에게서 온 것인지, 입문용 모델을 찾는 소비자에게서 온 것인지 반영합니다. 이러한 쿼리 인식은 시스템이 더 관련성 높은 결과를 반환할 수 있게 합니다.
멀티모달 기능: GCL은 시스템이 텍스트와 이미지를 통합된 방식으로 임베딩하고 검색할 수 있도록 하여 멀티모달 검색을 지원합니다. 예를 들어 전자상거래 환경에서 GCL은 제품 제목, 설명, 리뷰, 이미지를 하나의 벡터로 결합하여 더 관련성 높은 검색 결과를 제공할 수 있습니다.
교차 필드 결합: GCL은 모델이 여러 필드의 정보를 단일 벡터 표현으로 효과적으로 결합할 수 있게 하여 검색 결과의 전반적인 품질을 개선합니다.
모달 내 이해: 학습 중 다양한 텍스트 필드를 통합함으로써 GCL은 텍스트-텍스트 쿼리를 더 효과적으로 처리하는 모델의 능력을 향상시킵니다.
GCL이 어떻게 작동하는지 설명하기 위해, GCL을 사용하여 멀티모달 검색을 최적화하는 과정을 보여주는 다음 다이어그램을 살펴보겠습니다:
그림 2: GCL을 사용한 멀티모달 검색 최적화 과정
시스템은 검색 결과에 대한 클릭과 같은 사용자 상호작용을 캡처하는 것에서 시작합니다. 그런 다음 이러한 상호작용을 집계하여 각 쿼리-결과 쌍에 대한 점수를 생성합니다. 쿼리는 더 나은 검색 성능을 위해 모델을 학습하는 데 사용되며, 집계된 점수는 학습 중 서로 다른 결과의 중요도를 가중하는 데 사용됩니다. 그런 다음 모델은 쿼리 정보와 사용자 상호작용 점수를 모두 통합한 이 가중 데이터로 학습됩니다. 마지막으로 학습된 모델은 새로운 쿼리와 점수를 사용해 성능을 평가합니다.
이 과정은 모델이 미리 정의된 쌍 사이의 거리만 최소화하는 것이 아니라 실제 사용자 행동으로부터 학습하고 실제 검색 시나리오에 맞게 최적화할 수 있게 합니다. 이제 GCL이 검색 최적화의 핵심 과제를 어떻게 해결하는지 살펴보았으니, 특정 작업과 실제 애플리케이션에 맞게 어떻게 미세 조정할 수 있는지 알아보겠습니다.
GCL을 활용한 미세 조정 작업
GCL은 다재다능하며 기본 검색을 넘어 다양한 검색 스타일 작업을 위해 모델을 미세 조정하는 데 사용할 수 있습니다. 다음 이미지는 이러한 작업 중 일부를 보여줍니다:
그림 3: GCL을 활용한 미세 조정 작업의 예
이러한 각 미세 조정 작업을 더 자세히 살펴보겠습니다:
기본 검색 향상
GCL은 사용자 상호작용 데이터를 통합하여 기존의 쿼리-문서 검색을 개선합니다. 이는 사용자가 특정 용어를 검색할 때 모델이 단순히 키워드만 매칭하는 것이 아니라, 과거에 사용자들이 유사한 쿼리와 결과와 어떻게 상호작용했는지도 고려한다는 의미입니다. 예를 들어, 가벼운 laptop을 검색한 많은 사용자가 ultrabooks를 클릭했다면, 모델은 ultrabook이라는 용어가 명시적으로 언급되지 않았더라도 이 쿼리에 대해 ultrabooks의 순위를 더 높게 매기도록 학습합니다.
고급 추천
GCL은 쿼리-문서 및 문서-문서 추천을 모두 가능하게 합니다. 이러한 이중 접근 방식은 더 섬세하고 맥락적인 제품 제안을 가능하게 합니다. 쿼리-문서 추천에서 GCL은 사용자의 검색 쿼리를 기반으로 제품을 제안할 수 있으며, 쿼리 용어뿐만 아니라 사용자 행동 패턴도 고려합니다. 문서-문서 추천의 경우, GCL은 항목들이 겉으로 명확히 유사하지 않더라도 기능의 유사성, 사용자 상호작용 패턴 또는 맥락적 관련성을 기반으로 관련 제품을 식별할 수 있습니다.
엔터티 해석 및 중복 제거
GCL의 문서-문서 매칭 기능은 엔터티 해석 및 중복 제거 작업에 강력합니다. 항목이 설명되거나 분류되는 방식에 약간의 차이가 있더라도 데이터셋 전반에서 유사하거나 동일한 항목을 식별할 수 있습니다. 이는 중복 제품 목록을 식별해야 하는 전자상거래나 동일한 엔터티가 여러 데이터 소스에서 다르게 표현될 수 있는 데이터 통합 프로젝트에서 특히 유용합니다.
조건부 검색
이 기능을 통해 GCL은 검색 과정에 맥락 정보를 통합할 수 있습니다. 예를 들어, winter jackets에 대한 검색은 사용자의 위치에 따라 서로 다른 결과를 제공합니다(예: 추운 기후에는 두꺼운 다운 재킷, 온화한 겨울에는 더 가벼운 재킷). GCL은 이러한 조건부 요인을 기반으로 결과를 조정하도록 학습하여, 특정 맥락이나 마켓플레이스에 맞춘 더 관련성 높은 검색 결과를 제공합니다.
개인화 검색
GCL은 탐색 기록, 현재 장바구니에 있는 항목, 과거 구매 행동과 같은 사용자별 맥락을 고려함으로써 개인화를 한 단계 더 발전시킵니다. 이를 통해 사용자의 현재 관심사와 필요에 부합하는 고도로 맞춤화된 검색 결과를 제공할 수 있습니다. 예를 들어, 사용자가 고급 카메라 장비를 둘러보고 있었다면, 삼각대 검색 시 예산형 대안보다 전문가급 옵션을 우선시할 ****수 있습니다.
분류 및 택소노미 매핑
GCL은 제품을 사전 정의된 택소노미로 자동 분류하는 것과 같은 분류 작업에 적용될 수 있습니다. 이는 수동 분류가 시간이 많이 걸리고 오류가 발생하기 쉬운 대규모 전자상거래 플랫폼이나 콘텐츠 관리 시스템에서 특히 유용합니다. GCL은 기존 분류와 사용자 상호작용으로부터 학습하여 새로운 항목을 어떻게 분류할지에 대해 지능적인 결정을 내릴 수 있으며, 일관성을 보장하고 대규모 데이터셋의 전반적인 구성을 개선합니다.
이러한 파인튜닝 작업은 GCL을 다양한 검색 과제에 매우 적응력 있게 만듭니다. 이제 GCL이 실제 시나리오에서 어떻게 적용되고 있는지 살펴보겠습니다.
GCL의 실제 적용 사례
Robertson은 GCL이 실제 문제를 해결하는 데 어떻게 사용되고 있는지에 대한 여러 예를 공유했습니다. 한 주목할 만한 사례는 기성 모델을 사용해 기본적인 벡터 검색 솔루션을 처음 구현했던 전자상거래 플랫폼과 관련이 있었습니다. 그러나 시스템이 관련성 높은 결과를 제공하지 못하면서 해당 플랫폼은 장바구니 추가율과 전반적인 참여도가 급격히 감소하는 것을 경험했습니다.
GCL을 통합한 후, 플랫폼은 상당한 개선을 보였습니다. 사용자 선호도와 더 잘 부합하는 제품이 더 높은 순위에 올라 더 나은 참여도와 매출 증가로 이어졌습니다. 플랫폼은 사용자 리뷰와 제품 이미지 같은 비정형 데이터를 활용하여 검색 결과의 관련성을 개선할 수 있었습니다. 클릭 및 구매 행동과 같은 사용자 상호작용 데이터를 통합함으로써, 플랫폼은 개인화된 순위 기반 검색 결과를 제공하는 능력을 향상시켰습니다.
학술 연구 분야에서 GCL은 저자 세부 정보와 인용 같은 메타데이터를 검색 프로세스에 통합함으로써 관련 연구 논문의 검색을 개선했습니다. 이는 검색 프로세스를 가속화했을 뿐만 아니라 결과의 관련성도 높여, 대규모 데이터베이스를 탐색하는 연구자들에게 시스템을 더 효과적으로 만들었습니다.
이제 GCL이 프로덕션 환경에서 성능을 더욱 개선하기 위해 고급 기법을 어떻게 통합하는지 살펴보겠습니다.
GCL의 고급 기법
Robertson은 GCL 모델의 성능을 더욱 향상시킬 수 있는 여러 고급 기법을 언급했습니다. 여기에는 절단 및 임베딩의 이진화와 같은 프로덕션 인식 학습 방법이 포함됩니다.
그림 4: 임베딩의 절단 및 이진화
절단 인식 학습은 Matryoshka 임베딩의 생성을 가능하게 하며, 이는 충실도 손실 없이 임베딩 크기를 2-4배 줄일 수 있습니다. 모델은 단일 모델에서 다양한 크기의 의미 있는 표현을 생성하는 방법을 학습합니다. 이진화를 학습하는 것은 0 또는 1만을 갖는 임베딩을 학습함으로써 충실도 손실을 최소화하면서 저장 공간과 지연 시간을 크게 줄일 수 있게 해주는 또 다른 기법입니다. 이러한 기법은 저장 비용과 검색 속도가 중요한 요소인 프로덕션 환경에서 특히 가치가 있습니다.
GCL은 또한 검색 결과에 대한 더 섬세한 제어를 가능하게 하는 조건부 임베딩 생성을 지원합니다
그림 5: 조건부 임베딩
쿼리에서 접두사나 조건문을 사용함으로써, 모델은 특정 조건에 따라 결과를 조정하는 방법을 학습할 수 있습니다. 예를 들어, USA Marketplace: SLR camera는 UK Marketplace: SLR camera와 다른 결과를 산출할 수 있습니다. 조건부 임베딩은 이미지 생성 모델에서 프롬프트가 작동하는 방식과 유사하게 결과의 스타일이나 품질에 영향을 주는 데에도 사용할 수 있습니다.
이러한 고급 기법은 GCL의 기술적 측면을 향상시킬 뿐만 아니라 실제 검색 작업에서 성능 개선으로 이어집니다. GCL로 학습된 모델이 기존 접근 방식과 비교해 어떻게 수행되는지 살펴보겠습니다.
GCL을 통한 성능 개선
GCL을 사용하면 여러 다양한 시나리오에서 성능이 향상됩니다. Robertson이 공유한 일부 사례를 살펴보겠습니다:
그림 6: GCL 학습 임베딩 모델과 다른 모델 간의 성능 비교
도메인 내 성능은 사전 학습된 모델과 비교해 NDCG(Normalized Discounted Cumulative Gain)가 6배 증가한 것으로 나타났습니다. 학습 중 보지 못한 새로운 쿼리의 경우에도 GCL은 사전 학습된 모델보다 거의 3배 뛰어난 성능을 보였습니다. 학습 중 보지 못한 새로운 데이터셋에 적용했을 때도 GCL은 성능 우위를 유지했습니다. 제로샷 시나리오에서도 GCL은 기존 모델과 비교해 NDCG 개선을 보였습니다. 이러한 결과는 다양한 검색 시나리오 전반에서 GCL의 견고성과 일반화 가능성을 입증합니다.
검색 효과, 특히 신규 및 제로샷 시나리오에서 이처럼 상당한 개선을 통해 GCL은 검색 시스템의 성능을 재정의할 준비가 되어 있습니다. 이제 Milvus와 함께 GCL을 활용하여 이러한 이점을 자체 RAG 애플리케이션에 어떻게 적용할 수 있는지 살펴보겠습니다.
RAG 애플리케이션을 위한 Milvus와 GCL 활용
Marqo는 임베딩 기반 검색을 위한 포괄적인 솔루션을 제공하지만, 많은 조직은 이미 벡터 데이터베이스 요구 사항을 위해 Milvus에 의존하고 있습니다. Milvus를 사용 중이거나 데이터 인프라에 통합할 계획이라면, 검색 증강 생성(RAG) 애플리케이션에서 GCL 파인튜닝 모델의 이점을 여전히 누릴 수 있습니다.
RAG를 위해 GCL을 Milvus와 통합하는 방법은 다음과 같습니다.
Marqtune으로 파인튜닝: Marqo의 파인튜닝 플랫폼인 Marqtune을 사용하여 사전 학습된 모델에 GCL을 적용하세요. 이 프로세스는 특정 검색 작업에 맞게 모델을 최적화합니다.
파인튜닝된 모델 다운로드: 파인튜닝 후 Marqtune에서 최적화된 모델을 다운로드하세요.
Milvus와의 통합: 파인튜닝된 모델을 사용하여 임베딩을 생성한 다음, 이를 Milvus에 저장하고 검색할 수 있습니다.
효율적인 검색: Milvus의 최적화된 대규모 고속 벡터 검색 기능을 활용하세요. GCL의 쿼리 인식 임베딩과 결합하면, Milvus는 복잡한 멀티모달 데이터셋에서도 관련 결과를 효율적으로 순위화하고 반환할 수 있습니다.
확장성: 데이터셋이 증가함에 따라 Milvus는 수십억 개의 임베딩을 저장하고 검색해야 하는 증가하는 요구를 처리할 수 있어, 성능이 일관되게 유지되도록 보장합니다.
GCL과 Milvus의 결합된 힘으로 검색 증강 시스템은 인상적인 확장성과 성능을 달성할 수 있습니다. 그렇다면 Milvus가 이러한 애플리케이션에 이상적으로 적합한 이유는 무엇일까요?
GCL로 강화된 RAG 시스템에 Milvus를 선택해야 하는 이유
Generalized Contrastive Learning(GCL) 파인튜닝 모델을 사용하여 검색 증강 생성(RAG) 시스템을 구현할 때, 적절한 벡터 데이터베이스를 선택하는 것은 매우 중요합니다. Milvus는 강력한 기능과 첨단 기술 덕분에 탁월한 선택으로 두드러집니다. Milvus가 GCL로 생성된 임베딩을 처리하고 효율적인 RAG 애플리케이션을 구동하는 데 왜 적합한지 살펴보겠습니다.
Milvus의 주요 기능
멀티테넌시 지원: Milvus는 여러 사용자 또는 애플리케이션이 서로 간섭하지 않고 동일한 시스템에서 작업할 수 있게 해줍니다. 이 기능은 안전하고 격리된 데이터 액세스를 제공하므로, 서로 다른 팀이나 프로젝트가 동일한 Milvus 인스턴스를 사용해야 할 수 있는 엔터프라이즈 환경에 이상적입니다. GCL로 강화된 RAG 시스템의 맥락에서는 단일 Milvus 배포에서 다양한 부서 또는 사용 사례를 위한 여러 검색 작업을 실행하면서 데이터 분리와 보안을 유지할 수 있습니다.
확장 가능하고 탄력적인 아키텍처: 증가하는 데이터 요구 사항을 처리하도록 설계된 Milvus는 수요에 맞춰 자동으로 확장됩니다. 이는 데이터 볼륨이 증가해도 성능이 최적으로 유지되도록 보장합니다. 이러한 확장성은 빠르게 늘어나는 문서 컬렉션을 다루는 경우가 많은 RAG 애플리케이션에 매우 중요합니다. GCL로 더 많은 모델을 파인튜닝하고 더 많은 임베딩을 생성함에 따라, Milvus는 검색 속도나 효율성을 저하시키지 않고도 이러한 성장을 손쉽게 수용할 수 있습니다.
다양한 인덱스 지원: Milvus는 HNSW(Hierarchical Navigable Small World), PQ(Product Quantization), Binary, DiskANN을 포함한 여러 유형의 인덱스를 지원합니다. 이러한 다양성 덕분에 검색 속도, 정확도, 저장 효율성의 균형을 맞추며 특정 사용 사례에 가장 적합한 인덱스 유형을 선택할 수 있습니다. 예를 들어, HNSW는 GCL로 생성된 임베딩에서 고속 검색에 이상적일 수 있으며, PQ는 대규모 임베딩 세트를 더 압축적으로 저장하는 데 사용될 수 있습니다.
조정 가능한 일관성: Milvus는 데이터의 일관성 수준을 조정할 수 있게 해주어, 애플리케이션의 요구 사항에 따라 성능과 데이터 정확성 사이의 균형을 맞출 수 있습니다. RAG 시스템의 맥락에서 이 기능은 특히 유용합니다. 실시간 애플리케이션에서는 검색 속도를 우선시할 수도 있고, 금융 또는 의료 애플리케이션처럼 데이터 정확성이 가장 중요한 시나리오에서는 더 강한 일관성을 선택할 수도 있습니다.
하드웨어 가속 컴퓨팅: GPU와 같은 하드웨어를 활용하도록 최적화된 Milvus는 리소스 집약적인 작업을 더 빠르고 효율적으로 처리합니다. 이는 계산 요구량이 클 수 있는 GCL 모델로 작업할 때 특히 유리합니다. 하드웨어 가속은 임베딩 데이터베이스가 커지더라도 검색 시간이 빠르게 유지되도록 보장하여 RAG 시스템의 응답성을 유지합니다.
Milvus를 구동하는 고급 기술
유연한 컴퓨팅 유형: Milvus는 AVX512 (Advanced Vector Extensions), SIMD (Single Instruction, Multiple Data)를 위한 Neon, GPU acceleration을 포함한 다양한 하드웨어 환경에 최적화되어 있습니다. 이러한 유연성은 Milvus가 고성능 하드웨어를 효과적으로 활용하여 빠른 처리와 비용 효율적인 확장성을 제공할 수 있게 합니다. GCL로 강화된 RAG 시스템의 경우, 이는 사용 가능한 하드웨어와 성능 요구 사항에 따라 가장 적합한 컴퓨팅 유형을 선택할 수 있음을 의미합니다.
다재다능한 검색 기능: Milvus는 top-K ANN (Approximate Nearest Neighbors), range ANN, 필터링된 검색을 포함한 광범위한 검색 방법을 지원합니다. 이러한 다양한 검색 유형을 통해 특정 요구 사항에 맞게 검색 기능을 조정할 수 있습니다. 예를 들어, top-K ANN은 주어진 쿼리 임베딩에 대해 가장 관련성 높은 문서를 찾는 데 사용될 수 있으며, 필터링된 검색은 더 정밀한 검색을 위해 의미적 유사성과 메타데이터 필터를 결합할 수 있습니다.
고급 인덱싱 기법: 15가지 서로 다른 인덱싱 유형을 지원하는 Milvus는 데이터가 저장되고 검색되는 방식에 유연성을 제공합니다. 여기에는 고속 검색을 위한 HNSW와 대규모 데이터셋 처리를 위한 DiskANN 같은 고급 기법이 포함됩니다. 올바른 인덱스 선택은 RAG 시스템의 성능에 상당한 영향을 미칠 수 있으며, 우선순위에 따라 검색 속도 또는 메모리 효율성에 맞게 최적화할 수 있게 해줍니다.
언어 및 API 유연성: Milvus는 Python, Java, Go, Node.js를 포함한 여러 프로그래밍 언어를 지원합니다. 이러한 다재다능함은 Milvus를 기존 기술 스택에 쉽게 통합할 수 있게 하며, 개발자가 선호하는 언어로 작업할 수 있게 합니다. RAG 시스템의 경우, 이는 어떤 언어로 구축되었든 기존 코드베이스에 Milvus를 원활하게 통합할 수 있음을 의미합니다.
강력한 데이터 관리: Milvus는 컬렉션 및 파티션 관리.를 포함한 정교한 데이터 관리 기능을 제공합니다. 이를 통해 대규모 임베딩 데이터셋을 효율적으로 구성하고 검색할 수 있습니다. GCL로 강화된 RAG 시스템의 경우, 임베딩을 논리적 컬렉션(예: 문서 유형 또는 도메인별)과 파티션으로 구조화하여 더 표적화되고 효율적인 검색을 가능하게 할 수 있습니다.
강력한 아키텍처와 고급 기능을 고려할 때, Milvus는 검색 증강 시스템에서 GCL로 강화된 모델을 활용하기 위한 이상적인 인프라를 제공합니다.
결론
Robertson은 Generalized Contrastive Learning(GCL)이 순위와 쿼리 인식을 도입하여 검색을 어떻게 향상시키고, 결과의 관련성과 순위를 개선하는지 훌륭하게 보여주었습니다. 이 접근 방식은 기존의 이진 모델을 넘어 전자상거래와 학술 연구 같은 애플리케이션에 매우 효과적입니다.
또한 Milvus가 확장 가능한 아키텍처와 임베딩의 효율적인 처리를 통해 이러한 발전을 어떻게 더욱 지원하며, 복잡한 멀티모달 데이터셋에 대한 고속 검색과 최적화된 성능을 가능하게 하는지도 살펴보았습니다. GCL과 Milvus는 함께 차세대 검색 증강 시스템을 구축하기 위한 강력한 솔루션을 제공합니다.
계속 읽기

Zilliz Cloud Now Available in Azure North Europe: Bringing AI-Powered Vector Search Closer to European Customers
The addition of the Azure North Europe (Ireland) region further expands our global footprint to better serve our European customers.

Why AI Databases Don't Need SQL
Whether you like it or not, here's the truth: SQL is destined for decline in the era of AI.

Zilliz Cloud Introduces Advanced BYOC-I Solution for Ultimate Enterprise Data Sovereignty
Explore Zilliz Cloud BYOC-I, the solution that balances AI innovation with data control, enabling secure deployments in finance, healthcare, and education sectors.


