귀하의 비즈니스에 가장 적합한 CU 유형과 크기를 선택하는 방법은 무엇인가요?
Zilliz Cloud의 Compute Unit(CU)는 검색 요청 및 인덱스를 처리하는 하드웨어 리소스를 의미합니다. Zilliz Cloud는 성능 최적화, 용량 최적화, 확장 용량 CU의 세 가지 유형의 CU를 제공합니다. 각 CU 유형은 다양한 비즈니스 요구 사항에 맞춰 서로 다른 CPU, 메모리, 스토리지 리소스 조합으로 구성됩니다. 따라서 Zilliz Cloud 클러스터를 구성할 때 적절한 CU 옵션과 크기를 선택하는 것이 중요합니다.
성능 최적화 CU
성능 최적화 CU는 최소 초당 100개 쿼리(QPS)의 높은 처리량과 밀리초 단위의 빠른 응답 시간이 필요한 유사도 검색 작업에 이상적입니다. 각 CU는 약 150만 개의 768차원 벡터를 처리할 수 있습니다.
이 CU 유형은 다음 사용 사례에 필수적입니다(단, 이에 국한되지 않음).
- 생성형 AI 애플리케이션
- 추천 시스템
- 검색 엔진
- 챗봇
- 콘텐츠 모더레이션
- LLM의 지식 베이스 보강
- 사기 방지 시스템
용량 최적화 CU
애플리케이션이 수천만 개의 벡터를 처리한다면 용량 최적화 CU 사용을 고려하세요. 각 CU는 약 500만 개의 768차원 벡터를 처리할 수 있습니다. 이 유형의 CU는 성능 최적화 CU보다 훨씬 더 많은 데이터를 더 낮은 비용으로 저장할 수 있지만, 성능도 더 낮습니다.
용량 최적화 CU는 특히 다음 시나리오에 유용합니다(단, 이에 국한되지 않음).
- 텍스트, 이미지, 동영상, 분자 구조와 같은 대규모 비정형 데이터 검색
- 저작권 침해 감지
- 신원 확인.
확장 용량 CU
확장 용량 CU는 응답 시간이 중요하지 않고 예산이 매우 제한적인 경우에 이상적입니다. 각 CU는 비교적 합리적인 가격으로 2천만 개의 768차원 벡터를 처리할 수 있습니다. 검색 지연 시간은 더 높지만, 용량 최적화 CU보다 최대 4배 더 많은 데이터를 저장할 수 있습니다.
이 유형의 CU는 다음과 같은 오프라인 작업에 적합합니다.
- 데이터 라벨링 또는 클러스터링
- 중복 제거
- 데이터셋 이상치 감지 또는 클래스 균형 조정.
세 가지 CU 유형 평가
아래 표는 Zilliz Cloud의 CU 유형 간 차이점에 대한 개요를 제공합니다.
| CU 유형 | 지연 시간 | 처리량 | 용량 | 백만 벡터당 비용 (참고: 768차원 벡터 기준) |
|---|---|---|---|---|
| 성능 최적화 | 낮음 | 높음 | 낮음 | 월 $65부터 |
| 용량 최적화 | 중간 | 중간 | 중간 | 월 $20부터 |
| 확장 용량 CU | 높음 | 낮음 | 높음 | 월 $10부터 |
성능 비교
다양한 CU 옵션의 성능을 측정하기 위해 검색 지연 시간과 처리량이라는 두 가지 핵심 지표를 살펴보았습니다. 다양한 topk 값(10, 100, 250, 1000)을 사용하여 두 개의 데이터셋에서 Zilliz Cloud의 세 가지 CU 유형을 테스트했습니다. 첫 번째 데이터셋은 768차원 벡터 1,000,000개로 구성되며, 두 번째 데이터셋은 동일한 차원의 벡터 5,000,000개를 포함합니다.
| top_k | / | / | 10 | 100 | 250 | 1000 |
|---|---|---|---|---|---|---|
| 지연 시간 | 성능 최적화 CU | 1M 768dim | <10ms | <10ms | <10ms | 10-20ms |
| 용량 최적화 CU | 5M 768dim | <50ms | <50ms | <50ms | 50-100ms | |
| 확장 용량 CU |
위 표는 낮은 지연 시간에는 성능 최적화 CU가 용량 최적화 CU보다 뛰어나므로 최선의 선택임을 보여줍니다. 일반적인 topk 값인 10-250에서 10밀리초 미만의 지연 시간을 유지하며, 용량 최적화보다 5~10배 빠릅니다. topk 값이 수천 단위인 경우, 각 CU 유형의 지연 시간은 성능 최적화 CU의 경우 10-20ms, 용량 최적화 CU의 경우 50-100ms로 다양합니다. 하지만 성능 최적화 CU가 수천 단위의 topk 값으로 작업을 수행할 때 응답 속도가 느려지더라도, 검색 지연 시간은 여전히 많은 실시간 애플리케이션에 적합하다는 점은 주목할 만합니다.
| top_k | 10 | 100 | 250 | 1000 | ||
|---|---|---|---|---|---|---|
| QPS | Performance-optimized cu | 1M 768dim | 520 | 440 | 270 | 150 |
| Capacity-optimized CU | 5M 768dim | 100 | 80 | 60 | 40 | |
| Extended-Capacity CU |
처리량 측면에서는 성능 최적화 CU가 우수합니다. 용량 최적화 CU보다 4~5배 더 뛰어난 성능을 보입니다.
용량 비교
표준 벡터 차원 세트인 128, 256, 512, 768, 1024를 사용하여 Zilliz Cloud의 세 가지 유형의 CU를 테스트했습니다.
| 벡터 차원 | CU당 벡터 수(백만) | CU당 벡터 수(백만) | CU당 벡터 수(백만) |
|---|---|---|---|
| / | Performance-optimized CU | Capacity-optimized CU | Extended-Capacity CU |
| 128 | 5 | 25 | 곧 제공 예정 |
| 256 | 2.96 | 14.87 | 곧 제공 예정 |
| 512 | 1.63 | 8.22 | 곧 제공 예정 |
| 768 | 1.5 | 5 | 20 |
| 1024 | 0.86 | 4.34 | 곧 제공 예정 |
위 표의 테스트 결과를 바탕으로 다음을 확인할 수 있습니다.
- Extended-Capacity CU는 768차원 벡터를 저장하는 데 가장 큰 용량을 제공하며, Performance-optimized CU와 Capacity-optimized CU보다 각각 13배 및 4배 더 큽니다.
- 벡터 차원이 증가할수록 데이터를 저장하는 데 더 많은 저장 공간이 필요합니다. 예를 들어, 하나의 CU는 1024차원 벡터에 비해 512차원 벡터를 대략 두 배 더 많이 저장할 수 있습니다.
참고: 이 실험은 스칼라 필드를 추가하지 않고 기본 키와 벡터에만 초점을 맞췄습니다. 그러나 id, label, keywords, summary, URL 등과 같은 추가 스칼라 필드가 있는 경우, 각 CU 유형의 실제 용량은 위 표와 다를 수 있습니다. 따라서 정확성을 위해서는 실증적 측정에 의존하는 것이 중요합니다.
몇 가지 예를 살펴보겠습니다!
지연 시간, 처리량, 용량, 비용의 관점에서 Zilliz Cloud의 세 가지 CU 옵션을 비교했습니다. 그렇다면 비즈니스에 가장 적합한 옵션을 어떻게 선택할 수 있을까요? 올바른 선택을 하는 데 도움이 되도록 두 가지 예를 살펴보겠습니다.
예시 1
768차원 임베딩 벡터를 가진 비공개 문서의 1,000만 개 이상의 텍스트 청크를 저장하기 위해 Zilliz Cloud를 채택하는 LLM 증강 챗봇을 구축한다고 가정해 보겠습니다. 애플리케이션은 Zilliz Cloud가 1,000 QPS를 지원하고 종단 간 지연 시간이 30밀리초 미만으로 상위 10개 결과를 검색해야 합니다.
성능 최적화 CU는 30ms 미만의 지연 시간을 달성할 수 있는 유일한 방법입니다. 각 성능 최적화 CU는 최대 150만 개의 768차원 벡터를 저장할 수 있으므로, 1,000만 개의 모든 벡터를 처리하려면 최소 7개의 CU가 필요합니다. 하나의 CU는 topk 값이 10일 때 처리량 기준으로 최대 QPS 520에 도달할 수 있습니다. 1,000 QPS를 처리하려면 두 개의 복제본이 필요합니다.
따라서 이 시나리오에 가장 적합한 접근 방식은 각각 7개의 CU를 포함하는 성능 최적화 CU의 복제본 두 개를 사용하는 것입니다.
예제 2
애플리케이션이 이미지의 저작권 위반을 감지하고 1억 개의 풀에서 유사한 이미지를 찾아야 한다고 가정해 보겠습니다. 각 이미지는 768차원 벡터로 임베딩됩니다. 실시간 응답은 필요하지 않지만, 50 QPS의 처리량으로 상위 100개 결과를 기대합니다.
용량 최적화 CU와 성능 최적화 CU 모두 상위 100개 결과를 검색할 때 초당 50개의 요청을 처리할 수 있습니다. 그러나 용량 최적화 CU는 성능 최적화 CU보다 세 배 더 많은 벡터를 저장할 수 있습니다. 따라서 용량 최적화 CU가 요구 사항에 더 적합한 옵션입니다.
테스트 결과에 따르면, 단일 용량 최적화 CU는 최대 560만 개의 768차원 벡터를 저장할 수 있습니다. 1억 개의 벡터를 수용하려면 최소 20개의 CU가 필요합니다. topk 값이 100일 때, 단일 CU는 처리량 기준으로 최대 QPS 80에 도달할 수 있습니다. 50 QPS의 경우, 하나의 복제본이면 충분합니다. 따라서 20개의 용량 최적화 CU로 구성된 클러스터가 필요합니다.
요약
Zilliz Cloud는 세 가지 유형의 CU를 제공합니다. 애플리케이션이 매우 빠르고 실시간으로 반응해야 한다면 성능 최적화 CU를 선택하는 것이 좋습니다. 용량 최적화 CU는 수천만 개의 벡터를 저장하고 검색해야 하는 애플리케이션에 가장 적합한 선택입니다. 예산이 빠듯하고 속도와 처리량을 희생해도 괜찮다면 Extended-Capacity CU가 적합합니다.
Zilliz Cloud 시작하기
무료 티어(신용카드 필요 없음)로 탐색해 보거나, 최대 $200 크레딧이 제공되는 30일 엔터프라이즈 평가판을 사용해 보세요. 어떤 클라우드 마켓플레이스를 통해서든 구독하면 추가 $100 크레딧을 받을 수 있습니다.
Zilliz Cloud 문서를 통해 더 자세히 알아보세요.
계속 읽기

Introducing Loon: A New Storage Engine for Vector Data That Never Stops Changing
Loon is a new storage engine for Milvus 3.0 and Zilliz Vector Lakebase, built to manage evolving vector datasets with ColumnGroups, row ID alignment, and Manifests.

Zilliz Cloud Now Available in AWS Asia Pacific (Seoul)
Zilliz Cloud is now available in AWS Seoul — low-latency vector search, in-country data residency, and one-step migration for Korean AI teams. 31 regions across 5 clouds.

Introducing Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud
We're announcing the general availability of Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud.



