For "Single tenant LAION 100M" below, we refer to the "Laion 100m" (S3 URI를 복사하려면 클릭하세요.) Dataset (100M * 768 float dense vectors).
For "Multitenant Cohere 10M" Dataset below, we refer to the "Cohere Large" (S3 URI를 복사하려면 클릭하세요.) Dataset (10M * 768 float dense vectors). All data are randomly splitted across 1000 tenants.
이 사례는 클라우드 데이터가 이미 로드되어 검색이 가능한 이후의 쿼리 동작을 측정합니다. 다양한 응답 페이로드, 스칼라 필터 선택성, 테넌시 모드에서 최대 동시 QPS, P99 지연 시간, 리콜을 비교하므로 차트에 속도만 표시하는 것이 아니라 처리량과 결과 품질을 모두 표시합니다.
모드
싱글 테넌트 LAION 100M
필터
필터링되지 않음
페이로드
ids only
지연 시간
최대 동시성 P99 지연 시간
디스플레이 비용
topK = 100
벡터 검색 지연 시간 및 QPS필터링되지 않음 - ids only - 최대 동시성 P99
제품최대 동시성 P99 지연 시간최대 동시성 QPSRECALL@10쿼리 비용 @ 최대 QPS
이 사례는 예열된 정상 상태 쿼리 경로에 대해 유휴 콜드 기간 이후의 첫 번째 쿼리를 측정합니다. 이는 콜드 스타트 동작을 정상적인 검색 처리량과 분리하여 차트에 비활성 후 제품에 중요한 워밍업 페널티가 있는지 여부를 표시합니다.
모드
필터링되지 않음
Cold / Warm Latency필터링되지 않음
질리즈 클라우드 용량 12CU
55 / 54 ms
Turbopuffer Pinned
64 / 45 ms
질리즈 클라우드 계층형 4CU
122 / 57 ms
Pinecone 서버리스
271 / 60 ms
Turbopuffer
2048 / 322 ms
차가운/따뜻한 비율낮을수록 좋습니다.
질리즈 클라우드 용량 12CU
1.01×
Turbopuffer Pinned
1.42×
질리즈 클라우드 계층형 4CU
2.16×
Pinecone 서버리스
4.52×
Turbopuffer
6.36×
참고:
특정 제품은 p99 백분위수에서 콜드/웜 비율이 더 극적일 수 있지만, 이는 일반적으로 이후 쿼리에서 네트워크 흔들림 문제를 나타내며 완전히 재현할 수 없다는 점에 유의하세요. 따라서 저희는 각 라운드의 첫 번째 쿼리, 즉 콜드/웜 지연 시간에 대한 보다 충실한 정의를 고수하고 있습니다.
대부분의 제품이 이러한 정보를 제공하는 공개 API를 제공하지 않기 때문에 제품의 컬렉션이 콜드 상태가 되는 시기는 다소 모호합니다. 실제 프로덕션 환경을 시뮬레이션하기 위해 콜드 레이턴시 벤치마킹에서는 제품에 대한 마지막 작업 후 컬렉션이 가능한 한 콜드 상태가 될 때까지 최소 24시간을 기다립니다.