Zilliz Cloud의 종합 모니터링 및 관측 가능성 소개
Zilliz에서는 사용자가 고성능 벡터 데이터베이스 애플리케이션을 구축하고 유지하는 데 필요한 도구를 제공하기 위해 최선을 다하고 있습니다. 지난 몇 달 동안 당사의 엔지니어링 팀은 광범위한 모니터링 및 관측 가능성 기능을 개발해 왔으며, 오늘 이를 여러분께 공유하게 되어 기쁩니다. 당사 플랫폼에 추가된 이 강력한 기능을 통해 사용자는 클러스터의 성능을 모니터링하고, 사용자 지정 알림을 설정하며, 잠재적인 문제에 신속하게 대응할 수 있습니다.
클러스터 메트릭: 벡터 데이터베이스 성능에 대한 가시성
새로운 Metrics 대시보드는 여러 핵심 영역에 걸쳐 클러스터 성능을 포괄적으로 보여줍니다:
5가지 리소스 메트릭: CPU 사용량, 메모리 사용률, 스토리지 소비량을 모니터링합니다.
9가지 성능 메트릭: 읽기 및 쓰기 작업 모두에 대한 초당 쿼리 수(QPS), 초당 벡터 수(VPS), 지연 시간을 추적합니다.
4가지 데이터 메트릭: 컬렉션 수, 엔티티 수, 로드된 엔티티를 모니터링합니다.
이러한 메트릭은 직관적인 대시보드를 통해 제공되며, 세부 분석을 위해 사용자 지정 시간 범위를 선택할 수 있습니다.
cluster metrics screenshot.png
그림 1: Zilliz Cloud 모니터링 메트릭 스크린샷
사용자 지정 가능한 알림: 잠재적 문제를 앞서 파악하세요
메트릭을 보완하기 위해 두 가지 유형의 알림을 도입했습니다:
- 5가지 조직 알림: 신용카드 만료, 무료 크레딧 잔액, 사용 비용과 같은 청구 관련 사항에 중점을 둡니다.
Figure 2- Screenshot of Organization Alerts .png
그림 2: 조직 알림 스크린샷
- 34가지 프로젝트 알림: CU 사용량, QPS 임계값, 지연 시간 문제, 요청 이상을 포함하여 클러스터의 운영 측면을 모니터링합니다.
Figure 3- Screenshot of Project Alerts.png
그림 3: 프로젝트 알림 스크린샷
당사의 알림 시스템은 사전 정의된 대상과 조건을 제공하지만, 광범위한 사용자 지정도 가능합니다. 임계값과 지속 시간을 설정하고 다양한 심각도 수준 중에서 선택하여 특정 요구 사항에 맞게 알림을 조정할 수 있습니다.
메트릭 및 알림 시스템의 주요 기능
새로운 Monitoring & Observability 시스템은 Zilliz Cloud 클러스터에 대한 포괄적인 인사이트를 제공하도록 설계되었습니다. 기대할 수 있는 내용은 다음과 같습니다:
실시간 모니터링을 통해 클러스터 성능에 대한 최신 인사이트를 얻을 수 있습니다. 이러한 즉각적인 피드백을 통해 성능 문제가 발생하는 즉시 빠르게 식별하고 대응할 수 있습니다.
당사는 사용 사례에 가장 중요한 메트릭에 집중하도록 보기 화면을 맞춤 설정할 수 있는 사용자 지정 가능한 대시보드를 구현했습니다. 주로 쿼리 성능, 리소스 사용률 또는 데이터 증가에 관심이 있든, 이러한 핵심 영역을 강조하도록 대시보드를 구성할 수 있습니다.
당사의 유연한 알림 구성 시스템을 사용하면 사용자 지정 임계값과 지속 시간으로 알림을 설정할 수 있습니다. 이러한 세분화된 제어는 잠재적인 문제를 조기에 포착하는 데 도움이 되어 클러스터를 선제적으로 관리할 수 있게 합니다.
중요한 알림을 절대 놓치지 않도록 여러 알림 채널을 통합했습니다. 이메일, PagerDuty, slack 또는 webhook 통합을 통해 알림을 받을 수 있어, 이러한 알림을 기존 워크플로 및 모니터링 시스템에 쉽게 통합할 수 있습니다.
마지막으로, 당사 시스템은 과거 데이터에 대한 접근을 제공하여 시간 경과에 따른 성능 추세를 분석할 수 있게 합니다. 이 기능은 장기적인 최적화, 용량 계획, 시스템 변경의 영향을 이해하는 데 매우 중요합니다.
이러한 기능은 함께 작동하여 강력한 모니터링 및 관측 가능성 솔루션을 제공하며, Zilliz Cloud 클러스터의 최적 성능을 유지할 수 있도록 지원합니다.
시작하기
당사의 모니터링 및 관측 가능성 기능은 Zilliz Cloud 콘솔 내에서 쉽게 접근할 수 있도록 설계되었습니다. 이러한 도구를 활용하는 방법은 다음과 같습니다:
메트릭 액세스: 클러스터 보기 내의 Metrics 탭으로 이동하여 상세한 성능 데이터를 살펴보세요.
알림 설정: Organization Alerts 또는 Project Alerts 페이지를 방문하여 알림 설정을 구성하고 관리하세요.
단계별 가이드와 모범 사례를 포함하여 당사의 모니터링 및 관측 가능성 기능에 대한 자세한 정보는 문서 페이지를 방문하세요. 이러한 리소스는 이 강력한 도구를 최대한 활용하고 Zilliz Cloud 경험을 최적화하는 데 도움이 됩니다.
다음 단계는 무엇인가요?
당사는 메트릭 및 알림 시스템을 지속적으로 개선하기 위해 노력하고 있습니다. 다음은 당사의 로드맵 일부입니다:
알림 템플릿: 여러 알림에 빠르게 설정하고 쉽게 적용할 수 있는 템플릿을 개발하여 알림 구성 프로세스를 간소화하고 있습니다.
Pod 리소스 메트릭: 곧 제공될 메트릭에는 CPU 사용량, Memory 사용량, Network flow와 같은 상세한 pod 수준 정보가 포함될 예정입니다.
향상된 데이터 작업 메트릭: Indexed entity metrics, Cluster connection metrics 등을 포함하여 데이터 작업에 대한 더 깊은 인사이트를 제공하도록 메트릭을 확장하고 있습니다.
서드파티 통합: 고급 모니터링 설정을 지원하기 위해 인기 있는 모니터링 플랫폼인 Datadog 및 Prometheus와의 통합을 개발하고 있습니다.
이러한 예정 기능은 Zilliz Cloud 클러스터에 대해 더욱 세분화된 제어와 인사이트를 제공하여 성능을 최적화하고 문제에 더 효과적으로 대응할 수 있게 해줍니다. Zilliz Cloud의 새로운 Metrics and Alerts 기능에 대해 자세히 알아보려면 10월 3일 릴리스 심층 분석 웨비나에 참여하세요.
앞으로 몇 달 안에 이러한 개선 사항을 소개하게 되어 기쁩니다. 여러분의 피드백은 Zilliz Cloud를 만들어가는 데 매우 중요합니다. Discord를 통해 의견을 공유하거나 지원팀에 문의하세요.
새로운 모니터링 및 관측 가능성 기능을 살펴보시면서 여러분의 의견을 듣기를 기대합니다.
계속 읽기

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.

DeepRAG: Thinking to Retrieval Step by Step for Large Language Models
Discover DeepRAG, an advanced retrieval-augmented generation (RAG) model that improves LLM accuracy by retrieving only essential data through step-by-step reasoning.


