Intelligenteres Autoscaling in Zilliz Cloud: Immer für jede Workload optimiert
KI-Workloads folgen keinen gleichmäßigen, vorhersehbaren Kurven. In einem Moment bedient Ihre Vektordatenbank Anfragen problemlos; im nächsten treibt eine virale Kampagne, eine neue Datenaufnahme oder ein routinemäßiger Login-Ansturm um 9 Uhr die Auslastung in den roten Bereich. Teams sind gezwungen, zwischen Überprovisionierung und Budgetverschwendung oder Unterprovisionierung und dem Risiko von Engpässen zu wählen.
Mit dem neuesten Upgrade führt Zilliz Cloud intelligenteres Autoscaling ein—ein vollständig automatisiertes, optimierteres, elastisches Ressourcenmanagementsystem. Es skaliert sofort nach oben, um die Leistung aufrechtzuerhalten, und skaliert automatisch nach unten, um Verschwendung zu reduzieren, wodurch Rätselraten entfällt und Ihre Datenbank bei jeder Workload in der richtigen Größe bleibt.
Was ist neu beim Autoscaling und wie funktioniert es?
Zilliz Cloud unterstützt seit Langem automatisches Scale-up, um die Leistung bei plötzlichen Traffic-Spitzen sicherzustellen. Jetzt, mit dieser Version, ist auch Scaling down automatisch—damit wird der Kreislauf der Kostenoptimierung geschlossen. Anstatt Schwellenwerte abzustimmen oder zu raten, wann Anpassungen nötig sind, legen Sie einfach einen minimalen und maximalen CU-Bereich fest, und Zilliz Cloud optimiert die Kapazität kontinuierlich in Echtzeit. Das bedeutet:
Niedrigere Kosten – Ressourcen werden automatisch reduziert, wenn die Nachfrage sinkt.
Konstante Leistung – Ressourcen werden sofort erweitert, wenn die Nachfrage steigt.
Einfacherer Betrieb – kein manuelles Schwellenwertmanagement oder ständige Neukonfiguration mehr.
Im Hintergrund wird Autoscaling durch zwei komplementäre Modi unterstützt, die das gesamte Spektrum realer Workload-Muster abdecken:
Dynamisches Scaling – Dies ist die reaktive Intelligenz des Systems. Durch die kontinuierliche Überwachung der CU-Auslastung (Compute Unit) in Echtzeit skaliert Zilliz Cloud Ressourcen automatisch nach oben bei unvorhersehbaren Spitzen wie starker Datenaufnahme oder komplexen Abfragelasten und skaliert wieder nach unten, wenn die Nachfrage nachlässt. Das Ergebnis ist konstante Leistung ohne die Verschwendung einer dauerhaften Überprovisionierung.
Geplantes Scaling – Dies ist das proaktive Gegenstück. Viele Workloads folgen vorhersehbaren Mustern, etwa Login-Anstürmen am Morgen oder Spitzenzeiten im Geschäftsbetrieb. Mit geplantem Scaling können Sie Anpassungen für sowohl CUs als auch Replicas auf Basis von Zeitfenstern vordefinieren. So ist Ihr System vollständig auf erwarteten Traffic vorbereitet und vermeidet gleichzeitig unnötige Kosten außerhalb der Spitzenzeiten.
Hinweis: Sie können jederzeit weiterhin manuell skalieren.
Zusammen stellen diese Funktionen sicher, dass Ihre Vektordatenbank stets die richtigen Ressourcen zur richtigen Zeit hat—ohne verschwendete Ausgaben oder Leistungsrisiken.
Praktische Anwendungsfälle für Autoscaling
Um diese Funktion greifbar zu machen, betrachten wir drei häufige Anwendungsfälle, in denen Autoscaling messbaren geschäftlichen Mehrwert liefert.
1. Flash-Sale-Rausch
Eine E-Commerce-Plattform startet mittags einen zweistündigen Flash Sale. Der Traffic strömt herein und setzt vektorbasierte APIs für „ähnliche Produkte“ und Empfehlungen stark unter Druck. Ohne Scaling könnte das System genau in dem Moment ins Stocken geraten, in dem der Umsatz davon abhängt.
Lösung: Mit Scheduled Replica Scaling können Replicas um 11:50 Uhr—kurz vor Beginn des Events—um das Vierfache erhöht und um 14:05 Uhr wieder auf den Ausgangswert zurückgeführt werden. Dies gewährleistet reibungslose Leistung während des Spitzenfensters und stellt gleichzeitig sicher, dass Sie nur dann für Kapazität zahlen, wenn sie benötigt wird.
2. Login-Ansturm am Morgen
Die KI-Wissensdatenbank eines Unternehmens verzeichnet an jedem Wochentag um 9 Uhr Hunderte von Mitarbeitenden, die sich anmelden. Der Ansturm überlastet die Abfragekapazität, verlangsamt die Antworten des RAG-Chatbots und sorgt für einen frustrierenden Start in den Arbeitstag.
Lösung: Scheduled Scaling ermöglicht es, Query-Node-Replicas um 8:50 Uhr automatisch zu erweitern und nach dem Ansturm wieder zu reduzieren. Es ist wie das Öffnen zusätzlicher Fahrspuren auf einer Autobahn vor der Rushhour—schnelle Antwortzeiten bleiben erhalten, ohne Ressourcen zu verschwenden, sobald der Verkehr abnimmt.
3. Mitternächtliche Katalogaktualisierung
Eine Datenpipeline startet über Nacht einen großen, ungeplanten Reindexierungsauftrag. Der Prozess verbraucht Speicher und konkurriert mit Live-Traffic, wodurch Suchen verlangsamt werden und sogar Timeouts drohen.
Lösung: Mit Dynamic CU Scaling reagiert Zilliz Cloud in Echtzeit, wenn die Kapazität steigt, und skaliert CUs automatisch, um die Workload aufzufangen. Sobald die Indizierung abgeschlossen ist, werden die Ressourcen wieder herunterskaliert. Live-Abfragen bleiben schnell, die Ingestion wird reibungslos abgeschlossen, und es ist kein manueller Eingriff erforderlich.
Was kommt als Nächstes?
Dieses Release ist ein großer Schritt nach vorn, aber es bildet auch die Grundlage für etwas Größeres: eine Vektordatenbank, die Ressourcen vollständig eigenständig verwaltet.
Derzeit untersuchen wir in Zilliz Cloud aktiv granularere Skalierungsstrategien. Unterschiedliche Workloads erfordern unterschiedliche Kompromisse. Einige priorisieren Kosteneffizienz, andere benötigen jederzeit Performance-Reserven. Wir stellen uns Skalierungs-„Profile“ vor, mit denen Sie eine bevorzugte Strategie definieren können—konservativ für Hintergrundjobs, ausgewogen für allgemeine Workloads oder aggressiv für geschäftskritische Launches. Dies würde Teams eine fein abgestimmte Kontrolle geben und gleichzeitig operative Unsicherheiten reduzieren.
Unser langfristiges Ziel ist die Entwicklung eines Ressourcenmanagement-Frameworks, das sowohl autonom als auch anpassungsfähig ist und Ihnen die Gewissheit gibt, dass Ihre Vektordatenbank die Kapazität stets an die Nachfrage anpasst—ohne manuellen Aufwand.
Erste Schritte mit Autoscaling in Zilliz Cloud
Autoscaling ist in Zilliz Cloud live, und Sie können es ab sofort nutzen. So probieren Sie es selbst aus:
Melden Sie sich bei der Zilliz Cloud console an. Gehen Sie zu Ihrem Projekt und wählen Sie den Cluster aus, den Sie verwalten möchten.
Legen Sie Ihren CU-Bereich fest. Definieren Sie die minimalen und maximalen Compute Units (CUs) für Ihre Workload. Autoscaling erweitert und reduziert die Ressourcen innerhalb dieses Bereichs automatisch.
Wählen Sie Ihren Skalierungsmodus.
- Verwenden Sie Dynamic Scaling für unvorhersehbare Workloads (z. B. Daten-Ingestion, plötzliche Abfragespitzen).
Verwenden Sie Scheduled Scaling für vorhersehbare Zyklen (z. B. morgendliche Login-Spitzen, Flash Sales).
Sie können jederzeit weiterhin manuell skalieren, wenn Sie sofortige Anpassungen vornehmen möchten.
- Beobachten Sie es in Aktion. Überwachen Sie in Echtzeit, wie Ihr Cluster hoch- und herunterskaliert, und passen Sie die Einstellungen an, während Sie mehr über Ihre Workload erfahren.
Mit nur wenigen Klicks bleibt Ihre Datenbank ohne ständiges Tuning stets richtig dimensioniert. Sie profitieren von schnellerer Performance während Spitzen, niedrigeren Kosten in Ruhephasen und weniger operativem Aufwand.
Tipp: Beginnen Sie mit einem größeren CU-Bereich, um zu beobachten, wie sich Autoscaling verhält, und passen Sie anschließend die Grenzen an, sobald Sie ein tieferes Verständnis Ihrer Workload gewonnen haben.
👉 Weitere Informationen finden Sie in unserer Autoscaling-Dokumentation.
👉 Haben Sie Fragen? Unser Support-Team hilft Ihnen gerne weiter.
Mehr als Autoscaling: Enterprise-taugliche Funktionen in Zilliz Cloud
Autoscaling ist nur ein Teil dessen, was Zilliz Cloud zum umfassendsten und produktionsreifsten Vektordatenbank-Service macht. In den jüngsten Releases haben wir außerdem SSO GA, Audit-Logs, die Milvus 2.6 Private Preview und eine wachsende Reihe von Enterprise-Funktionen eingeführt, die darauf ausgelegt sind, die Anforderungen von Teams zu erfüllen, die KI in großem Maßstab entwickeln. (Weitere Details finden Sie in unserem Launch-Blog.)
Basierend auf Milvus bietet Zilliz Cloud ein vollständig verwaltetes Erlebnis mit:
Elastische Skalierung & Kosteneffizienz – Bereitstellung mit einem Klick, serverloses Autoscaling und nutzungsbasierte Preisgestaltung.
Fortschrittliche KI-Suche – Vektor-, Volltext- und hybride Suche (sparse + dense) mit Metadatenfilterung, dynamischem Schema und Multi-Tenancy.
Abfragen in natürlicher Sprache – MCP-Server-Unterstützung für intuitive Abfragen ohne komplexe APIs.
Zuverlässigkeit & Sicherheit auf Enterprise-Niveau – 99,95 % SLA, SOC 2 Type II- und ISO 27001-Zertifizierungen, DSGVO-Compliance, HIPAA-Bereitschaft, RBAC, BYOC und jetzt Audit Logs.
Globale Verfügbarkeit – Bereitstellungen über AWS, GCP und Azure mit Latenzzeiten unter 100 ms weltweit.
Nahtlose Migration – Integrierte Tools für den Wechsel von Pinecone, Qdrant, Elasticsearch, PostgreSQL, OpenSearch oder On-Prem Milvus.
Zusammen stellen diese Funktionen sicher, dass Zilliz Cloud nicht nur ein Vektordatenbankdienst ist, sondern eine produktionsreife Grundlage für Enterprise-KI-Anwendungen.
Weiterlesen

How to Improve Retrieval Quality for Japanese Text with Sudachi, Milvus/Zilliz, and AWS Bedrock
Learn how Sudachi normalization and Milvus/Zilliz hybrid search improve Japanese RAG accuracy with BM25 + vector fusion, AWS Bedrock embeddings, and practical code examples.

Vector Databases vs. Document Databases
Use a vector database for similarity search and AI-powered applications; use a document database for flexible schema and JSON-like data storage.

Vector Databases vs. Graph Databases
Use a vector database for AI-powered similarity search; use a graph database for complex relationship-based queries and network analysis.



