Autoscaling plus intelligent dans Zilliz Cloud : toujours optimisé pour chaque charge de travail
Les charges de travail d’IA ne suivent pas des courbes lisses et prévisibles. À un moment, votre base de données vectorielle sert confortablement les requêtes ; l’instant d’après, une campagne virale, une nouvelle ingestion de données ou un pic de connexions habituel à 9 h pousse l’utilisation dans la zone rouge. Les équipes sont contraintes de choisir entre le surprovisionnement et le gaspillage de budget, ou le sous-provisionnement et le risque de goulots d’étranglement.
Avec la dernière mise à niveau, Zilliz Cloud introduit un autoscaling plus intelligent—un système de gestion des ressources élastique, entièrement automatisé et plus rationalisé. Il augmente instantanément la capacité pour maintenir les performances et la réduit automatiquement pour limiter le gaspillage, supprimant les approximations et maintenant votre base de données correctement dimensionnée, quelle que soit la charge de travail.
Quoi de neuf pour l’autoscaling et comment cela fonctionne-t-il ?
Zilliz Cloud prend depuis longtemps en charge le scale-up automatique, garantissant les performances lors de pics soudains de trafic. Désormais, avec cette version, la réduction de capacité est également automatique—bouclant la boucle de l’optimisation des coûts. Au lieu d’ajuster des seuils ou de deviner quand intervenir, vous définissez simplement une plage de CU minimale et maximale, et Zilliz Cloud optimise en continu la capacité en temps réel. Cela signifie :
Coûts réduits – les ressources se contractent automatiquement lorsque la demande baisse.
Performances constantes – les ressources s’étendent instantanément lorsque la demande augmente.
Opérations simplifiées – plus de gestion manuelle des seuils ni de reconfiguration constante.
Sous le capot, l’autoscaling repose sur deux modes complémentaires couvrant tout l’éventail des schémas de charges de travail réelles :
Dynamic Scaling – C’est l’intelligence réactive du système. En surveillant en continu l’utilisation des CU (Compute Unit) en temps réel, Zilliz Cloud augmente automatiquement les ressources lors de pics imprévisibles, comme une ingestion importante ou des charges de requêtes complexes, puis les réduit lorsque la demande diminue. Résultat : des performances constantes sans le gaspillage d’un surprovisionnement permanent.
Scheduled Scaling – C’est le pendant proactif. De nombreuses charges de travail suivent des schémas prévisibles, comme les pics de connexions du matin ou les heures de pointe métier. Avec le scheduled scaling, vous pouvez prédéfinir des ajustements pour les CU et les Replicas en fonction de fenêtres temporelles. Cela garantit que votre système est parfaitement préparé au trafic attendu tout en évitant les coûts inutiles pendant les heures creuses.
Remarque : Vous pouvez toujours effectuer un scaling manuel à tout moment.
Ensemble, ces capacités garantissent que votre base de données vectorielle dispose toujours des bonnes ressources au bon moment—sans dépenses gaspillées ni risques de performance.
Cas d’utilisation pratiques de l’autoscaling
Pour rendre cette fonctionnalité concrète, examinons trois cas d’utilisation courants où l’autoscaling apporte une valeur métier mesurable.
1. Frénésie de vente flash
Une plateforme d’e-commerce lance une vente flash de deux heures à midi. Le trafic afflue, exerçant une forte pression sur les API de recommandation et de “produits similaires” alimentées par des vecteurs. Sans scaling, le système peut vaciller au moment précis où les revenus en dépendent.
Solution : Avec le Scheduled Replica Scaling, les replicas peuvent être multipliés par 4 à 11 h 50—juste avant le début de l’événement—et revenir au niveau de base à 14 h 05. Cela garantit des performances fluides pendant la fenêtre de pointe, tout en vous assurant de ne payer la capacité que lorsqu’elle est nécessaire.
2. Pic de connexions matinal
La base de connaissances IA d’une entreprise voit des centaines d’employés se connecter à 9 h chaque jour de semaine. Le pic submerge la capacité de requêtes, ralentissant les réponses du chatbot RAG et créant un début de journée de travail frustrant.
Solution : Le Scheduled Scaling permet aux replicas des nœuds de requête de s’étendre automatiquement à 8 h 50 et de se contracter à nouveau après l’affluence. C’est comme ouvrir des voies supplémentaires sur une autoroute avant l’heure de pointe—maintenir des temps de réponse rapides sans gaspiller de ressources une fois le trafic dissipé.
3. Actualisation du catalogue à minuit
Un pipeline de données lance pendant la nuit une importante tâche de réindexation non planifiée. Le processus consomme de la mémoire et entre en concurrence avec le trafic en direct, ralentissant les recherches et risquant même des délais d’expiration.
Solution : Avec Dynamic CU Scaling, Zilliz Cloud réagit en temps réel à mesure que la capacité augmente, en mettant automatiquement à l’échelle les CUs pour absorber la charge de travail. Une fois l’indexation terminée, les ressources redescendent en charge. Les requêtes en direct restent rapides, l’ingestion se termine sans heurts, et aucune intervention manuelle n’est requise.
Et ensuite ?
Cette version constitue une avancée majeure, mais elle pose aussi les bases de quelque chose de plus grand : une base de données vectorielle qui gère ses ressources de manière entièrement autonome.
Actuellement, nous explorons activement des stratégies de mise à l’échelle plus granulaires dans Zilliz Cloud. Différentes charges de travail exigent différents compromis. Certaines privilégient l’efficacité des coûts, d’autres nécessitent une marge de performance à tout moment. Nous envisageons des « profils » de mise à l’échelle qui vous permettent de définir une stratégie préférée — conservatrice pour les tâches en arrière-plan, équilibrée pour les charges de travail générales, ou agressive pour les lancements à fort enjeu. Cela donnerait aux équipes un contrôle fin tout en réduisant les incertitudes opérationnelles.
Notre objectif à long terme est de développer un cadre de gestion des ressources à la fois autonome et adaptable, vous donnant l’assurance que votre base de données vectorielle adaptera toujours sa capacité à la demande, sans aucun effort manuel.
Premiers pas avec l’autoscaling dans Zilliz Cloud
L’autoscaling est disponible dans Zilliz Cloud, et vous pouvez commencer à l’utiliser dès maintenant. Voici comment l’essayer par vous-même :
Connectez-vous à la console Zilliz Cloud. Accédez à votre projet et sélectionnez le cluster que vous souhaitez gérer.
Définissez votre plage de CUs. Définissez le nombre minimum et maximum de Compute Units (CUs) pour votre charge de travail. L’autoscaling augmentera et réduira automatiquement les ressources dans cette plage.
Choisissez votre mode de mise à l’échelle.
- Utilisez Dynamic Scaling pour les charges de travail imprévisibles (par ex., ingestion de données, pics soudains de requêtes).
Utilisez Scheduled Scaling pour les cycles prévisibles (par ex., afflux de connexions le matin, ventes flash).
Vous pouvez toujours mettre à l’échelle manuellement à tout moment si vous souhaitez des ajustements immédiats.
- Observez-le en action. Surveillez la montée et la descente en charge de votre cluster en temps réel, et affinez les réglages à mesure que vous en apprenez davantage sur votre charge de travail.
En quelques clics seulement, votre base de données restera correctement dimensionnée sans réglages constants. Vous constaterez des performances plus rapides pendant les pics, des coûts réduits pendant les périodes creuses, et moins de maux de tête opérationnels en cours de route.
Astuce : Commencez avec une plage de CUs plus large afin d’observer le comportement de l’autoscaling, puis affinez les limites à mesure que vous acquérez une compréhension plus approfondie de votre charge de travail.
👉 Pour plus d’informations, consultez notre documentation sur l’autoscaling.
👉 Vous avez des questions ? Notre équipe support est là pour vous aider.
Plus que l’autoscaling : des capacités prêtes pour l’entreprise dans Zilliz Cloud
L’autoscaling n’est qu’un élément de ce qui fait de Zilliz Cloud le service de base de données vectorielle le plus complet et le plus prêt pour la production. Dans les versions récentes, nous avons également introduit SSO GA, les journaux d’audit, la préversion privée de Milvus 2.6, ainsi qu’un ensemble croissant de fonctionnalités de niveau entreprise conçues pour répondre aux besoins des équipes qui développent l’IA à grande échelle. (Consultez notre blog de lancement pour plus de détails.)
Construit sur Milvus, Zilliz Cloud offre une expérience entièrement gérée avec :
Évolutivité élastique et efficacité des coûts – Déploiement en un clic, mise à l’échelle automatique serverless et tarification à l’usage.
Recherche IA avancée – Recherche vectorielle, plein texte et hybride (sparse + dense) avec filtrage des métadonnées, schéma dynamique et multi-tenance.
Interrogation en langage naturel – Prise en charge du serveur MCP pour des requêtes intuitives sans API complexes.
Fiabilité et sécurité de niveau entreprise – SLA de 99,95 %, certifications SOC 2 Type II et ISO 27001, conformité au RGPD, préparation HIPAA, RBAC, BYOC, et désormais journaux d’audit.
Disponibilité mondiale – Déploiements sur AWS, GCP et Azure avec une latence inférieure à 100 ms dans le monde entier.
Migration transparente – Outils intégrés pour migrer depuis Pinecone, Qdrant, Elasticsearch, PostgreSQL, OpenSearch ou Milvus sur site.
Ensemble, ces capacités garantissent que Zilliz Cloud n’est pas seulement un service de base de données vectorielle : c’est une base prête pour la production destinée aux applications d’IA d’entreprise.
Continuer à lire

How Zilliz Saw the Future of Vector Databases—and Built for Production
An inside look at how Zilliz built vector databases for real-world use, focusing on scalability, stability, and running them reliably at scale.

Why Not All VectorDBs Are Agent-Ready
Explore why choosing the right vector database is critical for scaling AI agents, and why traditional solutions fall short in production.

AI Integration in Video Surveillance Tools: Transforming the Industry with Vector Databases
Discover how AI and vector databases are revolutionizing video surveillance with real-time analysis, faster threat detection, and intelligent search capabilities for enhanced security.



