Escalonamento automático mais inteligente no Zilliz Cloud: sempre otimizado para cada carga de trabalho
As cargas de trabalho de IA não seguem curvas suaves e previsíveis. Em um momento, seu banco de dados vetorial está atendendo consultas confortavelmente; no seguinte, uma campanha viral, uma nova ingestão de dados ou um pico rotineiro de logins às 9h empurra o uso para a zona vermelha. As equipes são forçadas a escolher entre superprovisionar e desperdiçar orçamento, ou subprovisionar e arriscar gargalos.
Com a atualização mais recente, o Zilliz Cloud apresenta um autoscaling mais inteligente—um sistema de gerenciamento de recursos elásticos totalmente automatizado e mais simplificado. Ele escala para cima instantaneamente para manter o desempenho e escala para baixo automaticamente para reduzir desperdícios, eliminando suposições e mantendo seu banco de dados dimensionado adequadamente sob qualquer carga de trabalho.
O que há de novo no Autoscaling e como ele funciona?
O Zilliz Cloud há muito oferece suporte ao scale-up automático, garantindo desempenho durante picos repentinos de tráfego. Agora, com esta versão, o scaling down também é automático—fechando o ciclo da otimização de custos. Em vez de ajustar limites ou adivinhar quando fazer ajustes, você simplesmente define uma faixa mínima e máxima de CUs, e o Zilliz Cloud otimiza continuamente a capacidade em tempo real. Isso significa:
Custos mais baixos – os recursos contraem automaticamente quando a demanda cai.
Desempenho consistente – os recursos expandem instantaneamente quando a demanda aumenta.
Operações mais simples – sem mais gerenciamento manual de limites ou reconfiguração constante.
Nos bastidores, o autoscaling é impulsionado por dois modos complementares que cobrem todo o espectro de padrões de cargas de trabalho do mundo real:
Dynamic Scaling – Esta é a inteligência reativa do sistema. Ao monitorar continuamente a utilização de CUs (Compute Unit) em tempo real, o Zilliz Cloud escala automaticamente os recursos para cima durante picos imprevisíveis, como ingestão intensa ou cargas de consultas complexas, e escala de volta para baixo quando a demanda diminui. O resultado é desempenho consistente sem o desperdício do superprovisionamento permanente.
Scheduled Scaling – Esta é a contraparte proativa. Muitas cargas de trabalho seguem padrões previsíveis, como picos de login pela manhã ou horários comerciais de pico. Com o scheduled scaling, você pode predefinir ajustes tanto para CUs quanto para Replicas com base em janelas de tempo. Isso garante que seu sistema esteja totalmente preparado para o tráfego esperado, evitando custos desnecessários durante horários de menor movimento.
Observação: Você ainda pode escalar manualmente a qualquer momento.
Juntas, essas capacidades garantem que seu banco de dados vetorial sempre tenha os recursos certos no momento certo—sem gastos desperdiçados nem riscos de desempenho.
Casos de uso práticos para Autoscaling
Para tornar esse recurso concreto, vejamos três casos de uso comuns em que o autoscaling entrega valor de negócio mensurável.
1. Frenesi de promoção relâmpago
Uma plataforma de e-commerce lança uma promoção relâmpago de duas horas ao meio-dia. O tráfego dispara, colocando forte pressão sobre APIs de “produtos similares” e recomendações baseadas em vetores. Sem escalabilidade, o sistema pode falhar exatamente no momento em que a receita depende dele.
Solução: Com o Scheduled Replica Scaling, as réplicas podem ser aumentadas 4× às 11:50 AM—logo antes do início do evento—e retornar à linha de base às 2:05 PM. Isso garante desempenho fluido durante a janela de pico, ao mesmo tempo em que garante que você pague pela capacidade apenas quando ela for necessária.
2. Pico de logins pela manhã
A base de conhecimento de IA de uma empresa vê centenas de funcionários fazendo login às 9h em cada dia útil. O pico sobrecarrega a capacidade de consulta, desacelerando as respostas do chatbot RAG e criando um início frustrante para o dia de trabalho.
Solução: O Scheduled Scaling permite que as réplicas dos nós de consulta se expandam automaticamente às 8:50 AM e se contraiam novamente após o rush. É como abrir faixas extras em uma rodovia antes do horário de pico—mantendo os tempos de resposta rápidos sem desperdiçar recursos quando o tráfego diminui.
3. Atualização do catálogo à meia-noite
Um pipeline de dados inicia um grande job de reindexação não programado durante a noite. O processo consome memória e compete com o tráfego ao vivo, desacelerando buscas e até arriscando timeouts.
Solução: Com o Dynamic CU Scaling, o Zilliz Cloud responde em tempo real conforme a capacidade aumenta, escalando automaticamente as CUs para absorver a carga de trabalho. Assim que a indexação é concluída, os recursos reduzem novamente. As consultas em tempo real permanecem rápidas, a ingestão é concluída sem problemas e nenhuma intervenção manual é necessária.
O que vem a seguir?
Esta versão é um grande avanço, mas também é a base para algo maior: um banco de dados vetorial que gerencia recursos totalmente por conta própria.
Atualmente, estamos explorando ativamente estratégias de escalabilidade mais granulares no Zilliz Cloud. Diferentes cargas de trabalho exigem diferentes compensações. Algumas priorizam a eficiência de custos, outras exigem margem de desempenho o tempo todo. Estamos imaginando “perfis” de escalabilidade que permitam definir uma estratégia preferida — conservadora para tarefas em segundo plano, equilibrada para cargas de trabalho gerais ou agressiva para lançamentos de alto risco. Isso daria às equipes controle refinado, ao mesmo tempo em que reduziria a incerteza operacional.
Nosso objetivo de longo prazo é desenvolver uma estrutura de gerenciamento de recursos que seja autônoma e adaptável, oferecendo a você a confiança de que seu banco de dados vetorial sempre ajustará a capacidade à demanda, com zero esforço manual.
Começando com Autoscaling no Zilliz Cloud
O autoscaling está disponível no Zilliz Cloud, e você pode começar a usá-lo agora mesmo. Veja como experimentar por conta própria:
Faça login no console do Zilliz Cloud. Acesse seu projeto e selecione o cluster que deseja gerenciar.
Defina seu intervalo de CUs. Defina o mínimo e o máximo de Compute Units (CUs) para sua carga de trabalho. O autoscaling expandirá e reduzirá automaticamente os recursos dentro desse intervalo.
Escolha seu modo de escalabilidade.
- Use Dynamic Scaling para cargas de trabalho imprevisíveis (por exemplo, ingestão de dados, picos repentinos de consultas).
Use Scheduled Scaling para ciclos previsíveis (por exemplo, picos de login pela manhã, vendas relâmpago).
Você ainda pode escalar manualmente a qualquer momento se quiser ajustes imediatos.
- Veja em ação. Monitore como seu cluster aumenta e reduz em tempo real, e ajuste conforme aprende mais sobre sua carga de trabalho.
Com apenas alguns cliques, seu banco de dados permanecerá dimensionado corretamente sem ajustes constantes. Você verá desempenho mais rápido durante picos, custos menores durante períodos de baixa e menos dores de cabeça operacionais ao longo do caminho.
Dica: Comece com um intervalo de CUs mais amplo para observar como o autoscaling se comporta e, em seguida, ajuste os limites conforme obtém uma compreensão mais profunda da sua carga de trabalho.
👉 Para mais informações, consulte nossa documentação de autoscaling.
👉 Tem dúvidas? Nossa equipe de suporte está aqui para ajudar.
Mais do que Autoscaling: recursos prontos para empresas no Zilliz Cloud
Autoscaling é apenas uma parte do que torna o Zilliz Cloud o serviço de banco de dados vetorial mais completo e pronto para produção. Em versões recentes, também introduzimos SSO GA, logs de auditoria, o Milvus 2.6 private preview e um conjunto crescente de recursos de nível empresarial projetados para atender às necessidades de equipes que criam IA em escala. (Veja nosso blog de lançamento para detalhes.)
Construído sobre o Milvus, o Zilliz Cloud oferece uma experiência totalmente gerenciada com:
Escalabilidade elástica e eficiência de custos – Implantação com um clique, escalonamento automático sem servidor e preços conforme o uso.
Busca avançada com IA – Busca vetorial, de texto completo e híbrida (esparsa + densa) com filtragem de metadados, esquema dinâmico e multilocação.
Consultas em linguagem natural – Suporte a servidor MCP para consultas intuitivas sem APIs complexas.
Confiabilidade e segurança de nível empresarial – SLA de 99,95%, certificações SOC 2 Tipo II e ISO 27001, conformidade com GDPR, prontidão para HIPAA, RBAC, BYOC e, agora, logs de auditoria.
Disponibilidade global – Implantações na AWS, GCP e Azure com latência inferior a 100 ms em todo o mundo.
Migração sem complicações – Ferramentas integradas para migrar do Pinecone, Qdrant, Elasticsearch, PostgreSQL, OpenSearch ou Milvus on-premises.
Juntas, essas capacidades garantem que o Zilliz Cloud não seja apenas um serviço de banco de dados vetorial — é uma base pronta para produção para aplicações de IA empresariais.
Continue lendo

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

Optimizing Embedding Model Selection with TDA Clustering: A Strategic Guide for Vector Databases
Discover how Topological Data Analysis (TDA) reveals hidden embedding model weaknesses and helps optimize vector database performance.

Bringing AI to Legal Tech: The Role of Vector Databases in Enhancing LLM Guardrails
Discover how vector databases enhance AI reliability in legal tech, ensuring accurate, compliant, and trustworthy AI-powered legal solutions.



