Nossa Jornada até 35 mil+ Estrelas no GitHub: A Verdadeira História de Construir o Milvus do Zero
Nos últimos anos, estivemos focados em uma coisa: construir um banco de dados vetorial pronto para empresas para a era da IA. A parte difícil não é construir um banco de dados — é construir um que seja escalável, fácil de usar e que realmente resolva problemas reais em produção.
Neste junho, alcançamos um novo marco: o Milvus chegou a 35.000 estrelas no GitHub (agora tem mais de 35,5 mil estrelas no momento em que escrevemos). Não vamos fingir que isso é apenas mais um número — significa muito para nós.
Cada estrela representa um desenvolvedor que dedicou tempo para ver o que construímos, achou útil o suficiente para salvar nos favoritos e, em muitos casos, decidiu usá-lo. Alguns de vocês foram além: abriram issues, contribuíram com código, responderam perguntas em nossos fóruns e ajudaram outros desenvolvedores quando eles ficaram travados.
Queríamos reservar um momento para compartilhar nossa história — a verdadeira, incluindo todas as partes confusas.
Começamos a construir o Milvus porque nada mais funcionava
Em 2017, começamos com uma pergunta simples: à medida que aplicações de IA começavam a surgir e dados não estruturados explodiam, como armazenar e pesquisar de forma eficiente os embeddings vetoriais que impulsionam a compreensão semântica?
Bancos de dados tradicionais não foram criados para isso. Eles são otimizados para linhas e colunas, não para vetores de alta dimensão. As tecnologias e ferramentas existentes eram impossíveis ou dolorosamente lentas para o que precisávamos.
Tentamos tudo o que estava disponível. Soluções improvisadas com Elasticsearch. Índices personalizados construídos sobre MySQL. Até experimentamos FAISS, mas ele foi projetado como uma biblioteca de pesquisa, não como uma infraestrutura de banco de dados de produção. Nada oferecia a solução completa que imaginávamos para cargas de trabalho empresariais de IA.
Então começamos a construir o nosso próprio. Não porque achássemos que seria fácil — bancos de dados são notoriamente difíceis de fazer direito — mas porque podíamos ver para onde a IA estava indo e sabíamos que ela precisava de uma infraestrutura criada especificamente para chegar lá.
Em 2018, estávamos profundamente envolvidos no desenvolvimento do que se tornaria o Milvus. O termo "banco de dados vetorial" nem existia ainda. Estávamos essencialmente criando uma nova categoria de software de infraestrutura, o que era ao mesmo tempo empolgante e assustador.
Tornando o Milvus open source: construindo em público
Em novembro de 2019, decidimos tornar open source a versão 0.10 do Milvus.
Tornar open source significa expor todos os seus defeitos ao mundo. Cada gambiarra, cada comentário TODO, cada decisão de design sobre a qual você não tem total certeza. Mas acreditávamos que, se bancos de dados vetoriais se tornariam infraestrutura crítica para IA, eles precisavam ser abertos e acessíveis a todos.
A resposta foi impressionante. Desenvolvedores não apenas usaram o Milvus — eles o melhoraram. Encontraram bugs que deixamos passar, sugeriram recursos que não havíamos considerado e fizeram perguntas que nos levaram a pensar com mais profundidade sobre nossas escolhas de design.
Em 2020, entramos para a LF AI & Data Foundation. Isso não foi apenas por credibilidade — nos ensinou como manter um projeto open source sustentável. Como lidar com governança, compatibilidade retroativa e construção de software que dure anos, não meses.
Em 2021, lançamos o Milvus 1.0 e graduamos da LF AI & Data Foundation. Nesse mesmo ano, vencemos o desafio global BigANN para busca vetorial em escala de bilhões. Essa vitória foi gratificante, mas, mais importante, validou que estávamos resolvendo problemas reais da maneira certa.
A decisão mais difícil: começar de novo
É aqui que as coisas ficam complicadas. Em 2021, o Milvus 1.0 funcionava bem para muitos casos de uso, mas clientes empresariais continuavam pedindo as mesmas coisas: melhor arquitetura cloud-native, escalabilidade horizontal mais fácil, mais simplicidade operacional.
Tínhamos uma escolha: remendar nosso caminho adiante ou reconstruir do zero. Escolhemos reconstruir.
Milvus 2.0 foi essencialmente uma reescrita completa. Introduzimos uma arquitetura de armazenamento-computação totalmente desacoplada com escalabilidade dinâmica. Levamos dois anos e, honestamente, foi um dos períodos mais estressantes da história da nossa empresa. Estávamos descartando um sistema funcional que milhares de pessoas usavam para criar algo ainda não comprovado.
Mas, quando lançamos o Milvus 2.0 em 2022, ele transformou o Milvus de um poderoso banco de dados vetorial em uma infraestrutura pronta para produção, capaz de escalar para cargas de trabalho empresariais. Naquele mesmo ano, também concluímos uma rodada de financiamento Série B+—não para queimar dinheiro, mas para reforçar nosso foco na qualidade do produto e no suporte a clientes globais. Sabíamos que esse caminho levaria tempo, mas cada passo precisava ser construído sobre uma base sólida.
Quando Tudo Acelerou com a IA
2023 foi o ano do RAG (geração aumentada por recuperação). De repente, a busca semântica deixou de ser uma técnica interessante de IA para se tornar uma infraestrutura essencial para chatbots, sistemas de perguntas e respostas sobre documentos e agentes de IA.
As estrelas do Milvus no GitHub dispararam. As solicitações de suporte se multiplicaram. Desenvolvedores que nunca tinham ouvido falar de bancos de dados vetoriais começaram, de repente, a fazer perguntas sofisticadas sobre estratégias de indexação e otimização de consultas.
Esse crescimento foi empolgante, mas também avassalador. Percebemos que precisávamos escalar não apenas nossa tecnologia, mas toda a nossa abordagem de suporte à comunidade. Contratamos mais defensores de desenvolvedores, reescrevemos completamente nossa documentação e começamos a criar conteúdo educacional para desenvolvedores novos em bancos de dados vetoriais.
Também lançamos o Zilliz Cloud—nossa versão totalmente gerenciada do Milvus. Algumas pessoas perguntaram por que estávamos "comercializando" nosso projeto de código aberto. A resposta honesta é que manter uma infraestrutura de nível empresarial é caro e complexo. O Zilliz Cloud nos permite sustentar e acelerar o desenvolvimento do Milvus, mantendo ao mesmo tempo o projeto principal completamente open source.
Então veio 2024. A Forrester nos nomeou líder na categoria de bancos de dados vetoriais. O Milvus passou de 30.000 estrelas no GitHub. E percebemos: a estrada que vínhamos pavimentando havia sete anos finalmente se tornara a rodovia. À medida que mais empresas adotavam bancos de dados vetoriais como infraestrutura crítica, nosso crescimento de negócios acelerou rapidamente—validando que a base que havíamos construído podia escalar tanto tecnicamente quanto comercialmente.
A Equipe por Trás do Milvus: Zilliz
Aqui está algo interessante: muitas pessoas conhecem o Milvus, mas não a Zilliz. Na verdade, estamos bem com isso. Zilliz é a equipe por trás do Milvus—nós o construímos, mantemos e damos suporte a ele.
O que mais nos importa são as coisas pouco glamourosas que fazem a diferença entre uma demonstração legal e uma infraestrutura pronta para produção: otimizações de desempenho, patches de segurança, documentação que realmente ajuda iniciantes e respostas cuidadosas às issues do GitHub.
Construímos uma equipe global de suporte 24/7 nos EUA, Europa e Ásia, porque os desenvolvedores precisam de ajuda em seus fusos horários, não nos nossos. Temos colaboradores da comunidade que chamamos de "Embaixadores Milvus", que organizam eventos, respondem a perguntas em fóruns e muitas vezes explicam conceitos melhor do que nós.
Também acolhemos integrações com AWS, GCP e outros provedores de nuvem—even when they offer their own managed versions of Milvus. Mais opções de implantação são boas para os usuários. Embora tenhamos notado que, quando as equipes enfrentam desafios técnicos complexos, muitas vezes acabam entrando em contato diretamente conosco, porque entendemos o sistema no nível mais profundo.
Muitas pessoas pensam que o open source é apenas uma "caixa de ferramentas", mas na verdade é um "processo evolutivo" — um esforço coletivo de inúmeras pessoas que o amam e acreditam nele. Somente aqueles que realmente entendem a arquitetura podem fornecer o "porquê" por trás das correções de bugs, da análise de gargalos de desempenho, da integração de sistemas de dados e dos ajustes arquiteturais.
Então, se você está usando o Milvus open-source, ou considerando bancos de dados vetoriais como um componente central do seu sistema de IA, incentivamos você a entrar em contato conosco diretamente para obter o suporte mais profissional e oportuno.
Impacto Real em Produção: A Confiança dos Usuários
Os casos de uso do Milvus cresceram além do que imaginávamos inicialmente. Estamos impulsionando a infraestrutura de IA para algumas das empresas mais exigentes do mundo em todos os setores.
Bosch, líder global em tecnologia automotiva e pioneira em direção autônoma, revolucionou sua análise de dados com o Milvus, alcançando uma redução de 80% nos custos de coleta de dados e economias anuais de US$ 1,4 milhão, enquanto pesquisa bilhões de cenários de direção em milissegundos para casos críticos de borda.
Read AI, uma das empresas de IA de produtividade de crescimento mais rápido, atendendo milhões de usuários ativos mensais, usa o Milvus para alcançar latência de recuperação abaixo de 20-50 ms em bilhões de registros e aceleração de 5× na busca agêntica. Seu CTO diz: "O Milvus serve como o repositório central e impulsiona nossa recuperação de informações entre bilhões de registros."
Uma líder global em fintech, uma das maiores plataformas de pagamento digital do mundo, processando dezenas de bilhões de transações em mais de 200 países e mais de 25 moedas, escolheu o Milvus por sua ingestão em lote 5-10× mais rápida que a dos concorrentes, concluindo trabalhos em menos de 1 hora que levavam mais de 8 horas em outras soluções.
Filevine, a principal plataforma de trabalho jurídico confiada por milhares de escritórios de advocacia nos Estados Unidos, gerencia 3 bilhões de vetores em milhões de documentos jurídicos, economizando 60-80% do tempo dos advogados na análise de documentos e alcançando "verdadeira consciência dos dados" para o gerenciamento de casos jurídicos.
Também apoiamos NVIDIA, OpenAI, Microsoft, Salesforce, Walmart, e muitas outras em praticamente todos os setores. Mais de 10.000 organizações escolheram o Milvus ou o Zilliz Cloud como seu banco de dados vetorial de preferência.
Essas não são apenas histórias de sucesso técnico — são exemplos de como os bancos de dados vetoriais estão se tornando silenciosamente uma infraestrutura crítica que impulsiona as aplicações de IA que as pessoas usam todos os dias.
Por Que Criamos o Zilliz Cloud: Banco de Dados Vetorial de Nível Empresarial como Serviço
O Milvus é open-source e gratuito para uso. Mas executar o Milvus bem em escala empresarial exige conhecimento profundo e recursos significativos. Seleção de índices, gerenciamento de memória, estratégias de escalabilidade, configurações de segurança — essas não são decisões triviais. Muitas equipes querem o poder do Milvus sem a complexidade operacional e com suporte empresarial, garantias de SLA etc.
É por isso que criamos o Zilliz Cloud — uma versão totalmente gerenciada do Milvus implantada em 25 regiões globais e 5 grandes clouds, incluindo AWS, GCP e Azure, projetada especificamente para cargas de trabalho de IA em escala empresarial que exigem desempenho, segurança e confiabilidade.
Veja o que torna o Zilliz Cloud diferente:
Escala Massiva com Alto Desempenho: Nosso mecanismo proprietário AutoIndex com tecnologia de IA entrega velocidades de consulta 3-5× mais rápidas que o Milvus open-source, sem necessidade de ajuste de índice. A arquitetura cloud-native suporta bilhões de vetores e dezenas de milhares de consultas simultâneas, mantendo tempos de resposta abaixo de um segundo.
Segurança e conformidade integradas: Criptografia em repouso e em trânsito, RBAC granular, registro de auditoria abrangente, integração SAML/OAuth2.0 e implantações BYOC (bring your own cloud). Estamos em conformidade com GDPR, HIPAA e outros padrões globais de que as empresas realmente precisam.
Otimizado para eficiência de custos: Armazenamento de dados em camadas hot/cold, escalabilidade elástica que responde a cargas de trabalho reais e preços pay-as-you-go podem reduzir o custo total de propriedade em 50% ou mais em comparação com implantações autogerenciadas.
Verdadeiramente agnóstico em relação à nuvem, sem aprisionamento a fornecedor: Implante na AWS, Azure, GCP, Alibaba Cloud ou Tencent Cloud sem aprisionamento a fornecedor. Garantimos consistência e escalabilidade globais, independentemente de onde você execute.
Esses recursos podem não parecer chamativos, mas resolvem problemas reais e diários que equipes empresariais enfrentam ao criar aplicações de IA em escala. E o mais importante: ainda é Milvus por baixo, portanto não há aprisionamento proprietário nem problemas de compatibilidade.
O que vem a seguir: Vector Data Lake
Cunhamos o termo "banco de dados vetorial" e fomos os primeiros a construir um, mas não vamos parar por aí. Agora estamos construindo a próxima evolução: Vector Data Lake.
Este é o problema que estamos resolvendo: nem toda busca vetorial precisa de latência em milissegundos. Muitas empresas têm conjuntos de dados massivos que são consultados ocasionalmente, incluindo análise de documentos históricos, computações de similaridade em lote e análise de tendências de longo prazo. Para esses casos de uso, um banco de dados vetorial tradicional em tempo real é tanto excessivo quanto caro.
Vector Data Lake usa uma arquitetura separada de armazenamento e computação, especificamente otimizada para vetores em escala massiva e acessados com pouca frequência, mantendo os custos drasticamente mais baixos do que os sistemas em tempo real.
Os principais recursos incluem:
Pilha de dados unificada: Conecta perfeitamente camadas de dados online e offline com formatos consistentes e armazenamento eficiente, para que você possa mover dados entre camadas hot e cold sem reformatação ou migrações complexas.
Ecossistema de computação compatível: Funciona nativamente com frameworks como Spark e Ray, dando suporte a tudo, desde busca vetorial até ETL e analytics tradicionais. Isso significa que suas equipes de dados existentes podem trabalhar com dados vetoriais usando ferramentas que já conhecem.
Arquitetura otimizada para custos: Dados hot permanecem em SSD ou NVMe para acesso rápido; dados cold são movidos automaticamente para armazenamento de objetos como S3. Estratégias inteligentes de indexação e armazenamento mantêm a E/S rápida quando você precisa, ao mesmo tempo em que tornam os custos de armazenamento previsíveis e acessíveis.
Não se trata de substituir bancos de dados vetoriais — trata-se de oferecer às empresas a ferramenta certa para cada carga de trabalho. Busca em tempo real para aplicações voltadas ao usuário, data lakes vetoriais econômicos para analytics e processamento histórico.
Ainda acreditamos na lógica por trás da Lei de Moore e do Paradoxo de Jevons: à medida que o custo unitário da computação cai, a adoção escala. O mesmo se aplica à infraestrutura vetorial.
Ao melhorar índices, estruturas de armazenamento, cache e modelos de implantação — dia após dia — esperamos tornar a infraestrutura de IA mais acessível e econômica para todos, e ajudar a trazer dados não estruturados para o futuro nativo de IA.
Um grande obrigado a todos vocês!
Essas mais de 35 mil estrelas representam algo de que temos genuinamente orgulho: uma comunidade de desenvolvedores que considera o Milvus útil o suficiente para recomendá-lo e contribuir com ele.
Mas ainda não terminamos. O Milvus tem bugs a corrigir, melhorias de desempenho a fazer e recursos que nossa comunidade vem pedindo. Nosso roadmap é público, e queremos genuinamente sua opinião sobre o que priorizar.
O número em si não é o que importa — é a confiança que essas estrelas representam. A confiança de que continuaremos construindo de forma aberta, ouvindo feedback e tornando o Milvus melhor.
Aos nossos contribuidores: seus PRs, relatórios de bugs e melhorias na documentação tornam o Milvus melhor todos os dias. Muito obrigado.
Aos nossos usuários: obrigado por confiarem a nós suas cargas de trabalho de produção e pelo feedback que nos mantém honestos.
À nossa comunidade: obrigado por responderem a perguntas, organizarem eventos e ajudarem os recém-chegados a começar.
Se você é novo em bancos de dados vetoriais, adoraríamos ajudar você a começar. Se você já usa Milvus ou Zilliz Cloud, adoraríamos ouvir sobre sua experiência. E se você apenas tem curiosidade sobre o que estamos construindo, nossos canais da comunidade estão sempre abertos.
Vamos continuar construindo a infraestrutura que torna possíveis as aplicações de IA—juntos.
Encontre-nos aqui: Milvus no GitHub | Zilliz Cloud | Discord | LinkedIn | X | YouTube
Continue lendo

Zilliz Skills Breakdown: How AI Agents Master Vector Databases
Zilliz's Milvus Skill (pymilvus, 7 files) and Zilliz Cloud Skill (zilliz-cli, 14 modules) bring vector-DB dev and ops into one Claude Code session.

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Vector Databases vs. Hierarchical Databases
Use a vector database for AI-powered similarity search; use a hierarchical database for organizing data in parent-child relationships with efficient top-down access patterns.



