A Próxima Parada para Bancos de Dados Vetoriais: 8 Previsões para 2023
2022 marcou um ano significativo para os bancos de dados vetoriais. Notavelmente, a comunidade Milvus lançou o banco de dados vetorial cloud-native Milvus 2.0. Mais de dez produtos de bancos de dados vetoriais de código aberto, como Vald, Weaviate, Qdrant, Vespa, Vearch, AquilaDB e Marqo, surgiram no GitHub. Fabricantes de bancos de dados como Elastic e Redis entraram na disputa, introduzindo recursos de recuperação vetorial. No front da nuvem, a Zilliz, a equipe por trás da comunidade Milvus, lançou um serviço DBaaS totalmente gerenciado, o Zilliz Cloud, competindo com empresas como Pinecone e Google Vertex AI.
O mercado de capitais foi igualmente vibrante, com várias empresas de bancos de dados vetoriais garantindo financiamentos significativos, preparando o cenário para um maior crescimento. Esse influxo de capital e interesse em bancos de dados vetoriais em 2022 abre caminho para minhas previsões para 2023, um ano em que espero testemunhar o desenvolvimento e a maturação contínuos desta tecnologia emergente.
| Empresa | Captado | Data |
|---|---|---|
| Zilliz | $60M (Rodada B+) | Ago 2022 |
| Pinecone | $28M (Rodada A) | Mar 2022 |
| Weaviate | $16M (Rodada A) | Fev 2022 |
| Qdrant | €2M (Rodada Pre-Seed) | Jan 2022 |
Situações de Financiamento das Empresas de Bancos de Dados Vetoriais em 2022
Previsões de 2023 para Bancos de Dados Vetoriais
Previsão nº 1: Diferenciação e Especialização em Bancos de Dados Vetoriais
Em 2023, os bancos de dados vetoriais evoluirão de forma distinta devido ao influxo de capital e ao rápido desenvolvimento de casos de uso, levando à diferenciação e especialização:
Serviço Online Versus Processamento Offline: Bancos de dados vetoriais tradicionais, projetados para altas demandas online em tempo real com escalas de dados menores, agora se adaptarão para lidar com conjuntos de dados massivos de áreas como processamento de imagens e NLP, necessitando de processamento em lote aprimorado e capacidades offline.
Instâncias Lógicas Versus Instâncias Físicas: O setor verá uma divisão entre instâncias lógicas, focadas na facilidade de uso e implantações simples, e instâncias físicas como Milvus, que oferecem armazenamento flexível e soluções de recuperação eficientes. Essa divergência atende a necessidades variadas, desde processamento vetorial simples até geração vetorial complexa.
Standalone Versus Sistemas Distribuídos Cloud-Native: A escolha entre sistemas standalone e sistemas distribuídos cloud-native será crucial. Enquanto sistemas standalone oferecem estabilidade, designs distribuídos cloud-native como o Milvus 2.0 estão preparados para escalabilidade e eficiências baseadas na nuvem.
Diferentes Implementações de Indexação: As metodologias de indexação estão se diversificando. Com novos desenvolvimentos como a tecnologia ScaNN do Google, os bancos de dados vetoriais estão evoluindo em desempenho e funcionalidade, adaptando-se a casos de uso específicos e requisitos de eficiência.
Essas tendências indicam um movimento em direção a bancos de dados vetoriais mais personalizados e especializados, alinhados às necessidades específicas de diversas aplicações e escalas de dados.
Previsão nº 2: Movimento em Direção a uma Interface de Consulta Unificada
Atualmente, os bancos de dados vetoriais carecem de uma interface de consulta unificada, usando predominantemente SDKs Python personalizados ou APIs Restful. No entanto, desenvolvimentos como o BigLake do Big Query no Google Next 2022, que avança o SQL como linguagem primária para dados não estruturados e processamento vetorial, sugerem uma mudança significativa. Apesar da base de usuários tradicional do SQL diferir dos desenvolvedores de deep learning e de seu sucesso misto em machine learning, seu potencial como linguagem de consulta para bancos de dados vetoriais merece atenção.
Além de SQL, há experimentos com linguagens de consulta baseadas em GraphQL e DSLs personalizadas. Independentemente de qual interface ganhe aceitação mais ampla, a previsão para 2023 é o surgimento de uma interface padrão de facto no domínio de bancos de dados vetoriais, com múltiplos produtos adotando uma abordagem semelhante para implementação.
Previsão #3: Maior Integração de Bancos de Dados Vetoriais com Bancos de Dados Tradicionais
Os bancos de dados vetoriais evoluíram consideravelmente nos últimos dois anos, indo além de sua fase inicial como simples wrappers em torno do FAISS. Agora, eles rotineiramente apresentam capacidades para filtrar e indexar campos escalares e gerenciar operações CRUD em dados de streaming, integrando elementos como parsers, otimizadores, memória e gerenciamento de concorrência de bancos de dados tradicionais. Muitos bancos de dados OLAP e NoSQL incorporam capacidades de recuperação vetorial, tornando-se atores significativos neste campo.
Apesar da crença de que "um tamanho não serve para todos", com bancos de dados tradicionais enfrentando dificuldades na recuperação vetorial devido a limitações humanas e arquiteturais, 2023 provavelmente verá mais fabricantes de bancos de dados tradicionais entrando no espaço de recuperação vetorial, atraídos por seu potencial. Bancos de dados vetoriais, por outro lado, estão aprendendo cada vez mais com os domínios de bancos de dados tradicionais, fazendo a transição de seu núcleo de infraestrutura de IA para funcionalidades mais orientadas a bancos de dados. Essa mudança é impulsionada pela necessidade de soluções de recuperação vetorial mais generalistas e estáveis. Consequentemente, esperamos ver um influxo de talentos com experiência em bancos de dados tradicionais (incluindo processamento de transações, processamento de aplicações, busca e cache) para o setor de bancos de dados vetoriais em 2023.
Previsão #4: Redução Significativa de Custos em Bancos de Dados Vetoriais
Em 2023, prevê-se que os bancos de dados vetoriais experimentarão uma redução de custos de 3 a 5 vezes. Essa mudança é crucial, pois custo e desempenho têm sido barreiras significativas para que a recuperação vetorial supere a busca tradicional por palavras-chave. Atualmente, a maioria dos bancos de dados vetoriais depende exclusivamente de memória. Para armazenar dados vetoriais na faixa de dezenas de bilhões, eles precisam de capacidade de memória na ordem de dezenas de terabytes.
Vários fatores estão contribuindo para essa redução de custos:
Uso Generalizado da Arquitetura ARM na Nuvem: O desempenho computacional simples da ARM oferece uma eficiência de custo 2 a 3 vezes melhor do que X86.
Crescimento de Hardware Heterogêneo: Esses sistemas superam as capacidades de memória/armazenamento e largura de banda das GPUs.
Avanços em Técnicas de Quantização: Especialmente a aplicação de quantização de 4 bits na recuperação vetorial.
Foco na Pesquisa de Índices Disk Anns: Emergindo como uma direção de pesquisa dominante.
Desempenho de Discos NVMe: Utilizando tecnologias como AIO e IO_URING, alcançando IOPs na casa dos milhões.
Compreensão Mais Profunda de Bancos de Dados Vetoriais: Aproveitando metadados e técnicas de poda semelhantes às de bancos de dados tradicionais, reduzindo a necessidade de consultar todos os shards a cada vez.
Seleção de Índices e Parâmetros de Modelo Baseada em Machine Learning: Essa abordagem será implementada em produção pela primeira vez.
Características de Temperatura dos Dados Vetoriais: Assim como dados escalares tradicionais, dados vetoriais exibem características quentes e frias.
Esses desenvolvimentos indicam um ano promissor para bancos de dados vetoriais, tornando-os mais econômicos e eficientes.
Previsão #5: Surgimento do Primeiro Banco de Dados Vetorial Serverless
Em 2023, antecipamos a introdução do primeiro banco de dados vetorial serverless. A arquitetura serverless oferece flexibilidade e cobrança sob demanda, particularmente atraente para serviços de bancos de dados vetoriais hospedados na nuvem. Essa tecnologia se adequa à natureza complexa das recuperações vetoriais, que incluem processos offline e online e frequentemente enfrentam cargas flutuantes em ambientes multi-tenant. Serverless simplifica a avaliação de capacidade e o isolamento de negócios para os usuários.
Embora os bancos de dados vetoriais serverless ainda estejam evoluindo e tenham um caminho a percorrer antes de atingir a maturidade, há potencial para desenvolvimentos iniciais semelhantes aos sistemas autônomos baseados em contêineres e dinamicamente escaláveis do AWS Aurora. No entanto, a plena realização de um banco de dados vetorial serverless verdadeiramente distribuído ainda pode estar um pouco distante.
Previsão nº 6: Ascensão de Ferramentas de Código Aberto para Bancos de Dados Vetoriais
Em 2023, podemos esperar ver a ascensão de ferramentas de código aberto adaptadas para bancos de dados vetoriais. As características únicas dos dados vetoriais exigem a criação de ferramentas inovadoras que vão além dos métodos tradicionais de representação de dados. Essas ferramentas fornecerão maneiras mais intuitivas e visuais de exibir dados vetoriais, incluindo sua distribuição e caminhos de consulta.
O desenvolvimento de ferramentas de transferência de dados também será um foco importante. Essas ferramentas aprimorarão os recursos de backup, migração e importação de dados, abordando a crescente diversidade dos bancos de dados vetoriais. Elas desempenharão um papel crucial na conexão de diferentes tipos de dados e no gerenciamento do fluxo de dados vetoriais em larga escala gerados por plataformas como Spark, PyTorch e TensorFlow, facilitando a integração perfeita entre várias nuvens e data centers.
Previsão nº 7: Adoção Inicial de IA para Banco de Dados (AI4DB) em Bancos de Dados Vetoriais
Em 2023, os bancos de dados vetoriais liderarão o caminho para uma implementação prática das tecnologias de IA para Banco de Dados (AI4DB). Embora AI4DB tenha sido um conceito no campo de bancos de dados por muitos anos, sua adoção generalizada tem sido desafiadora. O principal obstáculo tem sido as altas exigências de precisão e explicabilidade dos bancos de dados relacionais, em que até mesmo uma pequena porcentagem de imprecisões pode dificultar aplicações de IA em casos de uso do mundo real.
Os bancos de dados vetoriais, no entanto, operam inerentemente com otimização probabilística, focando mais nas taxas de recall do que na precisão absoluta. Essa característica permite uma aplicação mais agressiva de AI4DB, como ajuste automático de parâmetros, reescrita de instruções de consulta e uso de índices aprendidos. Testes mostraram que usar previsões de modelo para parâmetros de consulta pode mais que dobrar o desempenho em grandes conjuntos de dados. A otimização de índices e parâmetros de consulta com base em conjuntos de dados e em um pequeno conjunto de consultas provavelmente gerará melhorias ainda mais significativas.
Previsão nº 8: Segunda Empresa Comercial Emergindo do Milvus de Código Aberto
Em 2023, podemos esperar ver o lançamento de novos empreendimentos comerciais que aproveitam o banco de dados vetorial de código aberto Milvus. Milvus é um dos bancos de dados vetoriais nativos de nuvem líderes e mais avançados globalmente. Assim como projetos de código aberto bem-sucedidos como Hadoop, Presto e Clickhouse, Milvus inspirará entidades comerciais a contribuir e construir sobre sua base. Embora iniciar um projeto de banco de dados vetorial do zero se torne cada vez mais desafiador, o potencial para desenvolver SaaS (Software as a Service) baseado em bancos de dados vetoriais como Milvus continua significativo. Essa tendência provavelmente continuará com mais colaboradores ingressando na comunidade de código aberto, colaborando no projeto Milvus e explorando oportunidades comerciais.
Considerações Finais
Nos últimos anos, houve uma expansão significativa nas capacidades e nos casos de uso de bancos de dados vetoriais, muito auxiliada por avanços no poder computacional, incluindo GPUs e hardware especializado. Olhando para 2023, este está se desenhando como um ano altamente aguardado para a indústria e a comunidade de código aberto. Ele promete ser um período de inovação, crescimento e colaboração contínuos.
Esta série de previsões, embora breve, visa fornecer um vislumbre do futuro dos bancos de dados vetoriais, destacando os desenvolvimentos e oportunidades empolgantes no horizonte. À medida que avançamos em 2023, as perspectivas para este campo são promissoras e indicativas da natureza dinâmica e em evolução da tecnologia. Vamos aguardar o que o próximo ano nos trará em bancos de dados vetoriais. Até 2023!
Continue lendo

From Vector Database to Vector Lakebase
Zilliz offers a fully managed Vector Lakebase powered by Milvus, unifying real-time vector search, lake-scale discovery, and Al data operations.

Smarter Autoscaling in Zilliz Cloud: Always Optimized for Every Workload
With the latest upgrade, Zilliz Cloud introduces smarter autoscaling—a fully automated, more streamlined, elastic resource management system.

Legal Document Analysis: Harnessing Zilliz Cloud's Semantic Search and RAG for Legal Insights
Enhance legal document analysis with Zilliz Cloud’s Semantic Search and RAG. Improve accuracy, efficiency, and scalability for contracts, case law, and compliance.



