TiDB vs MyScale Escolhendo o banco de dados vetorial certo para seus apps de IA
O que é um Banco de Dados Vetorial?
Antes de compararmos TiDB e MyScale, vamos primeiro explorar o conceito de bancos de dados vetoriais.
Um banco de dados vetorial é especificamente projetado para armazenar e consultar vetores de alta dimensão, que são representações numéricas de dados não estruturados. Esses vetores codificam informações complexas, como o significado semântico de texto, as características visuais de imagens ou atributos de produtos. Ao permitir buscas por similaridade eficientes, os bancos de dados vetoriais desempenham um papel fundamental em aplicações de IA, possibilitando análise e recuperação de dados mais avançadas.
Casos de uso comuns para bancos de dados vetoriais incluem recomendações de produtos em e-commerce, plataformas de descoberta de conteúdo, detecção de anomalias em cibersegurança, análise de imagens médicas e tarefas de processamento de linguagem natural (NLP). Eles também desempenham um papel crucial na Geração Aumentada por Recuperação (RAG), uma técnica que melhora o desempenho de grandes modelos de linguagem (LLMs) fornecendo conhecimento externo para reduzir problemas como alucinações de IA.
Há muitos tipos de bancos de dados vetoriais disponíveis no mercado, incluindo:
- Bancos de dados vetoriais especializados como Milvus, Zilliz Cloud (Milvus totalmente gerenciado)
- Bibliotecas de busca vetorial como Faiss e Annoy.
- Bancos de dados vetoriais leves como Chroma e Milvus Lite.
- Bancos de dados tradicionais com complementos de busca vetorial capazes de realizar buscas vetoriais em pequena escala.
TiDB é um banco de dados tradicional e MyScale é um banco de dados criado sobre ClickHouse que combina busca vetorial e análise SQL. Ambos com busca vetorial como complemento. Esta publicação compara suas capacidades de busca vetorial.
TiDB: Visão geral e tecnologia principal
TiDB, desenvolvido pela PingCAP, é um banco de dados SQL distribuído e de código aberto que oferece capacidades de processamento transacional e analítico híbrido (HTAP). Ele é compatível com MySQL, facilitando a adoção por equipes já familiarizadas com o ecossistema MySQL. A arquitetura SQL distribuída do TiDB oferece escalabilidade horizontal como bancos de dados NoSQL, mantendo o modelo relacional dos bancos de dados SQL, tornando-o altamente flexível para lidar com cargas de trabalho transacionais e analíticas.
Um dos principais pontos fortes do TiDB é sua arquitetura HTAP, que permite processar cargas de trabalho transacionais (OLTP) e analíticas (OLAP) em um único banco de dados, reduzindo a necessidade de sistemas separados. Além disso, a compatibilidade do TiDB com MySQL facilita a integração em ambientes existentes que dependem de MySQL sem mudanças significativas no código da aplicação. O banco de dados também apresenta auto-sharding, distribuindo automaticamente os dados entre nós para melhorar o desempenho de leitura e escrita enquanto mantém forte consistência.
TiDB oferece suporte à busca vetorial por meio da integração com bibliotecas e plugins externos, permitindo gerenciamento e consulta eficientes de dados vetorizados. Esse recurso, combinado com a arquitetura HTAP do TiDB, o torna uma opção versátil para empresas que precisam de capacidades de busca vetorial juntamente com cargas de trabalho transacionais e analíticas. A arquitetura distribuída do TiDB permite lidar com consultas vetoriais em larga escala assim que as configurações necessárias estiverem implementadas.
Embora a inclusão de funcionalidades de busca vetorial no TiDB exija configuração adicional, a compatibilidade SQL do sistema permite que os desenvolvedores combinem a busca vetorial com consultas relacionais tradicionais. Essa flexibilidade torna o TiDB adequado para aplicações complexas que exigem tanto busca vetorial quanto recursos de banco de dados relacional, oferecendo uma solução abrangente para diversas necessidades de gerenciamento de dados.
O que é MyScale? Visão geral e tecnologia principal
MyScale é um banco de dados baseado em nuvem construído sobre o banco de dados de código aberto ClickHouse, projetado para cargas de trabalho de IA e machine learning. Ele pode lidar com dados estruturados e vetoriais, além de análises em tempo real e machine learning. MyScale é focado em séries temporais, busca vetorial e busca de texto completo, por isso é bom para processamento em tempo real e insights impulsionados por IA. Ao usar a arquitetura do ClickHouse, MyScale é de alto desempenho e escalável para IA.
Um dos principais recursos do MyScale é o suporte nativo a SQL, que simplifica consultas impulsionadas por IA ao integrar busca vetorial, busca de texto completo e consultas SQL tradicionais em um único sistema. Isso reduz a necessidade de múltiplas ferramentas e o torna escalável para IA. MyScale oferece suporte e gerencia o processamento analítico de dados estruturados e vetorizados em uma única plataforma usando arquitetura de banco de dados OLAP para operar em dados vetorizados. Desenvolvedores podem interagir com o MyScale usando SQL, então ele é acessível a todos os programadores familiarizados com bancos de dados relacionais.
MyScale tem vários tipos de índice vetorial e métricas de similaridade para dar suporte a diferentes casos de uso. Ele oferece suporte a métricas de distância comuns como distância euclidiana (L2), produto interno (IP) e similaridade de cosseno. O banco de dados tem vários algoritmos de indexação: MSTG (Multi-Scale Tree Graph), ScaNN, IVFFLAT, IVFPQ, IVFSQ e HNSW, cada um com seu próprio conjunto de parâmetros para ajuste. O mecanismo vetorial MSTG proprietário do MyScale usa SSDs NVMe para aumentar a densidade de dados, por isso supera bancos de dados vetoriais especializados tanto em desempenho quanto em custo.
Ao combinar a funcionalidade de um banco de dados SQL, banco de dados vetorial e mecanismo de busca de texto completo em um único sistema, MyScale reduz custos de infraestrutura e manutenção. Essa unificação permite consultas e análises conjuntas de dados e uma base de dados única para aplicações de IA. MyScale também tem MyScale Telemetry para observabilidade completa de sistemas LLM, para que você possa monitorar e depurar com eficiência. À medida que os dados se tornam mais complexos, MyScale é uma solução preparada para o futuro que pode lidar com novas modalidades de dados e tamanhos de bancos de dados, mantendo o desempenho computacional e a integração entre diferentes tipos de dados.
Principais diferenças
Implementação de busca vetorial
TiDB integra busca vetorial por meio de bibliotecas externas, enquanto MyScale tem recursos nativos de busca vetorial com vários tipos de índice (MSTG, ScaNN, IVFFLAT, IVFPQ, IVFSQ, HNSW). O mecanismo vetorial MSTG proprietário do MyScale usa SSDs NVMe para melhorar a densidade de dados e o desempenho.
Arquitetura e tratamento de dados
TiDB usa uma arquitetura híbrida de processamento transacional/analítico (HTAP), lidando tanto com cargas de trabalho OLTP quanto OLAP. É compatível com MySQL e inclui auto-sharding para distribuição de dados.
MyScale é construído sobre a arquitetura OLAP do ClickHouse, com foco em séries temporais, busca vetorial e busca de texto completo. Ele processa dados estruturados e vetoriais em um sistema unificado.
Desempenho e escalabilidade
TiDB escala horizontalmente enquanto mantém forte consistência, distribuindo dados entre nós por meio de auto-sharding.
MyScale aproveita a arquitetura de alto desempenho do ClickHouse e afirma ter desempenho superior e melhor custo-benefício em comparação com bancos de dados vetoriais especializados por meio de seu mecanismo vetorial MSTG.
Integração
TiDB oferece compatibilidade com MySQL, tornando-o adequado para ambientes MySQL existentes com alterações mínimas de código.
MyScale combina recursos de banco de dados SQL, banco de dados vetorial e busca de texto completo em uma única plataforma. Ele inclui MyScale Telemetry para monitoramento de sistemas LLM.
Custo e manutenção
TiDB pode exigir configuração e recursos adicionais para a implementação de busca vetorial.
A plataforma unificada da MyScale potencialmente reduz os custos de infraestrutura e manutenção ao eliminar a necessidade de sistemas separados.
Escolha TiDB
Quando você precisa de compatibilidade com MySQL e consegue lidar tanto com cargas de trabalho transacionais quanto analíticas. Especialmente quando você precisa de forte consistência em configurações distribuídas, auto-sharding e planeja integrar a busca vetorial a um ecossistema MySQL existente sem grandes alterações de código.
Escolha MyScale
Quando você tem aplicações orientadas por IA que precisam de integração estreita entre busca vetorial, análise de séries temporais e busca de texto completo. Quando você precisa de busca vetorial nativa com várias opções de indexação, MyScale Telemetry para monitorar seu sistema LLM e uma plataforma unificada para reduzir a complexidade da infraestrutura.
Conclusão
TiDB é excelente em fornecer SQL distribuído compatível com MySQL com capacidades HTAP, tornando-o ideal para organizações que priorizam consistência de dados e fluxos de trabalho MySQL familiares. MyScale se destaca com sua implementação nativa de busca vetorial e abordagem unificada para lidar com dados estruturados e vetoriais. Sua escolha deve estar alinhada aos seus requisitos específicos: escolha TiDB para SQL distribuído de nível empresarial com capacidades de busca vetorial, ou MyScale para busca vetorial e análises dedicadas com monitoramento abrangente de sistemas LLM.
Leia isto para obter uma visão geral de TiDB e MyScale, mas para avaliá-los você precisa avaliar com base no seu caso de uso. Uma ferramenta que pode ajudar com isso é o VectorDBBench, uma ferramenta de benchmarking open-source para comparação de bancos de dados vetoriais. No fim, um benchmarking minucioso com seus próprios conjuntos de dados e padrões de consulta será fundamental para tomar uma decisão entre essas duas abordagens poderosas, porém diferentes, para busca vetorial em sistemas de bancos de dados distribuídos.
Usando o VectorDBBench open-source para avaliar e comparar bancos de dados vetoriais por conta própria
VectorDBBench é uma ferramenta de benchmarking open-source para usuários que precisam de sistemas de armazenamento e recuperação de dados de alto desempenho, especialmente bancos de dados vetoriais. Esta ferramenta permite que os usuários testem e comparem diferentes sistemas de bancos de dados vetoriais, como Milvus e Zilliz Cloud (o Milvus gerenciado), usando seus próprios conjuntos de dados e encontrem aquele que se ajusta aos seus casos de uso. Com o VectorDBBench, os usuários podem tomar decisões com base no desempenho real do banco de dados vetorial, em vez de alegações de marketing ou boatos.
VectorDBBench é escrito em Python e licenciado sob a licença open-source MIT, o que significa que qualquer pessoa pode usá-lo, modificá-lo e distribuí-lo livremente. A ferramenta é mantida ativamente por uma comunidade de desenvolvedores comprometida em melhorar seus recursos e desempenho.
Baixe o VectorDBBench de seu repositório GitHub para reproduzir nossos resultados de benchmark ou obter resultados de desempenho em seus próprios conjuntos de dados.
Dê uma olhada rápida no desempenho dos principais bancos de dados vetoriais no Leaderboard do VectorDBBench.
Leia os blogs a seguir para saber mais sobre avaliação de bancos de dados vetoriais.
Recursos adicionais sobre VectorDB, GenAI e ML
Continue lendo

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.

Announcing the General Availability of Single Sign-On (SSO) on Zilliz Cloud
SSO is GA on Zilliz Cloud, delivering the enterprise-grade identity management capabilities your teams need to deploy vectorDB with confidence.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.
The Definitive Guide to Choosing a Vector Database
Overwhelmed by all the options? Learn key features to look for & how to evaluate with your own data. Choose with confidence.


