TiDB vs MyScale Choisir la bonne base de données vectorielle pour vos applications d’IA
Qu’est-ce qu’une base de données vectorielle ?
Avant de comparer TiDB et MyScale, explorons d’abord le concept de bases de données vectorielles.
Une base de données vectorielle est spécifiquement conçue pour stocker et interroger des vecteurs de grande dimension, qui sont des représentations numériques de données non structurées. Ces vecteurs encodent des informations complexes, telles que la signification sémantique d’un texte, les caractéristiques visuelles d’images ou les attributs de produits. En permettant des recherches de similarité efficaces, les bases de données vectorielles jouent un rôle central dans les applications d’IA, permettant une analyse et une récupération des données plus avancées.
Les cas d’utilisation courants des bases de données vectorielles incluent les recommandations de produits en e-commerce, les plateformes de découverte de contenu, la détection d’anomalies en cybersécurité, l’analyse d’images médicales et les tâches de traitement du langage naturel (NLP). Elles jouent également un rôle crucial dans la génération augmentée par récupération (RAG), une technique qui améliore les performances des grands modèles de langage (LLMs) en fournissant des connaissances externes afin de réduire des problèmes tels que les hallucinations de l’IA.
Il existe de nombreux types de bases de données vectorielles disponibles sur le marché, notamment :
- Bases de données vectorielles dédiées telles que Milvus, Zilliz Cloud (Milvus entièrement géré)
- Bibliothèques de recherche vectorielle telles que Faiss et Annoy.
- Bases de données vectorielles légères telles que Chroma et Milvus Lite.
- Bases de données traditionnelles avec des extensions de recherche vectorielle capables d’effectuer des recherches vectorielles à petite échelle.
TiDB est une base de données traditionnelle et MyScale est une base de données construite sur ClickHouse qui combine recherche vectorielle et analyse SQL. Toutes deux disposent de la recherche vectorielle comme extension. Cet article compare leurs capacités de recherche vectorielle.
TiDB : Présentation et technologie de base
TiDB, développée par PingCAP, est une base de données SQL distribuée open source qui offre des capacités de traitement hybride transactionnel et analytique (HTAP). Elle est compatible avec MySQL, ce qui facilite son adoption par les équipes déjà familiarisées avec l’écosystème MySQL. L’architecture SQL distribuée de TiDB offre une scalabilité horizontale similaire à celle des bases de données NoSQL tout en conservant le modèle relationnel des bases de données SQL, ce qui la rend très flexible pour gérer à la fois des charges de travail transactionnelles et analytiques.
L’un des principaux atouts de TiDB est son architecture HTAP, qui lui permet de traiter des charges de travail transactionnelles (OLTP) et analytiques (OLAP) dans une seule base de données, réduisant ainsi le besoin de systèmes séparés. De plus, la compatibilité de TiDB avec MySQL facilite son intégration dans les environnements existants qui reposent sur MySQL sans modifications importantes du code applicatif. La base de données dispose également de l’auto-sharding, qui distribue automatiquement les données entre les nœuds afin d’améliorer les performances de lecture et d’écriture tout en maintenant une forte cohérence.
TiDB prend en charge la recherche vectorielle grâce à l’intégration avec des bibliothèques et plugins externes, permettant une gestion et une interrogation efficaces des données vectorisées. Cette fonctionnalité, combinée à l’architecture HTAP de TiDB, en fait une option polyvalente pour les entreprises ayant besoin de capacités de recherche vectorielle parallèlement à des charges de travail transactionnelles et analytiques. L’architecture distribuée de TiDB lui permet de gérer des requêtes vectorielles à grande échelle une fois les configurations nécessaires en place.
Bien que l’inclusion de fonctionnalités de recherche vectorielle dans TiDB nécessite une configuration supplémentaire, la compatibilité SQL du système permet aux développeurs de combiner la recherche vectorielle avec des requêtes relationnelles traditionnelles. Cette flexibilité rend TiDB adapté aux applications complexes qui nécessitent à la fois des capacités de recherche vectorielle et de base de données relationnelle, offrant une solution complète pour des besoins variés de gestion des données.
Qu’est-ce que MyScale ? Présentation et technologie de base
MyScale est une base de données cloud construite au-dessus de la base de données open source ClickHouse, conçue pour les charges de travail d’IA et de machine learning. Elle peut gérer des données structurées et vectorielles, ainsi que l’analytique en temps réel et le machine learning. MyScale se concentre sur les séries temporelles, la recherche vectorielle et la recherche en texte intégral, ce qui la rend adaptée au traitement en temps réel et aux insights pilotés par l’IA. En utilisant l’architecture ClickHouse, MyScale est performante et évolutive pour l’IA.
L’une des principales fonctionnalités de MyScale est la prise en charge native de SQL, qui simplifie les requêtes pilotées par l’IA en intégrant la recherche vectorielle, la recherche en texte intégral et les requêtes SQL traditionnelles dans un seul système. Cela réduit le besoin de plusieurs outils et la rend évolutive pour l’IA. MyScale prend en charge et gère le traitement analytique des données structurées et vectorisées sur une seule plateforme en utilisant une architecture de base de données OLAP pour opérer sur des données vectorisées. Les développeurs peuvent interagir avec MyScale en utilisant SQL, ce qui la rend accessible à tous les programmeurs familiers avec les bases de données relationnelles.
MyScale dispose de plusieurs types d’index vectoriels et de métriques de similarité pour prendre en charge différents cas d’utilisation. Elle prend en charge les métriques de distance courantes comme la distance euclidienne (L2), le produit interne (IP) et la similarité cosinus. La base de données propose plusieurs algorithmes d’indexation : MSTG (Multi-Scale Tree Graph), ScaNN, IVFFLAT, IVFPQ, IVFSQ et HNSW, chacun avec son propre ensemble de paramètres à ajuster. Le moteur vectoriel propriétaire MSTG de MyScale utilise des SSD NVMe pour augmenter la densité des données, ce qui lui permet de surpasser les bases de données vectorielles spécialisées à la fois en performance et en coût.
En combinant les fonctionnalités d’une base de données SQL, d’une base de données vectorielle et d’un moteur de recherche en texte intégral dans un seul système, MyScale réduit les coûts d’infrastructure et de maintenance. Cette unification permet des requêtes et des analyses conjointes des données ainsi qu’une base de données unique pour les applications d’IA. MyScale dispose également de MyScale Telemetry pour une observabilité complète des systèmes LLM, afin que vous puissiez surveiller et déboguer efficacement. À mesure que les données deviennent plus complexes, MyScale est une solution pérenne capable de gérer de nouvelles modalités de données et des tailles de bases de données plus importantes tout en maintenant les performances de calcul et l’intégration entre différents types de données.
Principales différences
Implémentation de la recherche vectorielle
TiDB intègre la recherche vectorielle via des bibliothèques externes, tandis que MyScale dispose de capacités natives de recherche vectorielle avec plusieurs types d’index (MSTG, ScaNN, IVFFLAT, IVFPQ, IVFSQ, HNSW). Le moteur vectoriel propriétaire MSTG de MyScale utilise des SSD NVMe pour améliorer la densité des données et les performances.
Architecture et gestion des données
TiDB utilise une architecture de traitement hybride transactionnel/analytique (HTAP), gérant à la fois les charges de travail OLTP et OLAP. Il est compatible avec MySQL et inclut l’auto-sharding pour la distribution des données.
MyScale s’appuie sur l’architecture OLAP de ClickHouse, en se concentrant sur les séries temporelles, la recherche vectorielle et la recherche en texte intégral. Il traite les données structurées et vectorielles dans un système unifié.
Performance et évolutivité
TiDB évolue horizontalement tout en maintenant une forte cohérence, en distribuant les données entre les nœuds grâce à l’auto-sharding.
MyScale exploite l’architecture haute performance de ClickHouse et revendique des performances et une rentabilité supérieures à celles des bases de données vectorielles spécialisées grâce à son moteur vectoriel MSTG.
Intégration
TiDB offre une compatibilité MySQL, ce qui le rend adapté aux environnements MySQL existants avec des modifications minimales du code.
MyScale combine les capacités d’une base de données SQL, d’une base de données vectorielle et de recherche en texte intégral sur une seule plateforme. Il inclut MyScale Telemetry pour la surveillance des systèmes LLM.
Coût et maintenance
TiDB peut nécessiter une configuration et des ressources supplémentaires pour la mise en œuvre de la recherche vectorielle.
La plateforme unifiée de MyScale peut potentiellement réduire les coûts d’infrastructure et de maintenance en éliminant le besoin de systèmes séparés.
Choisissez TiDB
Lorsque vous avez besoin d’une compatibilité MySQL et que vous pouvez gérer à la fois des charges de travail transactionnelles et analytiques. En particulier lorsque vous avez besoin d’une forte cohérence dans des configurations distribuées, d’un auto-sharding et que vous prévoyez d’intégrer la recherche vectorielle dans un écosystème MySQL existant sans modifications majeures du code.
Choisissez MyScale
Lorsque vous avez des applications pilotées par l’IA qui nécessitent une intégration étroite entre la recherche vectorielle, l’analyse de séries temporelles et la recherche plein texte. Lorsque vous avez besoin d’une recherche vectorielle native avec plusieurs options d’indexation, de MyScale Telemetry pour surveiller votre système LLM et d’une plateforme unifiée pour réduire la complexité de l’infrastructure.
Conclusion
TiDB excelle dans la fourniture de SQL distribué compatible avec MySQL avec des capacités HTAP, ce qui le rend idéal pour les organisations qui privilégient la cohérence des données et les workflows MySQL familiers. MyScale se distingue par sa mise en œuvre native de la recherche vectorielle et son approche unifiée de la gestion des données structurées et vectorielles. Votre choix doit s’aligner sur vos exigences spécifiques : choisissez TiDB pour un SQL distribué de niveau entreprise avec des capacités de recherche vectorielle, ou MyScale pour une recherche vectorielle et des analyses dédiées avec une surveillance complète du système LLM.
Lisez ceci pour obtenir un aperçu de TiDB et de MyScale, mais pour les évaluer, vous devez le faire en fonction de votre cas d’utilisation. Un outil qui peut vous y aider est VectorDBBench, un outil de benchmarking open source pour la comparaison de bases de données vectorielles. En fin de compte, un benchmarking approfondi avec vos propres jeux de données et schémas de requêtes sera essentiel pour prendre une décision entre ces deux approches puissantes mais différentes de la recherche vectorielle dans les systèmes de bases de données distribuées.
Utiliser VectorDBBench open source pour évaluer et comparer les bases de données vectorielles par vous-même
VectorDBBench est un outil de benchmarking open source destiné aux utilisateurs qui ont besoin de systèmes de stockage et de récupération de données haute performance, en particulier de bases de données vectorielles. Cet outil permet aux utilisateurs de tester et de comparer différents systèmes de bases de données vectorielles comme Milvus et Zilliz Cloud (le Milvus managé) en utilisant leurs propres jeux de données et de trouver celui qui correspond à leurs cas d’utilisation. Avec VectorDBBench, les utilisateurs peuvent prendre des décisions basées sur les performances réelles des bases de données vectorielles plutôt que sur des affirmations marketing ou des ouï-dire.
VectorDBBench est écrit en Python et sous licence open source MIT, ce qui signifie que chacun peut librement l’utiliser, le modifier et le distribuer. L’outil est activement maintenu par une communauté de développeurs déterminés à améliorer ses fonctionnalités et ses performances.
Téléchargez VectorDBBench depuis son dépôt GitHub pour reproduire nos résultats de benchmark ou obtenir des résultats de performance sur vos propres jeux de données.
Jetez un rapide coup d’œil aux performances des principales bases de données vectorielles sur le classement VectorDBBench.
Lisez les blogs suivants pour en savoir plus sur l’évaluation des bases de données vectorielles.
Ressources supplémentaires sur VectorDB, GenAI et ML
Continuer à lire

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

Zilliz Cloud Audit Logs Goes GA: Security, Compliance, and Transparency at Scale
Zilliz Cloud Audit Logs are now GA, giving enterprises real-time visibility, compliance-ready trails, and stronger security across AWS, GCP, and Azure.

Our Journey to 35K+ GitHub Stars: The Real Story of Building Milvus from Scratch
Join us in celebrating Milvus, the vector database that hit 35.5K stars on GitHub. Discover our story and how we’re making AI solutions easier for developers.
The Definitive Guide to Choosing a Vector Database
Overwhelmed by all the options? Learn key features to look for & how to evaluate with your own data. Choose with confidence.


