Notre parcours vers plus de 35 000 étoiles GitHub : la véritable histoire de la création de Milvus à partir de zéro
Depuis quelques années, nous nous concentrons sur une seule chose : construire une base de données vectorielle prête pour l’entreprise à l’ère de l’IA. La difficulté n’est pas de construire une base de données — c’est d’en construire une qui soit évolutive, facile à utiliser, et qui résolve réellement des problèmes concrets en production.
En juin, nous avons franchi une nouvelle étape : Milvus a atteint 35 000 étoiles sur GitHub (il compte désormais plus de 35,5K étoiles au moment de la rédaction). Nous n’allons pas faire comme si ce n’était qu’un chiffre de plus — cela compte énormément pour nous.
Chaque étoile représente un développeur qui a pris le temps de regarder ce que nous avons construit, l’a trouvé suffisamment utile pour l’ajouter à ses favoris et, dans de nombreux cas, a décidé de l’utiliser. Certains d’entre vous sont allés plus loin : en signalant des problèmes, en contribuant du code, en répondant aux questions dans nos forums et en aidant d’autres développeurs lorsqu’ils sont bloqués.
Nous voulions prendre un moment pour partager notre histoire — la vraie, avec toutes ses imperfections.
Nous avons commencé à construire Milvus parce que rien d’autre ne fonctionnait
En 2017, nous sommes partis d’une question simple : alors que les applications d’IA commençaient à émerger et que les données non structurées explosaient, comment stocker et rechercher efficacement les embeddings vectoriels qui alimentent la compréhension sémantique ?
Les bases de données traditionnelles n’étaient pas conçues pour cela. Elles sont optimisées pour les lignes et les colonnes, pas pour les vecteurs de grande dimension. Les technologies et outils existants étaient soit impossibles à utiliser, soit douloureusement lents pour ce dont nous avions besoin.
Nous avons essayé tout ce qui était disponible. Des solutions bricolées avec Elasticsearch. Des index personnalisés construits au-dessus de MySQL. Nous avons même expérimenté FAISS, mais il était conçu comme une bibliothèque de recherche, pas comme une infrastructure de base de données de production. Rien ne fournissait la solution complète que nous imaginions pour les charges de travail d’IA en entreprise.
Nous avons donc commencé à construire la nôtre. Pas parce que nous pensions que ce serait facile — les bases de données sont notoirement difficiles à bien concevoir — mais parce que nous voyions où allait l’IA et savions qu’elle aurait besoin d’une infrastructure spécialement conçue pour y parvenir.
En 2018, nous étions plongés dans le développement de ce qui allait devenir Milvus. Le terme « base de données vectorielle » n’existait même pas encore. Nous étions essentiellement en train de créer une nouvelle catégorie de logiciel d’infrastructure, ce qui était à la fois enthousiasmant et terrifiant.
Rendre Milvus open source : construire publiquement
En novembre 2019, nous avons décidé de publier Milvus version 0.10 en open source.
Rendre un projet open source signifie exposer toutes ses failles au monde. Chaque bricolage, chaque commentaire TODO, chaque décision de conception dont vous n’êtes pas entièrement sûr. Mais nous pensions que si les bases de données vectorielles devaient devenir une infrastructure critique pour l’IA, elles devaient être ouvertes et accessibles à tous.
La réponse a été impressionnante. Les développeurs ne se sont pas contentés d’utiliser Milvus — ils l’ont amélioré. Ils ont trouvé des bugs que nous avions manqués, suggéré des fonctionnalités auxquelles nous n’avions pas pensé et posé des questions qui nous ont poussés à réfléchir plus profondément à nos choix de conception.
En 2020, nous avons rejoint la LF AI & Data Foundation. Ce n’était pas seulement pour la crédibilité — cela nous a appris à maintenir un projet open source durable. Comment gérer la gouvernance, la compatibilité ascendante et construire des logiciels qui durent des années, pas des mois.
En 2021, nous avons publié Milvus 1.0 et sommes sortis diplômés de la LF AI & Data Foundation. Cette même année, nous avons remporté le défi mondial BigANN pour la recherche vectorielle à l’échelle du milliard. Cette victoire nous a fait plaisir, mais surtout, elle a validé le fait que nous résolvions de vrais problèmes de la bonne manière.
La décision la plus difficile : repartir de zéro
C’est là que les choses se compliquent. En 2021, Milvus 1.0 fonctionnait bien pour de nombreux cas d’utilisation, mais les clients en entreprise demandaient sans cesse les mêmes choses : une meilleure architecture cloud-native, une mise à l’échelle horizontale plus facile, plus de simplicité opérationnelle.
Nous avions le choix : avancer à coups de correctifs ou reconstruire depuis zéro. Nous avons choisi de reconstruire.
Milvus 2.0 était essentiellement une réécriture complète. Nous avons introduit une architecture stockage-calcul entièrement découplée, avec une scalabilité dynamique. Cela nous a pris deux ans et a été, honnêtement, l’une des périodes les plus stressantes de l’histoire de notre entreprise. Nous mettions de côté un système fonctionnel que des milliers de personnes utilisaient pour construire quelque chose qui n’avait pas encore fait ses preuves.
Mais lorsque nous avons publié Milvus 2.0 en 2022, cela a transformé Milvus, qui est passé d’une puissante base de données vectorielle à une infrastructure prête pour la production, capable de s’adapter aux charges de travail des entreprises. Cette même année, nous avons également finalisé une levée de fonds de série B+—non pas pour brûler de l’argent, mais pour redoubler d’efforts sur la qualité du produit et l’assistance aux clients du monde entier. Nous savions que cette voie prendrait du temps, mais chaque étape devait être construite sur des bases solides.
Quand tout s’est accéléré avec l’IA
2023 a été l’année du RAG (génération augmentée par récupération). Soudain, la recherche sémantique est passée d’une technique d’IA intéressante à une infrastructure essentielle pour les chatbots, les systèmes de questions-réponses sur documents et les agents IA.
Les étoiles GitHub de Milvus ont explosé. Les demandes d’assistance se sont multipliées. Des développeurs qui n’avaient jamais entendu parler des bases de données vectorielles posaient soudain des questions pointues sur les stratégies d’indexation et l’optimisation des requêtes.
Cette croissance était enthousiasmante, mais aussi écrasante. Nous avons compris que nous devions faire évoluer non seulement notre technologie, mais aussi toute notre approche du soutien à la communauté. Nous avons recruté davantage de developer advocates, entièrement réécrit notre documentation et commencé à créer du contenu éducatif pour les développeurs découvrant les bases de données vectorielles.
Nous avons également lancé Zilliz Cloud—notre version entièrement managée de Milvus. Certaines personnes nous ont demandé pourquoi nous « commercialisions » notre projet open source. La réponse honnête est que maintenir une infrastructure de niveau entreprise est coûteux et complexe. Zilliz Cloud nous permet de soutenir et d’accélérer le développement de Milvus tout en gardant le projet principal entièrement open source.
Puis est arrivée 2024. Forrester nous a nommés leader dans la catégorie des bases de données vectorielles. Milvus a dépassé les 30 000 étoiles GitHub. Et nous avons compris : la route que nous pavions depuis sept ans était enfin devenue une autoroute. À mesure que davantage d’entreprises adoptaient les bases de données vectorielles comme infrastructure critique, la croissance de notre activité s’est rapidement accélérée—confirmant que les fondations que nous avions bâties pouvaient évoluer à la fois techniquement et commercialement.
L’équipe derrière Milvus : Zilliz
Voici quelque chose d’intéressant : beaucoup de gens connaissent Milvus, mais pas Zilliz. Cela nous convient en fait très bien. Zilliz est l’équipe derrière Milvus—nous le construisons, le maintenons et le soutenons.
Ce qui nous importe le plus, ce sont les choses peu glamour qui font la différence entre une démo sympa et une infrastructure prête pour la production : optimisations des performances, correctifs de sécurité, documentation qui aide réellement les débutants, et réponses réfléchies aux issues GitHub.
Nous avons constitué une équipe d’assistance mondiale 24/7 aux États-Unis, en Europe et en Asie, car les développeurs ont besoin d’aide dans leurs fuseaux horaires, pas dans les nôtres. Nous avons des contributeurs communautaires que nous appelons les « Milvus Ambassadors », qui organisent des événements, répondent aux questions sur les forums et expliquent souvent les concepts mieux que nous.
Nous avons également accueilli favorablement les intégrations avec AWS, GCP et d’autres fournisseurs cloud—même lorsqu’ils proposent leurs propres versions managées de Milvus. Davantage d’options de déploiement, c’est une bonne chose pour les utilisateurs. Même si nous avons remarqué que lorsque les équipes rencontrent des défis techniques complexes, elles finissent souvent par nous contacter directement, car nous comprenons le système au niveau le plus profond.
Beaucoup de gens pensent que l’open source n’est qu’une « boîte à outils », mais c’est en réalité un « processus évolutif » — un effort collectif porté par d’innombrables personnes qui l’aiment et y croient. Seuls ceux qui comprennent véritablement l’architecture peuvent expliquer le « pourquoi » derrière les corrections de bugs, l’analyse des goulots d’étranglement de performance, l’intégration des systèmes de données et les ajustements architecturaux.
Donc, si vous utilisez Milvus open source, ou si vous envisagez les bases de données vectorielles comme un composant central de votre système d’IA, nous vous encourageons à nous contacter directement pour bénéficier du support le plus professionnel et le plus réactif.
Impact réel en production : la confiance des utilisateurs
Les cas d’utilisation de Milvus ont dépassé ce que nous avions initialement imaginé. Nous alimentons l’infrastructure d’IA de certaines des entreprises les plus exigeantes au monde, dans tous les secteurs.
Bosch, leader mondial des technologies automobiles et pionnier de la conduite autonome, a révolutionné son analyse de données avec Milvus, en obtenant une réduction de 80 % des coûts de collecte de données et 1,4 M$ d’économies annuelles, tout en recherchant en quelques millisecondes des milliards de scénarios de conduite afin d’identifier des cas limites critiques.
Read AI, l’une des entreprises d’IA de productivité à la croissance la plus rapide, au service de millions d’utilisateurs actifs mensuels, utilise Milvus pour atteindre une latence de récupération inférieure à 20-50 ms sur des milliards d’enregistrements et une accélération de 5× dans la recherche agentique. Leur CTO déclare : « Milvus sert de référentiel central et alimente notre récupération d’informations parmi des milliards d’enregistrements. »
Un leader mondial de la fintech, l’une des plus grandes plateformes de paiement numérique au monde, traitant des dizaines de milliards de transactions dans plus de 200 pays et plus de 25 devises, a choisi Milvus pour une ingestion par lots 5 à 10× plus rapide que celle des concurrents, en accomplissant en moins d’une heure des tâches qui prenaient plus de 8 heures aux autres.
Filevine, la principale plateforme de travail juridique, utilisée par des milliers de cabinets d’avocats à travers les États-Unis, gère 3 milliards de vecteurs sur des millions de documents juridiques, permettant aux avocats de gagner 60 à 80 % du temps consacré à l’analyse documentaire et d’atteindre une « véritable conscience des données » pour la gestion des dossiers juridiques.
Nous soutenons également NVIDIA, OpenAI, Microsoft, Salesforce, Walmart, et bien d’autres dans presque tous les secteurs. Plus de 10 000 organisations ont fait de Milvus ou de Zilliz Cloud leur base de données vectorielle de choix.
Ce ne sont pas seulement des réussites techniques — ce sont des exemples de la manière dont les bases de données vectorielles deviennent discrètement une infrastructure critique qui alimente les applications d’IA que les gens utilisent chaque jour.
Pourquoi nous avons créé Zilliz Cloud : une base de données vectorielle de niveau entreprise en tant que service
Milvus est open source et gratuit à utiliser. Mais bien exécuter Milvus à l’échelle de l’entreprise exige une expertise approfondie et des ressources importantes. Choix des index, gestion de la mémoire, stratégies de mise à l’échelle, configurations de sécurité — ce ne sont pas des décisions triviales. De nombreuses équipes veulent la puissance de Milvus sans la complexité opérationnelle, avec un support entreprise, des garanties SLA, etc.
C’est pourquoi nous avons créé Zilliz Cloud — une version entièrement managée de Milvus déployée dans 25 régions mondiales et sur 5 grands clouds, notamment AWS, GCP et Azure, conçue spécifiquement pour les charges de travail d’IA à l’échelle de l’entreprise qui exigent performance, sécurité et fiabilité.
Voici ce qui distingue Zilliz Cloud :
Échelle massive avec hautes performances : Notre moteur propriétaire AutoIndex alimenté par l’IA offre des vitesses de requête 3 à 5× plus rapides que Milvus open source, sans aucun réglage d’index requis. L’architecture cloud-native prend en charge des milliards de vecteurs et des dizaines de milliers de requêtes simultanées tout en maintenant des temps de réponse inférieurs à la seconde.
Sécurité et conformité intégrées: Chiffrement au repos et en transit, RBAC granulaire, journalisation d’audit complète, intégration SAML/OAuth2.0 et déploiements BYOC (bring your own cloud). Nous sommes conformes au RGPD, à HIPAA et à d’autres normes mondiales dont les entreprises ont réellement besoin.
Optimisé pour la rentabilité : Stockage de données chaud/froid par niveaux, mise à l’échelle élastique qui s’adapte aux charges de travail réelles, et tarification à l’usage peuvent réduire le coût total de possession de 50 % ou plus par rapport aux déploiements autogérés.
Véritablement agnostique vis-à-vis du cloud, sans verrouillage fournisseur : Déployez sur AWS, Azure, GCP, Alibaba Cloud ou Tencent Cloud sans verrouillage fournisseur. Nous garantissons une cohérence et une évolutivité mondiales, quel que soit l’endroit où vous exécutez vos workloads.
Ces capacités peuvent ne pas sembler spectaculaires, mais elles résolvent des problèmes réels et quotidiens auxquels les équipes d’entreprise sont confrontées lorsqu’elles créent des applications d’IA à grande échelle. Et surtout : sous le capot, c’est toujours Milvus, donc il n’y a ni verrouillage propriétaire ni problèmes de compatibilité.
Prochaine étape : Vector Data Lake
Nous avons inventé le terme "base de données vectorielle" et avons été les premiers à en créer une, mais nous ne nous arrêtons pas là. Nous construisons maintenant la prochaine évolution : Vector Data Lake.
Voici le problème que nous résolvons : toutes les recherches vectorielles n’ont pas besoin d’une latence de l’ordre de la milliseconde. De nombreuses entreprises disposent de jeux de données massifs qui ne sont interrogés qu’occasionnellement, notamment pour l’analyse de documents historiques, les calculs de similarité par lots et l’analyse des tendances à long terme. Pour ces cas d’utilisation, une base de données vectorielle traditionnelle en temps réel est à la fois excessive et coûteuse.
Vector Data Lake utilise une architecture séparant stockage et calcul, spécifiquement optimisée pour des vecteurs à très grande échelle et rarement consultés, tout en maintenant des coûts nettement inférieurs à ceux des systèmes en temps réel.
Les capacités principales incluent :
Pile de données unifiée : Connecte de manière transparente les couches de données en ligne et hors ligne avec des formats cohérents et un stockage efficace, afin que vous puissiez déplacer les données entre les niveaux chaud et froid sans reformatage ni migrations complexes.
Écosystème de calcul compatible : Fonctionne nativement avec des frameworks comme Spark et Ray, en prenant en charge tout, de la recherche vectorielle à l’ETL et à l’analytique traditionnels. Cela signifie que vos équipes data existantes peuvent travailler avec des données vectorielles à l’aide d’outils qu’elles connaissent déjà.
Architecture optimisée pour les coûts : Les données chaudes restent sur SSD ou NVMe pour un accès rapide ; les données froides sont automatiquement déplacées vers un stockage objet comme S3. Des stratégies intelligentes d’indexation et de stockage maintiennent des E/S rapides lorsque vous en avez besoin, tout en rendant les coûts de stockage prévisibles et abordables.
Il ne s’agit pas de remplacer les bases de données vectorielles, mais de donner aux entreprises le bon outil pour chaque charge de travail. Recherche en temps réel pour les applications destinées aux utilisateurs, data lakes vectoriels rentables pour l’analytique et le traitement historique.
Nous croyons toujours à la logique qui sous-tend la loi de Moore et le paradoxe de Jevons : à mesure que le coût unitaire du calcul diminue, l’adoption augmente. Il en va de même pour l’infrastructure vectorielle.
En améliorant les index, les structures de stockage, la mise en cache et les modèles de déploiement — jour après jour — nous espérons rendre l’infrastructure d’IA plus accessible et abordable pour tous, et contribuer à faire entrer les données non structurées dans l’avenir natif de l’IA.
Un grand merci à vous tous !
Ces 35K+ étoiles représentent quelque chose dont nous sommes sincèrement fiers : une communauté de développeurs qui trouvent Milvus suffisamment utile pour le recommander et y contribuer.
Mais nous n’avons pas terminé. Milvus a des bugs à corriger, des améliorations de performance à apporter et des fonctionnalités que notre communauté réclame. Notre feuille de route est publique, et nous souhaitons réellement connaître votre avis sur les priorités à établir.
Le nombre en lui-même n’est pas ce qui compte — c’est la confiance que ces étoiles représentent. La confiance que nous continuerons à construire de manière ouverte, à écouter les retours et à améliorer Milvus.
À nos contributeurs : vos PR, rapports de bugs et améliorations de la documentation rendent Milvus meilleur chaque jour. Merci beaucoup.
À nos utilisateurs : merci de nous faire confiance pour vos charges de travail en production et pour les retours qui nous permettent de rester honnêtes.
À notre communauté : merci de répondre aux questions, d’organiser des événements et d’aider les nouveaux venus à se lancer.
Si vous débutez avec les bases de données vectorielles, nous serions ravis de vous aider à démarrer. Si vous utilisez déjà Milvus ou Zilliz Cloud, nous aimerions connaître votre expérience. Et si vous êtes simplement curieux de ce que nous construisons, nos canaux communautaires sont toujours ouverts.
Continuons à construire l’infrastructure qui rend les applications d’IA possibles—ensemble.
Retrouvez-nous ici : Milvus on GitHub | Zilliz Cloud | Discord | LinkedIn | X | YouTube
Continuer à lire

Similarity Metrics for Vector Search
Exploring five similarity metrics for vector search: L2 or Euclidean distance, cosine distance, inner product, and hamming distance.

Optimizing Embedding Model Selection with TDA Clustering: A Strategic Guide for Vector Databases
Discover how Topological Data Analysis (TDA) reveals hidden embedding model weaknesses and helps optimize vector database performance.

Selecting the Right ETL Tools for Unstructured Data to Prepare for AI
Learn the right ETL tools for unstructured data to power AI. Explore key challenges, tool comparisons, and integrations with Milvus for vector search.



