L’infrastructure derrière un milliard de voix : comment un fournisseur de LLM de premier plan et Zilliz alimentent un avenir de l’IA multilingue en Inde

<300 ms
Latence de bout en bout à 40-50 QPS sur des dizaines de millions de vecteurs.
Plus de 3 500 dimensions
Des dizaines de millions de vecteurs de grande dimension servis efficacement pour la recherche sémantique multilingue.
Rééchantillonnage automatique
Rééquilibrage continu des données et de la charge entre les nœuds à mesure que le système évolue.
Compromis équilibrés
Un résultat bien équilibré entre performance, rappel et coût.
À propos de l’entreprise
Le client est une entreprise leader de l’IA générative en Inde, axée sur la création de technologies linguistiques multilingues qui soutiennent la riche diversité linguistique du pays. Leur plateforme couvre les grands modèles de langage, la reconnaissance vocale, la synthèse vocale, la traduction et des APIs conviviales pour les développeurs, qui alimentent des agents conversationnels et des applications axées sur la voix dans les secteurs public comme privé. En combinant des modèles entraînés localement avec une récupération ancrée dans des sources de connaissances fiables, ils fournissent des systèmes d’IA capables de produire des réponses précises et culturellement adaptées à l’échelle nationale.
À mesure que leur système RAG multilingue gagnait en maturité, l’équipe a rencontré des goulots d’étranglement croissants au niveau de l’infrastructure — des embeddings à haute dimension et de la répartition inégale des charges de travail à l’augmentation des frais opérationnels. Zilliz Cloud a résolu ces défis grâce à la mise à l’échelle automatisée, à la recherche hybride et à une récupération haute performance qui ont éliminé la maintenance manuelle et rétabli la précision requise pour l’IA multilingue à grande échelle. Aujourd’hui, ce partenariat constitue une base essentielle pour la mission de l’entreprise : fournir des expériences d’IA ancrées et dignes de confiance aux utilisateurs dans tout le pays.
Le défi de l’ancrage de la vérité à grande échelle
Construire une IA pour une population linguistiquement diverse introduit des complexités que la plupart des grands modèles de langage ne sont pas conçus pour gérer. Bien que de nombreux modèles soient performants en anglais et dans quelques langues à ressources abondantes, ils éprouvent souvent des difficultés avec les langues moins représentées dans les jeux de données d’entraînement mondiaux. Ce décalage peut entraîner des hallucinations, des interprétations erronées et des réponses incohérentes — des problèmes qui affectent directement la confiance des utilisateurs, en particulier lorsque les personnes attendent des réponses exactes et ancrées dans leur langue locale.
Pour y remédier, le client a développé un système de génération augmentée par récupération (RAG) alimenté par Wikipédia, qui enrichit ses modèles avec un contexte factuel en temps réel. Au lieu de s’appuyer uniquement sur les poids du modèle, chaque requête récupère les informations les plus pertinentes depuis une base de connaissances organisée avant de générer une réponse. Cela réduit considérablement les hallucinations et améliore l’exactitude factuelle, en particulier pour les questions culturellement spécifiques ou régionalement nuancées.
Cependant, le passage à l’échelle de ce système a rapidement révélé des défis d’infrastructure plus profonds. L’équipe devait traiter l’ensemble du corpus de Wikipédia, en transformant des millions d’articles en vecteurs à haute dimension — des dizaines de millions au total, chacun avec des milliers de dimensions — qui devaient être recherchés en bien moins de 300 millisecondes. Le volume, la dimensionnalité et les exigences de latence en temps réel exerçaient une pression énorme sur leur base de données vectorielle sous-jacente.
Leur configuration initiale, construite sur Qdrant et quelques autres outils open source, fonctionnait, mais s’accompagnait d’une surcharge opérationnelle importante. La mise à l’échelle nécessitait un repartitionnement manuel qui pouvait prendre des heures, et la répartition des charges de travail entre les nœuds était incohérente — laissant souvent une machine surchargée pendant que les autres restaient inactives. Pour une entreprise en pleine évolution qui construit une infrastructure d’IA fondamentale, ces inefficacités dépassaient le simple désagrément ; elles ralentissaient directement leur feuille de route produit et leur capacité à livrer des services d’IA fiables.
Cela a clairement montré qu’ils avaient besoin d’une base de données vectorielle bien plus évolutive et résiliente, capable de soutenir une croissance rapide et des systèmes RAG de niveau production sans intervention opérationnelle constante.
Le parcours vers la base de données vectorielle Zilliz Cloud
À mesure que les limites de leur infrastructure vectorielle existante devenaient de plus en plus évidentes, l’équipe a commencé à évaluer des alternatives évolutives et fiables. Leurs critères portaient sur le partitionnement automatique, une mise à l’échelle horizontale sans effort, des capacités de recherche hybride pour soutenir les charges de travail multilingues, et une fiabilité de niveau entreprise. Ils ont testé plusieurs plateformes par rapport à leurs exigences de production, notamment 40 à 50 QPS avec une latence inférieure à 300 ms pour des vecteurs dépassant 3 500 dimensions.
Zilliz Cloud s’est distingué par sa capacité à répartir les charges de travail de manière uniforme, à éliminer le repartitionnement manuel et à prendre en charge une mise à l’échelle rapide sans surcharge opérationnelle. Les capacités de recherche hybride vectorielle et en texte intégral de la plateforme se sont révélées particulièrement précieuses pour leurs scénarios de récupération multilingue, où la précision et la compréhension contextuelle ont un impact direct sur les performances des modèles en aval.
L’équipe a noté que Zilliz Cloud répondait non seulement à leurs critères techniques, mais fournissait également la fiabilité et l’évolutivité nécessaires pour prendre en charge un système RAG en forte croissance servant des millions d’utilisateurs. Il offrait la base dont ils avaient besoin pour accélérer leur feuille de route tout en restant concentrés sur la création d’expériences d’IA multilingues de haute qualité.
Détails de mise en œuvre
Zilliz Cloud est devenu l’épine dorsale de l’infrastructure RAG du client, alimentant l’IA multilingue grâce à une recherche vectorielle haute performance. Leur système fonctionne avec des embeddings de plus de 3 500 dimensions — bien plus élevés que dans les implémentations RAG typiques — après que des expériences approfondies ont montré que des vecteurs de dimension inférieure étaient insuffisants pour capturer la complexité linguistique requise dans leurs cas d’utilisation.
Leurs exigences de performance étaient élevées : maintenir 40 à 50 QPS avec une latence de bout en bout inférieure à 300 ms, tout en conservant une efficacité des coûts. La configuration précédente, basée sur une base de données vectorielle open source, peinait à atteindre ces critères. Malgré l’exécution d’un cluster multinœud, un seul nœud gérait la majeure partie de la charge de travail en raison d’une distribution inégale des données, créant d’importants goulots d’étranglement opérationnels et des défis de mise à l’échelle.
Avec Zilliz Cloud, l’amélioration a été immédiate. Les segments de données sont automatiquement équilibrés entre les nœuds, éliminant le processus de repartitionnement manuel de 2 à 3 heures qui ralentissait auparavant les opérations d’ingénierie. Les capacités de recherche hybride de la plateforme se sont révélées particulièrement utiles, leur permettant de combiner la similarité sémantique avec la correspondance basée sur des mots-clés afin de fournir une récupération plus précise.
Zilliz Cloud les a également aidés à atteindre un meilleur équilibre entre performance, rappel et coût. Leur solution précédente reposait sur une quantification agressive pour réduire les dépenses, mais le compromis en matière de rappel dégradait la qualité des résultats de recherche — un compromis inacceptable pour leurs applications multilingues. Le moteur Cardinal search de Zilliz Cloud a rétabli les niveaux de rappel dont ils avaient besoin tout en restant dans les limites budgétaires.
À l’avenir, l’équipe se prépare à adopter la fonctionnalité RaBitQ de Zilliz Cloud, une technologie avancée de quantification 1 bit conçue pour offrir des performances supérieures et une meilleure efficacité des coûts sans sacrifier le rappel. Cela leur offre une voie claire pour faire évoluer encore davantage leurs charges de travail RAG sans devoir restructurer à plusieurs reprises leur infrastructure.
Plus important encore, le passage à Zilliz Cloud a libéré leur équipe d’ingénierie de la maintenance constante de la base de données, leur permettant de réorienter leurs efforts vers l’amélioration de la qualité des modèles et des capacités du système.
Impact au-delà de la technologie : rendre l’IA véritablement indienne
Aujourd’hui, le système alimenté par RAG du client prend en charge des agents d’IA multilingues auxquels les utilisateurs peuvent accéder via la voix ou des applications de messagerie. Leur API permet aux développeurs d’activer ou de désactiver l’ancrage factuel en fonction des besoins de chaque cas d’utilisation — en équilibrant vitesse et précision grâce à un simple bouton de configuration. Lorsque l’ancrage est activé, les utilisateurs reçoivent des réponses étayées par une source de connaissances fiable, améliorant la fiabilité sur un large éventail de sujets et de langues.
Cette capacité a un impact concret significatif dans le monde réel. Des personnes de différentes régions peuvent poser des questions dans la langue de leur choix et recevoir en quelques secondes des réponses précises et contextuellement appropriées. Elle représente une étape vers une IA accessible aux communautés qui ont historiquement été mal desservies par les modèles grand public, et met en évidence la manière dont une infrastructure de base de données vectorielle adaptée peut permettre aux systèmes d’IA de fournir des résultats fiables à grande échelle.
Pour le client, Zilliz Cloud est devenu un composant central de cette vision : l’aider à proposer des expériences d’IA fondées et fiables sans compromettre les performances ni l’agilité. En supprimant les contraintes opérationnelles et en améliorant la précision de la récupération, Zilliz Cloud a permis à son équipe de se concentrer sur l’essentiel : construire des systèmes d’IA qui reflètent véritablement la diversité linguistique et culturelle de leurs utilisateurs.


