Comment les lacs de métadonnées renforcent les applications d’IA/ML de nouvelle génération
As AI technologies like large language models (LLMs) and la génération augmentée par récupération (RAG) continuent d’évoluer, la demande en infrastructures de données flexibles et efficaces augmente. Les organisations recherchent des architectures de données capables de prendre en charge ces nouveaux outils tout en minimisant la dette technique et en permettant une évolutivité fluide.
Les lacs de métadonnées émergent comme une solution clé à cet égard. Il s’agit de référentiels centralisés qui stockent les métadonnées provenant de diverses sources au sein d’une organisation, offrant une approche unifiée de la gestion des données. Les métadonnées fournissent le contexte et la compréhension des données stockées, notamment la source des données, la qualité, la traçabilité, la propriété, le contenu, la structure et le contexte.
Lisa N. Cao, Product Manager chez Datastrato, a récemment donné une conférence lors du Unstructured Data Meetup organisé par Zilliz, où elle a abordé le rôle essentiel des lacs de métadonnées dans le développement IA/ML de nouvelle génération. S’appuyant sur son expérience de data engineer, Lisa a partagé des perspectives sur la manière dont les lacs de métadonnées peuvent rationaliser la gestion des données et s’intégrer à diverses technologies comme les bases de données vectorielles, les modèles de deep learning et les LLMs dans des environnements pilotés par l’IA.
Lisa prenant la parole lors du Unstructured Data Meetup de juin à Palo Alto
Cet article de blog récapitule les points clés de Lisa et explore les défis liés au déploiement de pipelines RAG en production. Mais d’abord, présentons brièvement RAG ainsi que les défis du développement et du déploiement RAG.
Introduction rapide à RAG (Retrieval Augmented Generation)
RAG, ou Retrieval-Augmented Generation, est un framework avancé qui améliore les réponses des LLMs en combinant des modules de récupération et de génération. Le module de récupération comprend une base de données vectorielle comme Milvus ou Zilliz Cloud (Milvus entièrement géré) et un modèle d’embedding, et le module génératif est généralement un LLM comme ChatGPT.
Figure 1 Fonctionnement de RAG
Figure 1 : Fonctionnement de RAG
Lorsqu’un utilisateur saisit une requête dans une application RAG, la base de données vectorielle du module de récupération extrait les documents les plus pertinents du vaste corpus textuel. Ces documents récupérés sont appelés « meilleurs candidats » et sont fournis au LLM comme contexte de la requête utilisateur afin de générer une réponse plus précise. RAG est particulièrement utile dans des applications telles que les systèmes de questions-réponses, les chatbots et les systèmes de gestion des connaissances.
Défis actuels du développement RAG
Récemment, de nombreuses techniques avancées ont été introduites dans le pipeline RAG afin d’améliorer la précision et les performances, notamment des méthodes de récupération sophistiquées basées sur le re-ranking et la récupération récursive, ainsi que des techniques de fine-tuning basées sur les embeddings et les LLMs. De plus, des frameworks agentiques conçus pour le routage et la planification des requêtes ont été introduits afin de renforcer les capacités de RAG.
Cependant, ces avancées introduisent également de nouvelles complexités. Lisa a évoqué plusieurs défis auxquels de nombreuses équipes IA sont confrontées lors du développement et du déploiement de RAG en production :
Faible observabilité : Surveiller la vitesse d’ingestion des documents et les changements de distribution des données au sein des pipelines RAG est difficile. Étant donné que la base de données vectorielle dans une application RAG stocke souvent des milliards de documents, le suivi des changements et des mises à jour des données pour la gestion des connaissances devient difficile.
Gestion du cycle de vie : Un contrôle de version et une gestion du cycle de vie efficaces sont essentiels pour suivre les changements et les mises à jour des données. Les équipes ont besoin d’outils robustes pour retracer la lignée des données de manière transparente et auditable afin d’assurer la conformité.
Latence et optimisation : Bien que le fine-tuning avancé et la récupération récursive puissent améliorer la précision des sorties générées, ils peuvent également augmenter les temps de réponse, entraînant une latence plus élevée et une satisfaction utilisateur moindre.
Réponses contextuelles aux requêtes : Les requêtes utilisateur complexes peuvent être difficiles à interpréter avec précision pour les LLM, ce qui entraîne des réponses manquant de contexte ou de nuance.
Confidentialité des données : La gouvernance de l’IA constitue un autre défi, en particulier lorsqu’il s’agit d’ajouter du masquage ou du chiffrement aux données utilisées pour l’entraînement.
Mécanisme d’apprentissage continu : Lisa a souligné l’importance de maintenir les applications RAG à jour avec des données fraîches. « Il y a une énorme différence entre les modèles qui accèdent à des données continuellement mises à jour et ceux qui s’appuient sur des données obsolètes », a-t-elle noté. La mise en œuvre d’un mécanisme d’apprentissage continu peut toutefois être techniquement difficile.
Dépendance vis-à-vis d’un fournisseur : S’appuyer fortement sur un seul fournisseur de services cloud pour les besoins du pipeline peut entraîner une dépendance vis-à-vis d’un fournisseur, rendant la transition vers un autre écosystème difficile et coûteuse.
L’un des problèmes sous-jacents qui contribuent à ces défis est la présence de silos de données au sein des organisations.
Silos de données au sein des organisations : un facteur clé des défis liés au RAG
Les silos de données sont un problème courant dans les organisations où les données ne sont pas facilement accessibles entre différentes équipes ou différents départements en raison d’obstacles structurels ou technologiques. Ces silos peuvent exister au niveau opérationnel, entre diverses équipes, ou en raison de la complexité des outils et des applications utilisés.
Figure 2- Silos de données affectant l’efficacité dans les organisations
Figure 2 : Silos de données affectant l’efficacité dans les organisations
Lisa a souligné le problème omniprésent des silos de données, notant : « Chaque entreprise essaie de répondre à cette question : “Comment créer une cohérence opérationnelle de nos données dans l’ensemble de l’organisation ?” » C’est particulièrement difficile lorsque les équipes sont réparties dans le monde entier et travaillent avec différents entrepôts de données.
Il existe également des silos entre différentes équipes. Par exemple, les analystes BI et les ingénieurs de données utilisent souvent des outils différents et peuvent manquer d’une communication efficace. Certaines équipes peuvent ne pas posséder les connaissances en programmation ou les compétences techniques nécessaires pour accéder aux données disponibles et les traiter. Par exemple, les ingénieurs DevOps peuvent avoir du mal à comprendre la base de code des ingénieurs ML.
Les silos de données ont un impact direct sur la capacité à créer et à maintenir des pipelines RAG efficaces, car ils empêchent la circulation fluide des données au sein d’une organisation. Ce manque d’intégration peut conduire à des sources de données fragmentées, à des incohérences dans l’utilisation des données et, en fin de compte, à des défis dans le déploiement de systèmes RAG qui reposent sur des données complètes et actuelles.
Lacs de métadonnées : combler l’écart pour une gestion unifiée des données
Pour relever les défis RAG mentionnés ci-dessus, les entreprises ont besoin de solutions d’architecture de données pour unifier, standardiser et opérationnaliser les données dans toute l’organisation. Les lacs de métadonnées offrent une architecture flexible pour stocker et gérer les métadonnées — des informations sur la source, la structure, le format, l’utilisation, la lignée, et plus encore.
Qu’est-ce qu’un lac de métadonnées ?
Un lac de métadonnées, ou gestion des métadonnées de lac de données, est un référentiel centralisé qui stocke les métadonnées provenant de diverses sources au sein d’une organisation. Les métadonnées sont les informations descriptives qui fournissent le contexte et la compréhension des données dans le lac de données. Elles incluent généralement des détails tels que la source des données, la qualité, la lignée, la propriété, le contenu, la structure et le contexte.
Figure 3- Une gestion unifiée des métadonnées .png
Figure 3 : Une gestion unifiée des métadonnées
Contrairement à un lac de données traditionnel, qui stocke des données brutes, un lac de métadonnées se concentre sur la gestion, l’organisation et la mise à disposition des métadonnées associées aux actifs de données à travers différents systèmes, bases de données et applications.
Figure 4- Comparaison de différentes conceptions d’architecture de données
Figure 4 : Comparaison de différentes conceptions d’architecture de données
Avantages des lacs de métadonnées
Amélioration de la découvrabilité des données : Les lacs de métadonnées servent de catalogues centralisés, stockant toutes les métadonnées et permettant aux équipes et aux utilisateurs de découvrir plus facilement les actifs de données dans toute l’organisation.
Métadonnées actives : Ces lacs permettent des métadonnées actives, qui peuvent déclencher des actions et s’intégrer à des pipelines orchestrés, automatisant les tâches et réduisant le besoin d’intervention manuelle.
Métadonnées intégrées : Les métadonnées peuvent être intégrées dans différentes applications, facilitant une intégration et une interaction fluides dans l’écosystème de données.
Gouvernance de l’IA renforcée : La centralisation de la gestion des métadonnées facilite la mise en œuvre de politiques de gouvernance cohérentes, garantissant la conformité et la qualité des données. Les lacs de métadonnées prennent également en charge un suivi détaillé de la lignée des données, des contrôles d’accès et des capacités d’audit.
Utilisation enrichie des métadonnées : Une gestion unifiée des métadonnées permet une utilisation plus riche des métadonnées, comme l’enrichissement, le masquage des données et la classification, améliorant la qualité, la sécurité et l’utilisabilité des données.
Dans l’ensemble, les lacs de métadonnées simplifient et automatisent la gestion du cycle de vie des données, facilitant la collaboration entre les équipes techniques et aidant à éliminer les silos de données qui entravent le développement RAG.
Démo : Créer des lacs de métadonnées avec Gravitino
Lisa a partagé son expérience de travail sur un projet open source dans lequel un lac de métadonnées a été développé avec Gravitino. Le projet visait à créer un catalogue de données prenant en charge plusieurs fournisseurs de services cloud, notamment AWS, Azure et GCP. Il permet aux utilisateurs d’enregistrer diverses sources de données dans le lac de métadonnées, telles que des buckets S3, la base de données vectorielle Milvus, des HiMetastores et d’autres entrepôts de données. Gravitino fournit également des contrôles d’accès et des outils pour suivre la lignée des données et faciliter l’audit.
Figure 5- L’architecture du lac de métadonnées construite avec Gravitino
Figure 5 : L’architecture du lac de métadonnées construite avec Gravitino
L’architecture utilise des API REST pour fournir des métadonnées à différentes applications. Les couches de connexion convertissent toutes les données en un schéma commun avant de les stocker dans le lac de métadonnées. Gravitino prend en charge les formats de données tabulaires et non tabulaires et permet un masquage basé sur des balises afin de garantir la sécurité des données.
Les équipes d’IA peuvent également intégrer des graphes de connaissances et des magasins vectoriels au sein du cadre de gestion des métadonnées, créant ainsi un catalogue unifié. En raison de la nature fédérée du catalogue, les requêtes peuvent accéder aux métadonnées sans déplacer les données sources. Les opérations de jointure s’effectuent soit en mémoire, soit à des emplacements définis, optimisant les performances et maintenant l’intégrité des données dans des environnements distribués.
Conclusion
Les lacs de métadonnées évoluent en catalogues d’IA qui gèrent les métadonnées et s’intègrent aux workflows d’IA et de ML. Ces lacs peuvent aider au développement RAG, à l’enregistrement des modèles, à la gouvernance de l’IA et à la mise en œuvre d’analyses avancées. En fournissant un plan unifié pour les opérations de données, les lacs de métadonnées permettent aux équipes de maintenir l’observabilité dans l’analyse des métadonnées, d’assurer des transitions fluides entre différents environnements cloud et sources de données comme la base de données vectorielle Milvus, et de faire respecter les cadres de gouvernance sans heurt. À mesure que les technologies d’IA progressent, les lacs de métadonnées joueront un rôle clé dans la prise en charge des applications IA/ML de nouvelle génération.
Ressources complémentaires
Continuer à lire

Milvus 2.6.x Now Generally Available on Zilliz Cloud, Making Vector Search Faster, Smarter, and More Cost-Efficient for Production AI
Milvus 2.6.x is now GA on Zilliz Cloud, delivering faster vector search, smarter hybrid queries, and lower costs for production RAG and AI applications.

The Real Bottlenecks in Autonomous Driving — And How AI Infrastructure Can Solve Them
Autonomous driving faces a data bottleneck. Learn how AI-native vector databases like Zilliz solve scale, cost, and insight challenges across AV pipelines.

What is the K-Nearest Neighbors (KNN) Algorithm in Machine Learning?
KNN is a supervised machine learning technique and algorithm for classification and regression. This post is the ultimate guide to KNN.



