Naviguer dans les défis de la gestion du ML : outils et perspectives pour réussir
Alors que l’apprentissage automatique (ML) continue de progresser à une vitesse fulgurante, la complexité de la gestion et du versionnement de jeux de données et de modèles massifs a augmenté de manière exponentielle. Si les développeurs s’appuient depuis longtemps sur des outils comme Git pour le contrôle de version dans le développement logiciel, les défis propres à l’apprentissage automatique exigent des solutions plus spécialisées. Contrairement au logiciel, où les bases de code peuvent être versionnées et gérées relativement facilement, les modèles ML, les jeux de données et les artefacts manquent souvent d’une norme industrielle unifiée pour le versionnement et la gestion.
Lors d’un récent Unstructured Data Meetup organisé par Zilliz, Rajat Arya, le cofondateur de XetHub (désormais acquis par HuggingFace), a expliqué comment lui et son équipe ont comblé cette lacune dans le versionnement et la gestion du ML. Son équipe a développé XetHub, un outil qui fait évoluer Git afin de gérer des données à l’échelle du pétaoctet. Oui, vous avez bien lu : des données à l’échelle du pétaoctet. Mais pourquoi était-ce nécessaire ? Quels avantages cela apporte-t-il, et comment cela fonctionne-t-il ? Quel est le lien avec les bases de données vectorielles ? Plongeons dans les perspectives d’Arya et décomposons les points clés.
Regardez le replay de la présentation de Rajat
Les points de friction dans le développement de l’apprentissage automatique
L’un des principaux obstacles dans le développement de l’apprentissage automatique est l’absence d’outils complets couvrant l’ensemble du pipeline ML. Bien qu’il existe de nombreux outils pour des tâches spécifiques, il subsiste une lacune importante en matière de solutions capables de gérer efficacement le processus de bout en bout. Voici quelques points de friction clés :
Évolutivité
La gestion de jeux de données pouvant atteindre 100 pétaoctets et au-delà constitue un défi considérable, en particulier lorsque les outils traditionnels imposent des limites au nombre de fichiers avec lesquels vous pouvez travailler.
Gestion des données
La création d’instantanés immuables des dépôts est cruciale pour garantir l’intégrité des données et faciliter le contrôle de version. Sans cette capacité, il devient difficile de suivre les changements et de maintenir la cohérence.
Collaboration
Faciliter une collaboration fluide entre data scientists et ingénieurs est essentiel. La révolution apportée par le contrôle de source dans le développement logiciel ne s’est pas pleinement étendue au ML, où la collaboration se heurte souvent à des obstacles en raison du manque d’outils standardisés.
Observabilité
Comprendre comment et quand les changements se produisent dans les modèles et les jeux de données est crucial pour déboguer et améliorer les systèmes ML. Sans visibilité sur ces changements, les équipes peinent à itérer efficacement.
De la recherche aux applications ML concrètes : tout change
Aux débuts, le ML et l’IA étaient principalement axés sur la recherche, avec des objectifs académiques impliquant de travailler sur des jeux de données statiques, souvent structurés. L’objectif était d’améliorer des métriques comme l’exactitude ou les taux d’erreur, ce qui fonctionnait bien dans un environnement de recherche contrôlé.
Cependant, à mesure que le ML est passé du monde académique à l’industrie, le paysage a changé de manière spectaculaire :
Jeux de données statiques vs dynamiques
Le ML académique traite souvent des jeux de données statiques, mais le ML industriel implique des données en constante évolution, parfois mises à jour aussi fréquemment que toutes les heures. Cette nature dynamique exige des outils capables de gérer des mises à jour continues de manière fluide.
Données structurées vs non structurées
Alors que la recherche académique se concentre souvent sur les données structurées, les applications du monde réel impliquent fréquemment des données non structurées. Cette évolution exige des techniques de traitement et de gestion des données plus sophistiquées. Nous avons besoin de bases de données vectorielles spécialement conçues comme Milvus et Zilliz Cloud (Milvus entièrement géré) pour le stockage, l’indexation et la récupération des données afin de gérer ces données non structurées.
Complexité croissante des modèles
Les modèles ML deviennent de plus en plus complexes, avec davantage de paramètres et des architectures plus profondes. La gestion de ces modèles complexes nécessite des outils capables d’évoluer avec eux.
Intégration avec le code applicatif
Dans les environnements industriels, les modèles ML doivent s’intégrer harmonieusement au code applicatif, ce qui nécessite un écosystème cohérent de packages et de frameworks fonctionnant ensemble sans friction.
Étendre les capacités de Git pour le machine learning avec XetHub
XetHub relève le défi de la scalabilité en étendant les capacités de Git afin de gérer efficacement de grands jeux de données et modèles. Voici comment il fait la différence :
Aucune limite sur le nombre de fichiers : Git traditionnel a du mal à gérer un grand nombre de fichiers, mais XetHub supprime cette limitation, permettant une mise à l’échelle fluide, quel que soit le nombre de fichiers.
Instantanés immuables : XetHub crée des instantanés immuables, garantissant la cohérence et la reproductibilité des données — essentielles pour un développement ML robuste.
Gestion efficace des données : Au lieu de transférer de grands jeux de données, XetHub gère les métadonnées et les pointeurs, rendant le système plus rapide et plus efficace, tout en économisant du temps et des ressources.
Atteindre l’observabilité dans les projets de machine learning
L’observabilité est cruciale pour les modèles et systèmes ML, car elle offre la visibilité nécessaire pour déboguer, itérer et améliorer les modèles. Voici quelques suggestions pour renforcer l’observabilité dans vos projets ML :
Résumé des données
Commencez par les données. Créez un résumé approximatif en une seule passe de vos données et de vos caractéristiques. C’est crucial, car cela vous permet de comprendre les évolutions de votre jeu de données au fil du temps. Par exemple, si le jeu de données A présente des distributions différentes à différents moments, disposer de résumés vous permet de prendre des décisions éclairées en fonction de ces changements.
Métriques et comportement du modèle
Ne stockez pas seulement les métriques de votre modèle, mais comprenez aussi comment votre modèle se comporte. Par exemple, le suivi de l’importance des caractéristiques de vos modèles ML vous aide à voir quelles caractéristiques orientent les prédictions. Des changements dans l’importance des caractéristiques pourraient indiquer des évolutions de vos données d’entraînement ou des modifications architecturales. Cette compréhension approfondie de vos modèles garantit que vous pouvez rapidement les déboguer et les améliorer.
Calcul et opérations
Le calcul fait partie intégrante de l’observabilité ML. Chaque opération, qu’elle porte sur des données, du code, des artefacts ou d’autres actifs, doit être stockée pour chaque commit ou changement. Ce suivi complet permet une observabilité ML totale, garantissant efficacité, traçabilité et reproductibilité entre différentes exécutions du même processus.
Le rôle des bases de données vectorielles dans le machine learning moderne
Les bases de données vectorielles, telles que Milvus et Zilliz Cloud (Milvus entièrement géré), sont un type de systèmes de gestion des données qui stockent, indexent et récupèrent des données de grande dimension — des représentations numériques (également appelées embeddings vectoriels) de données non structurées comme le texte, les vidéos, l’audio et les images. Elles sont largement utilisées pour la recherche de similarité, la recherche sémantique, les systèmes de recommandation, la génération augmentée par récupération (RAG) et de nombreux autres cas d’usage.
À mesure que les modèles de ML et les jeux de données deviennent plus complexes, la gestion et la récupération de vastes volumes de données de grande dimension deviennent de plus en plus difficiles. Les bases de données vectorielles répondent à ce défi en offrant des solutions que les bases de données traditionnelles ne peuvent égaler.
Génération augmentée par récupération (RAG)
L’une des applications les plus prometteuses des bases de données vectorielles est la génération augmentée par récupération (RAG). Cette technique combine la puissance des grands modèles de langage (LLMs) avec une récupération efficace des données vectorielles. Dans une configuration RAG, une requête d’entrée est transformée en vecteur à l’aide d’un modèle de machine learning comme les modèles d’embedding de texte d’OpenAI, puis recherchée dans une vaste collection de vecteurs stockés dans une base de données vectorielle comme Milvus. Les résultats les plus pertinents sont récupérés et transmis au LLM, lui permettant de générer des réponses plus précises et contextuellement pertinentes. Cette approche permet non seulement d’atténuer les problèmes d’hallucination dans les LLMs, mais aussi d’exploiter le potentiel de jeux de données privés ou propriétaires sans se soucier des problèmes de sécurité des données.
Combler le fossé entre la recherche et l’industrie
La transition du ML axé sur la recherche vers des applications réelles implique souvent de traiter des données non structurées et dynamiques. Les bases de données vectorielles sont particulièrement bien équipées pour relever ce défi, permettant une adaptation continue des modèles de ML aux données les plus récentes. Cette adaptabilité garantit que les modèles restent pertinents et efficaces même lorsque les données sous-jacentes évoluent.
Par exemple, dans le e-commerce, où les descriptions de produits et les avis clients sont constamment mis à jour, une base de données vectorielle comme Milvus peut récupérer rapidement les informations les plus pertinentes, permettant au modèle de ML de fournir des recommandations et des informations à jour.
Intégration transparente avec des outils comme XetHub
La capacité de XetHub à gérer des données à l’échelle du pétaoctet complète les points forts des bases de données vectorielles. En créant des instantanés immuables et en gérant efficacement les métadonnées, XetHub garantit que les projets de ML à grande échelle maintiennent l’intégrité des données et le contrôle des versions, même lorsqu’ils montent en charge. Les bases de données vectorielles peuvent s’intégrer à divers modèles et outils de machine learning comme XetHub, soutenant le développement et le déploiement de modèles de ML, en particulier dans des scénarios comme RAG, où la précision et la pertinence de la récupération d’informations sont primordiales.
Conclusion
La discussion de Rajat Arya a mis en lumière les défis importants du machine learning et la nécessité de meilleurs outils pour gérer et versionner les modèles et les données. XetHub répond à ces besoins en étendant les capacités de Git afin de gérer efficacement des jeux de données massifs.
À mesure que le machine learning continue de progresser, disposer d’outils robustes pour l’observabilité et la gestion des données devient crucial. En combinant des solutions comme XetHub avec des bases de données vectorielles et des modèles de machine learning, nous pouvons améliorer l’efficacité des projets de ML, en veillant à ce qu’ils soient bien gérés et adaptables aux nouvelles données. De telles combinaisons favorisent une transition plus fluide de la recherche vers les applications réelles, rendant le développement de l’IA plus pratique et fiable.
Ressources complémentaires
Rediffusion de la présentation Meetup de Rajat Arya sur YouTube.
Article : Git is for Data
Que sont les bases de données vectorielles et comment fonctionnent-elles ?
Qu’est-ce que la génération augmentée par récupération (RAG) ?
Modèles d’IA les plus performants pour vos applications GenAI | Zilliz
Centre d’apprentissage sur l’IA, les bases de données vectorielles et le ML
Continuer à lire

Vector Lakebase: End the AI Data Silo
Learn how Vector Lakebase unifies vector search, data lakes, and AI data operations so teams can serve RAG and agents without copy-and-sync pipelines.

Notion's Vector Search Is Excellent. Their Next Problem Is Harder.
Notion solved vector search scaling in two years. The next bottleneck — offline context engineering, unified data, and the real-time/offline gap — is harder.

Our Journey to 35K+ GitHub Stars: The Real Story of Building Milvus from Scratch
Join us in celebrating Milvus, the vector database that hit 35.5K stars on GitHub. Discover our story and how we’re making AI solutions easier for developers.



