Pipelines multimodaux pour les applications d’IA
La réussite des applications d’intelligence artificielle (IA) nécessite une préparation et une gestion efficaces des données. Un pipeline de données plus robuste conduit à des résultats plus précis, fiables et sensibles au contexte. À mesure que les flux de travail d’IA deviennent de plus en plus complexes, le besoin de pipelines évolutifs et intelligents pour les soutenir est devenu urgent.
Les systèmes d’IA modernes peinent à gérer les données non structurées, telles que les rapports, les images et les PDF. Les systèmes qui emploient la génération augmentée par récupération (RAG) nécessitent des stratégies précises pour traiter des données complexes tout en maintenant la précision des résultats et en réduisant les coûts.
Construire de tels systèmes signifie analyser des données provenant de différents formats, gérer des sorties d’IA imprévisibles et concevoir des pipelines capables d’évoluer efficacement. Récemment, lors de l’Unstructured Data Meetup organisé par Zilliz, Sam, CTO de Datavolo avec plus de 18 ans d’expérience en ingénierie des données et en IA, a abordé ces défis.
Une plateforme construite sur Apache NiFi, DataVolo, a été mise en avant pour répondre à ces problèmes. Elle simplifie le traitement des données non structurées et permet la création de pipelines évolutifs et cloud-native. DataVolo prend également en charge la réactivité en temps réel aux métadonnées, aux changements d’autorisations et à des cadres d’évaluation solides pour traiter les modèles d’IA non déterministes.
Cet article explique les principaux enseignements de la session sur les bonnes pratiques pour les pipelines multimodaux. Nous explorerons la gestion des données non structurées et des bases de données vectorielles comme Milvus pour une récupération efficace, ainsi que des stratégies concrètes pour améliorer les flux de travail d’IA.
La vidéo complète du meetup est disponible ici.
Pourquoi les pipelines multimodaux sont essentiels pour l’IA
Un défi majeur auquel les entreprises peuvent être confrontées lors de la mise en œuvre de l’IA à grande échelle est la gestion de masses de données complexes. Les outils conventionnels d’extraction-transformation-chargement (ETL) ne peuvent pas gérer les tâches impliquant le traitement de différents formats comme le texte, les images, les vidéos et l’audio. Voici pourquoi :
Les données non structurées dominent : Plus de 80% des données d’une entreprise sont non structurées, y compris les documents, les images et les vidéos. Cela représente un défi qui ne peut pas être relevé à l’aide d’outils traditionnels. Les pipelines multimodaux fournissent un flux de travail intégré avec des algorithmes d’IA avancés pour transformer les données non structurées en informations exploitables. Ces pipelines comblent le fossé entre les données brutes et les modèles d’IA, permettant aux organisations d’utiliser les données pour une meilleure prise de décision.
Améliorer la précision de l’IA : Les grands modèles de langage (LLM), tels que GPT, sont robustes mais sujets à des erreurs, comme la production de résultats non pertinents ou incorrects. La précision des modèles d’IA s’améliore grâce à la capacité des pipelines multimodaux à traiter divers types de données dans un cadre unifié enrichi de métadonnées. Ces métadonnées servent ensuite de guide pour aider les systèmes d’IA à récupérer les informations les plus pertinentes liées à une requête donnée.
Améliorer la génération augmentée par récupération : RAG combine la récupération de données avec l’IA générative pour produire des résultats plus innovants et liés au contexte. Les pipelines multimodaux fournissent des embeddings et des métadonnées pour des optimisations fluides des flux de travail. Ils garantissent que les modèles génératifs donnent des réponses pertinentes en récupérant toujours les données pertinentes lors de la récupération.
Mise à l’échelle des workflows d’IA : Les entreprises modernes traitent des volumes de données croissants. Les pipelines multimodaux automatisent des tâches comme le découpage, l’embedding et la gestion des métadonnées. Cela facilite le maintien des performances à mesure que les workflows montent en charge. Ces pipelines fournissent l’évolutivité nécessaire pour répondre à ces demandes croissantes sans renoncer à l’efficacité.
Mises à jour en temps réel : Les données d’entreprise changent constamment, des mises à jour de contenu aux autorisations d’accès. Les pipelines multimodaux assurent une synchronisation en temps réel. Cela permet aux systèmes d’IA de fonctionner avec les informations les plus récentes et les plus pertinentes. Cela prend également en charge les cas d’utilisation dynamiques où les données en temps réel sont essentielles pour obtenir des résultats d’IA précis.
Ces pipelines posent les bases de systèmes d’IA efficaces et innovants. Ils simplifient l’intégration de diverses sources de données et améliorent les performances des modèles d’IA dans le monde réel.
Défis du paysage des données de l’IA
Les systèmes d’IA nécessitent des données de haute qualité pour l’entraînement. Cependant, la gestion de différents types de données s’accompagne de défis. La complexité augmente lorsque l’entreprise traite d’énormes quantités de données non structurées. Examinons quelques-uns des défis du paysage des données de l’IA :
Complexité des types de données : Les formats de données nécessitent des outils ou des workflows spécifiques pour extraire des informations significatives. Par exemple, PDF contient des données mixtes, notamment des tableaux, du texte et des images. Par conséquent, il doit être analysé pour récupérer les données essentielles. Des modèles comme la détection de mise en page peuvent traiter et organiser ces données avec précision afin de préserver toutes les informations vitales.
Les métadonnées comme colonne vertébrale : Les métadonnées sont essentielles pour accroître la productivité des workflows d’IA. Elles fournissent une recherche avancée, une récupération et un contrôle d’accès afin que les utilisateurs puissent accéder rapidement aux données dont ils ont besoin. Les métadonnées sont cruciales pour filtrer, classer et sécuriser l’accès aux informations récupérées et constituent donc un composant clé des systèmes d’IA réussis. L’enrichissement des données avec des métadonnées renforce les approches de recherche hybride, en liant les embeddings sémantiques au filtre de métadonnées. Cela améliorera la précision et la pertinence des systèmes d’IA.
Gestion des données : Les données peuvent changer en raison de mises à jour, de corrections ou d’ajouts dans les grandes entreprises. Elles doivent disposer de systèmes capables de prendre efficacement en charge de tels flux dynamiques en temps réel. Par exemple, les systèmes d’ingestion actifs assurent la synchronisation des fichiers sources dans les systèmes de workflow d’IA sans interruption.
Approche axée sur l’évaluation : La surveillance et l’évaluation continues des résultats du système d’IA sont essentielles pour obtenir une sortie cohérente et fiable. Avant que le système ne passe en production, les entreprises doivent créer des jeux d’évaluation et des métriques. Cela aidera les organisations à mesurer la manière dont leurs systèmes traitent des données complexes pour atteindre les objectifs métier. Des jeux de données synthétiques peuvent être utilisés pour tester et affiner les stratégies, notamment le découpage et l’embedding.
Évolutivité et intégration : À mesure que le volume de données augmente progressivement, l’évolutivité devient très importante. Les systèmes d’IA doivent s’intégrer aux outils d’entreprise existants sans dégradation des performances ni augmentation des charges de travail. Les solutions évolutives améliorent l’efficacité des workflows à mesure que la taille et la complexité des données augmentent. L’intégration de systèmes avancés tels que les bases de données vectorielles améliore les fonctionnalités comme la recherche vectorielle, garantissant un fonctionnement fluide dans des scénarios réels.
En relevant ces défis, l’entreprise peut libérer toute la puissance des données et établir une base solide permettant aux systèmes d’IA de fonctionner efficacement dans des environnements dynamiques. Les pipelines modernes apportent des résultats transformateurs en comblant l’écart entre les données brutes et les workflows opérationnels en IA.
La place de DataVolo dans la pile d’IA
DataVolo est une plateforme révolutionnaire pour créer des pipelines de données multimodaux. Alimentée par Apache NiFi, DataVolo dispose d’une base solide pour les systèmes d’IA modernes. Les principales fonctionnalités comprennent :
Pipelines de données continus et automatisés : Datavolo est conçu pour une ingestion continue et pilotée par les événements. Il s’adapte dynamiquement en fonction des fluctuations du volume de données afin d’assurer des performances prévisibles en période de débit élevé. La plateforme prend en charge divers formats de données, notamment l’audio, la vidéo, les images, les signaux de capteurs, les données structurées JSON ou XML, ainsi que les journaux textuels.
Analyse et découpage : DataVolo peut gérer facilement les données non structurées. Il dispose de processeurs spécialisés pour l’analyse avancée de documents afin de décomposer des documents complexes en sections gérables. Par exemple, le processeur ChunkDocument utilise les informations structurelles pour former des blocs cohérents, tandis que le processeur ChunkText affine davantage ceux-ci en éléments plus petits en fonction de leur signification sémantique.
Déploiement cloud-native : DataVolo est intrinsèquement cloud-native, et son architecture permet des déploiements flexibles chez les principaux fournisseurs comme AWS, GCP et Azure. Il permet aux organisations d’utiliser leurs infrastructures cloud existantes. Il permet un fonctionnement fluide dans des environnements de cloud hybride, garantissant performance et facilité de gestion.
Observabilité : DataVolo s’intègre à OpenTelemetry pour une collecte de données standardisée, permettant ainsi son interopérabilité avec divers outils de surveillance et d’analyse. En outre, il s’intègre également à un générateur de flux basé sur GenAI qui traduit le langage naturel en flux NiFi. Cela facilite la création ou la gestion de pipelines de données.
Focus sur le profil de l’ingénieur données : Datavolo cible les ingénieurs données, en leur proposant une interface visuelle low-code pour concevoir, planifier et maintenir des pipelines. La plateforme offre un large éventail de processeurs et de connecteurs préconçus, prenant ainsi efficacement en charge une grande variété de sources et de destinations. Elle offre une flexibilité permettant de s’adapter rapidement aux évolutions des technologies d’IA et des exigences en matière de données. Cela rend les ingénieurs données efficaces pour fournir des solutions d’IA à fort impact sans ces complexités infrastructurelles.
Intégration avec les bases de données vectorielles : DataVolo s’intègre très bien avec Zilliz et Milvus pour une gestion efficace des bases de données vectorielles. Ces deux solutions fonctionnent en synergie pour renforcer le développement à l’échelle de l’entreprise de workflows d’IA évolutifs et performants.
Fonctionnement de DATAVOLO : Source
Étude de cas : Chatbot d’analyse de données financières
Le traitement de documents non structurés tels que les rapports financiers nécessite des approches innovantes pour gérer la complexité intrinsèque. La plupart des entreprises rencontrent de sérieux défis lorsqu’elles extraient des informations pertinentes à partir de tels documents. Voyons comment traiter ces documents et créer une solution évolutive.
Défi
Le traitement de documents financiers, tels que les rapports 10-K, est complexe pour une entreprise. Ces rapports comptent généralement des centaines de pages et contiennent des tableaux, des graphiques et des données sous forme de texte. Le traitement est très chronophage, sujet aux erreurs et inefficace s’il est effectué manuellement.
Solution
Un pipeline évolutif et automatisé doit intégrer des techniques avancées de traitement des données avec des bases de données vectorielles. La solution comprend les processus suivants :
Ingestion des données : Les données sont extraites de diverses sources, notamment des buckets S3, grâce à une ingestion automatisée. Elle ajoute des détails essentiels tels que le type de document et la source afin de rendre chaque document pertinent et utile à la prise de décision. Pour gérer les données non structurées avec des flux de données dynamiques, la CDC (Change Data Capture) est mise en œuvre. Elle garantit que chaque mise à jour, correction ou ajout dans les fichiers sources est capturé et synchronisé avec les systèmes cibles en temps réel.
CDC évite d’utiliser des informations non pertinentes et maintient l’intégrité des données dans l’ensemble des workflows. L’ingestion est encore optimisée grâce à ces stratégies de listing visant à éviter le retraitement des plus anciens :
Listing basé sur l’horodatage : Il permet de lister uniquement les fichiers qui ont été ajoutés ou modifiés après un certain horodatage. Cela vérifie que l’ingestion de données nouvelles ou mises à jour se fait sans redondance.
Techniques de hachage : Elles comparent le contenu afin d’identifier et d’ignorer les fichiers précédemment traités, même lorsque les noms de fichiers restent les mêmes.
Ces capacités garantissent des pipelines d’ingestion de données robustes et efficaces, adaptatifs aux changements, maintenant dynamiquement les systèmes d’IA alimentés par des informations exactes et à jour.
Prétraitement : Le prétraitement du document implique les étapes suivantes :
Détection de mise en page : La détection de mise en page joue un rôle important dans le traitement de documents complexes tels que les PDF et les rapports financiers. Elle applique le modèle YOLO-X affiné pour identifier et étiqueter les composants tels que les tableaux, les images et les sections avec des boîtes englobantes. Les tableaux conservent leur structure, tandis qu’il existe un lien contextuel avec le texte narratif ou les descriptions. Un graphe de document organise ces éléments de manière hiérarchique pour une meilleure navigation et récupération. L’OCR est utilisé lorsque les couches de texte ne sont pas présentes et qu’il est nécessaire de capturer tous les éléments du document. Cela garantit que la structure et le contexte sont maintenus afin que l’extraction des données soit précise et fiable.
Découpage en segments : Les documents sont divisés en segments gérables pour un traitement efficace. L’approche la plus naïve consiste à découper selon un nombre fixe de caractères, par exemple 400. Cependant, cela peut scinder des informations sémantiquement liées et, par conséquent, ce n’est pas efficace. Une méthode plus affinée est le découpage basé sur les sections, où les sections détectées grâce à la détection de mise en page fournissent les limites. Ainsi, chaque segment conserve le contexte d’une section, y compris le titre et le texte narratif qui y apparaît. L’autre stratégie de découpage utilise le sens du texte en appliquant la similarité cosinus de phrases consécutives. Lorsqu’elle est inférieure au seuil donné, elle effectue le découpage. Cette stratégie de récupération rend chaque segment sémantiquement cohérent avec une précision accrue de la requête d’un utilisateur.
Extraction de métadonnées : Certaines métadonnées, telles que le type de document et l’URL source, sont définies statiquement via la configuration dans le pipeline. D’autres métadonnées sont automatiquement dérivées du flux de traitement, comme les détails extraits grâce à la détection de mise en page ou l’enrichissement avec des sources de données externes. Par exemple, les symboles présents dans le document financier interrogeraient le même symbole dans une table PostgreSQL et ajouteraient les métadonnées appropriées au niveau de l’entreprise. Cela permettra des cas d’utilisation plus avancés comme la recherche hybride, les résultats classés et le contrôle d’accès sécurisé basé sur des métadonnées enrichies.
Embedding : Les segments de texte sont transformés en vecteurs dynamiques de grande dimension grâce à des embeddings de pointe. Ces vecteurs capturent l’essence des données et révèlent des connexions sémantiques significatives. Cela fait de la récupération d’informations une expérience intuitive lors de la réponse aux requêtes des utilisateurs.
Stockage : Ces embeddings et métadonnées sont stockés dans une base de données vectorielle haute performance comme Milvus. Cela permet une récupération rapide, même parmi des millions de vecteurs stockés grâce à l’indexation. Le filtrage des métadonnées apporte de la précision en permettant aux requêtes de prendre en compte un contexte supplémentaire, comme des plages de dates ou des sections de document.
Mises à jour en temps réel : Les pipelines d’ingestion continue mettent automatiquement à jour les données afin de maintenir l’exactitude et la pertinence du système. Cela garantit que les utilisateurs ont accès aux données les plus récentes.
Résultat
Cela aidera à créer un chatbot spécialement destiné aux analystes financiers. Le bot peut recevoir des requêtes de longue traîne comme « Quel a été le bénéfice net de l’entreprise X en 2023 ? » ou « Quels sont les principaux risques identifiés dans la section d’évaluation des risques ? » Il fournira en quelques secondes des réponses correctes et contextuellement pertinentes, avec des citations appropriées issues des documents originaux.
Principaux avantages
Efficacité : L’ingestion, le prétraitement et les embeddings sont automatisés afin de faire gagner du temps à l’équipe financière sur les tâches de plus haut niveau.
Scalabilité : La prise en charge évolutive du stockage et de la récupération de millions de vecteurs dans des bases de données vectorielles avancées simplifie l’analyse à mesure que les volumes de données augmentent.
Insights en temps réel : Les mises à jour continues garantissent que les analystes disposent des informations les plus récentes pour les décisions sensibles au facteur temps.
Ce cas d’utilisation met en évidence la puissance des pipelines multimodaux pour simplifier les workflows complexes. Il illustre comment l’intégration d’un traitement avancé des données avec des solutions de bases de données vectorielles peut apporter une valeur significative.
Milvus : Accélérer la recherche vectorielle
Milvus étend une prise en charge améliorée aux pipelines d’IA multimodaux en introduisant une série de fonctionnalités pour faciliter l’intégration et le traitement de différentes variétés de données comme les textes, les images et les vidéos. Parmi les principales améliorations figurent :
Recherche hybride vecteur-mot-clé : Milvus intègre la similarité vectorielle et les recherches plein texte par mots-clés au sein d’une seule plateforme. Il permet une récupération efficace à travers différentes modalités de données. Cela permet des applications d’IA sophistiquées qui nécessitent une compréhension sémantique et une correspondance précise des mots-clés.
Technologie Sparse-BM25 : Milvus a introduit la technologie Sparse-BM25 pour permettre une version vectorielle creuse de l’algorithme BM25. C’est l’un des algorithmes les plus populaires utilisés dans les systèmes de recherche plein texte. Cette technologie améliore remarquablement la vitesse et la précision de la recherche par mots-clés afin de compléter les recherches sémantiques basées sur les vecteurs. Cela améliore les performances des pipelines d’IA multimodaux.
Intégration des toolkits de développement IA : Milvus s’intègre nativement à la suite complète de toolkits de développement IA, notamment LangChain, LlamaIndex, OpenAI et HuggingFace. Ces toolkits font de Milvus le magasin vectoriel de choix pour les applications d’IA générative qui prennent en charge le RAG à travers diverses modalités de données et réduisent les frictions liées au développement de l’IA multimodale.
Ces améliorations rendent Milvus robuste et efficace pour créer et déployer un pipeline d’IA multimodal. Cela permet aux organisations de traiter et d’analyser différents types de données non structurées en un seul endroit.
Pipelines de données continus et automatisés
La nature dynamique et en constante évolution des données d’entreprise nécessite des workflows automatisés pour les jeux de données qui alimentent les systèmes d’IA. DataVolo répond à cela avec les éléments suivants :
Ingestion en temps réel : DataVolo permet l’ingestion en temps réel en se connectant à des sources de données comme les buckets S3, Google Drive et SharePoint. Il automatise l’ingestion à l’aide de mécanismes pilotés par les événements, réduisant l’intervention humaine. Il fournit également des stratégies d’ingestion configurables pour les traiter efficacement. Ces stratégies incluent le listage basé sur l’horodatage afin d’identifier et de gérer uniquement les fichiers nouveaux ou mis à jour sans créer de redondance, optimisant ainsi les ressources.
Architecture pilotée par les événements : Les pipelines DataVolo sont pilotés par les événements et réagissent automatiquement à tout changement dans les systèmes en amont. Des événements tels que des changements apportés aux fichiers, des mises à jour de métadonnées ou des autorisations utilisateur déclenchent la mise à jour automatique dans le pipeline. Même les métadonnées sensibles, comme les ACL, sont gérées de manière sécurisée tout au long de ce processus.
Conception évolutive et tolérante aux pannes : Elle offre évolutivité et tolérance aux pannes, réduisant drastiquement la dégradation des performances lors d’une ingestion à haut débit. La mise à l’échelle horizontale est gérée par une orchestration alimentée par Kubernetes. Avec une logique de nouvelle tentative intégrée, des processus de backfill et une gestion des temps d’arrêt en amont, elle offre fiabilité et résilience tout en gérant les pipelines de données.
Réussite de l’IA grâce à l’évaluation
L’évaluation constitue un pilier essentiel pour un déploiement efficace de l’IA. Elle mesure l’amélioration des systèmes en matière de précision, de fiabilité et de satisfaction. Les métriques suivantes peuvent aider à évaluer les modèles d’IA :
Métriques de récupération
Précision : Le ratio entre les données pertinentes récupérées et le total des résultats, afin que le système ne renvoie que les informations les plus pertinentes.
Rappel : Le ratio entre les données pertinentes récupérées et l’ensemble des données pertinentes, garantissant qu’aucune information précieuse n’est omise.
Score F1 : Cette métrique combine la précision et le rappel en un seul score. Elle équilibre les compromis entre ces deux éléments et fournit une évaluation complète.
Métriques des modèles de langage
Fidélité : Elle vérifie si les réponses de l’IA proviennent du contexte obtenu et réduit les hallucinations afin de maintenir la factualité.
Exactitude : Compare les réponses générées par l’IA aux données de test afin de mesurer la précision des résultats.
Le défi réside dans l’évaluation des modèles non déterministes, pour lesquels les systèmes peuvent fournir des résultats différents pour la même entrée en raison de leur nature probabiliste. Déterminer et évaluer les réponses « correctes » est intrinsèquement complexe. Les perceptions de l’exactitude et de la pertinence varient souvent selon l’utilisateur et le contexte spécifique. Des boucles de rétroaction dynamiques, des itérations, divers ensembles de test et des métriques sensibles au contexte sont nécessaires pour résoudre cela.
Le réglage des hyperparamètres est crucial pour affiner les workflows d’IA, en particulier les systèmes de génération augmentée par récupération (RAG). Différentes stratégies de découpage nécessitent une configuration minutieuse de paramètres tels que la taille des segments, le chevauchement et les seuils de similarité. Celles-ci incluent le découpage basé sur les sections pour un contexte plus large ou le découpage sémantique pour une précision plus élevée.
Les tests itératifs, combinés aux métriques de récupération, aident à identifier l’équilibre optimal entre précision et richesse contextuelle, garantissant une récupération et une génération de haute qualité.
Les workflows axés d’abord sur l’évaluation permettent aux systèmes d’IA de suivre l’évolution constante des données et des besoins des utilisateurs. Grâce à des améliorations itératives et à l’accent mis sur des métriques robustes, les résultats resteraient crédibles, exploitables et contextuels. Ce faisant, cela comble l’écart entre l’expérimentation et un déploiement fiable dans le monde réel, renforçant ainsi la confiance et la satisfaction à l’égard des résultats des applications d’IA.
Conclusion
Les pipelines multimodaux robustes constituent l’épine dorsale du passage des systèmes d’IA des phases expérimentales à la production à grande échelle. Ces pipelines gèrent de manière transparente divers types de données, permettant aux entreprises de créer des workflows plus innovants.
Elle offre une gestion des données évolutive, sécurisée et performante en intégrant des plateformes avancées de pipelines de données et des bases de données vectorielles comme Zilliz et Milvus. En outre, l’automatisation de tâches telles que le prétraitement des données, l’embedding et l’enrichissement des métadonnées réduirait l’effort manuel sans compromettre l’exactitude et l’évolutivité.
Les transformations et la synchronisation en temps réel des systèmes d’IA les rendront efficaces. Cela facilite la création de workflows d’IA, permettant une évaluation et une amélioration continues.
Cela aide les entreprises à améliorer continuellement les performances des applications, à s’adapter à l’évolution des paysages de données et à répondre aux besoins métier dynamiques. De telles technologies peuvent aider les entreprises dans leur façon de traiter les données et de déployer des applications pilotées par l’IA.
Ressources supplémentaires
Continuer à lire

Zilliz Skills Breakdown: How AI Agents Master Vector Databases
Zilliz's Milvus Skill (pymilvus, 7 files) and Zilliz Cloud Skill (zilliz-cli, 14 modules) bring vector-DB dev and ops into one Claude Code session.

How to Improve Retrieval Quality for Japanese Text with Sudachi, Milvus/Zilliz, and AWS Bedrock
Learn how Sudachi normalization and Milvus/Zilliz hybrid search improve Japanese RAG accuracy with BM25 + vector fusion, AWS Bedrock embeddings, and practical code examples.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.



