Évaluation des systèmes RAG multimodaux à l’aide de Trulens
À mesure que les architectures multimodales prennent de l’importance dans l’IA générative (GenAI), les organisations développent de plus en plus de solutions à l’aide de modèles multimodaux tels que GPT-4V et Gemini Pro Vision. Ces modèles offrent un avantage clé : ils peuvent intégrer sémantiquement et interpréter divers types de données — texte, images, et plus encore — ce qui les rend plus polyvalents et plus efficaces que les grands modèles de langage traditionnels (LLMs) dans un éventail plus large d’applications.
Cependant, à mesure que l’intérêt pour les modèles multimodaux augmente, les défis liés à la garantie de leur fiabilité et de leur exactitude augmentent également. Comme les LLMs, les modèles multimodaux sont sujets aux « hallucinations », où ils produisent des sorties incorrectes ou non pertinentes — en particulier lorsqu’ils sont chargés de traiter simultanément différents types de données d’entrée. La génération augmentée par récupération multimodale (RAG) répond à ces limites en enrichissant les modèles avec des informations contextuelles pertinentes provenant de sources externes.
Lors d’un Unstructured Data Meetup organisé par Zilliz, Josh Reini, Developer Advocate chez TruEra (désormais acquis par Snowflake), a partagé des informations sur les défis et les solutions liés au travail avec des frameworks multimodaux. Josh a souligné comment nous pouvions atténuer les hallucinations de l’IA à l’aide d’outils open source comme Trulens et comment l’intégration de la base de données vectorielle Milvus peut améliorer les performances des systèmes RAG multimodaux.
Josh Reini prenant la parole lors du SF Unstructured Data Meetup de novembre
Dans ce blog, nous récapitulerons les points clés de Josh et discuterons du rôle essentiel que les évaluations (ou « Evals ») jouent dans l’amélioration des systèmes RAG multimodaux, en veillant à ce que ces systèmes fournissent des résultats exacts et pertinents lorsqu’ils traitent des données complexes. Vous pouvez également regarder l’intervention complète de Josh sur YouTube pour obtenir davantage d’informations.
Comprendre les modèles multimodaux et le RAG multimodal
Les modèles multimodaux sont des modèles d’apprentissage automatique capables de traiter et d’intégrer plusieurs types de données ou modalités, comme le texte, les images, l’audio et la vidéo. Contrairement aux modèles de langage traditionnels qui se concentrent sur un seul type d’entrée, les modèles multimodaux combinent des informations provenant de diverses sources pour créer des sorties plus exactes sur le plan contextuel. Cette polyvalence les rend particulièrement utiles dans des scénarios où les données proviennent de différents formats. Par exemple, un modèle multimodal pourrait utiliser une image et une description textuelle pour générer une réponse plus précise qu’un modèle s’appuyant sur un seul type d’entrée.
Comme les LLMs, les modèles multimodaux sont optimisés pour la généralisation, ce qui leur permet de répondre à diverses entrées. Cependant, cette optimisation a un coût. Les modèles sont souvent pénalisés lorsqu’ils mémorisent des données spécifiques, ce qui crée une tension entre flexibilité et exactitude. Cet exercice d’équilibrage devient délicat lorsque la tâche implique de croiser plusieurs modalités, comme diagnostiquer une maladie à partir de symptômes textuels et d’images radiographiques.
Pour doter ces modèles à usage général de mémoires à long terme, nous pouvons décharger certaines connaissances spécifiques « mémorisées » vers des ressources externes, comme un vector store (par exemple, Milvus). Cette technique est connue sous le nom de RAG multimodal.
Les systèmes de RAG traditionnel se concentrent sur la récupération de texte pertinent afin d’améliorer le processus génératif des LLMs, produisant des réponses plus précises et personnalisées. Le RAG multimodal va au-delà du texte en intégrant des types de données supplémentaires — images, audio, vidéos, et plus encore — dans le processus de récupération et de génération à l’aide de modèles multimodaux et de bases de données vectorielles. Cette approche permet aux systèmes de RAG multimodal d’être plus efficaces dans les tâches nécessitant une compréhension plus approfondie des entrées textuelles et non textuelles.
Par exemple, le RAG multimodal peut récupérer des images ou des vidéos pertinentes dans des systèmes de questions-réponses visuelles afin de générer des réponses plus précises. De même, dans des tâches comme le sous-titrage d’images ou les systèmes de dialogue multimodaux, la capacité à combiner des données visuelles et textuelles garantit que le système fournit des sorties plus pertinentes contextuellement et plus exactes.
En tirant parti des forces complémentaires des modèles multimodaux et des mécanismes de récupération avancés, le RAG multimodal offre une solution puissante pour traiter des données complexes et multiformats, et générer des réponses riches et sensibles au contexte dans un large éventail d’applications.
Comment fonctionne le RAG multimodal ?
Maintenant que nous avons introduit le concept de RAG multimodal, explorons le fonctionnement de ces systèmes. Nous utiliserons un système de questions-réponses visuelles augmenté par récupération comme exemple pour illustrer le processus :
Figure- Fonctionnement d’un système RAG multimodal
Traitement des entrées multimodales : Le système RAG reçoit une requête utilisateur accompagnée d’une image.
Embedding : L’image et la requête textuelle sont toutes deux transformées en embeddings vectoriels à l’aide d’un modèle d’embedding multimodal. Ces embeddings permettent au système d’analyser et de comparer l’entrée entre différentes modalités (texte et image), le rendant capable de comprendre les relations entre les deux.
Récupération dans la base de données vectorielle : Le système utilise les embeddings d’image pour interroger une base de données vectorielle, telle que Milvus ou sa version managée, Zilliz Cloud, afin de récupérer des images similaires et leurs annotations associées ou des données pertinentes. Cette étape de récupération enrichit les connaissances du modèle en fournissant un contexte supplémentaire issu de données du monde réel.
Complétion : Les données récupérées (images similaires et leurs annotations) sont combinées avec la requête d’entrée originale. Le modèle multimodal utilise ce contexte enrichi pour générer une réponse complète ou une complétion qui exploite à la fois l’entrée originale et les informations récupérées.
Réponse : Enfin, le système génère une réponse précise intégrant les données externes récupérées avec l’entrée originale. Cela permet au modèle de produire une réponse plus sensible au contexte, pertinente et précise à la requête de l’utilisateur.
En incorporant des données externes par le biais de la récupération, les systèmes de RAG multimodal vont au-delà de ce que le modèle connaît en interne, garantissant des sorties plus précises et pertinentes contextuellement.
La nécessité d’évaluations systématiques
Malgré la puissante combinaison de modèles multimodaux et de systèmes de récupération, des défis subsistent. Si des démonstrations impressionnantes peuvent mettre en valeur le potentiel du RAG multimodal, transformer une démonstration en une application robuste et prête pour la production est beaucoup plus difficile.
La clé pour surmonter ces défis est l’évaluation systématique. Ces évaluations aident à identifier les faiblesses, les modes de défaillance et les axes d’amélioration dans les applications multimodales, permettant aux développeurs de les affiner et de les optimiser au fil du temps. Dans le domaine de l’IA, nous voyons souvent deux types d’équipes :
Les équipes qui construisent des prototypes enthousiasmants qui fonctionnent environ 80 % du temps.
Les équipes qui réussissent à déployer ces systèmes en production, ce qui est une tâche beaucoup plus complexe et exigeante.
Pour le second groupe — ceux qui se concentrent sur la production — l’itération et l’évaluation systématiques sont essentielles, en particulier dans des domaines tels que l’éducation (tuteurs basés sur les LLM), le support client (résumé de transcriptions) et les services financiers (chatbots internes ou destinés aux clients), où la fiabilité et la précision sont critiques.
C’est là que les outils d’évaluation, souvent appelés Evals, deviennent indispensables. Les outils d’évaluation permettent aux développeurs de surveiller les performances, de tester la fiabilité et d’identifier les axes d’amélioration à mesure qu’ils itèrent vers une solution de niveau production. Parmi les outils d’évaluation populaires figurent Trulens, Ragas, LangFuse, OpenAI Evals, DeepEval, Phoenix et LangSmith.
Dans les sections suivantes, nous utiliserons TruLens, un outil d’évaluation open-source, comme étude de cas pour démontrer comment les évaluations systématiques peuvent être appliquées aux systèmes RAG multimodaux.
Comment TruLens aide à l’évaluation du RAG multimodal
Trulens est un outil open-source pour évaluer les grands modèles de langage (LLM) et les applications RAG multimodales. Sa force réside dans sa capacité à surveiller, tester et déboguer les applications, ce qui le rend particulièrement utile pour identifier les axes d’amélioration et garantir la fiabilité des applications.
Une fois que les développeurs connectent leur application à TruLens, ils peuvent journaliser des enregistrements et définir des fonctions d’évaluation qui évaluent systématiquement les performances du modèle. Ces évaluations sont cruciales pour détecter les hallucinations, qui peuvent entraîner des réponses inexactes ou non pertinentes, en particulier dans les systèmes RAG multimodaux complexes.
Dans un système RAG typique, trois composants essentiels doivent être évalués :
Figure- Trois piliers du RAG (triade RAG)
Requête : L’utilisateur envoie une requête, qui peut prendre la forme de texte ou d’une combinaison de texte et d’images.
Contexte : Le système récupère des informations pertinentes, telles que des images et du texte, depuis une base de données vectorielle afin de fournir du contexte au modèle.
Réponse : Le LLM ou le modèle multimodal génère une réponse sur la base du contexte récupéré et de la requête originale.
Pour garantir que le modèle reste précis et fiable, des évaluations sont effectuées à chaque étape afin de détecter les hallucinations et d’évaluer dans quelle mesure le système fonctionne bien. C’est souvent appelé la triade RAG, comme le montre le diagramme ci-joint.
Il existe trois types critiques d’évaluations pour garantir que la sortie du système est fiable :
Pertinence du contexte : Cela vérifie dans quelle mesure les informations récupérées (texte ou images) correspondent à la requête originale. Le contexte récupéré est-il pertinent et utile pour la requête en question ?
Ancrage : L’ancrage évalue si le contexte récupéré soutient la réponse générée. La réponse s’appuie-t-elle sur les informations récupérées, ou génère-t-elle des données non étayées ou incorrectes ?
Pertinence de la réponse : Cela mesure l’utilité et la précision de la réponse du modèle. La réponse est-elle significative et pertinente par rapport à la question de l’utilisateur ?
En intégrant TruLens, les développeurs peuvent suivre et améliorer en continu les performances de leurs systèmes RAG multimodaux, en veillant à ce que le modèle reste précis, fondé sur des preuves et contextuellement pertinent, tout en minimisant les hallucinations.
Pour un guide étape par étape sur la manière de mettre en œuvre et d’évaluer le RAG à l’aide de Trulens, lisez ce tutoriel : Évaluations pour la génération augmentée par récupération : TruLens + Milvus.
Exemple concret : évaluer un système RAG de questions-réponses visuelles
Pour mieux comprendre cela, considérons l’exemple d’un système RAG de questions-réponses visuelles. Dans ce système, l’utilisateur fournit à la fois une requête et une image. Le modèle génère un embedding à partir de l’image et recherche dans une base de données vectorielle des images similaires, qui sont ensuite associées à des annotations pour générer la réponse finale.
À chaque étape, nous devons évaluer si les images récupérées sont pertinentes par rapport à la requête originale, si la réponse du LLM est ancrée dans le contexte fourni, et si la réponse finale est pertinente par rapport à la question originale. Si le système récupère des images non pertinentes ou génère des diagnostics incorrects, les évaluations nous aideront à identifier le mode de défaillance et à améliorer le modèle.
Une équipe, X-ray Insight, a créé une application lors d’un hackathon qui illustre ces évaluations en action. Ils ont extrait des images radiographiques et des annotations (diagnostics), transformé les images en embeddings d’images, chargé ces embeddings avec des métadonnées (les diagnostics) dans la base de données vectorielle Milvus/Zilliz, et utilisé une image fournie par l’utilisateur (qui a également été transformée en embeddings) pour récupérer des cas similaires. Les métadonnées (p. ex., les diagnostics) associées à ces images ont été utilisées pour générer un diagnostic final via un modèle multimodal.
Figure : fonctionnement du système X-ray Insight
Grâce à TruLens, l’équipe X-ray Insight a pu évaluer les performances de son modèle à plusieurs étapes :
Génération d’embeddings : Prétraiter l’image, calculer l’embedding (un processus chronophage) et garantir la qualité de l’embedding.
Récupération de cas : Rechercher des cas pertinents dans la base de données vectorielle sur la base des embeddings calculés.
Diagnostic final : Générer un diagnostic à partir des notes du patient et le comparer aux données récupérées.
Une fois ces évaluations en place, TruLens permet à l’équipe d’analyser les caractéristiques communes entre les diagnostics, d’identifier les modes de défaillance et de s’améliorer grâce aux enseignements obtenus.
Conclusion
En résumé, déployer des modèles multimodaux et des systèmes RAG en production exige plus que la création d’un prototype impressionnant. Une itération systématique au moyen d’évaluations telles que la pertinence du contexte, l’ancrage et la pertinence de la réponse est essentielle pour garantir que ces modèles sont fiables et précis. Des outils comme TruLens fournissent un cadre pour suivre, tester et déboguer ces applications, aidant les développeurs à affiner leurs modèles et à éviter les hallucinations.
Alors que nous continuons à repousser les limites de ce que les modèles multimodaux peuvent faire, les évaluations resteront une pierre angulaire du processus de développement. Elles garantiront que ces modèles génèrent des résultats de manière ancrée et pertinente.
Ressources supplémentaires
Continuer à lire

A Few Notes from Databricks Data + AI Summit 2026: Why the Data Layer Matters Again
James Luan shares notes from Databricks Data + AI Summit 2026 on why production AI is pushing the data layer back to the center of infrastructure.

Why Teams Are Migrating from Weaviate to Zilliz Cloud — and How to Do It Seamlessly
Explore how Milvus scales for large datasets and complex queries with advanced features, and discover how to migrate from Weaviate to Zilliz Cloud.

Build for the Boom: Why AI Agent Startups Should Build Scalable Infrastructure Early
Explore strategies for developing AI agents that can handle rapid growth. Don't let inadequate systems undermine your success during critical breakthrough moments.



