8 dernières avancées du RAG que chaque développeur devrait connaître
Les grands modèles de langage (LLM) sont puissants, mais leur qualité dépend de celle de leurs données d’entraînement. Lorsque vous posez une question complexe, vous voulez que l’IA combine ses connaissances intégrées avec des informations récentes et pertinentes provenant de sources externes. C’est exactement ce que fait la génération augmentée par récupération : elle comble le fossé entre les données d’entraînement statiques et les informations dynamiques et à jour.
Le RAG traditionnel a été important, mais les développeurs repoussent les limites de ce qui est possible. Dans cet article, nous explorerons huit variantes avancées du RAG capables de résoudre des problèmes réels auxquels vous pourriez être confronté : récupération lente, mauvaise compréhension du contexte, gestion des données multimodales et optimisation des ressources.
Pourquoi ces nouveaux types de RAG sont importants
Les systèmes RAG traditionnels combinaient deux étapes : récupérer les données pertinentes en tant que contexte à partir d’une base de connaissances alimentée par une base de données vectorielle, telle que Milvus, et générer des réponses à l’aide d’un modèle de langage.
Bien qu’efficaces, les premières implémentations du RAG ont rencontré des défis en matière d’efficacité, d’évolutivité et de gestion des flux de données. Elles s’appuyaient souvent sur de simples mesures de similarité qui pouvaient passer à côté de nuances cruciales, ce qui entraînait des réponses génériques aux requêtes complexes. Pour surmonter ces limites, les chercheurs ont introduit de nouvelles stratégies qui permettent aux modèles de :
Décider dynamiquement des étapes de récupération : au lieu de toujours récupérer les données d’un seul coup, les méthodes plus récentes déterminent les moments optimaux pour récupérer des informations externes.
Intégrer des données multimodales : au-delà du texte, certains systèmes peuvent récupérer des images et des vidéos pour enrichir le contenu généré.
Optimiser l’utilisation des ressources : les frameworks RAG avancés ajustent l’allocation du calcul en fonction de la complexité de la requête.
C’est là que les avancées passionnantes du RAG entrent en jeu. Ces améliorations ont conduit à des sorties plus précises et conscientes du contexte, qui répondent mieux aux besoins des développeurs comme des entreprises.
Référence rapide : quel RAG devriez-vous utiliser ?
Voici un aperçu convivial pour les développeurs de ce que nous allons couvrir :
| Type de RAG | Innovation clé | Idéal pour |
| DeepRAG | Processus décisionnel de récupération étape par étape | Analyse juridique ou médicale |
| RealRAG | Traitement des données en temps réel | Surveillance des réseaux sociaux, application d’actualités |
| CoRAG | Récupération séquentielle, adaptative et multi-étapes | Dépannage technique |
| VideoRAG | Compréhension vidéo-vers-texte | Résumé de cours magistraux |
| CFT-RAG | Récupération arborescente (texte + image) | Détection de fraude |
| CG-RAG | Raisonnement contextuel basé sur les graphes | Recherche universitaire avec citations |
| GFM-RAG | Connexions de connaissances via réseaux neuronaux de graphes | Analyse de brevets |
| URAG | Prise en charge unifiée (texte + image + audio) | Chatbots éducatifs |
DeepRAG
DeepRAG remplace les pipelines de récupération traditionnels par un réseau neuronal unique entraîné de bout en bout. Il modélise le raisonnement augmenté par récupération comme un processus décisionnel. Au lieu de traiter la récupération et la génération comme des tâches distinctes, il décide dynamiquement quand s’appuyer sur des données externes plutôt que sur le raisonnement interne. Cette approche étape par étape cible efficacement des lacunes de connaissances spécifiques.
Il améliore la profondeur et la précision en perfectionnant les tâches à forte intensité de raisonnement d’environ 8 à 15 % et réduit la récupération de données inutile, économisant ainsi des ressources de calcul. Bien qu’il puisse augmenter la complexité de la conception du système et nécessiter un ajustement fin pour équilibrer la fréquence de récupération. Il est idéal pour la vérification des faits, les tâches de raisonnement en plusieurs étapes, les domaines à forte intensité de recherche et la génération de rapports détaillés (par exemple, l’analyse de documents juridiques ou l’aide au diagnostic médical).
Caractéristiques clés :
Récupération dynamique : Évalue chaque étape pour décider si une récupération est nécessaire.
Prise de décision stratégique : Utilise un processus de décision similaire à un processus de décision de Markov.
GitHub : https://github.com/microsoft/deepRAG
Article : https://arxiv.org/html/2502.01142v1
RealRAG
RealRAG améliore les modèles génératifs texte-image (par exemple, Flux et Stable Diffusion V3) en récupérant des images du monde réel. En comparant les images générées avec les exemples récupérés, le système comble les lacunes de connaissances afin d’améliorer le réalisme.
Il produit des sorties d’image plus réalistes et améliore la qualité du contenu visuel. Cependant, il entraîne des coûts d’infrastructure élevés pour le traitement multimodal 24/7. Il peut également rencontrer des difficultés dans les domaines disposant de jeux de données d’images de qualité limités. Il est particulièrement utile pour la conception de produits et l’imagerie médicale, où des représentations visuelles précises sont essentielles.
Figure- Vue d’ensemble de RealRAG
Figure : Vue d’ensemble de RealRAG (Source).
Caractéristiques clés :
Augmentation du score FID : 16,18 % sur le benchmark Stanford Car
Récupération basée sur l’image : Améliore la génération grâce à des données visuelles externes.
Apprentissage auto-réflexif : Affine les sorties via des retours issus de comparaisons d’images.
Article : https://arxiv.org/abs/2502.00848
CoRAG : Chain-of-Retrieval Augmented Generation
Inspiré par le chain-of-thought prompting, CoRAG décompose les requêtes en sous-questions et récupère les informations de manière séquentielle. Il ajuste la profondeur et l’étendue de la récupération en fonction de la complexité de la requête et reformule les requêtes si nécessaire.
Il gère les questions à multiples facettes avec une précision jusqu’à 30 % supérieure et priorise les informations essentielles grâce à la récupération séquentielle. Cependant, plusieurs cycles de récupération augmentent la latence. Il est idéal pour le dépannage technique ou la recherche lorsque les requêtes nécessitent des informations à plusieurs niveaux.
Caractéristiques clés :
Récupération séquentielle : Récupère les données en plusieurs étapes pour affiner la réponse.
Allocation adaptative du calcul : Équilibre les ressources en fonction des besoins en données.
Article : https://arxiv.org/abs/2501.14342
VideoRAG : Retrieval-Augmented Generation sur un corpus vidéo
Le contenu vidéo est une source riche d’informations, mais le RAG traditionnel est principalement conçu pour des documents textuels. VideoRAG étend les capacités du RAG au contenu vidéo en utilisant des modèles vision-langage (VLM) comme CLIP, ainsi que la transcription automatique, l’analyse d’images et le traitement audio pour extraire les informations. Cela permet aux LLM de comprendre, traiter et répondre aux requêtes liées aux vidéos. Il convertit les images vidéo en embeddings textuels pour permettre des requêtes comme « Trouver des scènes avec un conflit émotionnel ».
VideoRAG peut gérer du contenu vidéo extrêmement long sans compromettre la précision. Son architecture à double canal fournit des résumés détaillés et riches en contexte des données vidéo. Malheureusement, il nécessite d’importantes ressources GPU pour le traitement vidéo 4K et présente une complexité dans la gestion des flux de données multimodaux. Il convient à l’analyse de contenu vidéo, au résumé de cours et à la génération de contenu multimédia.
Caractéristiques clés :
Architecture à double canal : Traite séparément les données textuelles et visuelles.
Traitement vidéo de longueur illimitée : Maintient le contexte sur de longues séquences vidéo.
Voici un flux de travail simple de son fonctionnement :
Diviser la vidéo en images.
Générer des embeddings à l’aide de CLIP.
Stocker les embeddings dans une base de données vectorielle (Milvus) pour la recherche de similarité.
Récupérer les clips pertinents et générer des résumés.
Article : https://arxiv.org/abs/2501.05874
GitHub : https://github.com/starsuzi/VideoRAG
CFT-RAG : RAG basé sur un arbre de filtres de Cuckoo
CFT-RAG utilise une méthode d’accélération basée sur un arbre à l’aide d’un filtre de Cuckoo amélioré avec des données structurées (p. ex., fichiers CSV, tables SQL). Cela accélère la localisation des entités lors de la récupération, garantissant un accès plus rapide aux informations pertinentes. Il prend en charge à la fois le texte et les images. Par exemple, demander « Montre-moi des recettes de repas sains » renvoie des listes d’ingrédients et des vidéos de cuisine.
Il accélère considérablement le processus de récupération et améliore la précision en se concentrant sur les entités clés. Bien qu’il nécessite des données propres et bien structurées, et que la maintenance de la structure arborescente exige des mises à jour régulières. Il convient le mieux aux systèmes d’assistance en temps réel, à la détection de fraude ou aux plateformes de trading à haute fréquence.
Fonctionnalités clés :
Récupération et génération : Milvus pour les embeddings multimodaux, GPT-4 avec capacités de vision.
Structure arborescente des entités : Organise les informations dans un arbre hiérarchique.
Optimisation du filtre de Cuckoo : Améliore la vitesse et la précision de la récupération.
Article : https://arxiv.org/abs/2501.15098
CG-RAG : RAG à graphe contextualisé
CG-RAG améliore le contexte à l’aide de graphes de connaissances afin de capturer les relations entre les entités (comme des personnes ou des événements). Il utilise la récupération graphe lexicale-sémantique (LeSeGR) pour améliorer la qualité des réponses en tenant compte des interconnexions entre les concepts. Par exemple, une requête « lancements de produits d’Apple » récupère des entités (p. ex., iPhones, PDG) et leurs relations. Des outils comme Neo4j sont utilisés pour le stockage de graphes, et des réseaux de neurones graphiques (GNN) pour le parcours.
Cette innovation RAG excelle dans les sujets complexes ou les questions de recherche en cartographiant les relations de citation. Mais elle nécessite également une conception de schéma en amont, et les requêtes de graphe peuvent être gourmandes en ressources. Dans l’ensemble, elle est très efficace dans la recherche universitaire, la documentation technique et les scénarios nécessitant des insights approfondis sur des données interreliées.
Fonctionnalités clés :
Récupération basée sur les graphes : Structure les informations sous forme de nœuds interconnectés.
Relations de citation : Capture la manière dont différents éléments d’information sont liés.
Figure- Aperçu de CG-RAG
Figure : Aperçu de CG-RAG (Source).
Article : https://arxiv.org/abs/2501.15067
Autres innovations GraphRAG :
GFM-RAG : modèle de fondation de graphe pour RAG
GFM-RAG emploie un modèle de fondation de graphe utilisant des GNN pour affiner les connexions entre les requêtes sur des jeux de données de niche (p. ex., articles universitaires, dépôts de brevets) pour des domaines riches en jargon. Cette approche permet un raisonnement multi-sauts sur un graphe de connaissances structuré, améliorant considérablement la précision dans les requêtes à forte intensité de connaissances.
Il améliore la précision dans les requêtes à forte intensité de connaissances et est capable de gérer des relations complexes dans de grands jeux de données. Cependant, il nécessite des ensembles de fonctionnalités bien définis, et les requêtes complexes peuvent ralentir les réponses. Il est efficace dans la recherche scientifique nécessitant une cartographie précise des données.
Fonctionnalités clés :
Réseau de neurones graphique (GNN) : Enrichit sémantiquement les données récupérées.
Raisonnement multi-sauts : Relie des informations disparates entre les documents.
Article : https://arxiv.org/abs/2502.01113
URAG : RAG unifié
URAG combine texte, images, audio et vidéo dans une seule architecture. Il utilise des méthodes basées sur des règles avec des techniques RAG pour prendre en charge des LLM légers, fournissant des réponses précises dans des environnements aux ressources de calcul limitées.
Il fournit des réponses précises avec une surcharge computationnelle réduite. Cependant, les composants basés sur des règles peuvent limiter la flexibilité. Trouver le bon équilibre entre la récupération et la logique basée sur des règles peut être difficile. Il est idéal pour les chatbots éducatifs répondant via du texte et des diagrammes.
Fonctionnalités clés :
Conception modulaire : Remplacez les composants de récupération/génération.
Prise en charge multi-format : Gère plus de 10 formats de données.
Système hybride : Intègre une logique basée sur des règles avec des techniques RAG modernes.
Prise en charge des modèles légers : Optimise les performances pour les modèles plus petits.
Figure- Cadre URAG pour améliorer les performances des LLM dans les chatbots universitaires
Figure : Cadre URAG pour améliorer les performances des LLM dans les chatbots universitaires (Source).
Article : https://arxiv.org/abs/2501.16276
Comparaison des exigences en ressources
| Type de RAG | Mémoire GPU | Latence | Complexité de configuration | Meilleures performances |
|---|---|---|---|---|
| DeepRAG | Moyenne | Moyenne | Moyenne | Tâches de raisonnement |
| RealRAG | Élevée | Élevée | Élevée | Flux de données en direct |
| CoRAG | Moyenne | Élevée | Moyenne | Requêtes en plusieurs étapes |
| VideoRAG | Très élevée | Très élevée | Élevée | Contenu vidéo |
| CFT-RAG | Faible | Faible | Moyenne | Données structurées |
| CG-RAG | Moyenne | Moyenne | Élevée | Requêtes relationnelles |
| GFM-RAG | Élevée | Moyenne | Très élevée | Raisonnement complexe |
| URAG | Moyenne | Moyenne | Moyenne | Contenu mixte |
Les huit variantes de RAG que nous avons explorées représentent des développements récents passionnants dans le domaine, la plupart provenant d’articles de recherche et d’implémentations à un stade précoce. Bien que ces innovations soient très prometteuses et démontrent des approches intéressantes face aux défis courants du RAG, elles continuent d’évoluer à mesure que la communauté les expérimente dans différents contextes.
Comme pour toute technologie émergente, nous recommandons de commencer par de petites expérimentations pour voir comment ces approches fonctionnent avec vos données et cas d’usage spécifiques. Les exemples de code et recommandations ci-dessous visent à vous aider à démarrer l’exploration plutôt qu’à servir de plans de production. Chaque variante peut nécessiter une certaine adaptation pour répondre à vos exigences et à votre infrastructure particulières.
Conclusion
Les dernières avancées en matière de RAG résolvent des défis critiques de l’IA en améliorant la précision, la vitesse et la conscience du contexte ; il existe donc toujours une variante de RAG adaptée à vos besoins. Ces innovations permettent des systèmes plus intelligents et plus réactifs, capables de débloquer de nouvelles possibilités et d’élargir les applications des LLM dans tous les secteurs.
En tirant parti du service Milvus géré de Zilliz Cloud, les développeurs peuvent déployer facilement ces variantes de RAG. À mesure que le RAG continue d’évoluer, il jouera un rôle essentiel dans le façonnement de l’avenir de l’IA, en garantissant que les réponses soient fluides et profondément informées par les données les plus récentes et les indices contextuels.
Ressources connexes
Évaluer la génération augmentée par récupération (RAG) | Blog Zilliz
Créer des pipelines RAG personnalisés avec des tutoriels de code étape par étape | Tutoriels Zilliz
Avancées du RAG : une étude complète des techniques et applications
Dernières avancées en matière de RAG que tout développeur devrait connaître !
Continuer à lire

Smarter Autoscaling in Zilliz Cloud: Always Optimized for Every Workload
With the latest upgrade, Zilliz Cloud introduces smarter autoscaling—a fully automated, more streamlined, elastic resource management system.

Announcing VDBBench 1.0: Open-Source VectorDB Benchmarking with Your Real-World Production Workloads
Discover VDBBench 1.0, an open-source tool for benchmarking vector databases with real-world production data, streaming ingestion, and concurrent workloads.

Zilliz Named "Highest Performer" and "Easiest to Use" in G2's Summer 2025 Grid® Report for Vector Databases
Zilliz shines in G2's Summer 2025 Grid® Report as both "Highest Performer" and "Easiest to Use," solving the performance-usability dilemma.



