8 neueste RAG-Fortschritte, die jeder Entwickler kennen sollte
Large Language Models (LLMs) sind leistungsstark, aber nur so gut wie ihre Trainingsdaten. Wenn Sie eine komplexe Frage stellen, möchten Sie, dass die KI ihr eingebautes Wissen mit frischen, relevanten Informationen aus externen Quellen kombiniert. Genau das leistet Retrieval-Augmented Generation – sie überbrückt die Lücke zwischen statischen Trainingsdaten und dynamischen, aktuellen Informationen.
Traditionelles RAG war von großer Bedeutung, aber Entwickler haben die Grenzen dessen, was möglich ist, immer weiter verschoben. In diesem Artikel untersuchen wir acht fortgeschrittene RAG-Varianten, die reale Probleme lösen können, mit denen Sie möglicherweise konfrontiert sind: langsame Abfrage, schlechtes Kontextverständnis, Verarbeitung multimodaler Daten und Ressourcenoptimierung.
Warum diese neuen RAG-Typen wichtig sind
Traditionelle RAG-Systeme kombinierten zwei Schritte: das Abrufen relevanter Daten als Kontext aus einer Wissensdatenbank, die von einer Vektordatenbank, wie Milvus, unterstützt wird, und das Generieren von Antworten mithilfe eines Sprachmodells.
Obwohl wirksam, standen frühe Implementierungen von RAG vor Herausforderungen in Bezug auf Effizienz, Skalierbarkeit und Datenflussmanagement. Sie stützten sich oft auf einfache Ähnlichkeitsmaße, die entscheidende Nuancen übersehen konnten, was bei komplexen Anfragen zu generischen Antworten führte. Um diese Einschränkungen zu überwinden, haben Forscher neue Strategien eingeführt, die es Modellen ermöglichen:
Abrufschritte dynamisch zu entscheiden: Anstatt Daten immer in einem Durchgang abzurufen, bestimmen neuere Methoden die optimalen Zeitpunkte, um externe Informationen abzurufen.
Multimodale Daten einzubeziehen: Über Text hinaus können einige Systeme Bilder und Videos abrufen, um generierte Inhalte anzureichern.
Ressourcennutzung zu optimieren: Fortgeschrittene RAG-Frameworks passen die Rechenzuweisung basierend auf der Komplexität der Anfrage an.
Hier kommen die spannenden Fortschritte bei RAG ins Spiel. Diese Verbesserungen haben zu genaueren, kontextbewussten Ausgaben geführt, die den Bedürfnissen von Entwicklern und Unternehmen besser gerecht werden.
Kurzreferenz: Welches RAG sollten Sie verwenden?
Hier ist eine entwicklerfreundliche Übersicht darüber, was wir behandeln werden:
| RAG-Typ | Schlüsselinnovation | Am besten geeignet für |
| DeepRAG | Schrittweiser Abrufentscheidungsprozess | Juristische oder medizinische Analyse |
| RealRAG | Echtzeit-Datenverarbeitung | Social-Media-Monitoring, Nachrichten-App |
| CoRAG | Sequenzieller, adaptiver mehrstufiger Abruf | Technische Fehlerbehebung |
| VideoRAG | Video-zu-Text-Verständnis | Zusammenfassung von Vorlesungen |
| CFT-RAG | Baumbasierter (Text + Bild) Abruf | Betrugserkennung |
| CG-RAG | Graphbasiertes kontextuelles Schlussfolgern | Akademische Forschung mit Zitaten |
| GFM-RAG | Wissensverbindungen durch Graph Neural Networks | Patentanalyse |
| URAG | Einheitliche (Text + Bild + Audio) Unterstützung | Bildungs-Chatbots |
DeepRAG
DeepRAG ersetzt traditionelle Abruf-Pipelines durch ein einzelnes neuronales Netzwerk, das Ende-zu-Ende trainiert wird. Es modelliert retrieval-augmentiertes Schlussfolgern als Entscheidungsprozess. Anstatt Abruf und Generierung als separate Aufgaben zu behandeln, entscheidet es dynamisch, wann externe Daten gegenüber internem Schlussfolgern genutzt werden sollen. Dieser schrittweise Ansatz zielt effektiv auf spezifische Wissenslücken ab.
Es verbessert Tiefe und Genauigkeit, indem es rechenintensive Reasoning-Aufgaben um etwa 8-15 % verbessert und unnötige Datenabrufe reduziert, wodurch Compute-Ressourcen eingespart werden. Gleichzeitig kann es die Komplexität des Systemdesigns erhöhen und Fine-Tuning erfordern, um die Abruffrequenz auszubalancieren. Es ist ideal für Faktenverifikation, mehrstufige Reasoning-Aufgaben, forschungsintensive Bereiche und die Erstellung detaillierter Berichte (z. B. Analyse juristischer Dokumente oder Unterstützung bei medizinischen Diagnosen).
Wichtige Funktionen:
Dynamischer Abruf: Bewertet jeden Schritt, um zu entscheiden, ob ein Abruf erforderlich ist.
Strategische Entscheidungsfindung: Verwendet einen Entscheidungsprozess, der einem Markov Decision Process ähnelt.
GitHub: https://github.com/microsoft/deepRAG
Paper: https://arxiv.org/html/2502.01142v1
RealRAG
RealRAG verbessert text-zu-bild-generative Modelle (z. B. Flux und Stable Diffusion V3), indem es reale Bilder abruft. Durch den Vergleich generierter Bilder mit abgerufenen Beispielen schließt das System Wissenslücken, um den Realismus zu verbessern.
Es erzeugt realistischere Bildausgaben und verbessert die Qualität visueller Inhalte. Allerdings verursacht es hohe Infrastrukturkosten für multimodale Verarbeitung rund um die Uhr. Außerdem kann es in Bereichen mit begrenzten hochwertigen Bilddatensätzen Schwierigkeiten haben. Es ist besonders nützlich für Produktdesign und medizinische Bildgebung, wo präzise visuelle Darstellungen entscheidend sind.
Abbildung – Überblick über RealRAG
Abbildung: Überblick über RealRAG (Quelle).
Wichtige Funktionen:
FID-Score-Steigerung: 16,18 % auf dem Stanford-Car-Benchmark
Bildbasierter Abruf: Verbessert die Generierung mit externen visuellen Daten.
Selbstreflexives Lernen: Verfeinert Ausgaben durch Feedback aus Bildvergleichen.
Paper: https://arxiv.org/abs/2502.00848
CoRAG: Chain-of-Retrieval Augmented Generation
Inspiriert von chain-of-thought prompting zerlegt CoRAG Anfragen in Teilfragen und ruft Informationen sequenziell ab. Es passt Tiefe und Breite des Abrufs basierend auf der Komplexität der Anfrage an und formuliert Anfragen bei Bedarf um.
Es verarbeitet vielschichtige Fragen mit bis zu 30 % höherer Genauigkeit und priorisiert wesentliche Informationen durch sequenziellen Abruf. Mehrere Abrufrunden erhöhen jedoch die Latenz. Es ist ideal für technische Fehlerbehebung oder Forschung, bei denen Anfragen mehrschichtige Informationen erfordern.
Wichtige Funktionen:
Sequenzieller Abruf: Ruft Daten in mehreren Schritten ab, um die Antwort zu verfeinern.
Adaptive Compute-Zuweisung: Balanciert Ressourcen basierend auf Datenanforderungen aus.
Paper: https://arxiv.org/abs/2501.14342
VideoRAG: Retrieval-Augmented Generation über Videokorpus
Videoinhalte sind eine reichhaltige Informationsquelle, aber traditionelles RAG ist hauptsächlich für textbasierte Dokumente konzipiert. VideoRAG erweitert RAG-Fähigkeiten auf Videoinhalte, indem es Vision-Language Models (VLMs) wie CLIP zusammen mit Speech-to-Text, Frame-Analyse und Audioverarbeitung nutzt, um Informationen zu extrahieren. Dies ermöglicht es LLMs, Anfragen im Zusammenhang mit Videos zu verstehen, zu verarbeiten und darauf zu antworten. Es wandelt Videoframes in Text-Embeddings um, um Anfragen wie „Find scenes with emotional conflict“. zu ermöglichen.
VideoRAG kann extrem lange Videoinhalte verarbeiten, ohne die Genauigkeit zu beeinträchtigen. Seine Dual-Channel-Architektur liefert detaillierte, kontextreiche Zusammenfassungen von Videodaten. Leider erfordert es hohe GPU-Ressourcen für die Verarbeitung von 4K-Videos und ist komplex in der Verwaltung multimodaler Datenströme. Es eignet sich für Videoinhaltsanalyse, Vorlesungszusammenfassungen und die Generierung multimedialer Inhalte.
Wichtige Funktionen:
Dual-Channel-Architektur: Verarbeitet textuelle und visuelle Daten getrennt.
Videoverarbeitung unbegrenzter Länge: Erhält den Kontext über lange Videosequenzen hinweg.
Unten finden Sie einen einfachen Workflow, wie es funktioniert:
Teilen Sie das Video in Frames auf.
Generieren Sie Embeddings mit CLIP.
Speichern Sie Einbettungen in einer Vektordatenbank (Milvus) für die Ähnlichkeitssuche.
Rufen Sie relevante Clips ab und generieren Sie Zusammenfassungen.
Paper: https://arxiv.org/abs/2501.05874
GitHub: https://github.com/starsuzi/VideoRAG
CFT-RAG: Cuckoo-Filter-Tree-basiertes RAG
CFT-RAG verwendet eine baumbasierte Beschleunigungsmethode mit einem verbesserten Cuckoo Filter für strukturierte Daten (z. B. CSV-Dateien, SQL-Tabellen). Dies beschleunigt die Entitätslokalisierung während des Abrufs und gewährleistet einen schnelleren Zugriff auf relevante Informationen. Es unterstützt sowohl Text als auch Bilder. Zum Beispiel liefert die Anfrage „Zeig mir Rezepte für gesunde Mahlzeiten“ Zutatenlisten und Kochvideos zurück.
Es beschleunigt den Abrufprozess erheblich und verbessert die Präzision, indem es sich auf Schlüsselentitäten konzentriert. Obwohl es saubere, gut strukturierte Daten erfordert, und die Pflege der Baumstruktur regelmäßige Aktualisierungen erfordert. Es eignet sich am besten für Echtzeit-Supportsysteme, Betrugserkennung oder Hochfrequenzhandelsplattformen.
Hauptmerkmale:
Abruf und Generierung: Milvus für multimodale Einbettungen, GPT-4 mit visuellen Fähigkeiten.
Entitäts-Baumstruktur: Organisiert Informationen in einem hierarchischen Baum.
Cuckoo-Filter-Optimierung: Verbessert Abrufgeschwindigkeit und Genauigkeit.
Paper: https://arxiv.org/abs/2501.15098
CG-RAG: Kontextualisiertes Graph-RAG
CG-RAG erweitert den Kontext mithilfe von Wissensgraphen, um Beziehungen zwischen Entitäten (wie Personen oder Ereignissen) zu erfassen. Es nutzt Lexical-Semantic Graph Retrieval (LeSeGR), um die Antwortqualität zu verbessern, indem die Verbindungen zwischen Konzepten berücksichtigt werden. Beispielsweise ruft die Anfrage „Apple’s product launches“ Entitäten (z. B. iPhones, CEOs) und ihre Beziehungen ab. Tools wie Neo4j werden für die Graphspeicherung verwendet, und Graph Neural Networks (GNNs) für die Traversierung.
Diese RAG-Innovation überzeugt bei komplexen Themen oder Forschungsfragen, indem sie Zitationsbeziehungen abbildet. Sie erfordert jedoch auch eine anfängliche Schema-Entwicklung, und Graphabfragen können ressourcenintensiv sein. Insgesamt ist sie äußerst effektiv in der akademischen Forschung, technischen Dokumentation und in Szenarien, die tiefe Einblicke in miteinander verbundene Daten erfordern.
Hauptmerkmale:
Graphbasierter Abruf: Strukturiert Informationen als miteinander verbundene Knoten.
Zitationsbeziehungen: Erfasst, wie verschiedene Informationsstücke zusammenhängen.
Abbildung- Überblick über CG-RAG
Abbildung: Überblick über CG-RAG (Quelle).
Paper: https://arxiv.org/abs/2501.15067
Weitere GraphRAG-Innovationen:
GFM-RAG: Graph Foundation Model für RAG
GFM-RAG verwendet ein Graph Foundation Model, das GNNs nutzt, um Verbindungen zwischen Abfragen auf Nischendatensätzen (z. B. wissenschaftliche Arbeiten, Patentanmeldungen) für fachjargonlastige Domänen zu verfeinern. Dieser Ansatz ermöglicht Multi-Hop-Reasoning über einen strukturierten Wissensgraphen und steigert die Genauigkeit bei wissensintensiven Abfragen erheblich.
Es verbessert die Genauigkeit bei wissensintensiven Abfragen und ist in der Lage, komplexe Beziehungen in großen Datensätzen zu verarbeiten. Allerdings erfordert es klar definierte Merkmalsmengen, und komplexe Abfragen können Antworten verlangsamen. Es ist effektiv in der wissenschaftlichen Forschung, die eine präzise Datenzuordnung erfordert.
Hauptmerkmale:
Graph Neural Network (GNN): Reichert abgerufene Daten semantisch an.
Multi-Hop-Reasoning: Verbindet verstreute Informationen über Dokumente hinweg.
Paper: https://arxiv.org/abs/2502.01113
URAG: Vereinheitlichtes RAG
URAG kombiniert Text, Bilder, Audio und Video unter einer Architektur. Es verwendet regelbasierte Methoden mit RAG-Techniken, um leichtgewichtige LLMs zu unterstützen und präzise Antworten in Umgebungen mit begrenzten Rechenressourcen bereitzustellen.
Es liefert präzise Antworten bei reduziertem Rechenaufwand. Allerdings können regelbasierte Komponenten die Flexibilität einschränken. Das Gleichgewicht zwischen Retrieval und regelbasierter Logik kann herausfordernd sein. Es eignet sich ideal für Bildungs-Chatbots, die per Text und Diagrammen antworten.
Hauptmerkmale:
Modularer Aufbau: Retrieval-/Generierungskomponenten austauschen.
Unterstützung mehrerer Formate: Verarbeitet über 10+ Datenformate.
Hybridsystem: Integriert regelbasierte Logik mit modernen RAG-Techniken.
Unterstützung leichtgewichtiger Modelle: Optimiert die Leistung für kleinere Modelle.
Abbildung- URAG Framework zur Verbesserung der LLM-Leistung in Universitäts-Chatbots
Abbildung: URAG Framework zur Verbesserung der LLM-Leistung in Universitäts-Chatbots (Quelle).
Paper: https://arxiv.org/abs/2501.16276
Vergleich der Ressourcenanforderungen
| RAG-Typ | GPU-Speicher | Latenz | Setup-Komplexität | Beste Leistung |
|---|---|---|---|---|
| DeepRAG | Mittel | Mittel | Mittel | Reasoning-Aufgaben |
| RealRAG | Hoch | Hoch | Hoch | Live-Datenströme |
| CoRAG | Mittel | Hoch | Mittel | Mehrstufige Abfragen |
| VideoRAG | Sehr hoch | Sehr hoch | Hoch | Videoinhalte |
| CFT-RAG | Niedrig | Niedrig | Mittel | Strukturierte Daten |
| CG-RAG | Mittel | Mittel | Hoch | Beziehungsabfragen |
| GFM-RAG | Hoch | Mittel | Sehr hoch | Komplexes Reasoning |
| URAG | Mittel | Mittel | Mittel | Gemischte Inhalte |
Die acht RAG-Varianten, die wir untersucht haben, stellen spannende aktuelle Entwicklungen in diesem Bereich dar, wobei die meisten aus Forschungsarbeiten und Implementierungen im Frühstadium hervorgehen. Während diese Innovationen großes Potenzial zeigen und interessante Ansätze für gängige RAG-Herausforderungen demonstrieren, entwickeln sie sich noch weiter, während die Community in verschiedenen Kontexten mit ihnen experimentiert.
Wie bei jeder aufkommenden Technologie empfehlen wir, mit kleinen Experimenten zu beginnen, um zu sehen, wie diese Ansätze mit Ihren spezifischen Daten und Anwendungsfällen funktionieren. Die Codebeispiele und Empfehlungen unten sollen Ihnen den Einstieg in die Exploration erleichtern, statt als Produktions-Blueprints zu dienen. Jede Variante kann einige Anpassungen erfordern, um zu Ihren jeweiligen Anforderungen und Ihrer Infrastruktur zu passen.
Fazit
Die neuesten Fortschritte bei RAG lösen kritische Herausforderungen in der KI, indem sie Genauigkeit, Geschwindigkeit und Kontextbewusstsein verbessern, sodass es immer eine auf Ihre Bedürfnisse zugeschnittene RAG-Variante gibt. Diese Innovationen ermöglichen intelligentere, reaktionsschnellere Systeme, die neue Möglichkeiten erschließen und die Anwendungen von LLMs branchenübergreifend erweitern können.
Durch die Nutzung des verwalteten Milvus-Dienstes von Zilliz Cloud können Entwickler diese RAG-Varianten problemlos bereitstellen. Während sich RAG weiterentwickelt, wird es eine entscheidende Rolle bei der Gestaltung der Zukunft der KI spielen und sicherstellen, dass Antworten flüssig und durch die neuesten Daten und kontextuellen Hinweise fundiert informiert sind.
Verwandte Ressourcen
Evaluating Retrieval-Augmented Generation (RAG) | Zilliz Blog
Build Custom RAG Pipelines with Step-by-Step Code Tutorials | Zilliz Tutorials
Advancements in RAG: A Comprehensive Survey of Techniques and Applications
Neueste Fortschritte in RAG, die jeder Entwickler kennen sollte!
RAG mit Milvus und DeepSeek erstellen | Milvus-Dokumentation
Weiterlesen

Top 10 Context Engineering Techniques You Should Know for Production RAG
A practical guide to context engineering for production LLM systems, covering RAG, context processing, memory, agents, and multimodal context.

DeepSeek-OCR Explained: Optical Compression for Scalable Long-Context and RAG Systems
Discover how DeepSeek-OCR uses visual tokens and Contexts Optical Compression to boost long-context LLM efficiency and reshape RAG performance.

Creating Collections in Zilliz Cloud Just Got Way Easier
We've enhanced the entire collection creation experience to bring advanced capabilities directly into the interface, making it faster and easier to build production-ready schemas without switching tools.



