Fortgeschrittene RAG-Techniken: Text und Visualisierungen für präzisere Antworten verbinden
Large Language Models (LLMs) haben außergewöhnliche Fähigkeiten beim Verstehen und Erzeugen verschiedener Arten von Inhalten, Text oder visuell, gezeigt, wodurch sie in verschiedenen Branchen weit verbreitet eingesetzt werden. Trotz ihrer Vielseitigkeit erzeugen LLMs aufgrund begrenzten Domänenwissens und veralteter Daten häufig ungenaue oder erfundene Informationen—bekannt als Halluzinationen—.
Retrieval-Augmented Generation (RAG) ist eine Technik, die diese Herausforderungen angeht, indem sie die generativen Fähigkeiten von LLMs mit Retrieval-Systemen kombiniert, die relevante Informationen aus externen Quellen abrufen. Indem LLM-Antworten auf realen, aktuellen Daten basieren, verbessert RAG die Genauigkeit und kontextuelle Relevanz von Antworten und steigert die Gesamteffizienz des Systems. Diese Kombination aus Generierung und Retrieval treibt Innovationen voran, transformiert die Datenverarbeitung und macht LLMs in realen Anwendungen zuverlässiger.
Bei einem kürzlich von Zilliz veranstalteten Unstructured Data Meetup teilte Yi Ding, ehemaliger Head of Typescript and Partnerships bei LlamaIndex, Einblicke in einen neuen Ansatz für RAG: Small to Slide. Diese Methode verbessert die Leistung von multimodalen LLMs beim Umgang mit visuellen Daten wie Präsentationen oder Dokumenten mit Bildern. In diesem Blog untersuchen wir, wie RAG funktioniert, welche Herausforderungen RAG mit sich bringt und welche fortgeschrittenen RAG-Techniken es gibt, wie etwa Small to Slide RAG.
RAG verstehen
RAG kombiniert die Leistungsfähigkeit von LLMs mit der Fähigkeit, spezifische Informationen aus einer Wissensbasis abzurufen, die von Vektordatenbanken unterstützt wird. Wenn ein Benutzer eine Frage stellt, durchsucht das RAG-System die Datenbank nach relevanten Informationen und verwendet diese Informationen, um eine genauere Antwort zu generieren. Werfen wir einen Blick darauf, wie der RAG-Prozess funktioniert.
Abbildung: Wie RAG funktioniert
Ein RAG-System besteht aus drei Schlüsselkomponenten: einem Embedding-Modell, einer Vektordatenbank und einem LLM.
Das Embedding-Modell wandelt Dokumente in Vektor-Embeddings um, die in einer Vektordatenbank wie Milvus gespeichert werden.
Wenn ein Benutzer eine Frage stellt, transformiert das System die Anfrage mithilfe desselben Embedding-Modells in einen Vektor.
Die Vektordatenbank führt dann eine Ähnlichkeitssuche durch, um die relevantesten Informationen abzurufen. Diese abgerufenen Informationen werden mit der ursprünglichen Frage kombiniert, um eine „Frage mit Kontext“ zu bilden, die anschließend an das LLM gesendet wird.
Das LLM verarbeitet diese angereicherte Eingabe, um eine genauere und kontextuell relevantere Antwort zu generieren.
Diese Methode ist besonders wertvoll für den Umgang mit spezialisiertem Wissen oder dynamischen, häufig aktualisierten Informationen und stellt sicher, dass KI-Systeme präzise und zuverlässige Antworten liefern.
Beispielsweise könnte eine große E-Commerce-Plattform diesen Ansatz nutzen, um ihr Produktempfehlungssystem zu betreiben. Das System könnte Millionen von Produktbeschreibungen, Kundenbewertungen und Nutzungsdaten verarbeiten und sie als Vektoren speichern. Wenn ein Nutzer nach einem Produkt sucht, ruft das System schnell die relevantesten Artikel ab und berücksichtigt dabei nicht nur Schlüsselwörter, sondern auch die semantische Bedeutung der Anfrage.
RAG-Herausforderungen und fortgeschrittene RAG-Techniken
Während RAG leistungsstarke Fähigkeiten bietet, steht es auch vor Herausforderungen, die seine Wirksamkeit beeinträchtigen können, insbesondere wenn Daten groß und komplex werden.
Geschwindigkeit: Das Durchsuchen größerer Datenbanken dauert länger. Dies kann durch den Einsatz hardwarebeschleunigter Datenverarbeitung abgemildert werden, etwa durch Optimierung für GPUs oder andere Hochleistungssysteme.
Genauigkeit: Sicherzustellen, dass wir die relevantesten Informationen abrufen, ist eine Herausforderung. Entwickler benötigen Möglichkeiten, Leistung und Datengenauigkeit je nach ihren Anforderungen auszubalancieren.
Multimodale Daten: Ein einfaches RAG hat Schwierigkeiten mit Nicht-Text-Daten wie Bildern oder Diagrammen. Der Umgang mit verschiedenen Arten von Vektordaten wird in diesen Fällen entscheidend.
In den folgenden Abschnitten werden wir mehrere fortgeschrittene RAG-Techniken untersuchen—Small to Big RAG, Small to Slide RAG und ColPali—die diese Herausforderungen adressieren und die Geschwindigkeit, Genauigkeit und Vielseitigkeit von RAG-Systemen verbessern.
Small to Big RAG
Small to Big RAG ist eine Methode zur Verbesserung der Genauigkeit von RAG-Systemen. Die Kernidee besteht darin, Dokumente für präzise Suchen in kleinere, absichtsorientierte Abschnitte aufzuteilen, aber größere Kontextabschnitte abzurufen, anstatt nur die exakt passenden Teile zurückzugeben, um sicherzustellen, dass LLMs sinnvolle und vollständige Antworten generieren können. Denn während kleinere Abschnitte die Suchpräzision verbessern, indem sie auf spezifische Details fokussieren, können sie auch kritischen Kontext verfehlen, was zu unvollständigen oder ungenauen Antworten führt.
Schauen wir uns ein Beispiel an.
Betrachten Sie die Anfrage: “Wo arbeitet Frau Churilo?”
Bei der Verarbeitung könnte das Embedding-Modell das weniger häufige Wort “Churilo” gegenüber wichtigeren Begriffen wie “arbeitet” priorisieren. Infolgedessen könnte das System Sätze abrufen, in denen “Churilo” erwähnt wird, aber die Schlüsselinformation nicht liefern: “Chris ist derzeit VP of Marketing bei Zilliz.”
Small to Big RAG behebt diese Einschränkung, indem es den gesamten Absatz abruft, in dem ihre Rolle erwähnt wird, und dem LLM den vollständigen Kontext gibt, der erforderlich ist, um eine korrekte und vollständige Antwort zu liefern.
Abbildung: Falscher Abruf in traditionellem RAG
Small to Big RAG ist besonders effektiv beim Umgang mit komplexen oder mehrschichtigen Textdaten. In einem technischen Supportsystem zum Beispiel könnte das Abrufen eines einzelnen Satzes mit einem relevanten Schlüsselwort umgebende Details auslassen, die für das Verständnis entscheidend sind. Stattdessen ruft Small to Big RAG alle Abschnitte ab, die mit der Anfrage zusammenhängen. Wenn ein Nutzer beispielsweise fragt: “Wie setze ich mein Passwort zurück?” könnte das System den Absatz mit der direkten Antwort abrufen und zusätzlichen Kontext einschließen, etwa Sicherheitsempfehlungen, wodurch die Antwort umfassender und nützlicher wird.
Durch die Kombination der Präzision kleinerer Embeddings mit der kontextuellen Tiefe eines breiteren Abrufs stellt Small to Big RAG ein Gleichgewicht zwischen Genauigkeit und Vollständigkeit sicher. Dieser Ansatz ermöglicht es KI-Systemen, Antworten zu liefern, die nicht nur präzise, sondern auch reich an Kontext sind, wodurch ihre Zuverlässigkeit in realen Anwendungen verbessert wird.
Small to Slide RAG
Während Small to Big RAG bei der Verarbeitung textbasierter Daten hervorragend ist, hat es Schwierigkeiten, Informationen zu erfassen, die in visuellen Elementen wie Folien, Diagrammen oder Grafiken eingebettet sind. Small to Slide RAG ist eine verbesserte RAG-Methode, die dieses Problem löst, indem sie Text aus visuellen Elementen wie Folien einbettet, aber das gesamte Folienbild abruft. Dieses abgerufene Ergebnis wird dann an ein multimodales LLM übergeben und von diesem verarbeitet, das sowohl Text als auch Bilder analysieren kann.
So funktioniert es:
Texteinbettung: Das System extrahiert und bettet Text aus Folien ein.
Visueller Abruf: Anstatt nur Text abzurufen, ruft es das gesamte Folienbild ab, das die relevanten Informationen enthält.
Multimodale Verarbeitung: Die abgerufenen Folienbilder werden in ein multimodales LLM eingespeist (z. B. GPT-4 mit visuellen Fähigkeiten), das sowohl die visuellen als auch die textuellen Komponenten gleichzeitig verarbeiten kann.
Diese Methode ist besonders nützlich für die Verarbeitung komplexer Dokumente, in denen entscheidende Informationen über visuelle Elemente vermittelt werden. Zum Beispiel finden sich in vierteljährlichen Finanzberichten wichtige Erkenntnisse oft in Grafiken oder Diagrammen, die herkömmliche textbasierte RAG-Systeme möglicherweise übersehen. Durch das Abrufen und Analysieren des gesamten Folienbildes stellt Small to Slide RAG sicher, dass kein kritisches Detail übersehen wird, und liefert eine genauere und umfassendere Antwort.
Um die Leistungsfähigkeit von Small to Slide RAG zu demonstrieren, gab Yi Ding eine Demo eines praktischen Beispiels mit einem Nvidia-Foliensatz. Du kannst dir die Demo hier ansehen.
Abbildung: Ein Vergleich zwischen dem von einem traditionellen RAG und einem Small to Slide RAG abgerufenen Kontext
In dieser Demo verglich Yi Ding den von einem traditionellen RAG-System abgerufenen Kontext mit Small to Slide RAG bei der Beantwortung derselben Frage: "Welche SaaS-Plattformen unterstützt NVIDIA AI Enterprise?"
Traditionelles RAG: Das traditionelle textbasierte RAG-System hatte Schwierigkeiten, eine vollständige Antwort zu liefern. Es stützte sich ausschließlich auf aus den Folien extrahierten Text und übersah kritische Informationen, die in Diagrammen und Schaubildern eingebettet waren. Diese Einschränkung führte zu einer unvollständigen und weniger informativen Antwort.
Small to Slide RAG: Im Gegensatz dazu lieferte Small to Slide RAG deutlich bessere Ergebnisse. Das System rief die tatsächlichen Folienbilder ab, die die relevanten Informationen enthielten, und speiste sie in ein multimodales LLM ein (z. B. GPT-4 mit visuellen Fähigkeiten). Dadurch konnte das Modell sowohl die Text- als auch die visuellen Elemente interpretieren und eine wesentlich umfassendere und genauere Antwort generieren.
Dieses Beispiel veranschaulicht die einzigartige Stärke von Small to Slide RAG: seine Fähigkeit, komplexe Dokumente zu verarbeiten, in denen wichtige Informationen über Text und visuelle Elemente verteilt sind, was es zu einem unschätzbaren Werkzeug für die Verarbeitung visuell reichhaltiger Inhalte macht.
Damit diese RAG-Methoden reibungslos funktionieren, benötigen sie eine Infrastruktur zur Verwaltung komplexer Abfragen und Abrufoperationen.
ColPali: Die Grenzen erweitern
Am Ende seines Vortrags stellte Yi eine aufkommende Technik namens ColPali, vor, ein neuartiges Dokumentabrufmodell, das die Grenzen der Retrieval-Augmented Generation (RAG) erweitert. Im Gegensatz zu traditionellen Methoden, die Dokumente mit visuellen Daten (wie Folien und PDFs) in Text umwandeln, arbeitet ColPali direkt mit den visuellen Merkmalen von Dokumenten und ermöglicht es so, Informationen ohne den fehleranfälligen Schritt der Textextraktion zu indexieren und abzurufen.
Wie ColPali funktioniert
Obwohl sich ColPali noch in einem frühen Stadium befindet, verändert es die Art und Weise, wie wir üblicherweise Dokumentabruf durchführen, indem es sich auf visuelle Daten konzentriert:
Dokumente werden als Bilder behandelt, wodurch die Textkonvertierung vollständig umgangen wird.
Pro Bild werden mehrere Einbettungen, ähnlich wie visuelle n-Gramme, generiert, um fein abgestufte visuelle Merkmale zu erfassen.
Suchen werden durchgeführt, indem visuelle Einbettungen mit der Abfrage verglichen werden, um die relevantesten Bereiche des Dokuments zu identifizieren.
Abbildung: Französisches Dokument über die Ölförderung in Kasachstan, mit bestimmten hervorgehobenen Bereichen
Betrachten wir das im obigen Bild gezeigte Beispiel: ein französisches Dokument über die Ölförderung in Kasachstan. Bei einer Frage zur Offshore-Ölförderung hebt ColPali bestimmte Bereiche des Dokuments hervor—wie Diagramme und Schaubilder—die für die Abfrage am relevantesten sind. Dadurch wird sichergestellt, dass sowohl textuelle als auch visuelle Elemente berücksichtigt werden, was ein umfassendes Verständnis des Inhalts bietet.
Warum ColPali spannend ist
ColPali bietet mehrere wesentliche Vorteile gegenüber traditionellen RAG-Systemen:
Durch die direkte Arbeit mit Bildern vermeidet es Ungenauigkeiten, die durch die Umwandlung komplexer Dokumente (z. B. PDFs) in Text entstehen.
Es erfasst visuelle Informationen wie Layouts, Diagramme und Formatierungen, die bei textbasierten Methoden häufig verloren gehen.
ColPali ermöglicht Retrieval und Suche für visuelle Daten und eröffnet Möglichkeiten in Bereichen wie technischem Design, rechtlicher Dokumentation und mehr.
Eine praktische Anwendung von ColPali könnte in der Überprüfung architektonischer Entwürfe liegen. Stellen Sie sich ein KI-System vor, das Baupläne und technische Zeichnungen direkt analysiert. Bei einer Anfrage zu bestimmten Designelementen könnte das System relevante Teile der Zeichnungen hervorheben und dabei sowohl textuelle Anmerkungen als auch visuelle Merkmale einbeziehen.
Herausforderungen und Einschränkungen von ColPali
Obwohl ColPali vielversprechend ist, befindet es sich noch in einem frühen Stadium und bringt einige Herausforderungen mit sich:
Hoher Rechenaufwand: Das Generieren und Vergleichen mehrerer Einbettungen pro Bild ist rechenintensiv, wodurch GPU acceleration für den praktischen Einsatz unerlässlich wird.
Begrenztes Ökosystem: Im Vergleich zu etablierteren RAG-Techniken gibt es weniger Tools und Ressourcen für die Implementierung von ColPali.
Sprach- und trainingsspezifische Modelle: ColPali-Modelle stützen sich derzeit auf spezifische Trainingsdatensätze, was die Generalisierung über verschiedene Domänen hinweg einschränken kann.
Vor- und Nachteile der einzelnen RAG-Techniken
Jede der oben besprochenen Techniken bietet unterschiedliche Vorteile und Einschränkungen.
Abbildung: Vergleich verschiedener RAG-Techniken
Textbasiertes RAG ist am einfachsten zu implementieren und profitiert von umfassender Tool-Unterstützung. Es hat jedoch Schwierigkeiten, multimodale Informationen beizubehalten, und handhabt Chunking nicht immer perfekt. Andererseits verbessert Small to Slide die Erfassung multimodaler Daten, erfordert jedoch eine komplexere Einrichtung und funktioniert am besten mit bestimmten Datentypen. Schließlich vereinfacht ColPali den Prozess, indem es die Notwendigkeit der Textkonvertierung vermeidet und integrierte Attribution bietet, erfordert jedoch GPUs und benutzerdefinierte Modelle, was die Zugänglichkeit für einige Projekte einschränken kann.
Implementierung von Advanced RAG: Praktische Überlegungen
Wenn Sie erwägen, diese fortgeschrittenen RAG-Techniken in Ihren eigenen Projekten zu implementieren, sollten Sie einige Punkte beachten.
Datenbewertung
Betrachten Sie die Arten von Daten, mit denen Sie arbeiten. Wenn Sie viele Dokumente mit Diagrammen, Bildern oder komplexen Layouts haben, könnten Ansätze wie Small to Slide RAG besonders vorteilhaft sein. Wenn Sie beispielsweise ein System zur Analyse von Finanzberichten entwickeln, die häufig eine Mischung aus Text, Tabellen und Diagrammen enthalten, könnte Small to Slide RAG umfassendere Einblicke liefern als ein rein textbasierter Ansatz.
Rechenressourcen
Methoden wie Small to Slide RAG und ColPali können rechenintensiver sein als traditionelles RAG. Stellen Sie sicher, dass Sie über die notwendigen Ressourcen verfügen, insbesondere wenn Sie mit großen Datensätzen arbeiten.
Modellauswahl
Diese fortgeschrittenen Techniken erfordern oft bestimmte Modelltypen. Für Small to Slide RAG benötigen Sie ein multimodales LLM, das Text und Bilder verarbeiten kann. Stellen Sie sicher, dass Sie ein Modell wählen, das zu Ihren Anforderungen passt, und dass Sie über die Ressourcen verfügen, um es auszuführen.
Fähigkeiten der Vektordatenbank
Die Wahl der richtigen Vektordatenbank ist entscheidend für die Implementierung eines RAG-Systems, das auf Ihre Anforderungen zugeschnitten ist. Wenn Sie beispielsweise ein Small to Big RAG implementieren, benötigen Sie eine Vektordatenbank, die größere Textabschnitte effizient mithilfe von Embeddings abrufen kann, die aus kleineren Abschnitten erzeugt wurden. Skalierbarkeit wird entscheidend, wenn Ihre Anwendung mit riesigen Mengen an Vektordaten arbeitet, wie etwa Datensätzen im Milliardenmaßstab. Lösungen wie Milvus und sein verwalteter Dienst, Zilliz Cloud, sind für diese Szenarien konzipiert und bieten hochskalierbaren und effizienten Vektorabruf.
Bewertungsmetriken
Entwickeln Sie klare Metriken, um die Leistung Ihres RAG-Systems zu bewerten, einschließlich der Relevanz der abgerufenen Informationen, der Genauigkeit der generierten Antworten sowie der Geschwindigkeit von Abruf und Generierung.
Iterative Entwicklung
RAG entwickelt sich rasant weiter. Planen Sie einen iterativen Entwicklungsprozess, der es Ihnen ermöglicht, verschiedene Ansätze einfach zu testen und zu vergleichen. Beginnen Sie mit einer grundlegenden RAG-Implementierung und führen Sie dann schrittweise fortgeschrittenere Techniken wie Small to Big RAG oder Small to Slide RAG ein. Bewerten Sie kontinuierlich Leistung und Nutzerfeedback, um Ihren Entwicklungsprozess zu steuern.
Fazit
RAG-Techniken entwickeln sich weiter und bieten verschiedene Ansätze wie textbasiertes RAG, Small to Slide RAG und ColPali, um unterschiedlichen Anforderungen gerecht zu werden. Während textbasiertes RAG einen soliden Ausgangspunkt für allgemeine Anwendungen bietet, können speziellere Fälle, insbesondere solche, die visuelle Daten verarbeiten, von fortgeschrittenen Methoden wie Small to Slide RAG oder ColPali profitieren.
Die Wahl der richtigen Methode hängt von Ihren Daten und den verfügbaren Ressourcen ab. Jeder Ansatz bietet eine Möglichkeit, die Effizienz und Genauigkeit von KI-Systemen zu verbessern und so ein besseres Gleichgewicht zwischen Komplexität, Geschwindigkeit und Kosten zu ermöglichen. Indem Sie Ihren Ansatz an Ihren spezifischen Anforderungen ausrichten, können Sie RAG nutzen, um Systeme zu entwickeln, die Nutzern die richtigen Informationen zur richtigen Zeit im richtigen Format bieten.
Weitere Ressourcen
Weiterlesen

What Is a Vector Lakebase?
A Vector Lakebase is a unified, lake-native data architecture for AI that combines vector-database-grade serving with open lake storage, reusable lake-level indexes, and a shared semantic layer.

Zilliz Cloud BYOC Now Available Across AWS, GCP, and Azure
Zilliz Cloud BYOC is now generally available on all three major clouds. Deploy fully managed vector search in your own AWS, GCP, or Azure account — your data never leaves your VPC.

Democratizing AI: Making Vector Search Powerful and Affordable
Zilliz democratizes AI vector search with Milvus 2.6 and Zilliz Cloud for powerful, affordable scalability, cutting costs in infrastructure, operations, and development.



