Herausforderungen bei der strukturierten Extraktion von Dokumentdaten im großen Maßstab mit LLMs
Eine der zentralen Herausforderungen bei der Anwendung großer Sprachmodelle (LLMs) liegt in der Phase der Datenverarbeitung, insbesondere beim Umgang mit unterschiedlichen Datenformaten. Daten lassen sich typischerweise in drei Arten einteilen: strukturiert, halbstrukturiert oder unstrukturiert. Da LLMs hauptsächlich mit Text arbeiten, werden sie häufig auf unstrukturierte Daten angewendet, es sei denn, die Daten sind bereits in einer relationalen Tabelle organisiert.
In einem kürzlich abgehaltenen Webinar stellte Tim Spann, Principal Developer Advocate bei Zilliz, Unstract vor, eine Open-Source-Plattform, die darauf ausgelegt ist, die Extraktion unstrukturierter Daten zu optimieren und sie in strukturierte Formate umzuwandeln. Dieses Tool soll das Datenmanagement vereinfachen, indem es den Strukturierungsprozess automatisiert.
In diesem Blog befassen wir uns mit den wichtigsten Herausforderungen der Extraktion strukturierter Dokumentdaten, wie sie von Shuveb Hussain, Mitgründer und CEO von Unstract, skizziert wurden. Außerdem untersuchen wir, wie Unstract verschiedene Szenarien bewältigt, einschließlich seiner Integration mit Vektordatenbanken wie Milvus, um zuvor unhandhabbaren Daten Struktur zu verleihen.
Aktuelle Einschränkungen
Die Strukturierung von Daten ist seit Langem komplex und zeitaufwendig, insbesondere da Machine-Learning-Modelle immer größere Datenmengen erfordern. Historisch wurde ein erheblicher Teil dieser Extraktionsarbeit manuell durchgeführt—etwa im Fall gescannter handschriftlicher Dokumente—, weil Automatisierung die unterschiedlichen Anforderungen von Modellen nicht vollständig erfüllen konnte.
Obwohl große Sprachmodelle (LLMs) die Fähigkeit zur Analyse und Extraktion von Informationen aus Dokumenten verbessert haben, weisen sie bemerkenswerte Einschränkungen auf. Dokumente liegen häufig in verschiedenen Formaten vor, etwa als Tabellen, Formulare, Diagramme und Scans, wobei die Qualität und Konsistenz der Daten eine entscheidende Rolle für eine erfolgreiche Extraktion spielen. Darüber hinaus erfordern viele Anwendungen die Verarbeitung riesiger Dokumentmengen, und nicht alle folgen einer einheitlichen Struktur. Dies kann zusätzliche Anpassungen im Extraktionsprozess erforderlich machen, da LLMs Schwierigkeiten haben können, sehr variable oder komplexe Layouts ohne menschliches Eingreifen zu handhaben.
Abbildung 1: Herausforderungen bei der Datenstrukturierung
Abbildung 1 zeigt ein Bubble-Chart zu Herausforderungen, das die Landschaft der aktuellen Entwicklungen bei der Extraktion strukturierter Dokumentdaten darstellt. Das Diagramm hebt drei Schlüsselbereiche hervor:
Eine kleine Gruppe von Anwendungsfällen, die durch aktuelle Technologie erfolgreich gelöst wurden.
Ein erheblicher Teil des Marktes wird aktiv von großen Sprachmodellen (LLMs) adressiert.
Ein enormes Potenzial an ungelösten Geschäftsfällen, die offen bleiben. Diese Fälle könnten in Zukunft angegangen werden, abhängig von Fortschritten in verschiedenen Technologien.
Diese Visualisierung betont die Lücke zwischen dem, was derzeit erreichbar ist, und den potenziellen Durchbrüchen in naher Zukunft, wie der Anwendungsentwicklung mit KI-Agenten.
Dokumentenextraktion
Jeder, der versucht hat, mit LLMs Text aus Dokumenten zu extrahieren, weiß, wie herausfordernd es sein kann, alle notwendigen Informationen mit nur wenigen Codezeilen zu erhalten. Zwar können Tools wie Co-pilots bei diesem Prozess unterstützen, doch reichen sie oft nicht aus, um eine vollständig automatisierte Lösung bereitzustellen. Die extrahierten Daten haben möglicherweise nicht immer die gewünschte Struktur, und häufig ist ein Schritt menschlicher Intervention erforderlich, um die Informationen im richtigen Format zu organisieren.
Hier bietet Unstract eine vollständig automatisierte Lösung, bei der unstrukturierte Dokumente ohne menschliche Aufsicht in strukturierte Daten umgewandelt werden können. Unstract verwendet eine LLM-basierte Technologie, um die Informationen zu extrahieren.
Abbildung 2: Dokumentenextraktion
Unstract Cloud
Unstract ist eine No-Code-LLM-Plattform, die in die Kategorie Intelligent Document Processing (IDP) fällt. Sie optimiert die Dokumentenextraktion, indem sie den Prozess in zwei Hauptschritte unterteilt:
Prompt Engineering: Unstracts Prompt Studio ermöglicht es Benutzern, generische Prompts für bestimmte Dokumenttypen zu entwickeln, die anschließend wiederverwendet werden können, um strukturierte Daten aus anderen Dokumenten desselben Typs zu extrahieren.
Bereitstellungsphase: Sobald die Prompts erstellt wurden, können sie auf verschiedene Weise bereitgestellt werden, unter anderem als ETL-Pipeline, als API-Endpunkt oder als Teil einer Warteschlange zur manuellen Überprüfung für eine weitere Inspektion.
Unstract bietet zwei Ansätze, um eine genaue Datenextraktion zu erreichen:
Erhöhte Genauigkeit (LLM Challenge): Diese Methode umfasst die Verarbeitung des Dokuments mit einem LLM und die Verwendung eines zweiten LLM, um die Ausgabe des ersten zu überprüfen. Wenn die beiden Modelle keinen Konsens erzielen, wird das spezifische Feld, das extrahiert wird, auf null gesetzt, wodurch das Risiko vermieden wird, dass falsche Daten eingetragen werden. Dies reduziert das Risiko von Halluzinationen erheblich, da zwei Modelle von unterschiedlichen Anbietern wahrscheinlich nicht dieselbe falsche Ausgabe erzeugen.
Reduzierte Kosten
SinglePass Extraction: Anstatt mehrere Prompts für einzelne Felder zu senden, fasst dieser Ansatz alle Prompts in einer einzigen Anfrage zusammen. Das LLM gibt eine JSON-Ausgabe zurück, die alle erforderlichen Felder in einem Durchlauf enthält, wodurch Token-Nutzung und Latenz reduziert werden.
Zusammengefasste Extraktion: Diese Methode erstellt mithilfe des LLM auf Grundlage der Prompts des Benutzers eine Zusammenfassung des Eingabedokuments. Die Zusammenfassung wird anschließend verwendet, um die erforderlichen Felder zu extrahieren, wodurch die Token-Nutzung optimiert und die Latenz weiter reduziert wird.
Abbildung 3: Unstract-Extraktionsstrategien
Abbildung 4 und 5 zeigen ein Beispiel für ein Single-Pass-Extraction-Projekt, bei dem wir sehen können, dass mehrere Prompts kombiniert werden, um eine einzelne JSON-Ausgabe zu erhalten.
Abbildung 4: Unstract Prompt Studio (Dokumentenparser)
Abbildung 5: Unstract Prompt Studio (Kombinierte Ausgabe)
Darüber hinaus können Benutzer verschiedene Optionen konfigurieren, um den Extraktionsprozess anzupassen. Dazu gehören die Auswahl einer Vektordatenbank wie Milvus oder Zilliz Cloud zum Speichern und Abrufen von Vektoreinbettungen, die Auswahl eines zweiten LLM-Modells zum Vergleichen von Ausgaben wie Kosten oder Latenz oder die Auswahl der Challenge-LLM-Option, wenn Genauigkeit Vorrang vor Kosten hat.
Abbildung 6: Unstract Prompt Studio: Einstellungen
Sobald die Einstellungen definiert sind und die Ergebnisse der Textextraktion zufriedenstellend sind, können Sie den Workflow als Tool exportieren (Abbildung 7), den bereitzustellenden Workflow auswählen (Abbildung 8) und den API-Endpunkt abrufen (Abbildung 9).
Abbildung 7: Workflow als Tool exportieren
Abbildung 8: Workflow als Tool exportieren
Abbildung 9: API-Endpunkt bereitstellen
Unstract-Abrufstrategien
Unter Einstellungen können Benutzer zwischen zwei Abrufstrategien wählen:
Einfach: Diese Strategie verwendet eine einzelne Abfrage, um relevante Informationsabschnitte abzurufen, und nutzt dabei eine Kombination aus Keyword-Matching und Vektorsuche, um Genauigkeit sicherzustellen.
Teilfrage: Dieser Ansatz beinhaltet die Zerlegung einer komplexen Abfrage in einfachere Teilfragen. Jede Teilfrage ruft relevante Informationen ab, die anschließend zusammengeführt werden, um eine umfassende Antwort auf die ursprüngliche komplexe Abfrage zu liefern.
Obwohl der einfache Retrieval-Ansatz Geschwindigkeit und Kosteneffizienz bietet, erfasst er möglicherweise nicht das nuancierte Verständnis, das anspruchsvollere Modelle liefern können.
Der Teilfragen-Retriever ist besonders wertvoll für die Beantwortung komplexer Fragen, bei denen Informationen aus verschiedenen Kontexten oder Domänen integriert werden müssen. Indem sich dieser Ansatz auf die spezifischen Informationsanforderungen jeder Teilfrage konzentriert, verbessert er die Fähigkeit des Modells, detaillierte Abfragen effektiv zu verarbeiten.
Fazit
Der Bereich der strukturierten Dokumentendatenextraktion verändert sich dank Fortschritten bei großen Sprachmodellen und innovativen Tools wie Unstract rasant. Unstract bietet in Kombination mit Vektordatenbanken wie Zilliz Cloud eine effektive Möglichkeit, unstrukturierte Daten in strukturierte Formate umzuwandeln, wobei sowohl Genauigkeit als auch Kosteneinsparungen im Fokus stehen. Mit verschiedenen Retrieval-Strategien hilft es Nutzern, komplexe Fragen auf benutzerfreundliche Weise zu bewältigen.
Mit Blick auf die Zukunft ist das Potenzial für weitere Verbesserungen in der intelligenten Dokumentenverarbeitung enorm, wie Shuveb Hussain während des Webinars hervorhob. Da der Bedarf an effizienter Datenextraktion wächst, sind Plattformen wie Unstract bereit, eine führende Rolle zu übernehmen. Indem sie diese Technologien verbessern, helfen sie Organisationen, unstrukturierte Daten in nützliche Erkenntnisse umzuwandeln.
Dieser Wandel hin zu vollständig automatisierter Dokumentenverarbeitung dreht sich nicht nur um Technologie; es geht darum, zu verändern, wie Daten in verschiedenen Branchen verwaltet werden. Durch die Einführung dieser Fortschritte können Organisationen neue Wachstumschancen in einer zunehmend datengesteuerten Welt entdecken.
Weiterlesen

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

Zilliz Cloud Now Available in AWS Europe (Ireland)
Zilliz Cloud launches in AWS eu-west-1 (Ireland) — bringing low-latency vector search, EU data residency, and full GDPR-ready infrastructure to European AI teams. Now live across 30 regions on five cloud providers.

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.



