Optimierung der Datenverarbeitung mit Zilliz Cloud Pipelines: Ein tiefer Einblick in das Dokument-Chunking
Die Optimierung der Datenverarbeitung mit Zilliz Cloud Pipelines umfasst die Untersuchung des Dokument-Chunkings. Es ist eine Komponente der Umwandlung unstrukturierter Daten in eine durchsuchbare Vektorsammlung. Die Ingestion-, Deletion- und Search-Pipelines von Zilliz Cloud Pipelines erleichtern diesen Prozess zusätzlich. Jede erfüllt einen anderen Zweck im Datenverarbeitungs-Workflow.
Zilliz Cloud Pipelines spielen eine Rolle dabei, den Dokument-Chunking-Prozess zu vereinfachen und die Durchsuchbarkeit zu verbessern. Die Plattform ermöglicht Anwendungsfälle mit semantischer Suche in Textdokumenten und bietet einen wichtigen Baustein für Retrieval-Augmented Generation (RAG)-Anwendungen.
Zilliz Cloud Pipelines enthalten verschiedene Funktionen wie SEARCH_DOC_CHUNK, die den Abfragetext in ein Vektor-Embedding umwandeln. Anschließend werden die relevantesten Top-K-Dokument-Chunks abgerufen, wodurch es einfacher wird, die zugehörigen Informationen basierend auf der Bedeutung der Abfrage zu finden.
Zilliz Cloud Pipelines: Transformation der Datenverarbeitung
Die Ingenieure bei Zilliz haben Zilliz Cloud Pipelines entwickelt, um unstrukturierte Daten aus verschiedenen Quellen für vielbeschäftigte Gen-AI-Entwickler in eine durchsuchbare Vektorsammlung umzuwandeln. Diese Pipeline nimmt unstrukturierte Daten, teilt sie auf, wandelt sie in Embeddings um, indiziert sie und speichert sie mit den vorgesehenen Metadaten in Zilliz Cloud. Diese Architektur nutzt verschiedene zentrale technologische Komponenten und Fähigkeiten, die die Leistung verbessern.
Technologische Grundlage
Milvus Vector Database
Milvus Vector Database ist darauf ausgelegt, hochdimensionale Vektordaten effizient zu verarbeiten. Sie unterstützt zudem verschiedene Anwendungsfälle, einschließlich Zilliz Cloud, einem Cloud-Service, der Entwicklern hilft, sich auf Kernanwendungen zu konzentrieren, statt Datenbankoperationen zu verwalten.
Connectors
Die Connectors sind ein integriertes Tool, das mühelos verschiedene Datenquellen verbindet und die Datenaufnahme und Indexierung in Echtzeit ermöglicht, um sicherzustellen, dass die aktuellsten Inhalte sofort für alle Suchanfragen zugänglich sind. Skalierbar und adaptiv können die Connectors schwankende Traffic-Lasten nahtlos bewältigen und so eine reibungslose Skalierbarkeit ohne DevOps-Aufwand ermöglichen. Sie synchronisieren automatisch Dokumenthinzufügungen und -löschungen mit der Sammlung und halten sie so synchron. Darüber hinaus bietet detailliertes Logging Einblick in den Datenfluss, gewährleistet Transparenz und ermöglicht das Erkennen eventuell auftretender Anomalien.
Document Splitters
Splitter werden häufig bei der Dokumentverarbeitung und Textanalyse eingesetzt, um ein Dokument oder einen Text anhand bestimmter Zeichen oder Muster in kleinere Chunks oder Segmente zu unterteilen. Diese Chunks können anschließend separat verarbeitet oder analysiert werden. Beispielsweise können Splitter für Gen-AI-Anwendungen verwendet werden, um einen langen Text in einzelne Sätze oder Absätze aufzuteilen, bevor er in Vektor-Embeddings umgewandelt wird. Diese Embeddings dienen dazu, semantisch ähnliche Chunks zu finden.
Machine Learning Models
Machine-Learning-Modelle werden verwendet, um Vektor-Embeddings zu erstellen. Diese Embeddings erfassen semantische Beziehungen und kontextuelle Informationen, sodass Algorithmen Sprache effektiver verstehen und verarbeiten können. Open-Source-, kommerzielle und private Machine-Learning-Modelle können on-prem oder in Ihrer Cloud-Umgebung installiert oder über eine API zugänglich gemacht werden, um Vektor-Embeddings zu generieren.
Rerankers
In Informationsabrufsystemen verfeinert ein Reranker die anfänglichen Suchergebnisse, um deren Relevanz für die Abfrage zu verbessern. Im Gegensatz zur reinen Vector Approximate Nearest Neighbor (ANN)-Suche für den Abruf kann das Hinzufügen eines Rerankers die Suchqualität steigern, indem die semantische Beziehung zwischen Dokumenten und der Abfrage besser bewertet wird. Für Retrieval-Augmented Generation (RAG)-Anwendungen können Reranker die Genauigkeit generierter Antworten verbessern, indem sie eine kleinere, aber qualitativ hochwertigere Menge an Kontextdokumenten bereitstellen. Reranker sind jedoch rechenintensiv, was im Vergleich zum reinen ANN-Abruf zu höheren Kosten und längeren Abfragelatenzzeiten führt. Die Entscheidung, einen Reranker zu integrieren, sollte den Bedarf an verbesserter Relevanz gegen Leistungs- und Kostenbeschränkungen abwägen.
Fähigkeiten
Erstellung einer Ingestion-Pipeline
Benutzer haben die Möglichkeit, Pipelines entweder über die benutzerfreundliche Zilliz Cloud-Konsole oder über die stärker anpassbaren RESTful APIs zu erstellen. Dieser doppelte Ansatz stellt sicher, dass Benutzer ihre Erfahrung bei der Pipeline-Erstellung entsprechend ihren spezifischen Anforderungen und Präferenzen anpassen können, unabhängig davon, ob sie Einfachheit priorisieren oder erweiterte Anpassungsoptionen benötigen. Beim Erstellen der Pipeline können Benutzer wählen, ihre Dokumente zunächst aufzuteilen und dann eines von sechs Modellen (zilliz/bge-base-en-v1.5, voyageai/voyage-2, voyageai/voyage-code-2, openai/text-embedding-3-small, and openai/text-embedding-3-large. Für die chinesische Sprache nur zilliz/bge-base-zh-v1.5) auszuwählen, um Vektor-Embeddings zu erstellen. Sie können auch alle relevanten Metadaten speichern, die beim Abruf nützlich sein werden.
Datenquellenverbindung
Konnektoren sind als integrale Werkzeuge in Zilliz Cloud darauf ausgelegt, den Prozess der Verknüpfung verschiedener Datenquellen mit einer Vektordatenbank zu vereinfachen. Mit den intuitiven Anweisungen in der Benutzeroberfläche (UI) können Benutzer mühelos verschiedene Datenquellen in ihre Pipelines integrieren. Dies erhöht nicht nur die Vielseitigkeit und den Umfang ihrer Datenverarbeitungsfunktionen, sondern unterstreicht auch die Benutzerfreundlichkeit von Zilliz Cloud.
Beispielsweise dient ein Konnektor als Mechanismus zur Aufnahme von Daten aus einer Reihe von Quellen in Zilliz Cloud, darunter Object Storage, Kafka (bald verfügbar) und mehr. Am Beispiel des Object-Storage-Konnektors ermöglicht er Benutzern, ein Verzeichnis innerhalb eines Object-Storage-Buckets zu überwachen und Dateien wie PDFs und HTML mit Zilliz Cloud Pipelines zu synchronisieren. Anschließend können diese Dateien in Vektorrepräsentationen umgewandelt und für die Suche in der Vektordatenbank gespeichert werden. Mit dedizierten Ingestion- und Lösch-Pipelines bleiben die Dateien und ihre entsprechenden Vektorrepräsentationen innerhalb von Zilliz Cloud synchronisiert. Die Vektordatenbank-Collection spiegelt automatisch jede Hinzufügung oder Entfernung von Dateien im Object Storage wider und gewährleistet so Datenkonsistenz und -genauigkeit.
Ausführen der Search-Pipeline
Sobald Pipelines erstellt wurden, können sie ausgeführt werden, um unstrukturierte Daten zu verarbeiten und verschiedene Funktionalitäten innerhalb des Zilliz Cloud-Ökosystems zu ermöglichen. Beispielsweise können Benutzer nach dem Erstellen einer Ingestion-Pipeline deren Ausführung starten, um unstrukturierte Daten in durchsuchbare Vektor-Embeddings umzuwandeln. Diese Embeddings können anschließend in einer Zilliz Cloud-Vektordatenbank gespeichert werden, wodurch die Zugänglichkeit und Effizienz des Datenabrufs verbessert wird.
Ebenso können Benutzer nach dem Erstellen einer Search-Pipeline diese ausführen, wodurch das System eine semantische Suche durchführen kann. Diese Funktionalität ermöglicht es Benutzern, relevante Informationen aus der Vektordatenbank zu erkunden und abzurufen, wobei die Leistungsfähigkeit der semantischen Analyse genutzt wird, um Suchergebnisse zu verfeinern.
Darüber hinaus können Benutzer nach dem Erstellen einer Lösch-Pipeline deren Ausführung starten, indem sie alle Chunks entfernen, die einem angegebenen Dokument aus einer Collection innerhalb der Vektordatenbank zugeordnet sind. Diese Fähigkeit gewährleistet die Integrität und Sauberkeit der Datenbank, indem sie die Entfernung unnötiger oder veralteter Daten-Chunks erleichtert.
Pipeline-Kosten schätzen
Die mit dem Ausführen von Pipelines verbundenen Kosten werden in Tokens quantifiziert, die als grundlegende Maßeinheit dienen. Analog dazu, wie Large Language Models (LLMs) Tokens als grundlegende Bausteine nutzen, führen Pipelines die Dokumentverarbeitung und die Ausführung von Suchanfragen durch, indem sie Text als Sequenz von Tokens parsen und einbetten. Benutzer können unser Estimate Pipeline Usage tool nutzen, um Einblicke in die Kostenauswirkungen der Ausführung einer Pipeline zu gewinnen. Dieses Tool erleichtert das Zählen von Tokens innerhalb einer Datei oder Textzeichenfolge und ermöglicht es Benutzern, die erwartete Ressourcennutzung und die damit verbundenen Kosten für die Ausführung einer Pipeline abzuschätzen. Dieses Tool ermöglicht es Benutzern, fundierte Entscheidungen hinsichtlich Ressourcenzuweisung und Budgetierung zu treffen und so optimale Effizienz und Kosteneffektivität in ihren Pipeline-Operationen sicherzustellen.
Erneutes Ranking von Suchergebnissen
Der anfängliche Abruf allein mit Approximate Nearest Neighbor (ANN)-Vektorsuche ist sehr effizient und liefert oft zufriedenstellende Ergebnisse. In vielen Situationen kann die sekundäre Phase des erneuten Rankings als optional betrachtet werden. Für Anwendungen mit hohen Qualitätsstandards kann der Einsatz eines Rerankers die Genauigkeit verbessern, allerdings mit erhöhtem Rechenaufwand und längeren Suchzeiten. Typischerweise kann die Integration eines Reranker-Modells der Suchanfrage je nach Faktoren wie topK-Auswahl und Größe des Reranker-Modells 100 ms bis einige Sekunden Latenz hinzufügen. Wenn der anfängliche Abruf falsche oder irrelevante Dokumente liefert, filtert die Verwendung eines Rerankers diese effektiv heraus und verbessert so die Qualität der endgültig generierten Antwort.
Wenn ein Reranker für Ihren Anwendungsfall als notwendig erachtet wird, können Sie ihn über die UI auswählen.
Vorteile
Flexible Pipeline-Erstellung: Benutzer können Pipelines über die benutzerfreundliche Zilliz Cloud-Konsole oder die stärker anpassbaren RESTful APIs erstellen. Dieser doppelte Ansatz ermöglicht es Benutzern, die Erfahrung der Pipeline-Erstellung an ihre spezifischen Bedürfnisse und Präferenzen anzupassen, unabhängig davon, ob sie Einfachheit priorisieren oder erweiterte Anpassungsoptionen benötigen.
Nahtlose Integration von Datenquellen: Connectors in Zilliz Cloud vereinfachen die Verknüpfung verschiedener Datenquellen mit einer Vektordatenbank. Mit intuitiven Anweisungen in der Benutzeroberfläche (UI) können Benutzer mühelos verschiedene Datenquellen in ihre Pipelines integrieren und so die Vielseitigkeit und Reichweite ihrer Datenverarbeitungsfähigkeiten verbessern.
Kostenschätzung und Optimierung: Zilliz Cloud stellt ein Estimate Pipeline Usage tool bereit, das Benutzern hilft, die erwartete Ressourcennutzung und die damit verbundenen Pipeline-Kosten abzuschätzen. Benutzer können fundierte Entscheidungen hinsichtlich Ressourcenzuweisung und Budgetierung treffen, indem sie Tokens innerhalb einer Datei oder Textzeichenfolge zählen, und so optimale Effizienz und Kosteneffektivität in ihren Pipeline-Operationen sicherstellen.
Zilliz Cloud-Pipelines
Ingestion Pipelines
Der Hauptzweck von Ingestion Pipelines besteht darin, unstrukturierte Daten wie Textstücke und Dokumente in durchsuchbare Vektoreinbettungen zu verarbeiten. Sie enthalten eine Funktion INDEX_DOC, die das eingegebene Textdokument in verschiedene Chunks aufteilt und für jeden Chunk eine Vektoreinbettung generiert. Das Eingabefeld (doc_url) wird vier Ausgabefeldern (doc_name, chunk_id, chunk_text und embedding) als skalare und Vektorfelder der automatisch generierten Collection zugeordnet.
Search Pipelines
Der Prozess von Search Pipelines ist recht unkompliziert. Er unterstützt die semantische Suche, indem er eine Abfragezeichenfolge in eine Vektoreinbettung umwandelt und die top-K-Vektoren mit ihren Metadaten und dem entsprechenden Text abruft. Dafür wird eine Funktion namens SEARCH_DOC_CHUNK verwendet.
Deletion Pipelines
Deletion Pipelines werden verwendet, um alle Chunks in einem angegebenen Dokument aus einer Collection zu entfernen. Dadurch wird es einfacher, alle Daten eines Dokuments zu bereinigen. Es gibt eine Funktion namens PURGE_DOC_INDEX, die alle Dokument-Chunks löscht, die einen angegebenen doc_name haben.
Die Mechanik des Document Chunking
Das Ziel des Chunkings besteht, wie der Name schon sagt, darin, Informationen in mehrere kleinere Teile aufzuteilen, um sie effizienter und sinnvoller zu speichern. Dadurch kann der Abruf Informationen erfassen, die stärker mit der Frage zusammenhängen, und die Generierung präziser, aber weniger kostspielig sein, da nur ein Teil eines Dokuments in den LLM-Prompt aufgenommen wird, anstatt des gesamten Dokuments. Schließlich macht Document Chunking die Durchsuchbarkeit effizient, weil Informationen auf der Grundlage semantischen Verständnisses und nicht exakter Übereinstimmungen abgerufen werden.
Mit Zilliz Cloud Pipelines können Sie Dokumente in Sätze, Absätze, Zeilen oder eine Liste angepasster Zeichenfolgen aufteilen. Darüber hinaus können Sie die Chunk-Größe definieren. Standardmäßig enthält jeder höchstens 500 Tokens. Die folgende Tabelle listet die Zuordnungsbeziehung zwischen anwendbaren Modellen und ihren entsprechenden Chunk-Größenbereichen auf.
| Modell | Chunk-Größenbereich |
|---|---|
| zilliz/bge-base-en-v1.5 | 20-500 Tokens |
| zilliz/bge-base-zh-v1.5 | 20-500 Tokens |
| voyageai/voyage-2 | 20-3,000 Tokens |
| voyageai/voyage-code-2 | 20-12,000 Tokens |
| voyageai/voyage-large-2 | 20-12,000 Tokens |
| openai/text-embedding-3-small | 250-8,191 Tokens |
| openai/text-embedding-3-large | 250-8,191 Tokens |
Praktische Anwendungen und Vorteile von Document Chunking
Document Chunking hat ein breites Spektrum praktischer Anwendungen in verschiedenen Bereichen. Durch die Aufteilung von Textdaten in handhabbare Teile wird ein optimierterer Ansatz für den Umgang mit großen Mengen unstrukturierter Daten geboten. Im Folgenden sind einige der realen Anwendungen von Document Chunking aufgeführt.
Reale Anwendungen
Content Management
Im Content Management erleichtert der Document-Chunking-Prozess das Indexieren und Abrufen großer Dokumente, indem sie in kleine Teile zerlegt werden. Dieser Ansatz macht die Suche effizient und ermöglicht es Benutzern, die gewünschten Informationen schnell zu finden.
Forschung
Document Chunking ist im Forschungsbereich nützlich, um wissenschaftliche Arbeiten, Berichte und Forschungsartikel zu indexieren. Dadurch können Forschende nach ihren spezifischen Interessensegmenten suchen.
Recht
Chunking von Dokumenten unterstützt auch den Rechtsbereich. Chunking erleichtert die Suche nach bestimmten Klauseln, Verträgen, Bedingungen und Gerichtsentscheidungen. Dies verbessert die Genauigkeit und Effizienz der juristischen Recherche.
Medizin
Medizinische Fachkräfte können Document Chunking ebenfalls verwenden, um Patientenakten, klinische Leitlinien und Forschungsarbeiten zu verarbeiten und zu indexieren. Dies hilft ihnen, ohne Verzögerung auf kritische medizinische Informationen zuzugreifen.
Vorteile
Chunking bietet im Kontext von Retrieval Augmented Generation (RAG)-Modellen drei zentrale Vorteile:
- Erhöhte Präzision: Durch die Aufteilung von Text in kleinere, besser handhabbare Chunks ermöglicht Chunking dem Abrufprozess, Informationen zu erfassen, die spezifisch für die Anfrage relevant sind. Dies erhöht die Präzision der Suchergebnisse und stellt sicher, dass die abgerufenen Informationen eng mit den Anforderungen des Benutzers übereinstimmen.
- Reduzierte Rechenkosten: Chunking minimiert Rechenkosten, indem nur relevante Dokumentabschnitte in den Prompt des Sprachmodells aufgenommen werden. Durch das Vermeiden unnötiger Informationen hilft Chunking, den Verarbeitungsaufwand zu optimieren, was zu effizienteren Prozessen für Textabruf und -generierung führt.
- Verbesserte Kohärenz und Relevanz: Chunking-Strategien wie Document Specific Chunking berücksichtigen die ursprüngliche Organisation des Dokuments und erstellen Chunks, die an logischen Abschnitten wie Absätzen oder Unterabschnitten ausgerichtet sind. Dieser Ansatz erhält die Kohärenz und Relevanz des Textes, insbesondere bei strukturierten Dokumenten, und führt zu aussagekräftigeren und kontextuell passenderen Suchergebnissen.
Implementierung von Document Chunking mit Zilliz Cloud Pipelines: Eine Schritt-für-Schritt-Anleitung
Die Implementierung von Dokument-Chunking mit Zilliz Cloud Pipelines umfasst eine Reihe von Schritten. Der umfassende Leitfaden beinhaltet Einrichtung, Konfigurationen, Best Practices und Optimierungsstrategien. Zu den wichtigsten Punkten gehören die Registrierung bei Zilliz Cloud, das Erstellen von Pipelines, das Indexieren von Dokumenten und das Anpassen von Chunking-Strategien.
Einrichtung und Konfiguration
Registrieren oder Einloggen
Der erste Schritt besteht darin, sich beim Zilliz Cloud-Konto zu registrieren oder anzumelden. Dadurch erhalten Sie Zugriff auf den Zilliz Cloud Pipelines Service.
Pipelines erstellen
Benutzer müssen die von Zilliz bereitgestellten Anweisungen befolgen, um die Ingestion-, Such- und Lösch-Pipelines zu erstellen. Stellen Sie sicher, dass Sie die Such-Pipeline-ID und den API-Schlüssel für weitere Vorgänge notieren.
Web-UI-Methode
- Navigieren Sie zu Ihrem Projekt
- Gehen Sie mithilfe der Zilliz Cloud Web UI zu Ihrem Projekt.
- Wählen Sie im Navigationsbereich die Option „Pipelines“ aus.
- Navigieren Sie zum Tab „Overview“ und wählen Sie dann „Pipelines“ aus.
- Klicken Sie auf „+Pipeline“, um eine neue Pipeline zu erstellen.
- Pipeline-Typ auswählen
- Wählen Sie die Schaltfläche „+Pipeline“, um eine neue Pipeline zu erstellen.
- Stellen Sie sicher, dass Sie die Ingestion-Pipeline vor den Such- und Lösch-Pipelines erstellen.
- Die Ingestion-Pipeline konfigurieren
- Klicken Sie auf den Cluster, in dem die neue Collection erstellt wird.
- Geben Sie den Namen der neu erstellten Collection ein.
- Geben Sie einen Namen unter Einhaltung der Formatbeschränkungen an.
- Beschreiben Sie die Pipeline, wenn Sie möchten.
- Funktionen zur Pipeline hinzufügen
- ·Verwenden Sie die Funktion INDEX_DOC, da sie das Dokument in kleinere Chunks aufteilt, jeden Chunk vektorisiert und die Vektor-Embeddings speichert.
- Verwenden Sie die Funktion PRESERVE, um während der Datenaufnahme Skalarfelder zur Collection hinzuzufügen.
- Anpassung der Chunking-Strategie
- Passen Sie den Splitter an, um festzulegen, wie das Dokument in Chunks aufgeteilt wird. Verwenden Sie Zeichen wie „.“, „\n“ oder beliebige andere benutzerdefinierte Zeichenfolgen.
- Ihre Pipeline-Konfiguration speichern
- Nachdem Sie Funktionen hinzugefügt und konfiguriert haben, ist es nun an der Zeit, Ihre Pipeline zu speichern.
- Klicken Sie auf „Create Ingestion Pipeline“.
RESTful-API-Methode
Erstellen Sie eine Ingestion-Pipeline über die API. Verwenden Sie den curl-Befehl, um eine Ingestion-Pipeline zu erstellen.
--header "Content-Type: application/json" \
--header "Authorization: Bearer ${YOUR_API_KEY}" \
--url "https://controller.api.{cloud-region}.zillizcloud.com/v1/pipelines" \
-d '{
"projectId": "proj-xxxx",
"name": "my_doc_ingestion_pipeline",
"description": "Pipeline description",
"type": "INGESTION",
"functions": [
{
"name": "index_my_doc",
"action": "INDEX_DOC",
"inputField": "doc_url",
"language": "ENGLISH",
"chunkSize": 500,
"embedding": "zilliz/bge-base-en-v1.5",
"splitBy": ["\n\n", "\n", " "]
},
{
"name": "keep_doc_info",
"action": "PRESERVE",
"inputField": "publish_year",
"outputField": "publish_year",
"fieldType": "Int16"
}
],
"clusterId": "${CLUSTER_ID}",
"newCollectionName": "my_new_collection"
}'
- Pipelines verwalten
- Pipelines anzeigen und verwalten
- Klicken Sie auf „Pipelines“, um die verfügbaren Pipelines zusammen mit ihren Details und ihrer Token-Nutzung anzuzeigen.
- Verwenden Sie eine GET-Anfrage über die API, um Pipelines aufzulisten oder die Details von Pipelines anzuzeigen.
- Pipelines ausführen
- Um Daten im Vektorformat zu verarbeiten und zu speichern, führen Sie die Ingestion-Pipeline aus.
- Führen Sie nun die Such-Pipeline aus, um semantische Suchen durchzuführen.
- Nutzen Sie die Lösch-Pipeline, um unerwünschte Dokument-Chunks aus der Collection zu entfernen.
- Pipeline-Nutzung schätzen
- Sie können die Token-Nutzung für das Ausführen von Pipelines mithilfe der Zilliz Web UI sehen.
- Pipeline löschen
- Sie können die Pipeline, die nicht verwendet wurde, über die API (GET-Anfrage) oder über die Web UI löschen.
Dokumente indexieren
Benutzer können die URL des Dokuments in das Feld doc_url eingeben, wenn sie sich im Pipeline-Playground befinden. Wenn sie das Dokument aufnehmen möchten, klicken sie auf „RUN“ und der Vorgang wird ausgeführt. Dieser Schritt wandelt das Dokument in eine durchsuchbare Vektor-Collection um.
Chunking-Strategie anpassen
Mit Zilliz Cloud Pipelines können Sie die Chunking-Strategie anpassen. Benutzer können die Chunk-Größe mithilfe eines Splitters definieren, der verwendet wird, um das Dokument in Chunks aufzuteilen. Darüber hinaus können auch benutzerdefinierte Trennzeichen für Sätze, Zeilen und Absätze angegeben werden.
Wählen Sie ein Modell
Wählen Sie ein Modell zur Generierung von Vektor-Embeddings basierend auf der gewünschten Chunk-Größe und der Gesamtgröße Ihres Dokuments. Zilliz Cloud Pipelines unterstützt verschiedene Modelle, die jeweils ihren eigenen Chunk-Größenbereich haben.
Best Practices
- Experimentieren Sie mit verschiedenen Chunk-Größen, um das optimale Gleichgewicht zwischen Abrufqualität und Effizienz zu finden.
- Verwenden Sie die Splitter-Funktion, um die Dokumente anhand spezifischer Kriterien wie Absätzen, benutzerdefinierten Trennzeichen oder Sätzen in kleine Chunks aufzuteilen.
- Überprüfen Sie regelmäßig die Pipeline-Nutzung und beachten Sie die Zilliz Cloud Limits.
Tipps zur Fehlerbehebung und Optimierungsstrategien
- Ihr Dokument sollte mit der Funktion INDEX_DOC kompatibel sein.
- Bei Markdown- oder HTML-Dateien teilt die Funktion INDEX_DOC das Dokument nach Überschriften und anschließend größere Abschnitte basierend auf der angegebenen Chunk-Größe auf. Stellen Sie daher sicher, die Chunk-Größe entsprechend anzupassen.
- Wenn das gewählte Modell nicht die besten Ergebnisse liefert, können Sie auch mit anderen Modellen experimentieren.
Fazit
Zilliz Cloud Pipelines verwandeln unstrukturierte Daten in eine durchsuchbare Vektorsammlung. Sie haben erheblichen Einfluss auf die Datenverarbeitung und die semantische Suche. Zilliz Cloud Pipelines können Bilder, Videoframes und multimodale Dokumente durchsuchen. Zusätzliche Pipelines für diese Arten von Suchen werden in Zukunft hinzugefügt.
Zusammenfassend lässt sich sagen, dass Zilliz Cloud Pipelines die Datenverarbeitung und semantische Suche vollständig verändert haben, indem sie den Dokument-Chunking-Prozess optimieren und die Durchsuchbarkeit verbessern. Bei der Arbeit mit unstrukturierten Daten machen ihre Funktionen – einschließlich der Möglichkeit, Pipelines für Aufnahme, Suche und Löschung zu erstellen – sie zu einem unschätzbaren Werkzeug für Entwickler und Dateningenieure. Die Plattform verspricht, die Art und Weise, wie wir Informationen verarbeiten und suchen, weiter zu revolutionieren, indem sie Effizienz, Skalierbarkeit und Benutzerfreundlichkeit betont. Dies fördert die Erkundung und Integration in vielfältige Daten-Workflows.
Wenn Sie Zilliz Cloud Pipelines selbst ausprobieren möchten, testen Sie dieses Bootcamp mit dem Titel Build RAG using Zilliz Cloud Pipelines.
Weiterlesen

Zilliz Cloud Launches in AWS Australia, Expanding Global Reach to Australia and Neighboring Markets
We're thrilled to announce that Zilliz Cloud is now available in the AWS Sydney, Australia region (ap-southeast-2).

Milvus WebUI: A Visual Management Tool for Your Vector Database
Explore Milvus WebUI to monitor, manage, and optimize your vector database with real-time insights, performance tracking, and system health monitoring.

Selecting the Right ETL Tools for Unstructured Data to Prepare for AI
Learn the right ETL tools for unstructured data to power AI. Explore key challenges, tool comparisons, and integrations with Milvus for vector search.


