Erstellung überlegener RAG für codeintensive Texte mit Zilliz Cloud Pipelines und Voyage AI
Das Embedding-Modell steht im Zentrum von Retrieval Augmented Generation (RAG), beeinflusst in erster Linie die Retrieval-Fähigkeit und ist entscheidend für die gesamte Antwortqualität. Embedding-Modelle, die mit riesigen Mengen an Datenkorpora trainiert wurden, können die numerischen Bedeutungsrepräsentationen aus beliebigem Text extrahieren und eignen sich dadurch für verschiedene Aufgaben des Information Retrieval. Ein Embedding-Modell zu trainieren, das bei jeder Aufgabe herausragt, ist jedoch nach wie vor äußerst anspruchsvoll. Es stehen verschiedene Embedding-Modelle zur Verfügung, jedes mit einzigartigen Stärken und Schwächen sowie unterschiedlichen Eigenschaften.
Zilliz Cloud Pipelines integriert die besten verfügbaren Embedding-Modelle als Komplettlösung für Retrieval. Solch flexible Auswahlmöglichkeiten ermöglichen es Entwicklern, die besten Modelle zu erkunden und auszuwählen, die auf ihre spezifischen Anwendungsfälle zugeschnitten sind.
Heute freuen wir uns sehr, bekannt zu geben, dass Embedding-Modelle von Voyage AI in Zilliz Cloud Pipelines verfügbar sind. Die neu veröffentlichten Modelle voyage-2 und voyage-code-2 haben bei Retrieval-Aufgaben im Zusammenhang mit Quellcode, technischer Dokumentation und allgemeinen Aufgaben eine herausragende Qualität gezeigt. Beispielsweise ist voyage-code-2 Berichten zufolge bei codeintensiven Datensätzen um 14,52 % besser als OpenAI Embedding und für allgemeine Zwecke um 3,03 % besser.
Wir haben außerdem mit Voyage AI zusammengearbeitet, um die Wirksamkeit eines RAG-Systems zu bewerten, das mit verschiedenen Embedding-Modellen für codebezogene Aufgaben implementiert wurde. Das verwendete Sprachmodell ist GPT4. Wir haben das System an einer Teilmenge der Datensätze APPS und Codechef getestet, die Fragen zum Programmieren enthalten, wobei jede Frage genau eine richtige Antwort aus dem Korpus hat. Wir messen die Retrieval-Qualität mit "recall@k," also der Wahrscheinlichkeit, das richtige Ergebnis unter den top-k abgerufenen Dokumenten zu finden. Darüber hinaus bewerten wir die End-to-End-Qualität auch mit Ragas, einem beliebten Evaluierungsframework für RAG-Pipelines. Es verfügt über sechs Metriken, die verschiedene Aspekte von RAG beschreiben, von der Relevanz und Präzision der abgerufenen Texte bis hin zur Korrektheit und Qualität der endgültigen Antwort. Das harmonische Mittel der sechs Metriken, genannt "Ragas Score," misst die Gesamtleistung des Systems. Mehr über jede Metrik erfahren Sie auf der Milvus-Dokumentationsseite.
Vergleich der Retrieval- und Gesamtbewertungen beliebter Embedding-Modelle auf Code-Datensätzen.
Die oberen beiden Abbildungen zeigen, dass die Modelle voyages-2 und voyage-code-2 eine deutlich bessere Retrieval-Fähigkeit haben als die anderen Modelle. Die Kennzahl „Recall@k“ gibt an, dass beim Abrufen der top-k Ergebnisse eine Wahrscheinlichkeit besteht, dass die Ground Truth in den zurückgegebenen k Ergebnissen enthalten ist. Beispielsweise findet voyage-code-2 beim Datensatz apps_1solution in 62 % der Fälle die Ground Truth unter den top-4 Ergebnissen, während bge-base-en-v1.5 dies nur in 2 % der Fälle erreicht. Diese Tests zeigen, dass voyage-code-2 bei codebezogenen Aufgaben erheblich besser abschneidet als Embedding-Modelle, die nicht dafür optimiert sind.
Bei den End-to-End-RAG-Antworten führt die Verbesserung des Recalls zu einem Gewinn von über zehn Prozentpunkten bei Answer Correctness und Ragas Score im Vergleich zur leistungsstärksten Alternative. Insbesondere messen Context Precision und Context Recall die Wirkung der Retrieval-Phase. Voyage-Modelle übertreffen die anderen Optionen deutlich, insbesondere bei Context Precision. Bei Faithfulness und Answer Relevancy, die die Qualität der generierten Antworten messen, liegt Voyage mehr als fünf Prozentpunkte vor verschiedenen Modellen. Die Ergebnisse zeigen, dass eine bessere Retrieval-Qualität zu einer besseren Generierung in der RAG-Pipeline führt. Answer Similarity und Answer Correctness beziehen sich auf die Bewertung der semantischen Ähnlichkeit zwischen der generierten Antwort und der Ground Truth. Bei Answer Correctness hat RAG auf Basis von Voyage erneut deutliche Vorteile und übertrifft die anderen um mehr als fünf Punkte.
RAG ist zum vorherrschenden Ansatz für Frage-Antwort-Bots bei Coding-Problemen und in der Softwareentwicklung geworden. Diese Anwendungen können noch stärker von hochwertigen Voyage-Modellen profitieren, die sich bei codebezogenen Retrieval-Aufgaben auszeichnen. Eine verbesserte Retrieval-Qualität führt dazu, dass relevante Informationen aus Code oder technischer Dokumentation besser gefunden werden, was zu genaueren Antworten und einer besseren Benutzererfahrung führt.
In Zilliz Cloud Pipelines können Sie nun voyages-2 und voyage-code-2 als Embedding-Modelle auswählen, um bei codebezogenen Aufgaben die höchste Retrieval-Qualität zu erzielen, ohne sich um DevOps oder die Verwaltung Ihrer ML-Infrastruktur kümmern zu müssen. Das Beste daran ist, dass Sie kostenlos loslegen können, indem Sie sich unter https://cloud.zilliz.com/signup registrieren, um Ihre RAG-Anwendung einfach und präzise zu erstellen!
Weiterlesen

Zilliz Cloud Now Available in AWS Asia Pacific (Seoul)
Zilliz Cloud is now available in AWS Seoul — low-latency vector search, in-country data residency, and one-step migration for Korean AI teams. 31 regions across 5 clouds.

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Democratizing AI: Making Vector Search Powerful and Affordable
Zilliz democratizes AI vector search with Milvus 2.6 and Zilliz Cloud for powerful, affordable scalability, cutting costs in infrastructure, operations, and development.



