Creare RAG superiori per testi ricchi di codice con Zilliz Cloud Pipelines e Voyage AI
Il modello di embedding è al centro della Retrieval Augmented Generation (RAG), che influisce principalmente sulla capacità di retrieval ed è cruciale per la qualità complessiva della risposta. Addestrati con enormi quantità di corpora di dati, i modelli di embedding possono estrarre le rappresentazioni numeriche del significato da qualsiasi testo, rendendoli adatti a varie attività di information retrieval. Tuttavia, addestrare un modello di embedding che eccella in qualsiasi attività è ancora estremamente impegnativo. Sono disponibili diversi modelli di embedding, ciascuno con punti di forza e debolezze unici e proprietà variabili.
Zilliz Cloud Pipelines integra i migliori modelli di embedding disponibili come soluzione one-stop per il retrieval. Scelte così flessibili consentono agli sviluppatori di esplorare e scegliere i migliori modelli adattati ai loro casi d'uso specifici.
Oggi siamo entusiasti di annunciare che i modelli di embedding di Voyage AI sono disponibili in Zilliz Cloud Pipelines. I modelli appena rilasciati voyage-2 e voyage-code-2 hanno dimostrato una qualità eccezionale nelle attività di retrieval relative a codice sorgente, documentazione tecnica e attività generali. Ad esempio, voyage-code-2 è secondo quanto riportato migliore del 14,52% rispetto agli embedding di OpenAI su dataset ad alta intensità di codice e migliore del 3,03% per scopi generali.
Abbiamo inoltre collaborato con Voyage AI per valutare l'efficacia di un sistema RAG implementato con vari modelli di embedding per attività legate al codice. Il modello linguistico utilizzato è GPT4. Abbiamo testato il sistema su un sottoinsieme dei dataset APPS e Codechef, che contengono domande sulla programmazione, e ogni domanda ha esattamente una risposta corretta dal corpus. Misuriamo la qualità del retrieval tramite "recall@k," che è la probabilità di intercettare il risultato corretto nei primi k documenti recuperati. Inoltre, valutiamo anche la qualità end-to-end con Ragas, un popolare framework di valutazione per pipeline RAG. Ha sei metriche che descrivono vari aspetti della RAG, dalla pertinenza e precisione dei testi recuperati alla correttezza e qualità della risposta finale. La media armonica delle sei metriche, chiamata "Ragas Score," misura le prestazioni complessive del sistema. Puoi saperne di più su ciascuna metrica nella pagina della documentazione di Milvus.
Confronto dei punteggi di retrieval e complessivi tra i modelli di embedding più diffusi su dataset di codice.
Le due figure in alto mostrano che i modelli voyages-2 e voyage-code-2 hanno una capacità di retrieval significativamente migliore rispetto agli altri modelli. Il punteggio “Recall@k” indica che, quando si recuperano i primi k risultati, esiste una probabilità che la ground truth sia inclusa nei k risultati restituiti. Ad esempio, con il dataset apps_1solution, nel 62% dei casi, voyage-code-2 ottiene la ground truth nei primi 4 risultati, mentre bge-base-en-v1.5 ci riesce solo nel 2% dei casi. Questi test mostrano che voyage-code-2 offre prestazioni enormemente migliori nelle attività legate al codice rispetto ai modelli di embedding non ottimizzati per esse.
Per quanto riguarda le risposte RAG end-to-end, il miglioramento del recall porta a un guadagno di oltre dieci punti percentuali in Answer Correctness e Ragas Score, rispetto all’alternativa con le migliori prestazioni. Nello specifico, Context Precision e Context Recall misurano l’effetto della fase di retrieval. I modelli Voyage superano significativamente le altre opzioni, soprattutto in Context Precision. In Faithfulness e Answer Relevancy, che misurano la qualità delle risposte generate, Voyage è avanti rispetto a diversi modelli di oltre cinque punti percentuali. I risultati mostrano che una migliore qualità del retrieval porta a una migliore generazione nella pipeline RAG. Answer Similarity e Answer Correctness riguardano la valutazione della somiglianza semantica tra la risposta generata e la ground truth. In Answer Correctness, RAG basato su Voyage presenta di nuovo vantaggi evidenti, superando gli altri di oltre cinque punti.
RAG è diventato l’approccio predominante per i bot di domanda-risposta sui problemi di coding e sullo sviluppo software. Queste applicazioni possono beneficiare ancora di più dei modelli Voyage di alta qualità, che eccellono nei task di retrieval legati al codice. Una migliore qualità del retrieval si traduce in una migliore individuazione delle informazioni rilevanti dal codice o dalla documentazione tecnica, portando a risposte più accurate e a una migliore esperienza utente.
In Zilliz Cloud Pipelines, ora puoi scegliere voyages-2 e voyage-code-2 come modelli di embedding per ottenere la massima qualità di retrieval nei task legati al codice senza preoccuparti di DevOps o di gestire la tua infrastruttura ML. La parte migliore è che puoi iniziare gratuitamente registrandoti su https://cloud.zilliz.com/signup per creare la tua applicazione RAG con facilità e precisione!
Continua a leggere

What Is a Vector Lakebase?
A Vector Lakebase is a unified, lake-native data architecture for AI that combines vector-database-grade serving with open lake storage, reusable lake-level indexes, and a shared semantic layer.

Zilliz Cloud Update: Smarter Autoscaling for Cost Savings, Stronger Compliance with Audit Logs, and More
What's new in Zilliz Cloud? Smarter autoscaling with scale-down, audit logs GA, enhanced SSO, and Milvus 2.6 in Private Preview.

Vector Databases vs. Object-Relational Databases
Use a vector database for AI-powered similarity search; use an object-relational database for complex data modeling with both relational integrity and object-oriented features.



