8 ultimi progressi del RAG che ogni sviluppatore dovrebbe conoscere
Large Language Models (LLM) sono potenti, ma valgono solo quanto i loro dati di addestramento. Quando poni una domanda complessa, vuoi che l'IA combini la sua conoscenza integrata con informazioni fresche e rilevanti da fonti esterne. È esattamente ciò che fa la Retrieval-Augmented Generation: colma il divario tra dati di addestramento statici e informazioni dinamiche e aggiornate.
Il RAG tradizionale è stato significativo, ma gli sviluppatori hanno continuato a spingere i confini di ciò che è possibile. In questo articolo, esploreremo otto varianti avanzate di RAG che possono risolvere problemi reali che potresti trovarti ad affrontare: recupero lento, scarsa comprensione del contesto, gestione di dati multimodali e ottimizzazione delle risorse.
Perché questi nuovi tipi di RAG sono importanti
I sistemi RAG tradizionali combinavano due passaggi: recuperare dati rilevanti come contesto da una base di conoscenza alimentata da un vector database, come Milvus, e generare risposte usando un modello linguistico.
Sebbene efficaci, le prime implementazioni di RAG hanno affrontato sfide di efficienza, scalabilità e gestione del flusso dei dati. Spesso si basavano su semplici misure di similarità che potevano perdere sfumature cruciali, producendo risposte generiche per query complesse. Per superare queste limitazioni, i ricercatori hanno introdotto nuove strategie che consentono ai modelli di:
Decidere dinamicamente i passaggi di recupero: Invece di recuperare sempre i dati in un'unica operazione, i metodi più recenti determinano i momenti ottimali per recuperare informazioni esterne.
Incorporare dati multimodali: Oltre al testo, alcuni sistemi possono recuperare immagini e video per arricchire i contenuti generati.
Ottimizzare l'uso delle risorse: I framework RAG avanzati regolano l'allocazione del calcolo in base alla complessità della query.
È qui che entrano in gioco gli entusiasmanti progressi nel RAG. Questi miglioramenti hanno portato a output più accurati e consapevoli del contesto, che soddisfano meglio le esigenze sia degli sviluppatori sia delle aziende.
Riferimento rapido: quale RAG dovresti usare?
Ecco una panoramica pensata per gli sviluppatori di ciò che tratteremo:
| Tipo di RAG | Innovazione chiave | Ideale per |
| DeepRAG | Processo decisionale di recupero passo dopo passo | Analisi legale o medica |
| RealRAG | Elaborazione dei dati in tempo reale | Monitoraggio dei social media, app di notizie |
| CoRAG | Recupero sequenziale, adattivo e multi-passaggio | Risoluzione di problemi tecnici |
| VideoRAG | Comprensione da video a testo | Riassunto di lezioni |
| CFT-RAG | Recupero basato su alberi (testo + immagine) | Rilevamento delle frodi |
| CG-RAG | Ragionamento contestuale basato su grafi | Ricerca accademica con citazioni |
| GFM-RAG | Connessioni di conoscenza tramite reti neurali a grafo | Analisi di brevetti |
| URAG | Supporto unificato (testo + immagine + audio) | Chatbot educativi |
DeepRAG
DeepRAG sostituisce le pipeline di recupero tradizionali con una singola rete neurale addestrata end-to-end. Modella il ragionamento aumentato dal recupero come un processo decisionale. Invece di trattare recupero e generazione come attività separate, decide dinamicamente quando fare affidamento sui dati esterni rispetto al ragionamento interno. Questo approccio passo dopo passo mira efficacemente a specifiche lacune di conoscenza.
Migliora profondità e accuratezza migliorando le attività ad alta intensità di ragionamento di circa l'8-15% e riduce il recupero di dati non necessari, risparmiando risorse di calcolo. Sebbene possa aumentare la complessità della progettazione del sistema e richiedere fine-tuning per bilanciare la frequenza di retrieval. È ideale per la verifica dei fatti, attività di ragionamento multi-step, domini ad alta intensità di ricerca e la generazione di report dettagliati (ad es., analisi di documenti legali o supporto alla diagnosi medica).
Caratteristiche principali:
Retrieval dinamico: Valuta ogni passaggio per decidere se il retrieval è necessario.
Processo decisionale strategico: Utilizza un processo decisionale simile a un Markov Decision Process.
GitHub: https://github.com/microsoft/deepRAG
Paper: https://arxiv.org/html/2502.01142v1
RealRAG
RealRAG migliora i modelli generativi text-to-image (ad es., Flux e Stable Diffusion V3) recuperando immagini del mondo reale. Confrontando le immagini generate con esempi recuperati, il sistema colma le lacune di conoscenza per migliorare il realismo.
Produce output di immagini più realistici e migliora la qualità dei contenuti visivi. Tuttavia, presenta costi infrastrutturali elevati per l'elaborazione multimodale 24/7. Potrebbe anche avere difficoltà in domini con dataset di immagini di qualità limitata. È particolarmente utile per il design di prodotto e l'imaging medico, dove rappresentazioni visive accurate sono essenziali.
Figura- Panoramica di RealRAG
Figura: Panoramica di RealRAG (Fonte).
Caratteristiche principali:
Aumento del punteggio FID: 16,18% sul benchmark Stanford Car
Retrieval basato su immagini: Migliora la generazione con dati visivi esterni.
Apprendimento autoriflessivo: Perfeziona gli output tramite feedback dai confronti tra immagini.
Paper: https://arxiv.org/abs/2502.00848
CoRAG: Chain-of-Retrieval Augmented Generation
Ispirato al chain-of-thought prompting, CoRAG suddivide le query in sotto-domande e recupera informazioni in modo sequenziale. Regola la profondità e l'ampiezza del retrieval in base alla complessità della query e riformula le query quando necessario.
Gestisce domande sfaccettate con un'accuratezza fino al 30% superiore e dà priorità alle informazioni essenziali tramite retrieval sequenziale. Tuttavia, più cicli di retrieval aumentano la latenza. È ideale per la risoluzione di problemi tecnici o la ricerca in cui le query richiedono informazioni multilivello.
Caratteristiche principali:
Retrieval sequenziale: Recupera i dati in più passaggi per perfezionare la risposta.
Allocazione adattiva del calcolo: Bilancia le risorse in base alle esigenze dei dati.
Paper: https://arxiv.org/abs/2501.14342
VideoRAG: Retrieval-Augmented Generation over Video Corpus
I contenuti video sono una ricca fonte di informazioni, ma il RAG tradizionale è progettato principalmente per documenti basati su testo. VideoRAG estende le capacità RAG ai contenuti video utilizzando modelli vision-language (VLM) come CLIP, insieme a speech-to-text, analisi dei frame ed elaborazione audio per estrarre informazioni. Ciò consente agli LLM di comprendere, elaborare e rispondere a query relative ai video. Converte i frame video in embedding testuali per abilitare query come “Trova scene con conflitto emotivo”.
VideoRAG può gestire contenuti video estremamente lunghi senza compromettere l'accuratezza. La sua architettura a doppio canale fornisce riepiloghi dettagliati e ricchi di contesto dei dati video. Sfortunatamente, richiede elevate risorse GPU per l'elaborazione di video 4K e presenta complessità nella gestione di flussi di dati multimodali. È adatto all'analisi di contenuti video, alla sintesi di lezioni e alla generazione di contenuti multimediali.
Caratteristiche principali:
Architettura a doppio canale: Elabora separatamente dati testuali e visivi.
Elaborazione video di lunghezza illimitata: Mantiene il contesto su lunghe sequenze video.
Di seguito è riportato un semplice workflow di come funziona:
Suddividere il video in frame.
Generare embedding utilizzando CLIP.
Archivia gli embedding in un database vettoriale (Milvus) per la ricerca per similarità.
Recupera clip pertinenti e genera riassunti.
Paper: https://arxiv.org/abs/2501.05874
GitHub: https://github.com/starsuzi/VideoRAG
CFT-RAG: RAG basato su Cuckoo Filter Tree
CFT-RAG utilizza un metodo di accelerazione basato su albero usando un Cuckoo Filter migliorato con dati strutturati (ad es., file CSV, tabelle SQL). Questo accelera la localizzazione delle entità durante il recupero, garantendo un accesso più rapido alle informazioni pertinenti. Supporta sia testo sia immagini. Ad esempio, chiedere “Mostrami ricette di pasti salutari” restituisce liste di ingredienti e video di cucina.
Accelera significativamente il processo di recupero e migliora la precisione concentrandosi sulle entità chiave. Sebbene richieda dati puliti e ben strutturati, e mantenere la struttura ad albero richiede aggiornamenti regolari. È ideale per sistemi di supporto in tempo reale, rilevamento delle frodi o piattaforme di trading ad alta frequenza.
Caratteristiche principali:
Recupero e Generazione: Milvus per embedding multimodali, GPT-4 con capacità di visione.
Struttura ad albero delle entità: Organizza le informazioni in un albero gerarchico.
Ottimizzazione Cuckoo Filter: Migliora velocità e accuratezza del recupero.
Paper: https://arxiv.org/abs/2501.15098
CG-RAG: RAG con grafo contestualizzato
CG-RAG arricchisce il contesto usando grafi di conoscenza per catturare le relazioni tra entità (come persone o eventi). Utilizza il Lexical-Semantic Graph Retrieval (LeSeGR) per migliorare la qualità delle risposte considerando le interconnessioni tra concetti. Ad esempio, una query su “lanci di prodotti Apple” recupera entità (ad es., iPhone, CEO) e le loro relazioni. Strumenti come Neo4j sono usati per l’archiviazione dei grafi, e le Graph Neural Networks (GNNs) per l’attraversamento.
Questa innovazione RAG eccelle in argomenti complessi o domande di ricerca mappando le relazioni di citazione. Ma richiede anche una progettazione iniziale dello schema, e le query sui grafi possono essere intensive in termini di risorse. Nel complesso, è altamente efficace nella ricerca accademica, nella documentazione tecnica e negli scenari che richiedono approfondimenti profondi su dati interrelati.
Caratteristiche principali:
Recupero basato su grafi: Struttura le informazioni come nodi interconnessi.
Relazioni di citazione: Cattura come diversi frammenti di informazione si relazionano.
Figura- Panoramica di CG-RAG
Figura: Panoramica di CG-RAG (Fonte).
Paper: https://arxiv.org/abs/2501.15067
Altre innovazioni GraphRAG:
GFM-RAG: Graph Foundation Model per RAG
GFM-RAG impiega un graph foundation model usando GNN per affinare le connessioni tra query su dataset di nicchia (ad es., articoli accademici, domande di brevetto) per domini ricchi di gergo. Questo approccio consente il ragionamento multi-hop su un grafo di conoscenza strutturato, aumentando significativamente l’accuratezza nelle query ad alta intensità di conoscenza.
Migliora l’accuratezza nelle query ad alta intensità di conoscenza ed è capace di gestire relazioni complesse in grandi dataset. Tuttavia, richiede insiemi di feature ben definiti, e le query complesse possono rallentare le risposte. È efficace nella ricerca scientifica che richiede una mappatura precisa dei dati.
Caratteristiche principali:
Graph Neural Network (GNN): Arricchisce semanticamente i dati recuperati.
Ragionamento multi-hop: Collega informazioni disparate tra documenti.
Paper: https://arxiv.org/abs/2502.01113
URAG: RAG unificato
URAG combina testo, immagini, audio e video in un’unica architettura. Utilizza metodi basati su regole con tecniche RAG per supportare LLM leggeri, fornendo risposte precise in ambienti con risorse computazionali limitate.
Fornisce risposte accurate con un sovraccarico computazionale ridotto. Tuttavia, i componenti basati su regole possono limitare la flessibilità. Bilanciare il recupero e la logica basata su regole può essere complesso. È ideale per chatbot educativi che rispondono tramite testo e diagrammi.
Caratteristiche principali:
Design modulare: Sostituisci i componenti di recupero/generazione.
Supporto multi-formato: Gestisce oltre 10+ formati di dati.
Sistema ibrido: Integra la logica basata su regole con le moderne tecniche RAG.
Supporto per modelli leggeri: Ottimizza le prestazioni per modelli più piccoli.
Figura- Framework URAG per migliorare le prestazioni degli LLM nei chatbot universitari
Figura: Framework URAG per migliorare le prestazioni degli LLM nei chatbot universitari (Fonte).
Paper: https://arxiv.org/abs/2501.16276
Confronto dei requisiti delle risorse
| Tipo di RAG | Memoria GPU | Latenza | Complessità di configurazione | Migliori prestazioni |
|---|---|---|---|---|
| DeepRAG | Media | Media | Media | Attività di ragionamento |
| RealRAG | Alta | Alta | Alta | Flussi di dati live |
| CoRAG | Media | Alta | Media | Query multi-step |
| VideoRAG | Molto alta | Molto alta | Alta | Contenuti video |
| CFT-RAG | Bassa | Bassa | Media | Dati strutturati |
| CG-RAG | Media | Media | Alta | Query relazionali |
| GFM-RAG | Alta | Media | Molto alta | Ragionamento complesso |
| URAG | Media | Media | Media | Contenuti misti |
Le otto varianti di RAG che abbiamo esplorato rappresentano sviluppi recenti entusiasmanti nel settore, con la maggior parte proveniente da paper di ricerca e implementazioni in fase iniziale. Sebbene queste innovazioni mostrino grandi promesse e dimostrino approcci interessanti alle sfide comuni del RAG, sono ancora in evoluzione mentre la community le sperimenta in contesti diversi.
Come per qualsiasi tecnologia emergente, consigliamo di iniziare con piccoli esperimenti per vedere come questi approcci funzionano con i tuoi dati e casi d’uso specifici. Gli esempi di codice e le raccomandazioni riportati di seguito hanno lo scopo di aiutarti a iniziare l’esplorazione, piuttosto che fungere da blueprint di produzione. Ogni variante potrebbe richiedere qualche adattamento per adattarsi ai tuoi requisiti e alla tua infrastruttura specifici.
Conclusione
Gli ultimi progressi nel RAG stanno risolvendo sfide critiche nell’AI migliorando accuratezza, velocità e consapevolezza del contesto, quindi esiste sempre una variante di RAG su misura per le tue esigenze. Queste innovazioni consentono sistemi più intelligenti e reattivi, in grado di sbloccare nuove possibilità ed espandere le applicazioni degli LLM in tutti i settori.
Sfruttando il servizio Milvus gestito di Zilliz Cloud, gli sviluppatori possono distribuire facilmente queste varianti di RAG con facilità. Man mano che il RAG continua a evolversi, svolgerà un ruolo critico nel plasmare il futuro dell’AI, garantendo che le risposte siano fluide e profondamente informate dai dati più recenti e dai segnali contestuali.
Risorse correlate
Continua a leggere

My Wife Wanted Dior. I Spent $600 on Claude Code to Vibe-Code a 2M-Line Database Instead.
Write tests, not code reviews. How a test-first workflow with 6 parallel Claude Code sessions turns a 2M-line C++ codebase into a daily shipping pipeline.

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Zilliz Cloud Audit Logs Goes GA: Security, Compliance, and Transparency at Scale
Zilliz Cloud Audit Logs are now GA, giving enterprises real-time visibility, compliance-ready trails, and stronger security across AWS, GCP, and Azure.



