Iniezione di conoscenza negli LLM: Fine-tuning e RAG
I Large Language Models (LLM) sono impressionanti per la loro capacità di memorizzare e generare vaste conoscenze. Attingono a dataset enormi durante il pre-training, diventando esperti in vari argomenti. Ma hanno comunque i loro limiti. Per prima cosa, la loro conoscenza è statica, poiché non viene aggiornata con il passare del tempo. Inoltre, sebbene eccellano nella conoscenza generale, spesso non riescono a fornire l’elevata competenza richiesta per campi specializzati come sanità, finanza o diritto.
Metodi di injection della conoscenza come Fine-Tuning e Retrieval-Augmented Generation (RAG) vengono utilizzati per affrontare queste limitazioni. Il fine-tuning comporta la regolazione dei pesi di un modello con dati specifici per il task, mentre RAG introduce conoscenza esterna durante l’inferenza, consentendo al modello di recuperare informazioni rilevanti quando necessario. In questo studio, questi due approcci vengono confrontati in vari task ad alta intensità di conoscenza per valutarne l’efficacia nell’espandere e affinare la conoscenza fattuale degli LLM.
RAG ha costantemente superato il fine-tuning nei task ad alta intensità di conoscenza, dimostrando la sua superiore capacità di integrare informazioni esterne. Sebbene il fine-tuning abbia migliorato le prestazioni rispetto al modello base, non è stato competitivo quanto RAG. Inoltre, la data augmentation si è dimostrata vantaggiosa per il fine-tuning, poiché esporre i modelli a molteplici variazioni dello stesso fatto durante il training ha migliorato la retention della conoscenza.
Pipeline metodologica di Fine-Tuning e RAG
Diamo un’occhiata più da vicino ai due metodi ed esploriamo come si confrontano quando si tratta di migliorare la conoscenza di un LLM. Per mettere le cose in prospettiva, immagina tre studenti che fanno un test su un argomento che non hanno studiato. Uno aveva il libro di testo solo durante il test, un altro ha studiato prima del test e il terzo non aveva accesso ai materiali una volta iniziato il test. Chi pensi che avrebbe ottenuto il risultato migliore?
Scopriamolo!
Per una comprensione dettagliata, fai riferimento al seguente paper.
Perché gli LLM generano errori fattuali?
Nonostante la loro notevole fluidità e versatilità, gli LLM sono intrinsecamente soggetti a errori fattuali a causa di diversi fattori critici, tra cui deficit di conoscenza del dominio, dati di training obsoleti e limitazioni nel ragionamento.
- Deficit di conoscenza del dominio: Gli LLM possono mancare di una profonda competenza in domini specifici che erano sottorappresentati durante il training. Ad esempio, un modello addestrato prevalentemente su fonti di notizie generali può avere difficoltà con campi altamente specializzati come medicina o diritto se non è stato sottoposto a fine-tuning su dati specifici del dominio.
- Informazioni obsolete: Gli LLM sono vincolati dalla data limite dei loro dataset di training. Qualsiasi evento, progresso scientifico o cambiamento culturale che si verifichi dopo questa data limite non verrà incorporato, portando a risposte obsolete. Questo è particolarmente problematico in campi dinamici come la sanità, dove un modello addestrato prima della pandemia di COVID-19 non avrebbe informazioni sui protocolli sanitari legati alla pandemia e sugli sviluppi dei vaccini.
- Immorizzazione: Alcune conoscenze apprese dal modello durante il training potrebbero non essere trattenute, in particolare quando riguardano fatti rari o pattern visti meno frequentemente nei dati di training. Questo problema può ostacolare la capacità del modello di richiamare in modo coerente informazioni meno comuni tra diversi task o input.
- Dimenticanza: La dimenticanza catastrofica si verifica durante il fine-tuning quando un modello dimentica informazioni precedentemente apprese, specialmente fatti meno enfatizzati dal training originale. Questo è un problema comune con gli LLM e può influire sulla retention della conoscenza a lungo termine.
- Fallimenti del ragionamento: Gli LLM a volte non riescono ad applicare correttamente le proprie conoscenze, in particolare in compiti di ragionamento complessi e multi-step. Ad esempio, gli LLM possono produrre risposte errate o incomplete quando viene chiesto loro di risolvere problemi di matematica avanzata o deduzioni logiche a più fasi. Questi fallimenti sono spesso legati alla difficoltà del modello nel mantenere la coerenza logica su sequenze di pensiero più lunghe.
Questi problemi derivano principalmente dalla fase di addestramento del modello, con l'oblio catastrofico come notevole eccezione che emerge dopo l'addestramento durante il fine-tuning.
Iniettare conoscenza nei modelli linguistici
Gli errori fattuali nei Large Language Models (LLMs) sono spesso il risultato di lacune nella base di conoscenza del modello. Per affrontare questo problema, l'iniezione di conoscenza è una tecnica importante che aiuta a perfezionare ed espandere la capacità del modello di fornire risposte accurate.
L'iniezione di conoscenza si riferisce al processo di modifica o ampliamento di un modello linguistico con informazioni aggiuntive. Piuttosto che apprendere fatti completamente nuovi, orienta le predizioni del modello verso uno specifico dominio di conoscenza, migliorandone le prestazioni in compiti ad alta intensità di conoscenza.
Formulazione matematica
Esploriamo ora la formulazione matematica alla base dell'iniezione di conoscenza e come essa porti a un miglioramento dell'accuratezza del modello.
Problema
La ricerca si concentra sulla conoscenza fattuale. Se un modello sa qualcosa, può rispondere correttamente in modo coerente a domande correlate e distinguere le affermazioni vere da quelle false.
Ecco come funziona matematicamente:
Q = {qn}n=1N sia un insieme di N domande fattuali
Ogni domanda qn ha L risposte possibili e C = {cn}n=1N è l'insieme delle risposte corrette per queste domande.
M rappresenta il modello, che predice una risposta per ogni domanda. La risposta predetta dal modello per una domanda qn è indicata come M(qn) ∈ {an1 , . . . , anL } , e appartiene a un insieme di risposte possibili.
Possiamo valutare la conoscenza del modello calcolando il suo punteggio di conoscenza (accuratezza), che è la percentuale di risposte corrette che il modello fornisce rispetto a tutte le domande:
LM,Q := #{qn| M(qn) = cn} N .
In questa equazione:
LM,Q è il punteggio di conoscenza del modello.
Il numeratore conta quante volte la risposta del modello M(qn) corrisponde alla risposta corretta cn per ciascuna domanda qn.
Il denominatore è il numero totale di domande N.
Iniezione di conoscenza
Il pre-addestramento generale da solo non è sufficiente per molti compiti ad alta intensità di conoscenza. Per migliorare le prestazioni, abbiamo bisogno dell'iniezione di conoscenza.
Questo può essere rappresentato matematicamente come segue: dato un modello pre-addestrato M, un insieme di domande Q e una base di conoscenza ausiliaria BQ, miriamo a trovare una funzione per l'iniezione di conoscenza F tale che:
M′ := F(M, BQ) s.t. LM',Q > LM,Q.
In termini semplici, miriamo a creare un nuovo modello M′ applicando F, che incorpora la base di conoscenza BQ nel modello originale M. L'obiettivo è che il nuovo modello ottenga prestazioni migliori rispondendo correttamente a più domande.
Guadagno di accuratezza
Per vedere quanto l'iniezione di conoscenza (come il fine-tuning o RAG) abbia migliorato il modello, confrontiamo l'accuratezza prima e dopo l'aggiunta della conoscenza extra. Il miglioramento viene calcolato utilizzando questa formula:
(LM`,Q-LM,Q) / LM,Q
Dove:
LM,Q è l'accuratezza del modello prima dell'aggiunta di nuova conoscenza.
LM`,Qè l'accuratezza del modello dopo l'aggiunta di nuova conoscenza.
Questa formula mostra il guadagno relativo di accuratezza e quanto il modello sia migliorato dopo aver incorporato nuove informazioni.
Framework per l'iniezione di conoscenza
Due framework comuni per l'iniezione di conoscenza sono il fine-tuning (FT) e la retrieval-augmented generation (RAG). Il fine-tuning adatta il modello addestrandolo su dati specifici del dominio, mentre RAG potenzia il modello recuperando informazioni rilevanti da una base di conoscenza esterna durante l'inferenza.
Fine-Tuning
Il fine-tuning è una tecnica ampiamente utilizzata per l'iniezione di conoscenza. In questa tecnica, un LLM pre-addestrato viene ulteriormente addestrato su un dataset specializzato per interiorizzare conoscenze specifiche o migliorare le sue prestazioni in compiti particolari. Questo processo consente al modello di "adattare" la conoscenza appresa in precedenza per incorporare nuovi fatti, termini specifici di dominio e schemi di ragionamento.
Tipi di Fine-Tuning
- Fine-Tuning Supervisionato: Il fine-tuning supervisionato (SFT) richiede insiemi di coppie input-output etichettate. Un metodo SFT comune è l'instruction tuning, in cui l'input è una descrizione del compito in linguaggio naturale e l'output è un esempio del comportamento desiderato. Molti LLM all'avanguardia vengono sottoposti a instruction tuning dopo la fase di pre-addestramento. L'instruction tuning migliora la qualità complessiva del modello, con un'attenzione particolare alle capacità zero-shot e di ragionamento. Tuttavia, l'instruction tuning non insegna al modello nuove conoscenze e non è sufficiente da solo per l'iniezione di conoscenza.
Fine-Tuning con Reinforcement Learning: Le tecniche di fine-tuning basate sul reinforcement learning (RL) ottimizzano i modelli premiando le risposte corrette e penalizzando quelle errate. Gli esempi includono il reinforcement learning from human feedback (RLHF), la direct preference optimization (DPO) e la proximal policy optimization (PPO). Questi metodi sono utili per migliorare la qualità complessiva delle risposte e del comportamento. Tuttavia, come l'instruction tuning, il fine-tuning RL non affronta necessariamente l'ampiezza della conoscenza necessaria per l'iniezione di conoscenza.
Fine-Tuning Non Supervisionato: Il fine-tuning non supervisionato non richiede dati etichettati. Un metodo comune è il pre-addestramento continuo o fine-tuning non strutturato, in cui il processo è visto come una continuazione del pre-addestramento. Il modello viene addestrato in modo causale autoregressivo, prevedendo il token successivo. In genere viene utilizzato un tasso di apprendimento più basso per prevenire il catastrophic forgetting. Questo approccio è efficace per iniettare nuova conoscenza nel modello, poiché si basa sulla conoscenza memorizzata durante la fase di pre-addestramento. Questo lavoro utilizza il fine-tuning non supervisionato per migliorare la capacità del modello di apprendere nuove informazioni.
Retrieval Augmented Generation (RAG)
Retrieval Augmented Generation (RAG) è una forma di in-context learning che va oltre la conoscenza statica incorporata negli LLM consentendo ai modelli di recuperare informazioni rilevanti da fonti esterne prima di generare una risposta. A differenza del fine-tuning tradizionale, che modifica i pesi interni del modello, RAG si basa su basi di conoscenza esterne per ancorare gli output del modello a dati in tempo reale. Questo approccio ha il vantaggio di fornire accesso a informazioni aggiornate, specifiche di dominio e autorevoli, garantendo che il testo generato rimanga accurato e pertinente.
I modelli RAG sono costituiti da due componenti principali:
- Componente di Retrieval: Questa parte del modello è responsabile della ricerca di informazioni rilevanti in database esterni, repository di documenti o persino sul web in base a una query dell'utente. Prima del retrieval, i documenti vengono convertiti in embedding vettoriali utilizzando modelli di embedding e archiviati in un database vettoriale. Durante il retrieval, la query viene convertita in un embedding e confrontata con gli embedding archiviati nel database vettoriale per recuperare le informazioni più rilevanti. Database vettoriali comuni come Milvus consentono ricerche efficienti su grandi dataset.
- Componente di Generazione: Una volta recuperati i documenti o la conoscenza rilevanti, la componente di generazione sintetizza le informazioni recuperate in una risposta coerente e contestualmente appropriata. Ciò consente al modello di integrare informazioni in tempo reale e rispondere alle domande con maggiore accuratezza, soprattutto per argomenti che richiedono le conoscenze più recenti.
Configurazione Sperimentale
Questa sezione illustra la configurazione dell'esperimento, descrivendo in dettaglio la base di conoscenza, la selezione dei modelli, la configurazione dell'addestramento e i metodi di valutazione utilizzati per valutare le prestazioni dei modelli.
Base di conoscenza
La valutazione si basa su tre componenti chiave: il benchmark MMLU, il compito sugli eventi attuali e i compiti di generazione di parafrasi.
Benchmark MMLU
Sono stati selezionati quattro compiti dal benchmark Massively Multilingual Language Understanding (MMLU) per valutare le capacità degli LLM su compiti ad alta intensità di conoscenza. Questi compiti coprono materie come anatomia, astronomia, biologia, chimica e preistoria. La selezione si è basata sulla loro enfasi sulla conoscenza fattuale, con una dipendenza minima dal ragionamento.
MMLU è stato scelto come benchmark per la sua ampia copertura di domande fattuali a scelta multipla in vari domini, fornendo un test diversificato e oggettivo della comprensione fattuale di un modello. I compiti di preistoria sono stati inclusi per valutare la capacità del modello di elaborare informazioni fattuali dalla storia non moderna. Questo approccio testa la competenza del modello nel comprendere e manipolare la conoscenza isolatamente dai processi di ragionamento.
Compito sugli eventi attuali
È stato creato un nuovo dataset concentrandosi su domande a scelta multipla su eventi verificatisi dopo la data limite dei dati di addestramento dei modelli. Nello specifico, il compito era incentrato sugli "eventi attuali" degli USA, coprendo il periodo da agosto a novembre 2023 e tratto dai relativi indici di Wikipedia.
Questo approccio garantisce che i modelli non siano stati esposti a questi fatti durante il loro addestramento, consentendo un test diretto delle loro capacità di iniezione della conoscenza e della capacità di gestire informazioni fattuali aggiornate.
Generazione di parafrasi
GPT-4 è stato utilizzato per generare aumentazioni fornendo versioni parafrasate dei dati di input dopo aver creato il dataset. Al modello è stato chiesto di mantenere il significato originale riformulando le frasi. Ogni iterazione di parafrasi ha utilizzato un seme diverso per garantire diversità nelle versioni generate.
Per ciascun compito MMLU, sono stati selezionati casualmente 240 blocchi e sono state create due parafrasi per blocco, che è stato messo da parte per la validazione durante l'ottimizzazione degli iperparametri. Sono state generate dieci parafrasi per ciascun blocco utilizzato nel processo di fine-tuning per il dataset degli eventi attuali.
Selezione dei modelli
Llama2-7B, Mistral-7B e Orca2-7B sono stati scelti per valutare le prestazioni di inferenza attraverso diversi approcci di modellazione. Questa selezione include un mix di modelli di base open-source ampiamente utilizzati e un modello instruction-tuned, offrendo una base equilibrata per il confronto.
Inoltre, bge-large-en è stato selezionato come modello di embedding per il componente RAG. Questo modello di embedding era allo stato dell'arte tra le opzioni open-source, secondo la classifica MTEB di Hugging Face.
Configurazione dell'addestramento
Il processo di addestramento include i seguenti componenti chiave:
- Procedura: Tutti i modelli sono stati sottoposti a fine-tuning utilizzando un metodo di addestramento non supervisionato. Il dataset di addestramento è stato suddiviso in blocchi, assicurando che ogni blocco non superasse una dimensione di 256 token. I token speciali
ed sono stati utilizzati per contrassegnare l'inizio e la fine di ogni blocco.
- Hardware: I modelli sono stati addestrati su 4 GPU NVIDIA A-100, assicurando che fossero disponibili le risorse computazionali necessarie per il fine-tuning su larga scala.
Iperparametri:
I tassi di apprendimento sono stati testati nel seguente intervallo: da 1 × 10-6a 5 × 10-5.
I modelli sono stati addestrati per un massimo di 5 epoche con una dimensione del batch di 64, selezionata in base all'ottimizzazione degli iperparametri.
Valutazione
La valutazione è stata condotta utilizzando il framework LM-Evaluation-Harness, uno strumento popolare per valutare le prestazioni degli LLM. Questo framework fornisce un approccio standardizzato alla valutazione dei modelli, garantendo coerenza tra compiti e metodi. I modelli sono stati valutati in termini della loro capacità di prevedere le risposte corrette a domande fattuali.
Per l'esperimento, questi approcci di valutazione sono:
- Modello di base: Le prestazioni grezze del modello senza alcuna iniezione di conoscenza aggiuntiva.
- Fine-tuning (FT): Il modello viene sottoposto a fine-tuning su dati specifici del compito per migliorarne le prestazioni su domande basate su conoscenze fattuali.
- Retrieval-Augmented Generation (RAG): Questo metodo utilizza una knowledge base esterna e recupera informazioni pertinenti per potenziare le risposte del modello.
- Fine-Tuning + RAG (FT+RAG): Un approccio ibrido che combina il fine-tuning con la retrieval-augmented generation, con l'obiettivo di migliorare le prestazioni sfruttando sia l'adattamento della conoscenza sia il recupero.
Oltre a confrontare questi quattro approcci, le prestazioni sono state valutate in due diverse impostazioni:
- 0-shot: Il modello viene testato senza alcun esempio precedente, basandosi esclusivamente sulla conoscenza appresa durante il pre-training e su qualsiasi iniezione di conoscenza (fine-tuning o RAG).
- 5-shot: Al modello vengono forniti cinque esempi per ciascun compito, offrendo un contesto per effettuare previsioni. Questa impostazione testa la capacità del modello di generalizzare dagli esempi in uno scenario più pratico e reale.
Il confronto dell'accuratezza e delle prestazioni dei modelli attraverso questi quattro approcci ha rivelato l'impatto dell'iniezione di conoscenza, del fine-tuning e della retrieval-augmented generation sulla capacità degli LLM di gestire compiti ad alta intensità di conoscenza.
Risultati dell'esperimento
Ora, approfondiamo i risultati sperimentali su diverse knowledge base, ovvero il benchmark MMLU e i dati sugli eventi attuali, esplorando come ciascun approccio si è comportato nei compiti ad alta intensità di conoscenza
Risultati MMLU
In tutti i compiti, RAG ha costantemente superato i modelli di base, come si vede in termini di accuratezza della log-likelihood per tutti i compiti e le impostazioni.
Risultati per i dataset MMLU in termini di accuratezza della log-likelihood | Fonte
L'utilizzo di RAG con il modello di base come generatore si è dimostrato superiore al solo fine-tuning. In alcuni casi, la sostituzione del modello di base con un modello sottoposto a fine-tuning nella pipeline RAG ha ulteriormente migliorato i risultati. Tuttavia, l'effetto è stato incoerente e ha evidenziato l'instabilità intrinseca del fine-tuning. Inoltre, il prompting five-shot ha fornito un piccolo ma costante incremento in tutti i metodi.
Il guadagno relativo di accuratezza per ciascun metodo di iniezione della conoscenza, mediato (per colonna) su tutti gli esperimenti sul dataset MMLU | Fonte
Risultati sugli eventi attuali
RAG ha offerto prestazioni eccezionali nel compito sugli eventi attuali grazie al suo preciso allineamento tra le domande e il dataset ausiliario. Sebbene il fine-tuning si sia dimostrato vantaggioso, non ha raggiunto l'efficacia di RAG. Tuttavia, l'arricchimento del fine-tuning (FT-par) con più parafrasi ha migliorato significativamente i risultati rispetto all'approccio di base (FT-reg).
Risultati sugli eventi attuali. I modelli sottoposti a fine-tuning sul dataset originale sono etichettati come FT-reg, mentre quelli addestrati sul dataset con più parafrasi sono etichettati come FT-par | Fonte
Fine-tuning vs. RAG
I risultati dei compiti MMLU ed eventi attuali confermano la superiorità di RAG rispetto al fine-tuning. Sebbene il fine-tuning abbia migliorato l'accuratezza rispetto al modello di base, non è riuscito a eguagliare i guadagni prestazionali derivanti dal recupero.
Diversi fattori contribuiscono a questa tendenza:
- Accesso alla conoscenza contestuale: A differenza del fine-tuning, RAG recupera dinamicamente informazioni pertinenti, garantendo risposte fondate sul contesto.
- Catastrophic Forgetting: Il fine-tuning rischia di sovrascrivere conoscenze apprese in precedenza, potenzialmente riducendo le capacità generali del modello.
- Problemi di allineamento: I modelli sottoposti a fine-tuning possono richiedere ulteriore fine-tuning supervisionato o apprendimento per rinforzo (RLHF) per ottenere prestazioni ottimali
Risultati principali
- RAG supera i modelli di base: RAG (Retrieval Augmented Generation) ha superato costantemente i modelli di base, migliorando significativamente l'accuratezza, soprattutto per attività ad alta intensità di conoscenza, arricchendo il modello con dati esterni.
- RAG vs. Fine-Tuning (FT): RAG ha superato costantemente il Fine-Tuning (FT). La combinazione di RAG e FT ha mostrato alcuni miglioramenti quando si utilizza un modello sottoposto a fine-tuning come generatore nella pipeline RAG. Tuttavia, i risultati sono stati incoerenti, indicando l'instabilità intrinseca del fine-tuning rispetto a RAG.
- Incremento 5-shot: Il passaggio da 0-shot a 5-shot ha prodotto un piccolo ma costante miglioramento delle prestazioni, con RAG che ha beneficiato maggiormente del contesto aggiunto.
- L'aumento dei dati migliora la conservazione della conoscenza: Gli esperimenti mostrano che l'aumento dei dati basato su parafrasi porta a un incremento monotono dell'accuratezza del modello nelle attività di inserimento della conoscenza. I modelli comprendono e generalizzano meglio la nuova conoscenza riformulando le informazioni in più modi. Con l'aumento del numero di parafrasi, l'accuratezza del modello ha continuato a migliorare costantemente.
Accuratezza del modello nel compito sugli eventi attuali in funzione del numero di parafrasi | Fonte
RAG e database vettoriali
RAG (Retrieval Augmented Generation) potenzia i Large Language Models integrando i dati recuperati nelle risposte, migliorando l'accuratezza fattuale e la rilevanza contestuale.
Il ruolo dei database vettoriali in RAG
I database vettoriali svolgono un ruolo cruciale nella Retrieval-Augmented Generation (RAG) consentendo l'archiviazione e il recupero efficienti di embedding ad alta dimensionalità. In un sistema RAG, la fase di recupero dipende dall'identificazione delle informazioni semanticamente più rilevanti da una vasta base di conoscenza, ed è qui che i database vettoriali eccellono.
Questi database indicizzano dati testuali o multimodali come embedding vettoriali densi, consentendo ricerche di similarità rapide e accurate utilizzando metodi come la ricerca del vicino più prossimo approssimato (ANN). Quando viene generata una query, il database vettoriale recupera gli embedding corrispondenti più vicini in base alla similarità coseno o ad altre metriche di distanza. Ciò garantisce che solo le informazioni più rilevanti dal punto di vista contestuale vengano passate al modello di generazione, migliorando l'accuratezza fattuale e riducendo le allucinazioni.
I database vettoriali sono particolarmente preziosi nel recupero della conoscenza in tempo reale per applicazioni come sistemi di domande e risposte, chatbot, ricerca aziendale e motori di raccomandazione.
Milvus/Zilliz come database vettoriale/piattaforma cloud
Milvus, un database vettoriale open-source sviluppato da Zilliz, è una soluzione potente per gestire e interrogare embedding ad alta dimensionalità nei sistemi di Retrieval-Augmented Generation (RAG). RAG si basa su una ricerca di similarità efficiente per recuperare conoscenza rilevante prima di generare risposte, e Milvus è ottimizzato per attività di recupero in tempo reale su larga scala.
Arricchire la conoscenza degli LLM con Zilliz cloud per risposte più accurate | Fonte
Milvus consente l'archiviazione e l'indicizzazione di milioni o persino miliardi di embedding vettoriali, permettendo ai modelli RAG di eseguire rapide ricerche semantiche su vaste basi di conoscenza. Milvus garantisce un recupero a bassa latenza supportando più algoritmi di indicizzazione. Questo è fondamentale per le applicazioni in cui le informazioni in tempo reale sono essenziali, come chatbot, motori di ricerca e sistemi di IA aziendali.
Zilliz estende Milvus con soluzioni basate sul cloud, rendendo più semplice per le aziende distribuire e scalare la ricerca vettoriale per RAG senza gestire l’infrastruttura. Questo approccio cloud-native garantisce un’integrazione fluida con gli LLM. Consente alle organizzazioni di migliorare i propri modelli con il recupero dinamico della conoscenza, mantenendo al contempo prestazioni e scalabilità.
Potenziali direzioni di ricerca future
I Large Language Models (LLM) possiedono vaste quantità di conoscenza, ma la loro capacità di adattarsi a informazioni nuove, specializzate o mai viste rimane una sfida. Il fine-tuning e la retrieval-augmented generation (RAG) sono due approcci importanti per l’iniezione della conoscenza. Sebbene il fine-tuning possa essere utile per molte applicazioni, RAG si è dimostrata una scelta più affidabile per integrare conoscenza esterna.
Diverse aree chiave meritano ulteriori indagini per migliorare la nostra comprensione dell’iniezione della conoscenza negli LLM:
- Integrazione ibrida della conoscenza: Ricercare combinazioni di fine-tuning, RAG e altre tecniche per migliorare l’adattabilità. Comprendere come questi approcci si completano a vicenda può portare a un’iniezione della conoscenza più efficiente.
- Combinazione di metodi di fine-tuning: La ricerca futura dovrebbe esplorare l’integrazione dell’instruction-tuning e del fine-tuning basato sul reinforcement learning (RL) con il fine-tuning non supervisionato. Ciò potrebbe migliorare l’adattamento e la conservazione della conoscenza.
- Valutazione della rappresentazione della conoscenza negli LLM: Indagare come gli LLM archiviano e recuperano internamente la conoscenza iniettata da una prospettiva teorica. Una comprensione più chiara potrebbe portare a modelli più interpretabili ed efficienti.
- Misurazione della conoscenza negli LLM: Sviluppare nuovi framework di valutazione oltre gli approcci empirici per valutare meglio la conservazione della conoscenza. Stabilire benchmark standardizzati potrebbe migliorare la comparabilità di modelli diversi.
Ulteriori ricerche in queste aree aiuteranno a perfezionare le strategie di iniezione della conoscenza, migliorando l’efficienza e l’affidabilità degli LLM nell’adattarsi a nuove informazioni.
Ulteriori risorse
Continua a leggere

Zilliz Cloud Just Landed in Claude Code
The Zilliz Cloud Plugin brings the full power of Zilliz Cloud directly into your Claude Code terminal as natural-language conversations.

1 Table = 1000 Words? Foundation Models for Tabular Data
TableGPT2 automates tabular data insights, overcoming schema variability, while Milvus accelerates vector search for efficient, scalable decision-making.

Legal Document Analysis: Harnessing Zilliz Cloud's Semantic Search and RAG for Legal Insights
Enhance legal document analysis with Zilliz Cloud’s Semantic Search and RAG. Improve accuracy, efficiency, and scalability for contracts, case law, and compliance.



