Sfide nell'estrazione di dati da documenti strutturati su larga scala con gli LLM
Una delle sfide principali nell'applicazione dei modelli linguistici di grandi dimensioni (LLMs) risiede nella fase di elaborazione dei dati, in particolare quando si gestiscono formati di dati diversi. In genere è possibile classificare i dati in tre tipi: strutturati, semi-strutturati o non strutturati. Poiché gli LLM lavorano principalmente con il testo, vengono spesso applicati a dati non strutturati, a meno che i dati non siano già organizzati in una tabella relazionale.
In un recente webinar, Tim Spann, Principal Developer Advocate presso Zilliz, ha presentato Unstract, una piattaforma open-source progettata per semplificare l'estrazione di dati non strutturati e trasformarli in formati strutturati. Questo strumento mira a semplificare la gestione dei dati automatizzando il processo di strutturazione.
In questo blog, approfondiremo le principali sfide dell'estrazione di dati strutturati da documenti, come delineato da Shuveb Hussain, cofondatore e CEO di Unstract. Esploreremo anche come Unstract affronta vari scenari, inclusa la sua integrazione con database vettoriali come Milvus, per portare struttura a dati precedentemente ingestibili.
Limitazioni attuali
La strutturazione dei dati è da tempo complessa e dispendiosa in termini di tempo, soprattutto perché i modelli di machine learning richiedono quantità di dati sempre crescenti. Storicamente, una parte significativa di questo lavoro di estrazione è stata svolta manualmente, ad esempio nel caso di documenti manoscritti scansionati, perché l'automazione non poteva soddisfare pienamente le diverse esigenze dei modelli.
Sebbene i modelli linguistici di grandi dimensioni (LLM) abbiano migliorato la capacità di analizzare ed estrarre informazioni dai documenti, presentano limitazioni notevoli. I documenti spesso si presentano in vari formati, come tabelle, moduli, grafici e scansioni, dove la qualità e la coerenza dei dati svolgono un ruolo cruciale per il successo dell'estrazione. Inoltre, molte applicazioni richiedono l'elaborazione di enormi quantità di documenti, e non tutti aderiscono a una struttura uniforme. Ciò può richiedere un'ulteriore personalizzazione nel processo di estrazione, poiché gli LLM possono avere difficoltà a gestire layout altamente variabili o complessi senza intervento umano.
Figura 1: Sfide della strutturazione dei dati
La Figura 1 illustra un grafico a bolle delle sfide che mostra il panorama degli attuali sviluppi nell'estrazione di dati strutturati da documenti. Il grafico evidenzia tre aree chiave:
Un piccolo insieme di casi d'uso che sono stati risolti con successo dalla tecnologia attuale.
Una porzione significativa del mercato viene attivamente affrontata dai modelli linguistici di grandi dimensioni (LLM).
Un vasto potenziale di casi aziendali irrisolti che rimangono aperti. Questi casi potrebbero essere affrontati in futuro, a seconda dei progressi in varie tecnologie.
Questa visualizzazione enfatizza il divario tra ciò che è attualmente realizzabile e le potenziali svolte nel prossimo futuro, come lo sviluppo di applicazioni di agenti IA.
Estrazione di documenti
Chiunque abbia tentato di estrarre testo dai documenti utilizzando gli LLM sa quanto possa essere difficile ottenere tutte le informazioni necessarie con solo poche righe di codice. Sebbene strumenti come i Co-pilot possano assistere in questo processo, spesso non riescono a fornire una soluzione completamente automatizzata. I dati estratti potrebbero non avere sempre la struttura desiderata e spesso è necessario un passaggio di intervento umano per organizzare le informazioni nel formato corretto.
È qui che Unstract fornisce una soluzione completamente automatizzata in cui i documenti non strutturati possono essere trasformati in dati strutturati senza la necessità di supervisione umana. Unstract utilizza una tecnologia basata su LLM per estrarre le informazioni.
Figura 2: Estrazione di documenti
Unstract Cloud
Unstract è una piattaforma LLM no-code che rientra nella categoria dell'Intelligent Document Processing (IDP). Semplifica l'estrazione dei documenti dividendo il processo in due passaggi principali:
Prompt Engineering: il Prompt Studio di Unstract consente agli utenti di sviluppare prompt generici per tipi di documenti specifici, che possono poi essere riutilizzati per estrarre dati strutturati da altri documenti dello stesso tipo.
Fase di distribuzione: una volta creati i prompt, possono essere distribuiti in vari modi, anche come pipeline ETL, endpoint API o come parte di una coda di revisione manuale per ulteriori controlli.
Unstract offre due approcci per ottenere un'estrazione accurata dei dati:
Accuratezza migliorata (LLM Challenge): questo metodo prevede l'elaborazione del documento con un LLM e l'utilizzo di un secondo LLM per contestare l'output del primo. Se i due modelli non raggiungono un consenso, il campo specifico estratto viene impostato su null, evitando il rischio di inserire dati errati. Ciò riduce significativamente il rischio di allucinazioni, poiché è improbabile che due modelli di fornitori diversi producano lo stesso output errato.
Costi ridotti
Estrazione SinglePass: invece di inviare più prompt per singoli campi, questo approccio consolida tutti i prompt in un'unica richiesta. L'LLM restituisce un output JSON contenente tutti i campi richiesti in un solo passaggio, riducendo l'uso di token e la latenza.
Estrazione riassunta: questo metodo crea un riepilogo del documento di input utilizzando l'LLM in base ai prompt dell'utente. Il riepilogo viene quindi utilizzato per estrarre i campi necessari, ottimizzando l'uso dei token e riducendo ulteriormente la latenza.
Figura 3: Strategie di estrazione di Unstract
Le Figure 4 e 5 mostrano un esempio di un progetto di Estrazione Single Pass, in cui possiamo vedere che diversi prompt vengono combinati per ottenere un singolo output JSON.
Figura 4: Unstract Prompt Studio (Parser di documenti)
Figura 5: Unstract Prompt Studio (Output combinato)
Inoltre, gli utenti possono configurare varie opzioni per adattare il processo di estrazione. Queste includono la selezione di un database vettoriale come Milvus o Zilliz Cloud per archiviare e recuperare embedding vettoriali, la scelta di un secondo modello LLM per confrontare output come costi o latenza, oppure selezionare l'opzione challenge LLM se l'accuratezza ha priorità sui costi.
Figura 6: Unstract Prompt Studio: Impostazioni
Una volta definite le impostazioni e quando i risultati dell'estrazione del testo sono soddisfacenti, puoi esportare il workflow come strumento (Figura 7), selezionare il workflow da distribuire (Figura 8) e ottenere l'endpoint API (Figura 9).
Figura 7: Esporta il workflow come strumento
Figura 8: Esporta il workflow come strumento
Figura 9: Distribuisci endpoint API
Strategie di recupero di Unstract
In Impostazioni, gli utenti possono scegliere tra due strategie di recupero:
Semplice: Questa strategia utilizza una singola query per recuperare blocchi di informazioni rilevanti, impiegando una combinazione di corrispondenza per parole chiave e ricerca vettoriale per garantire l'accuratezza.
Sotto-domanda: Questo approccio prevede la scomposizione di una query complessa in sotto-domande più semplici. Ogni sotto-domanda recupera informazioni rilevanti, che vengono poi aggregate per fornire una risposta completa alla query complessa originale.
Sebbene l'approccio di recupero semplice offra velocità ed efficienza dei costi, potrebbe non cogliere la comprensione sfumata che modelli più sofisticati possono fornire.
Il retriever a sotto-domande è particolarmente prezioso per affrontare domande complesse che devono integrare informazioni provenienti da vari contesti o domini. Concentrandosi sui requisiti informativi specifici di ciascuna sotto-domanda, questo approccio migliora la capacità del modello di gestire efficacemente query dettagliate.
Conclusione
Il campo dell'estrazione di dati da documenti strutturati sta cambiando rapidamente, grazie ai progressi nei modelli linguistici di grandi dimensioni e a strumenti innovativi come Unstract. Unstract offre un modo efficace per trasformare dati non strutturati in formati strutturati in combinazione con database vettoriali come Zilliz Cloud, concentrandosi al contempo sia sull'accuratezza sia sul risparmio dei costi. Con diverse strategie di recupero, aiuta gli utenti a gestire domande complesse in modo intuitivo.
Guardando al futuro, il potenziale per ulteriori miglioramenti nell'elaborazione intelligente dei documenti è enorme, come evidenziato da Shuveb Hussain durante il webinar. Con la crescita della necessità di un'estrazione efficiente dei dati, piattaforme come Unstract sono pronte a fare da apripista. Migliorando queste tecnologie, aiutano le organizzazioni a trasformare dati non strutturati in insight utili.
Questo passaggio verso un'elaborazione dei documenti completamente automatizzata non riguarda solo la tecnologia; riguarda il cambiamento del modo in cui i dati vengono gestiti in diversi settori. Adottando questi progressi, le organizzazioni possono scoprire nuove opportunità di crescita in un mondo sempre più guidato dai dati.
Continua a leggere

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

How to Improve Retrieval Quality for Japanese Text with Sudachi, Milvus/Zilliz, and AWS Bedrock
Learn how Sudachi normalization and Milvus/Zilliz hybrid search improve Japanese RAG accuracy with BM25 + vector fusion, AWS Bedrock embeddings, and practical code examples.

Proactive Monitoring for Vector Database: Zilliz Cloud Integrates with Datadog
we're excited to announce Zilliz Cloud's integration with Datadog, enabling comprehensive monitoring and observability for your vectorDB deployments.



