Pipeline multimodali per applicazioni IA
Il successo nelle applicazioni di intelligenza artificiale (AI) richiede una preparazione e una gestione efficienti dei dati. Una pipeline di dati più solida porta a output più accurati, affidabili e consapevoli del contesto. Man mano che i workflow di AI diventano sempre più complessi, la necessità di pipeline scalabili e intelligenti a supporto è diventata urgente.
I moderni sistemi di AI faticano con i dati non strutturati, come report, immagini e PDF. I sistemi che impiegano la retrieval augmented generation (RAG) richiedono strategie precise per gestire dati complessi mantenendo al contempo l’accuratezza dei risultati e contenendo i costi.
Costruire tali sistemi significa analizzare dati provenienti da formati diversi, gestire output di AI imprevedibili e costruire pipeline in grado di scalare in modo efficiente. Di recente, all’Unstructured Data Meetup organizzato da Zilliz, Sam, CTO di Datavolo con oltre 18 anni di esperienza in ingegneria dei dati e AI, ha affrontato queste sfide.
Una piattaforma basata su Apache NiFi, DataVolo, è stata evidenziata per affrontare questi problemi. Semplifica l’elaborazione dei dati non strutturati e consente la creazione di pipeline scalabili e cloud-native. DataVolo supporta anche la reattività in tempo reale a metadati, modifiche delle autorizzazioni e solidi framework di valutazione per affrontare modelli di AI non deterministici.
Questo articolo spiega i principali punti emersi dalla sessione sulle best practice per le pipeline multimodali. Esploreremo la gestione dei dati non strutturati e dei database vettoriali come Milvus per un recupero efficiente e strategie attuabili per migliorare i workflow di AI.
Il video completo del meetup è disponibile qui.
Perché le pipeline multimodali sono fondamentali per l’AI
Una sfida primaria che le aziende possono affrontare durante l’implementazione dell’AI su larga scala è gestire masse di dati complicati. Gli strumenti convenzionali di extract-transform-load (ETL) non possono gestire attività che implicano la gestione di formati diversi come testo, immagini, video e audio. Ecco perché:
I dati non strutturati dominano: Oltre l’80% dei dati di un’azienda è non strutturato, inclusi documenti, immagini e video. Questo presenta una sfida che non può essere affrontata utilizzando strumenti tradizionali. Le pipeline multimodali forniscono un workflow integrato con algoritmi di AI avanzati per trasformare i dati non strutturati in intelligence azionabile. Queste pipeline colmano il divario tra dati grezzi e modelli di AI, consentendo alle organizzazioni di utilizzare i dati per prendere decisioni migliori.
Migliorare l’accuratezza dell’AI: I large language model (LLM), come GPT, sono robusti ma inclini a errori, come produrre output irrilevanti o errati. L’accuratezza dei modelli di AI migliora grazie alla capacità delle pipeline multimodali di elaborare vari tipi di dati in un framework unificato arricchito con metadati. Questi metadati agiscono quindi come guida per aiutare i sistemi di AI a recuperare le informazioni più rilevanti relative a una determinata query.
Migliorare la Retrieval-Augmented Generation: La RAG combina il recupero dei dati con l’AI generativa per produrre output più innovativi e correlati al contesto. Le pipeline multimodali forniscono embedding e metadati per ottimizzazioni fluide del workflow. Garantisce che i modelli generativi forniscano risposte pertinenti recuperando sempre i dati rilevanti durante il retrieval.
Scalabilità dei workflow AI: Le aziende moderne gestiscono volumi di dati sempre maggiori. Le pipeline multimodali automatizzano attività come chunking, embedding e gestione dei metadati. Questo rende più facile mantenere le prestazioni mentre i workflow crescono. Queste pipeline forniscono la scalabilità necessaria per soddisfare tali esigenze crescenti senza rinunciare all'efficienza.
Aggiornamenti in tempo reale: I dati aziendali cambiano costantemente, dagli aggiornamenti dei contenuti alle autorizzazioni di accesso. Le pipeline multimodali garantiscono la sincronizzazione in tempo reale. Questo mantiene i sistemi AI operativi con le informazioni più recenti e pertinenti. Supporta inoltre casi d'uso dinamici in cui i dati in tempo reale sono fondamentali per output AI accurati.
Queste pipeline pongono le basi per sistemi AI efficienti e innovativi. Semplificano l'integrazione di diverse fonti di dati e migliorano le prestazioni dei modelli AI nel mondo reale.
Sfide nel panorama dei dati AI
I sistemi AI richiedono dati di alta qualità per l'addestramento. Tuttavia, la gestione di vari tipi di dati comporta delle sfide. La complessità aumenta quando l'azienda gestisce enormi quantità di dati non strutturati. Diamo un'occhiata ad alcune delle sfide nel panorama dei dati AI:
Complessità dei tipi di dati: I formati dei dati richiedono strumenti o workflow specifici per estrarre informazioni significative. Ad esempio, PDF contiene dati misti, incluse tabelle, testo e immagini. Pertanto, deve essere analizzato per recuperare i dati essenziali. Modelli come il rilevamento del layout possono elaborare e organizzare accuratamente tali dati per preservare tutte le informazioni vitali.
Metadati come spina dorsale: I metadati sono essenziali per aumentare la produttività dei workflow AI. Forniscono ricerca avanzata, recupero e controllo degli accessi, in modo che gli utenti possano accedere rapidamente ai dati di cui hanno bisogno. I metadati sono fondamentali per filtrare, classificare e proteggere l'accesso alle informazioni recuperate e, pertanto, sono una componente chiave dei sistemi AI di successo. Arricchire i dati con metadati potenzia gli approcci di ricerca ibrida, collegando gli embedding semantici al filtro dei metadati. Questo migliorerà la precisione e la pertinenza nei sistemi AI.
Gestione dei dati: I dati possono cambiare a causa di aggiornamenti, correzioni o aggiunte nelle grandi imprese. Devono disporre di sistemi in grado di supportare efficacemente tali flussi dinamici in tempo reale. Ad esempio, i sistemi di ingestione attiva garantiscono la sincronizzazione dei file sorgente nei sistemi di workflow AI senza interruzioni.
Approccio evaluation-first: Il monitoraggio e la valutazione continui dei risultati del sistema AI sono fondamentali per ottenere un output coerente e affidabile. Prima che il sistema passi in produzione, le aziende dovrebbero creare set e metriche di valutazione. Questo aiuterà le organizzazioni a misurare come i loro sistemi elaborano dati complessi per soddisfare gli obiettivi aziendali. I dataset sintetici possono essere utilizzati per testare e perfezionare le strategie, inclusi chunking ed embedding.
Scalabilità e integrazione: Con l'aumento graduale del volume dei dati, la scalabilità diventa molto importante. I sistemi AI dovrebbero integrarsi con gli strumenti aziendali esistenti senza degrado delle prestazioni e aumento dei carichi di lavoro. Le soluzioni scalabili migliorano l'efficienza dei workflow man mano che aumentano le dimensioni e la complessità dei dati. L'integrazione di sistemi avanzati come i database vettoriali migliora funzionalità come la ricerca vettoriale, garantendo un funzionamento fluido in scenari reali.
Affrontando questi aspetti, l'impresa può liberare tutto il potenziale dei dati e creare una solida base affinché i sistemi AI funzionino efficacemente in ambienti dinamici. Le pipeline moderne portano risultati trasformativi colmando il divario tra dati grezzi e workflow operativi nell'AI.
Il ruolo di DataVolo nello stack AI
DataVolo è una piattaforma rivoluzionaria per la creazione di pipeline di dati multimodali. Basata su Apache NiFi, DataVolo ha solide fondamenta per i sistemi AI moderni. Le funzionalità principali includono:
Pipeline di dati continue e automatizzate: Datavolo è progettato per l’ingestione continua e guidata dagli eventi. Si scala dinamicamente in base alla fluttuazione del volume dei dati per garantire prestazioni prevedibili nei momenti di throughput elevato. La piattaforma supporta vari formati di dati, inclusi audio, video, immagini, segnali dei sensori, JSON o XML strutturati e log basati su testo.
Parsing e Chunking: DataVolo può gestire dati non strutturati con facilità. Dispone di processori specializzati per il parsing avanzato dei documenti, al fine di suddividere documenti complessi in sezioni gestibili. Ad esempio, il processore ChunkDocument utilizza informazioni strutturali per formare chunk coerenti, mentre il processore ChunkText perfeziona ulteriormente questi ultimi in elementi più piccoli basati sul significato semantico.
Distribuzione Cloud-Native: DataVolo è intrinsecamente cloud-native e la sua architettura consente distribuzioni flessibili tra i principali provider come AWS, GCP e Azure. Consente alle organizzazioni di utilizzare le loro infrastrutture cloud esistenti. Consente un funzionamento fluido in ambienti cloud ibridi, garantendo prestazioni e gestibilità.
Osservabilità: DataVolo si integra con OpenTelemetry per la raccolta standardizzata dei dati, consentendo così la sua interoperabilità con una varietà di strumenti di monitoraggio e analisi. Inoltre, si integra anche con un Generatore di flussi basato su GenAI che traduce il linguaggio naturale in flussi NiFi. Questo rende più semplice creare o gestire pipeline di dati.
Focus sulla Persona del Data Engineer: Datavolo si rivolge ai data engineer, introducendoli a un’interfaccia visuale low-code per progettare, pianificare e mantenere pipeline. La piattaforma offre un’ampia gamma di diversi processori e connettori predefiniti, supportando così efficacemente un’ampia varietà di sorgenti e destinazioni. Fornisce flessibilità nell’adattarsi rapidamente ai cambiamenti nelle tecnologie AI e nei requisiti dei dati. Questo rende i data engineer efficaci nel fornire soluzioni AI di impatto senza queste complessità infrastrutturali.
Integrazione con database vettoriali: DataVolo si integra molto bene sia con Zilliz sia con Milvus per una gestione efficiente dei database vettoriali. Questi due lavorano in sinergia per potenziare lo sviluppo a livello aziendale di workflow AI scalabili e performanti.
Funzionamento di DATAVOLO: Fonte
Caso di studio: Chatbot per l’analisi dei dati finanziari
L’elaborazione di documenti non strutturati, come i report finanziari, richiede approcci innovativi per gestire la complessità intrinseca. La maggior parte delle aziende affronta serie sfide nell’estrarre insight significativi da tali documenti. Scopriamo come elaborare tali documenti e creare una soluzione scalabile.
Sfida
L’elaborazione di documenti finanziari, come i report 10-K, è complessa per un’azienda. Questi report sono solitamente lunghi centinaia di pagine e contengono tabelle, grafici e dati in formato testuale. L’elaborazione è estremamente dispendiosa in termini di tempo, soggetta a errori e inefficiente se eseguita manualmente.
Soluzione
Una pipeline scalabile e automatizzata dovrebbe integrare tecniche avanzate per l’elaborazione dei dati con database vettoriali. La soluzione contiene i seguenti processi:
Ingestione dei dati: I dati vengono estratti da varie fonti, inclusi i bucket S3, tramite ingestione automatizzata. Aggiunge dettagli essenziali come il tipo di documento e la fonte per rendere ogni documento rilevante e utile nel prendere decisioni. Nella gestione di dati non strutturati con flussi di dati dinamici, viene implementato il CDC (Change Data Capture). Garantisce che ogni aggiornamento, correzione o aggiunta nei file sorgente venga acquisito e sincronizzato con i sistemi di destinazione in tempo reale.
CDC evita l'uso di informazioni irrilevanti e mantiene l'integrità dei dati tra i flussi di lavoro. L'ingestione è ulteriormente ottimizzata con queste strategie di listing per evitare la rielaborazione di elementi più vecchi:
Listing basato su timestamp: Consente di elencare solo quei file che sono stati aggiunti o modificati dopo un determinato timestamp. Ciò verifica che l'ingestione di dati nuovi o aggiornati avvenga senza ridondanza.
Tecniche di hashing: Confronta il contenuto per identificare e saltare i file precedentemente elaborati, anche quando i nomi dei file rimangono gli stessi.
Queste capacità garantiscono pipeline di ingestione dei dati robuste ed efficienti, adattive ai cambiamenti, mantenendo dinamicamente i sistemi di AI alimentati da informazioni accurate e aggiornate.
Pre-elaborazione: La pre-elaborazione del documento prevede i seguenti passaggi:
Rilevamento del layout: Il rilevamento del layout svolge un ruolo importante nell'elaborazione di documenti complessi come PDF e report finanziari. Applica il modello YOLO-X ottimizzato per identificare ed etichettare componenti come tabelle, immagini e sezioni con bounding box. Le tabelle mantengono la struttura, mentre vi è un collegamento contestuale del testo narrativo o delle descrizioni. Un grafo del documento porta questi elementi gerarchicamente per una migliore navigazione e recupero. L'OCR viene utilizzato quando i livelli di testo non sono presenti ed è necessario acquisire tutti gli elementi del documento. Garantisce che struttura e contesto siano mantenuti affinché l'estrazione dei dati sia accurata e affidabile.
Chunking: I documenti vengono suddivisi in chunk gestibili per un'elaborazione efficiente. L'approccio più ingenuo è il chunking per un numero fisso di caratteri, ad esempio 400. Tuttavia, ciò può dividere informazioni semanticamente connesse e, quindi, non è efficace. Un metodo più raffinato è il chunking basato su sezioni, in cui le sezioni rilevate tramite il rilevamento del layout forniscono i confini. Di conseguenza, ogni chunk mantiene il contesto di una sezione, inclusi il titolo e il testo narrativo che vi appare. L'altra strategia per il chunking utilizza il significato del testo applicando la similarità del coseno di frasi consecutive. Quando è inferiore alla soglia indicata, esegue il chunk. Questa strategia di recupero rende ciascuno semanticamente incoerente con una maggiore accuratezza della query di un utente.
Estrazione dei metadati: Alcuni metadati, come il tipo di documento e l'URL di origine, sono impostati staticamente tramite configurazione nella pipeline. Altri metadati sono derivati automaticamente dal flusso di elaborazione, come dettagli estratti tramite il rilevamento del layout o arricchimento con fonti di dati esterne. Ad esempio, i simboli presenti nel documento finanziario interrogherebbero lo stesso simbolo in una tabella PostgreSQL e aggiungerebbero metadati appropriati a livello aziendale. Ciò abiliterà casi d'uso più avanzati come ricerca ibrida, risultati classificati e controllo sicuro degli accessi basato su metadati arricchiti.
Embedding: I chunk di testo vengono trasformati in vettori dinamici ad alta dimensionalità tramite embedding all'avanguardia. Questi vettori catturano l'essenza dei dati e rivelano connessioni semantiche significative. Rende il recupero delle informazioni un'esperienza intuitiva durante la risposta alle query degli utenti.
Archiviazione: Questi embedding e metadati sono archiviati in un database vettoriale ad alte prestazioni come Milvus. Ciò consente un recupero rapido anche tra milioni di vettori archiviati tramite indicizzazione. Il filtro dei metadati apporta precisione consentendo alle query di considerare ulteriore contesto, come intervalli di date o sezioni del documento.
Aggiornamenti in tempo reale: Le pipeline di ingestione continua aggiornano automaticamente i dati per mantenere l'accuratezza e la rilevanza del sistema. Garantisce che gli utenti abbiano accesso ai dati più recenti.
Risultato
Questo aiuterà a creare un chatbot specificamente per gli analisti finanziari. Il bot può ricevere query long-tail come, "Qual è stato l'utile netto dell'Azienda X per il 2023?" o "Quali sono i principali rischi identificati nella sezione di valutazione dei rischi?" Fornirà risposte corrette e contestualmente pertinenti in pochi secondi, con citazioni appropriate dai documenti originali.
Vantaggi chiave
Efficienza: L'ingestion, la pre-elaborazione e gli embedding sono automatizzati per far risparmiare tempo al team finanziario su attività di livello superiore.
Scalabilità: Il supporto scalabile per l'archiviazione e il recupero di milioni di vettori in database advanced-vector semplifica l'analisi con l'aumentare dei volumi di dati.
Insight in tempo reale: Gli aggiornamenti continui assicurano che gli analisti dispongano delle informazioni più recenti per decisioni sensibili al fattore tempo.
Questo caso d'uso evidenzia la potenza delle pipeline multimodali nel semplificare flussi di lavoro complessi. Illustra come l'integrazione dell'elaborazione avanzata dei dati con soluzioni di database vettoriali possa offrire un valore significativo.
Milvus: Accelerare la ricerca vettoriale
Milvus estende un supporto potenziato alle pipeline di IA multimodale introducendo una serie di funzionalità per una facile integrazione ed elaborazione di diverse varietà di dati come testi, immagini e video. Alcuni dei principali miglioramenti includono:
Ricerca ibrida vettoriale-per parole chiave: Milvus integra ricerche per similarità vettoriale e ricerche full-text per parole chiave in un'unica piattaforma. Consente un recupero efficiente tra diverse modalità di dati. Questo permette applicazioni di IA sofisticate che richiedono comprensione semantica e corrispondenza precisa delle parole chiave.
Tecnologia Sparse-BM25: Milvus ha introdotto la tecnologia Sparse-BM25 per abilitare una versione a vettori sparsi dell'algoritmo BM25. È uno degli algoritmi più popolari utilizzati nei sistemi di ricerca full-text. Questa tecnologia migliora notevolmente la velocità e l'accuratezza della ricerca per parole chiave per integrare le ricerche semantiche basate su vettori. Questo migliora le prestazioni delle pipeline di IA multimodale.
Integrazione con toolkit di sviluppo IA: Milvus si integra nativamente con l'intera suite di toolkit di sviluppo IA, inclusi LangChain, LlamaIndex, OpenAI e HuggingFace. Questi toolkit rendono Milvus il vector store di riferimento per applicazioni di IA generativa che supportano RAG attraverso varie modalità di dati e riducono l'attrito nello sviluppo di IA multimodale.
Questi miglioramenti rendono Milvus robusto ed efficiente nella costruzione e distribuzione di una pipeline di IA multimodale. Ciò consente alle organizzazioni di elaborare e analizzare diversi tipi di dati non strutturati in un unico luogo.
Pipeline di dati continue e automatizzate
La natura dinamica e in costante cambiamento dei dati aziendali richiede flussi di lavoro automatizzati per i dataset che alimentano i sistemi di IA. DataVolo risponde a questa esigenza con quanto segue:
Ingestion in tempo reale: DataVolo consente l'ingestion in tempo reale collegandosi a fonti di dati come bucket S3, Google Drive e SharePoint. Automatizza l'ingest tramite meccanismi event-driven, riducendo l'intervento umano. Fornisce inoltre strategie di ingestion configurabili per elaborarlo in modo efficiente. Queste strategie includono l'elenco basato su timestamp per identificare e gestire solo file nuovi o aggiornati senza creare alcuna ridondanza, ottimizzando così le risorse.
Architettura event-driven: Le pipeline DataVolo sono event-driven e rispondono automaticamente a qualsiasi cambiamento nei sistemi upstream. Eventi come modifiche ai file, aggiornamenti dei metadati o permessi utente attivano l'aggiornamento automatico nella pipeline. Anche i metadati sensibili, come gli ACL, vengono gestiti in modo sicuro durante tutto questo processo.
Progettazione scalabile e tollerante ai guasti: Offre scalabilità e tolleranza ai guasti, riducendo drasticamente il degrado delle prestazioni durante l’ingestione ad alta produttività. La scalabilità orizzontale è gestita dall’orchestrazione basata su Kubernetes. Con logica di retry integrata, processi di backfill e gestione dei downtime upstream, offre affidabilità e resilienza nella gestione delle pipeline di dati.
Successo dell’AI attraverso la valutazione
La valutazione costituisce un pilastro essenziale per un deployment efficace dell’AI. Misura il perfezionamento dei sistemi verso accuratezza, affidabilità e soddisfazione. Le seguenti metriche possono aiutare a valutare i modelli AI:
Metriche di retrieval
Precision: Il rapporto tra i dati rilevanti recuperati e i risultati totali, in modo che il sistema restituisca solo le informazioni più pertinenti.
Recall: Il rapporto tra i dati rilevanti recuperati e il totale dei dati rilevanti, assicurando che nessuna informazione preziosa venga persa.
F1 Score: Questa metrica combina precision e recall in un unico punteggio. Bilancia i compromessi tra queste due e produce una valutazione completa.
Metriche del modello linguistico
Faithfulness: Verifica se le risposte dell’AI provengono dal contesto ottenuto e riduce le allucinazioni per mantenere la fattualità.
Correctness: Confronta le risposte generate dall’AI con i dati di test per misurare l’accuratezza degli output.
La sfida consiste nel valutare modelli non deterministici, per i quali i sistemi possono fornire output diversi per lo stesso input a causa della loro natura probabilistica. Determinare e valutare risposte "corrette" è intrinsecamente complesso. Le percezioni di accuratezza e rilevanza spesso variano a seconda dell’utente e del contesto specifico. Per risolvere questo problema sono necessari cicli di feedback dinamici, iterazioni, vari set di test e metriche sensibili al contesto.
Il tuning degli iperparametri è fondamentale per affinare i workflow AI, in particolare i sistemi di retrieval-augmented generation (RAG). Diverse strategie di chunking richiedono una configurazione accurata di parametri come dimensione del chunk, overlap e soglie di similarità. Queste includono il chunking basato su sezioni per un contesto più ampio o il chunking semantico per una maggiore precisione.
I test iterativi, combinati con le metriche di retrieval, aiutano a identificare l’equilibrio ottimale tra precisione e ricchezza contestuale, garantendo retrieval e generazione di alta qualità.
I workflow evaluation-first consentono ai sistemi AI di tenere il passo con scenari di dati e bisogni degli utenti in continua evoluzione. Con affinamenti iterativi ed enfasi su metriche robuste, gli output rimarrebbero credibili, azionabili e contestuali. Così facendo, colma il divario dalla sperimentazione verso un deployment affidabile nel mondo reale, generando quindi fiducia e soddisfazione nei risultati delle applicazioni AI.
Conclusione
Le pipeline multimodali robuste sono la spina dorsale della scalabilità dei sistemi AI dalle fasi sperimentali alla produzione su larga scala. Queste pipeline gestiscono senza soluzione di continuità diversi tipi di dati, consentendo alle aziende di costruire workflow più innovativi.
Offre una gestione dei dati scalabile, sicura e ad alte prestazioni integrando piattaforme avanzate di data pipeline e database vettoriali come Zilliz e Milvus. Inoltre, automatizzare attività come preprocessing dei dati, embedding e arricchimento dei metadata ridurrebbe lo sforzo manuale senza compromettere accuratezza e scalabilità.
Le trasformazioni e la sincronizzazione in tempo reale dei sistemi AI li renderanno efficaci. Rende più facile creare workflow AI, consentendo valutazione e miglioramento continui.
Questo aiuta le aziende a migliorare continuamente le prestazioni delle applicazioni, adattarsi a scenari di dati in evoluzione e soddisfare esigenze aziendali dinamiche. Tali tecnologie possono aiutare le aziende nel modo in cui elaborano i dati e distribuiscono applicazioni basate sull’AI.
Ulteriori risorse
Continua a leggere

Zilliz Cloud Just Landed in Claude Code
The Zilliz Cloud Plugin brings the full power of Zilliz Cloud directly into your Claude Code terminal as natural-language conversations.

Top 10 Context Engineering Techniques You Should Know for Production RAG
A practical guide to context engineering for production LLM systems, covering RAG, context processing, memory, agents, and multimodal context.

OpenAI o1: What Developers Need to Know
In this article, we will talk about the o1 series from a developer's perspective, exploring how these models can be implemented for sophisticated use cases.



