Garbage In, Garbage Out: perché una scarsa curatela dei dati sta uccidendo i tuoi modelli di IA
Nel mondo moderno, i dati sono diventati preziosi quanto il petrolio. Mentre le aziende si sono tradizionalmente concentrate sulla raccolta di enormi quantità di dati per costruire modelli e ottenere insight, l’attenzione si sta spostando dalla quantità alla qualità. Molte organizzazioni ora si rendono conto che disporre di dati di alta qualità è più cruciale che accumulare semplicemente grandi dataset. Tuttavia, questo cambiamento rivela una sfida significativa: molte aziende faticano a comprendere appieno e a curare efficacemente i propri dati esistenti.
All’Unstructured Data Meetup ospitato da Zilliz, Alexandre Bonnet, Lead ML Solutions Engineer presso Encord, ha affrontato questo problema nel suo intervento sulle insidie di una scarsa data curation e su come le aziende possano superare queste sfide. Ha sottolineato l’importanza della qualità dei dati e delle tendenze di mercato, presentando una roadmap per aiutare le organizzazioni a creare pipeline di produzione di dati di alta qualità. In questo blog, riepilogheremo i punti chiave di Alexandre. Puoi anche guardare il suo intervento completo su YouTube.
Relatore Alexandre Bonnet di Encord che parla al Meetup sui dati non strutturati di luglio a SF
L’evoluzione dell’IA
Alex discute il passaggio dalle applicazioni tradizionali di IA alla moderna IA generativa nelle aziende. Circa un decennio fa, i modelli di IA dovevano essere costruiti da zero per ogni caso d’uso, ed erano tipicamente limitati alla gestione di un solo tipo di dati (uni-modali). Questi primi modelli erano utilizzati principalmente da team tecnici di data scientist e ingegneri. Tuttavia, l’attuale panorama dell’IA si è evoluto in modo significativo con modelli fondazionali come YOLO, GPT e Claude, che possono essere ottimizzati per domini specifici con relativa facilità. Inoltre, le architetture moderne possono elaborare più tipi di dati (multimodali), rendendo l’IA accessibile anche agli utenti generici che potrebbero non avere una profonda preparazione tecnica. Questo cambiamento ha portato a una diffusione capillare dell’IA in vari settori, semplificando flussi di lavoro e processi.
Figura- IA tradizionale vs IA moderna
Alex sottolinea: "La ricerca su tutti i fronti dell’Intelligenza Artificiale è esplosa negli ultimi 10 anni.” Nonostante i progressi in aree come i dati sintetici e l’IA generativa, i progressi nella computer vision sono stati comparativamente più lenti. Ciò è in gran parte dovuto alla complessità della comprensione dei dati di immagini non strutturati, che pongono sfide uniche.
Figura: Sviluppi in diversi ambiti dell’IA nell’ultimo decennio
Alex evidenzia i tre pilastri principali dell'AI: Dati, Modelli e Calcolo. Sebbene ci siano stati rapidi progressi nelle architetture dei modelli—come i transformers, i meccanismi di attenzione e i large language models (LLM) che possono essere sottoposti a fine-tuning per compiti specifici—ci sono stati anche progressi significativi nell'hardware, in particolare con lo sviluppo di GPU ad alte prestazioni progettate per addestrare modelli complessi. Tuttavia, nonostante questi passi avanti nei modelli e nella potenza di calcolo, la qualità dei dati continua a rimanere indietro, restando nelle prime fasi di maturità.
Figura: Pilastri dell'AI
Perché la qualità dei dati è importante per l'AI
I modelli basati su testo addestrati su dataset rumorosi o non puliti spesso generano output con errori logici o persino caratteri senza senso. Allo stesso modo, è noto che i modelli di immagini, come alcuni basati sulla diffusione, producano elementi visivi con artefatti inattesi, come filigrane. La causa principale? Scarsa curatela dei dati.
Figura: Pulizia dei dati vs curatela dei dati
Per chiarire, curatela dei dati si riferisce all'organizzazione, alla gestione e alla preparazione dei dati per l'etichettatura o l'addestramento del modello, assicurando che siano pertinenti e strutturati per il compito specifico. Pulizia dei dati si concentra sull'identificazione e sulla correzione di errori o incoerenze nei dati, come la rimozione di duplicati, la correzione di campioni corrotti o la gestione del rumore. Entrambi i processi garantiscono che nell'addestramento del modello vengano utilizzati solo dati di alta qualità e affidabili.
Pulire e perfezionare i dati di addestramento su larga scala è una sfida importante. Prendiamo, ad esempio, il compito di addestrare un modello multi-modale utilizzando video di YouTube. Con l'enorme volume di dati, alcune clip possono contenere audio corrotto, linguaggio inappropriato o contenuti irrilevanti. Senza una rigorosa curatela dei dati, questi problemi possono degradare le prestazioni e l'affidabilità dei modelli di AI.
Una curatela efficace dei dati comporta il filtraggio e l'analisi meticolosi dei dataset per garantire che nei modelli vengano inseriti solo dati appropriati e di alta qualità. Alex sottolinea che il principio "dati eccellenti equivalgono a modelli eccellenti" è particolarmente vero nell'AI generativa. Per applicazioni specifiche di dominio, come il rilevamento di difetti di saldatura in contesti industriali o l'assistenza nella robotica chirurgica, i dati di addestramento devono essere altamente pertinenti e riflettere con precisione i casi d'uso previsti. Questo livello di curatela aiuta il modello a gestire efficacemente i casi limite e riduce il rischio di fallimento.
Durante la sua presentazione, Alex ha condiviso esempi che illustrano l'importanza di dati ben curati. In un caso, un modello linguistico basato sulla visione (VLM) come GPT-4 with vision non è riuscito a identificare se uno scuolabus in un'immagine fosse rivolto verso la parte anteriore o posteriore. Questo fallimento evidenzia come anche modelli sofisticati fatichino senza dati curati e di alta qualità, rafforzando la necessità di una curatela e pulizia dei dati complete per migliorare l'accuratezza e le prestazioni del modello.
Figura: Gli LLM basati sulla visione hanno prestazioni del modello scarse a causa di dati di addestramento rumorosi
Curatela dei dati per il fine-tuning di modelli specifici di dominio
Ora che abbiamo appreso l'importanza della qualità dei dati per le prestazioni dell'AI, esploriamo un esempio che dimostra come la curatela dei dati svolga un ruolo fondamentale nel fine-tuning dei modelli per domini specifici.
LLaVA è un modello linguistico di grandi dimensioni general-purpose sviluppato da Meta AI, altamente competente nella comprensione del linguaggio umano. Tuttavia, adattarlo a campi più specializzati, come il dominio medico, richiede sforzi mirati di curatela dei dati. Questo processo di fine-tuning ha portato alla creazione di LLaVA-Med, un assistente AI specializzato per applicazioni mediche.
Ecco i passaggi chiave coinvolti in questo processo:
Figure: Fine-tuning LLM with medical knowledge
Allineamento dei concetti medici
La prima fase di fine-tuning ha utilizzato appena il 4% del dataset disponibile—600.000 coppie immagine-testo provenienti da manuali e articoli di ricerca. Sono stati investiti tempo e impegno considerevoli nella curatela di un dataset ben bilanciato per aiutare il modello ad apprendere i concetti medici essenziali. Questo processo ha comportato una combinazione di competenze umane e tecniche semi-automatizzate, assicurando che i dati curati riflettessero accuratamente le sfumature del dominio medico.
Tuning delle istruzioni mediche
Nella seconda fase, il modello è stato sottoposto a fine-tuning con 60.000 coppie domanda-risposta per aiutarlo a imparare come rispondere alle query mediche. Questa fase ha consentito al modello di comprendere i prompt in input, recuperare informazioni pertinenti e generare risposte accurate basate sul contesto medico. L’attenzione al tuning delle istruzioni ha migliorato la capacità del modello di fornire assistenza consapevole del contesto in situazioni mediche reali.
Curando un dataset più piccolo e di alta qualità per l’addestramento, il team ha potuto eseguire il fine-tuning di LLaVA-Med in modo efficiente e ottenere risultati accurati, riducendo al contempo i costi di addestramento. Questo caso di studio sottolinea l’importanza della curatela dei dati nello sviluppo di modelli linguistici di grandi dimensioni (LLMs) specifici per dominio. Evidenzia inoltre come una curatela meticolosa e un fine-tuning mirato possano trasformare un modello general-purpose in uno strumento specializzato capace di distinguersi nei campi medici.
Tendenze in evoluzione nella qualità e curatela dei dati
Nelle pipeline di dati tradizionali, i dati raccolti in genere venivano sottoposti ad annotazione manuale o pre-annotazione usando modelli con supervisione umana. Successivamente, i dati annotati venivano utilizzati per addestrare il modello, che veniva poi distribuito. Sebbene questo approccio lineare possa funzionare per alcuni scenari, risulta insufficiente nei casi d’uso specializzati, soprattutto quando si gestiscono grandi quantità di dati non strutturati.
Per affrontare queste sfide, Alex sottolinea la necessità di pipeline di dati più flessibili e robuste. Le pipeline moderne possono incorporare fasi aggiuntive per una curatela dei dati potenziata. Una volta raccolti e archiviati in un data warehouse, i dati possono essere verificati, puliti e curati sfruttando strumenti esterni prima di passare all’addestramento del modello. Questi strumenti garantiscono la qualità dell’etichettatura dei dati dopo l’annotazione, un passaggio fondamentale per perfezionare il dataset.
Figure- Data Curation & Validation tools in modern data pipelines
Inoltre, Alex evidenzia l’importanza di configurare pipeline di monitoraggio dopo la distribuzione del modello. Queste pipeline consentono una valutazione e un miglioramento continui, assicurando che il modello si adatti ai nuovi dati e rimanga accurato. Perfezionando la pipeline e implementando questi passaggi aggiuntivi, le imprese possono migliorare la qualità dei loro dati e aumentare le prestazioni del modello.
Sfide comuni nella curatela e pulizia dei dati
La curatela e la pulizia dei dati presentano una serie di sfide che possono ostacolare l’efficienza e l’accuratezza dei modelli AI:
Revisione manuale dei dati: Revisionare manualmente grandi dataset—come scorrere ore di filmati video—non è solo dispendioso in termini di tempo, ma anche soggetto a errori.
Approcci ad hoc: Affidarsi a soluzioni improvvisate senza un adeguato livello di persistenza spesso porta a incoerenze e difficoltà nel gestire efficacemente il processo di curatela dei dati.
Problemi di qualità dei dati: I dataset contengono frequentemente duplicati, campioni corrotti o informazioni rumorose, il che può degradare le prestazioni del modello.
Interazioni cross-modali: Analizzare le relazioni tra diverse modalità di dati (ad es., testo, immagini, video) può essere complesso e richiede strumenti e tecniche sofisticati per garantire una rappresentazione e un’interazione accurate dei dati.
Come le organizzazioni possono superare le sfide della cura dei dati
Alex condivide gli approcci innovativi sviluppati da Encord per affrontare sfide comuni legate alla qualità dei dati, come duplicati, dati corrotti e campioni rumorosi:
- Approcci basati sugli embedding: I dati non strutturati possono essere convertiti in vector embeddings ad alta dimensionalità tramite embedding models e archiviati in un vector database come Milvus. Le organizzazioni possono identificare rapidamente anomalie e outlier visualizzando gli embedding in uno spazio a bassa dimensionalità. Questo approccio rende più facile cercare, organizzare e curare i dati non strutturati.
Figura: Uso degli embedding per visualizzare campioni di dati di training
Metriche di qualità dei dati: Metriche come sfocatura, luminosità e similarità degli embedding possono essere utilizzate per valutare la qualità dei dataset di immagini nelle attività di computer vision, aiutando a segnalare e correggere i problemi prima dell’addestramento del modello.
NLP per la cura dei dati: L’elaborazione del linguaggio naturale può filtrare e selezionare solo i campioni di dati più rilevanti per il training o il testing, riducendo il rumore e migliorando l’accuratezza del modello.
Livelli di persistenza: Implementare un livello di persistenza adeguato è cruciale per gestire il processo di cura dei dati, consentendo l’acquisizione e l’archiviazione coerenti dei risultati.
Deduplicazione dei dati: Le misurazioni di similarità basate sugli embedding aiutano a identificare e rimuovere campioni duplicati, migliorando la qualità dei dati e riducendo le esigenze di archiviazione. Ciò aiuta anche a trovare punti dati simili per l’augmentation.
Validazione dei metadati: Strumenti automatizzati validano i metadati per garantire l’integrità dei dati e rilevare campioni corrotti. Encord offre strumenti specifici progettati per questa attività, semplificando il processo.
Pulizia dei dati: Tecniche come rilevamento degli outlier, imputazione e normalizzazione possono affrontare il rumore nei dataset, garantendo che i dati siano adatti all’addestramento di modelli ad alte prestazioni.
Vantaggi di una cura e pulizia dei dati efficaci
Prestazioni del modello migliorate: Dati di alta qualità portano a modelli più accurati e affidabili.
Tempo di training ridotto: Dati puliti e curati possono accelerare il processo di training.
Costi inferiori: Evitando la necessità di ulteriori raccolte ed etichettature dei dati, le organizzazioni possono risparmiare denaro.
Maggiore spiegabilità del modello: Dati ben curati possono migliorare l’interpretabilità degli output del modello.
Conclusione
Una cura efficace dei dati diventa sempre più critica man mano che le applicazioni di IA diventano più complesse, in particolare quelle che gestiscono più tipi di dati come video e testo. Nell’intervento di Alex, acquisiamo una comprensione più approfondita delle varie sfide associate alla cura di dataset di immagini e testo e di come questi problemi influenzino direttamente le prestazioni del modello.
Tecniche come gli embedding vettoriali e le query basate su NLP offrono strumenti preziosi ai team per visualizzare meglio i propri dati, identificare campioni etichettati erroneamente o duplicati e pulire i dataset in modo più efficiente prima dell’addestramento del modello. Per garantire il successo, i team di data science devono selezionare gli embedding models appropriati, adattati ai loro specifici tipi di dati—che si tratti di embedding di immagini o di testo—e sfruttare vector database come Milvus per semplificare i processi di archiviazione e ricerca dei dati.
In definitiva, investire in una curatela dei dati di alta qualità non solo migliora le prestazioni del modello, ma riduce anche il rischio di errori e aumenta l'efficienza complessiva dei flussi di lavoro di IA.
Ulteriori risorse
Continua a leggere

How to Build an Enterprise-Ready RAG Pipeline on AWS with Bedrock, Zilliz Cloud, and LangChain
Build production-ready enterprise RAG with AWS Bedrock, Nova models, Zilliz Cloud, and LangChain. Complete tutorial with deployable code.

Zilliz Cloud Delivers Better Performance and Lower Costs with Arm Neoverse-based AWS Graviton
Zilliz Cloud adopts Arm-based AWS Graviton3 CPUs to cut costs, speed up AI vector search, and power billion-scale RAG and semantic search workloads.

Milvus WebUI: A Visual Management Tool for Your Vector Database
Explore Milvus WebUI to monitor, manage, and optimize your vector database with real-time insights, performance tracking, and system health monitoring.



