L'importanza dell'ingegneria dei dati per un'IA di successo con Airbyte e Zilliz
Questo articolo è stato originariamente pubblicato su DBTA il 17 ottobre 2024 e ripubblicato con autorizzazione.
Abilitare la raccolta e l’utilizzo dei dati è fondamentale per supportare con successo i progetti di AI su scala aziendale. Dall’integrazione dei dati alle pipeline di dati, alle prestazioni dell’AI, alla governance dei dati, alla conformità e altro ancora, aderire alle best practice di data engineering non è mai stato così prudente per abilitare un futuro basato sull’AI.
Nel più recente webinar di DBTA, Data Engineering Best Practices for AI, Brian Leonard, direttore dell’ingegneria presso Airbyte, e Tim Spann, principal developer advocate, Milvus, Zilliz, hanno offerto la loro competenza su come il data engineering possa risolvere le sfide comuni associate al deployment e alla scalabilità di un uso efficace dell’AI.
In qualità di azienda del movimento dei dati open source, Airbyte rende i dati azionabili ovunque, consentendo a oltre 20.000 professionisti dei dati e dell’AI di gestire dati diversificati in ambienti multi-cloud, secondo Leonard. Per quanto riguarda il caso d’uso AI di Airbyte, molte imprese stanno sfruttando la piattaforma Airbyte per caricare dati di prima parte nelle app AI estraendo record da fonti non strutturate—come Google Drive o Salesforce—e spostando tali dati nei lakehouse, dove gli utenti possono abilitare la generazione aumentata dal recupero (RAG) e il fine-tuning.
Leonard ha quindi esaminato più da vicino la pipeline di dati AI, analizzando il percorso dall’estrazione alla normalizzazione, all’elaborazione e all’utilizzo. Ogni fase della pipeline incorpora i seguenti processi:
- Estrazione: Crittografia dei dati, mascheramento PII, filtri pushdown, trasferimento di file, autorizzazioni
- Normalizzazione: Normalizzazione dello schema, pulizia dei dati, deduplicazione
- Elaborazione: Arricchimento, sintesi, ottimizzazione dei casi d’uso, suddivisione dei documenti in chunk, calcolo degli embedding
- Utilizzo: Inserire gli embedding in un archivio dati interrogabile, come Milvus, un database vettoriale
Spann ha approfondito i vantaggi di Milvus di Zilliz, un database vettoriale open source ad alte prestazioni, costruito per scalare. La ricerca vettoriale, ha osservato Spann, è il nuovo paradigma per l’AI, poiché “ora, immagini, testo, video, documenti—tutto è dato, e la ricerca vettoriale lo rende ricercabile.” Infatti, IDC prevede che il 90% dei dati di nuova generazione nel 2025 sarà non strutturato, riflettendo un’esigenza cruciale di ricerca vettoriale.
I database vettoriali sono responsabili dell’alimentazione della ricerca in una varietà di casi d’uso—dalla RAG alla ricerca di similarità molecolare, al rilevamento di frodi e anomalie, alla ricerca di similarità multimodale e altro ancora. Al suo centro, i dati non strutturati—e la capacità di estrarne conoscenza—sono fondamentali per abilitare il successo dell’AI.
Dal 2017, Zilliz aiuta le organizzazioni a dare senso ai dati non strutturati. Essendo stata creata da un team di alto livello di ingegneri di algoritmi e database con una solida esperienza nello sviluppo di sistemi distribuiti ad alte prestazioni, scalabili e ad alta disponibilità, progettati in modo unico per la ricerca vettoriale, Zilliz è stata costruita da zero per affrontare le varie sfide di data engineering associate all’AI, ha osservato Spann.
Di conseguenza, Milvus è un database vettoriale facile da configurare e ricco di funzionalità, che offre scalabilità elastica, codice riutilizzabile e ampie integrazioni, sostenuto da una comunità robusta e di supporto. Spann ha quindi guidato gli spettatori del webinar attraverso il modo in cui Milvus opera, descrivendone in dettaglio la struttura, le funzionalità e altro ancora.
Per il webinar completo e approfondito che discute il data engineering per l’era dell’AI, puoi visualizzare una versione archiviata del webinar qui.
Continua a leggere

VDBBench Adds Cost-Aware Benchmarking for Vector Databases
Compare Zilliz Cloud, Pinecone, and turbopuffer with VDBBench cost-aware vector database benchmarks across latency, freshness, multitenancy, and cold starts.

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Balancing Precision and Performance: How Zilliz Cloud's New Parameters Help You Optimize Vector Search
Optimize vector search with Zilliz Cloud’s level and recall features to tune accuracy, balance performance, and power AI applications.



