L’importance de l’ingénierie des données pour une IA réussie avec Airbyte et Zilliz
Cet article a été initialement publié sur DBTA le 17 octobre 2024 et republié avec autorisation.
Permettre la collecte et l’utilisation des données est essentiel pour soutenir avec succès les projets d’IA à l’échelle de l’entreprise. De l’intégration des données aux pipelines de données, en passant par les performances de l’IA, la gouvernance des données, la conformité et bien plus encore, l’adhésion aux bonnes pratiques d’ingénierie des données n’a jamais été aussi judicieuse pour permettre un avenir propulsé par l’IA.
Dans le dernier webinaire de DBTA, Data Engineering Best Practices for AI, Brian Leonard, directeur de l’ingénierie chez Airbyte, et Tim Spann, principal developer advocate, Milvus, Zilliz, ont fait part de leur expertise sur la manière dont l’ingénierie des données peut résoudre les défis courants associés au déploiement et à la mise à l’échelle d’une utilisation efficace de l’IA.
En tant qu’entreprise du mouvement des données open source, Airbyte rend les données exploitables partout, permettant à plus de 20 000 professionnels des données et de l’IA de gérer des données diverses dans des environnements multi-cloud, selon Leonard. Concernant le cas d’utilisation de l’IA d’Airbyte, de nombreuses entreprises exploitent la plateforme Airbyte pour charger des données propriétaires dans des applications d’IA en extrayant des enregistrements à partir de sources non structurées—telles que Google Drive ou Salesforce—et en déplaçant ces données vers des lakehouses, où les utilisateurs peuvent activer la génération augmentée par récupération (RAG) et l’affinage.
Leonard a ensuite examiné de plus près le pipeline de données d’IA, en étudiant le parcours depuis l’extraction jusqu’à la normalisation, le traitement et l’utilisation. Chaque phase du pipeline intègre les processus suivants :
- Extraction : Chiffrement des données, masquage des PII, filtres pushdown, transfert de fichiers, autorisations
- Normalisation : Normalisation des schémas, nettoyage des données, déduplication
- Traitement : Enrichissement, résumé, optimisation des cas d’utilisation, découpage de documents, calcul des embeddings
- Utilisation : Placer les embeddings dans un magasin de données interrogeable, tel que Milvus, une base de données vectorielle
Spann a développé les avantages de Milvus de Zilliz, une base de données vectorielle open source haute performance conçue pour le passage à l’échelle. La recherche vectorielle, a noté Spann, est le nouveau paradigme de l’IA, car « désormais, les images, le texte, la vidéo, les documents—tout est donnée, et la recherche vectorielle rend cela consultable ». En fait, IDC prévoit que 90 % des données nouvellement générées en 2025 seront non structurées, reflétant un besoin crucial de recherche vectorielle.
Les bases de données vectorielles sont responsables de l’alimentation de la recherche dans une variété de cas d’utilisation—du RAG à la recherche de similarité moléculaire, en passant par la détection de fraude et d’anomalies, la recherche de similarité multimodale, et bien plus encore. Fondamentalement, les données non structurées—et la capacité à en extraire des connaissances—sont essentielles pour permettre le succès de l’IA.
Depuis 2017, Zilliz aide les organisations à donner du sens aux données non structurées. Ayant été conçue par une équipe de premier plan d’ingénieurs en algorithmes et en bases de données, dotée d’une solide expérience dans le développement de systèmes distribués hautes performances, évolutifs et hautement disponibles, spécialement adaptés à la recherche vectorielle, Zilliz a été bâtie de A à Z pour relever les divers défis d’ingénierie des données associés à l’IA, a noté Spann.
Ainsi, Milvus est une base de données vectorielle riche en fonctionnalités et facile à configurer, qui offre une mise à l’échelle élastique, du code réutilisable et de vastes intégrations, soutenue par une communauté robuste et solidaire. Spann a ensuite présenté aux participants du webinaire le fonctionnement de Milvus, en détaillant sa structure, ses fonctionnalités et plus encore.
Pour visionner le webinaire complet et approfondi consacré à l’ingénierie des données à l’ère de l’IA, vous pouvez consulter une version archivée du webinaire ici.
Continuer à lire

VDBBench Adds Cost-Aware Benchmarking for Vector Databases
Compare Zilliz Cloud, Pinecone, and turbopuffer with VDBBench cost-aware vector database benchmarks across latency, freshness, multitenancy, and cold starts.

How Zilliz Saw the Future of Vector Databases—and Built for Production
An inside look at how Zilliz built vector databases for real-world use, focusing on scalability, stability, and running them reliably at scale.

Vector Databases vs. Graph Databases
Use a vector database for AI-powered similarity search; use a graph database for complex relationship-based queries and network analysis.



