Data Lakehouse : stockage évolutif avec des performances de niveau entrepôt
Data Lakehouse : stockage évolutif avec des performances de niveau entrepôt
Vous avez du mal à choisir entre la flexibilité des data lakes et les performances des data warehouses ? Et si vous n’aviez pas du tout à choisir ? Le data lakehouse apparaît comme une approche impressionnante de la gestion des données qui améliore considérablement la manière dont les organisations stockent, traitent et analysent leur actif le plus précieux. À mesure que les entreprises génèrent des types de données de plus en plus diversifiés — des enregistrements de transactions structurés aux données non structurées de capteurs IoT — les architectures traditionnelles atteignent leurs limites. Le data lakehouse apparaît comme la solution qui comble cet écart, offrant une flexibilité sans précédent sans sacrifier les performances.
Qu’est-ce qu’un Data Lakehouse ?
Un data lakehouse est une architecture moderne et ouverte de gestion des données qui combine la flexibilité, la rentabilité et l’évolutivité des data lakes avec les capacités de gestion des données et les transactions ACID des data warehouses. Cette approche hybride permet d’exécuter des opérations de business intelligence (BI) et de machine learning (ML) sur tous les types de données au sein d’une plateforme unique et unifiée.
Contrairement aux architectures traditionnelles à deux niveaux qui nécessitent des systèmes distincts pour différents types de données, un data lakehouse crée une source unique de vérité où coexistent des données structurées, semi-structurées et non structurées. L’architecture exploite un stockage objet cloud à faible coût (similaire aux data lakes) tout en mettant en œuvre des structures de données et des fonctionnalités de gestion (similaires aux data warehouses) directement au-dessus de cette couche de stockage.
Les principales caractéristiques distinctives incluent :
Stockage unifié : tous les types de données stockés dans des formats ouverts sur un stockage objet à faible coût
Transactions ACID : garantir la fiabilité et la cohérence des données
Application du schéma : maintenir la qualité et la structure des données lorsque nécessaire
Prise en charge de plusieurs charges de travail : permettre la BI, l’analytique, la science des données et le ML sur la même plateforme
Standards ouverts : utiliser des formats comme Parquet et des technologies comme Apache Iceberg
Comment fonctionne un Data Lakehouse ?
Pile technologique de base
L’architecture data lakehouse repose sur plusieurs avancées technologiques clés qui rendent cette approche unifiée possible :
Couches de métadonnées : des technologies comme Delta Lake, Apache Iceberg et Apache Hudi reposent sur des formats de fichiers ouverts (tels que Parquet) et suivent les fichiers qui appartiennent aux différentes versions de tables. Ces couches fournissent de riches fonctionnalités de gestion, notamment des transactions conformes à ACID, des capacités de voyage dans le temps, l’application et l’évolution des schémas, ainsi que la validation des données.
Moteurs de requête haute performance : les moteurs de requête modernes permettent une exécution SQL haute performance directement sur les data lakes grâce à diverses optimisations, notamment la mise en cache des données fréquemment utilisées dans la RAM/les SSD, des optimisations de disposition des données qui regroupent les données fréquemment consultées, des structures de données auxiliaires comme les statistiques et les index, ainsi que l’exécution vectorisée sur des CPU modernes.
Formats de données ouverts : l’utilisation de formats ouverts comme Parquet et ORC permet aux data scientists et aux ingénieurs en machine learning d’accéder facilement aux données à l’aide d’outils populaires tels que pandas, TensorFlow, PyTorch et Spark DataFrames, sans processus complexes de déplacement ou de transformation des données.
Architecture en médaillon
Un data lakehouse typique met en œuvre une architecture en médaillon avec trois couches distinctes :
Couche bronze (données brutes) : cette couche d’ingestion reçoit des données par lots ou en streaming provenant de diverses sources dans plusieurs formats. Les données sont stockées sous leur forme brute et non traitée, en conservant une fidélité complète à la source d’origine tout en permettant la flexibilité du schéma à la lecture.
Couche argent (nettoyée et conforme) : la couche de traitement applique des règles de qualité des données, standardise les formats et effectue les transformations initiales. Cela crée des jeux de données propres et validés tout en conservant des pistes d’audit détaillées et des informations de traçabilité des données.
Couche Gold (prête pour l’entreprise) : La couche finale fournit des données propres et enrichies, optimisées pour des cas d’utilisation spécifiques. Les tables sont conçues avec des dispositions de données et des optimisations appropriées afin de servir efficacement à la fois les requêtes analytiques et les charges de travail de machine learning.
Capacités de traitement des données
Traitement en temps réel : Les data lakehouses prennent en charge l’ingestion et le traitement de données en streaming, permettant des analyses en temps réel et des insights immédiats. Cela élimine la nécessité de bus de messages séparés comme Kafka dans de nombreux scénarios.
Traitement par lots : Les capacités traditionnelles de traitement par lots prennent en charge l’analyse de données historiques à grande échelle et les transformations complexes qui ne nécessitent pas une exécution en temps réel.
Analytique interactive : Les utilisateurs peuvent effectuer des requêtes ad hoc et des analyses exploratoires de données directement sur le lakehouse sans déplacer les données vers des systèmes analytiques séparés.
Delta Lake : la fondation des data lakehouses modernes
Delta Lake s’est imposé comme l’une des technologies les plus critiques alimentant les architectures modernes de data lakehouse. En tant que framework de stockage open source, Delta Lake comble le fossé entre les data lakes et les data warehouses en apportant fiabilité, performance et gouvernance au stockage des data lakes.
Qu’est-ce que Delta Lake ?
Delta Lake est une couche de stockage open source qui s’exécute au-dessus des data lakes existants et fournit des transactions ACID, une gestion évolutive des métadonnées, ainsi qu’un traitement unifié des données en streaming et par lots. Conçu à l’origine par Databricks et désormais maintenu par la Linux Foundation, Delta Lake transforme les data lakes peu fiables en data lakehouses fiables en ajoutant une couche de journal des transactions au-dessus du stockage d’objets dans le cloud.
À la base, Delta Lake stocke les données au format Parquet tout en maintenant un journal des transactions qui suit toutes les modifications apportées aux données. Ce journal des transactions est l’innovation clé qui permet les propriétés ACID, le time travel et d’autres fonctionnalités avancées qui n’étaient auparavant disponibles que dans les data warehouses traditionnels.
Fonctionnalités et capacités clés
Transactions ACID : Delta Lake fournit une prise en charge complète des transactions ACID, garantissant la fiabilité des données même avec des lectures et écritures concurrentes. Cela élimine les problèmes de corruption des données qui peuvent survenir dans les data lakes traditionnels lorsque plusieurs processus accèdent simultanément aux mêmes données.
Time travel et versioning : Chaque opération sur une table Delta crée une nouvelle version, permettant aux utilisateurs d’accéder aux versions historiques de leurs données. Cette capacité permet la récupération des données, l’audit, la reproduction d’expériences et l’annulation de modifications problématiques — des fonctionnalités cruciales pour la gouvernance des données et la conformité.
Application et évolution du schéma : Delta Lake empêche l’écriture de mauvaises données en appliquant la validation du schéma. Lorsque les schémas doivent changer, Delta Lake prend en charge une évolution contrôlée du schéma, permettant aux tables de s’adapter à l’évolution des besoins métier tout en maintenant la qualité des données.
Traitement par lots et streaming unifiés : Delta Lake permet aux charges de travail par lots et en streaming de lire et d’écrire simultanément dans les mêmes tables. Cela élimine la nécessité de systèmes séparés et de processus complexes de synchronisation des données, permettant l’analytique en temps réel sur des données continuellement mises à jour.
Gestion évolutive des métadonnées : Contrairement au stockage traditionnel basé sur des fichiers, qui devient lent avec un grand nombre de fichiers, Delta Lake gère efficacement les métadonnées des tables contenant des millions de fichiers et des milliards d’objets, maintenant des performances de requête rapides à grande échelle.
Fonctionnalités de qualité des données : Delta Lake prend en charge des attentes et des contraintes qui valident automatiquement la qualité des données lors des écritures, empêchant les données corrompues ou invalides d’entrer dans le lakehouse.
Comment Delta Lake alimente l’architecture de data lakehouse
Delta Lake sert de fondation de stockage qui rend le concept de data lakehouse pratique et fiable :
Couche de fiabilité : Les lacs de données traditionnels souffrent de problèmes de cohérence, d’écritures échouées et de corruption des données. Le journal des transactions de Delta Lake garantit que toutes les opérations sont atomiques et cohérentes, offrant la fiabilité requise par les charges de travail d’entreprise.
Optimisation des performances : Delta Lake inclut des fonctionnalités d’optimisation intégrées comme le saut de données, le Z-ordering et la compaction automatique des fichiers, qui améliorent considérablement les performances des requêtes. Ces optimisations se produisent de manière transparente sans nécessiter d’intervention manuelle.
Gouvernance et conformité : Grâce à des fonctionnalités comme les pistes d’audit, le voyage dans le temps et l’application des schémas, Delta Lake permet aux organisations de répondre aux exigences réglementaires et de maintenir une gouvernance des données appropriée — ce qui était difficile ou impossible avec les lacs de données traditionnels.
Prise en charge de plusieurs moteurs : Les tables Delta Lake peuvent être consultées par plusieurs moteurs de traitement, notamment Apache Spark, Apache Flink, Trino et d’autres, offrant une flexibilité dans le choix des outils tout en maintenant la cohérence des données.
Data Lakehouse vs. Data Lake vs. Data Warehouse
Comprendre les distinctions entre ces trois architectures aide à clarifier quand choisir une approche data lakehouse :
| Fonctionnalité | Data Warehouse | Data Lake | Data Lakehouse |
|---|---|---|---|
| Structure des données | Schéma à l’écriture | Schéma à la lecture | Schéma à la lecture et schéma à l’écriture |
| Types de données | Structurées uniquement | Tous les types | Tous les types |
| Prise en charge des transactions | Limitée | Complète (ACID) | Complète (ACID) |
| Performance | Requêtes SQL rapides | Performance variable | Vitesse proche de celle d’un entrepôt |
| Coût | Élevé à grande échelle | Stockage peu coûteux, calcul variable | Stockage peu coûteux, calcul optimisé |
Avantages et défis du Data Lakehouse
Avantages du Data Lakehouse
Architecture simple : Élimine la complexité liée à la maintenance de systèmes séparés de data warehouse et de data lake, réduisant la surcharge opérationnelle et le besoin de multiples processus ETL susceptibles d’introduire des incohérences dans les données.
Coût optimisé : Exploite le stockage objet à faible coût tout en offrant des capacités de requêtes hautes performances, réduisant considérablement le coût total de possession par rapport à la mise à l’échelle d’un data warehouse traditionnel.
Qualité des données améliorée : Met en œuvre l’application des schémas et les transactions ACID pour maintenir l’intégrité des données tout en préservant la flexibilité nécessaire pour gérer divers types de données et des schémas évolutifs.
Collaboration améliorée : Permet aux ingénieurs de données, analystes et data scientists de travailler sur la même plateforme avec les mêmes données, supprimant les silos traditionnels entre les différentes équipes de données.
Capacités en temps réel : Prend en charge à la fois les charges de travail par lots et en streaming, permettant des analyses en temps réel et des insights immédiats sans mouvement de données complexe entre les systèmes.
Réduction de la duplication des données : Fournit une source unique de vérité qui élimine la nécessité de maintenir plusieurs copies des données dans différents systèmes, améliorant la cohérence et réduisant les coûts de stockage.
Défis du Data Lakehouse
Complexité technique : La création et la maintenance d’un data lakehouse nécessitent une expertise dans plusieurs technologies et une planification architecturale minutieuse afin d’éviter les goulots d’étranglement de performance et d’assurer une gouvernance appropriée.
Considérations relatives à l’enfermement fournisseur : Bien qu’elles reposent sur des standards ouverts, certaines solutions lakehouse gérées peuvent créer des dépendances vis-à-vis de fournisseurs cloud ou de fournisseurs technologiques spécifiques.
Optimisation des performances : Atteindre des performances optimales nécessite une attention particulière au partitionnement des données, au dimensionnement des fichiers, aux stratégies d’indexation et aux techniques d’optimisation des requêtes.
Complexité de la migration : Les organisations disposant d’une infrastructure de données existante font face à des parcours de migration complexes qui nécessitent une planification rigoureuse afin d’éviter toute perturbation de l’activité.
Cas d’utilisation du Data Lakehouse
Grâce à sa capacité à combiner l’évolutivité des data lakes avec les performances des data warehouses, le data lakehouse a un impact dans divers secteurs, notamment :
Santé : les data lakehouses intègrent diverses sources de données — telles que les dossiers médicaux électroniques, l’imagerie médicale et les appareils portables — afin de fournir une vue complète de la santé des patients. Cette intégration permet l’analyse prédictive pour la détection précoce des maladies, des plans de traitement personnalisés et une allocation efficace des ressources.
Services financiers : les institutions financières utilisent les data lakehouses pour agréger et analyser les données issues des transactions, des flux de marché et des interactions avec les clients. Cette analyse complète des données améliore les modèles d’évaluation des risques, perfectionne les algorithmes de détection de fraude et soutient les efforts de conformité réglementaire, renforçant ainsi l’ensemble des opérations financières.
Commerce de détail : les détaillants exploitent les data lakehouses pour consolider les données issues des systèmes de point de vente, des plateformes d’e-commerce et des programmes de fidélité client. Cette approche unifiée des données permet des stratégies marketing personnalisées, des modèles de tarification dynamique et l’optimisation des stocks, améliorant ainsi l’expérience client et l’efficacité opérationnelle.
Fabrication : dans la fabrication, les data lakehouses intègrent les données provenant de capteurs, de lignes de production et de chaînes d’approvisionnement. Cette intégration soutient la maintenance prédictive en identifiant les schémas d’usure des équipements et en planifiant des interventions opportunes, réduisant les temps d’arrêt et optimisant les processus de production.
…et bien d’autres encore.
En fournissant une plateforme unifiée qui prend en charge divers types de données et charges de travail analytiques, les data lakehouses permettent aux organisations d’obtenir des informations exploitables, d’améliorer la prise de décision et de stimuler l’innovation.
La prochaine évolution : Vector Data Lake
Qu’est-ce que Vector Data Lake ?
À mesure que les organisations adoptent de plus en plus des workflows d’IA et de machine learning, elles font face à un défi sans précédent : des quantités massives de données non structurées sont générées quotidiennement, mensuellement et annuellement — des documents et images aux fichiers audio et données de capteurs. Pour extraire des informations de ces données non structurées, les organisations doivent les transformer en embeddings vectoriels qui capturent la signification sémantique et permettent une analyse fondée sur la similarité.
Vector Data Lake est spécifiquement optimisé pour stocker et traiter des embeddings vectoriels à très grande échelle et à faible coût. Alors que les organisations génèrent des téraoctets et des pétaoctets de données non structurées qui doivent être transformées en vecteurs afin de débloquer des insights d’IA, Vector Data Lake fournit une alternative économique aux bases de données vectorielles spécialisées pour les charges de travail d’analytique hors ligne à grande échelle. Bien que les bases de données vectorielles offrent d’excellentes performances pour les cas d’utilisation en temps réel, le stockage et le traitement de téraoctets de vecteurs deviennent extrêmement coûteux. Vector Data Lake résout ce problème en fournissant une solution optimisée en coûts pour les organisations qui peuvent tolérer une latence plus élevée en échange de coûts considérablement réduits.
Capacités clés de Vector Data Lake
Pile de données unifiée : Vector Data Lake connecte de manière transparente les couches de données en ligne et hors ligne avec des formats cohérents et un stockage efficace. Cela signifie que vous pouvez déplacer les données entre les niveaux chauds et froids sans reformatage ni migrations complexes, créant ainsi une approche véritablement unifiée de la gestion des données vectorielles.
Écosystème de calcul compatible : Conçu pour fonctionner nativement avec des frameworks comme Spark et Ray, Vector Data Lake prend en charge tout, de la recherche vectorielle à l’ETL et à l’analytique traditionnels. Cette compatibilité signifie que vos équipes data existantes peuvent travailler avec des données vectorielles à l’aide d’outils qu’elles connaissent déjà, éliminant ainsi le besoin d’une expertise spécialisée en bases de données vectorielles.
Architecture optimisée en termes de coûts : Le système gère intelligemment le placement des données : les données chaudes restent sur SSD ou NVMe pour un accès rapide, tandis que les données froides sont automatiquement déplacées vers un stockage objet comme S3. Des stratégies d’indexation et de stockage intelligentes maintiennent des E/S rapides lorsque nécessaire, tout en rendant les coûts de stockage prévisibles et abordables.
Data Lakehouse vs. Vector Data Lake vs Vector Database
Bien que les data lakehouses, les lacs de données vectorielles et les bases de données vectorielles gèrent tous d’énormes ensembles de données et l’analytique, ils sont conçus pour des besoins complètement différents : les Data Lakehouses se concentrent sur la flexibilité et la gouvernance, les Vector Data Lakes privilégient le stockage économique à grande échelle, et les Vector Databases misent avant tout sur la vitesse :
| Fonctionnalité | Data Lakehouse | Vector Data Lake | Vector Database |
|---|---|---|---|
| Types de données principaux | Structurées, semi-structurées, non structurées | Embeddings vectoriels + tous les types de données traditionnels | Principalement des embeddings vectoriels |
| Types de requêtes | Analytique SQL, reporting BI, entraînement ML | Recherche sémantique, analyse de similarité, analytique vectorielle | Recherche de similarité en temps réel, plus proche voisin |
| Latence | Du quasi temps réel au batch | Optimisé pour le batch, latence plus élevée acceptable | Latence ultra-faible (ms) |
| Modèle de coûts | Optimisé pour les charges de travail analytiques générales | Coût ultra-faible pour le stockage massif de vecteurs | Coût plus élevé pour la performance |
| Frameworks de calcul | Spark, moteurs SQL, frameworks ML | Spark, Ray, traitement conscient des vecteurs | Moteurs vectoriels spécialisés (FAISS, Pinecone, etc.) |
| Cas d’utilisation | Business intelligence, science des données, reporting | Analyse historique de documents, similarité par lots, analyse des tendances | Recommandations en temps réel, chatbots, recherche en direct |
| Niveaux de stockage | Chaud/tiède/froid pour tous les types de données | Vecteurs chauds (SSD/NVMe), vecteurs froids (stockage objet) | Stockage principalement chaud, index optimisés |
| Mise à l’échelle | Mise à l’échelle horizontale, multi-cloud | Mise à l’échelle horizontale massive, cloud-native | Verticale + horizontale, conçue à cet effet |
| Propriétés ACID | Prise en charge complète de la conformité ACID | ACID limité, cohérence éventuelle | ACID limité, accent mis sur la disponibilité |
| Gouvernance des données | Catalogue complet, suivi de la traçabilité | Gouvernance de base, forte dépendance aux métadonnées | Capacités de gouvernance minimales |
FAQ
1. Quel est le principal avantage d’un data lakehouse par rapport à un data lake ?
Un data lakehouse fournit une prise en charge des transactions ACID et l’application de schémas, garantissant la fiabilité des données et la performance pour l’analytique, éléments qui font généralement défaut dans les data lakes traditionnels.
2. Un data lakehouse peut-il remplacer un entrepôt de données ?
Bien qu’un data lakehouse puisse gérer de nombreuses charges de travail identiques à celles d’un entrepôt de données, certaines organisations peuvent choisir d’utiliser les deux systèmes pour répondre à des besoins spécifiques.
3. Quels outils sont couramment utilisés avec les data lakehouses ?
Les outils courants incluent Delta Lake pour la gestion des métadonnées, Apache Spark pour le traitement des données, ainsi que diverses plateformes de BI et de machine learning pour l’analytique.
4. Les data lakehouses conviennent-ils à l’analytique en temps réel ?
Oui, les data lakehouses prennent en charge l’ingestion et l’interrogation des données en temps réel, ce qui les rend adaptés aux applications d’analytique en temps réel.
5. Comment les data lakehouses gèrent-ils la gouvernance des données ?
Les data lakehouses intègrent des couches de métadonnées qui appliquent les schémas, suivent la lignée des données et prennent en charge les contrôles d’accès, garantissant une gouvernance robuste des données.
- **Qu’est-ce qu’un Data Lakehouse ?**
- **Comment fonctionne un Data Lakehouse ?**
- **Delta Lake : la fondation des data lakehouses modernes**
- **Data Lakehouse vs. Data Lake vs. Data Warehouse**
- **Avantages et défis du Data Lakehouse**
- **Cas d’utilisation du Data Lakehouse**
- **La prochaine évolution : Vector Data Lake**
- **FAQ**
Contenu
Commencez gratuitement, évoluez facilement
Essayez la base de données vectorielle entièrement managée conçue pour vos applications GenAI.
Essayer Zilliz Cloud gratuitement

