Données médiocres en entrée, données médiocres en sortie : pourquoi une mauvaise curation des données tue vos modèles d’IA
Dans le monde moderne, les données sont devenues aussi précieuses que le pétrole. Alors que les entreprises se sont traditionnellement concentrées sur la collecte de vastes quantités de données pour construire des modèles et obtenir des insights, l’accent se déplace vers la qualité plutôt que la quantité. De nombreuses organisations réalisent désormais que disposer de données de haute qualité est plus essentiel que simplement accumuler de grands jeux de données. Cependant, ce changement révèle un défi important : de nombreuses entreprises peinent à comprendre pleinement leurs données existantes et à les organiser efficacement.
Lors du Unstructured Data Meetup organisé par Zilliz, Alexandre Bonnet, Lead ML Solutions Engineer chez Encord, a abordé cette question dans son intervention sur les pièges d’une mauvaise curation des données et la manière dont les entreprises peuvent surmonter ces défis. Il a souligné l’importance de la qualité des données et des tendances du marché, en présentant une feuille de route pour aider les organisations à établir des pipelines de production de données de haute qualité. Dans ce blog, nous récapitulerons les points clés d’Alexandre. Vous pouvez également regarder son intervention complète sur YouTube.
Intervenant Alexandre Bonnet d’Encord prenant la parole lors du July Unstructured Data Meetup à SF
L’évolution de l’IA
Alex évoque le passage des applications d’IA traditionnelles à l’IA générative moderne dans les entreprises. Il y a environ dix ans, les modèles d’IA devaient être construits à partir de zéro pour chaque cas d’utilisation, et ils étaient généralement limités au traitement d’un seul type de données (unimodales). Ces premiers modèles étaient principalement utilisés par des équipes techniques de data scientists et d’ingénieurs. Cependant, le paysage actuel de l’IA a considérablement évolué avec des modèles de fondation comme YOLO, GPT et Claude, qui peuvent être affinés pour des domaines spécifiques avec une relative facilité. De plus, les architectures modernes peuvent traiter plusieurs types de données (multimodales), rendant l’IA accessible même aux utilisateurs généraux qui n’ont pas nécessairement de solides connaissances techniques. Cette évolution a entraîné une adoption généralisée de l’IA dans divers secteurs, rationalisant les flux de travail et les processus.
Figure- IA traditionnelle vs IA moderne
Alex souligne : « La recherche sur tous les fronts de l’intelligence artificielle a explosé au cours des 10 dernières années. » Malgré les avancées dans des domaines tels que les données synthétiques et l’IA générative, les progrès en vision par ordinateur ont été comparativement plus lents. Cela est largement dû aux complexités liées à la compréhension des données d’image non structurées, qui posent des défis uniques.
Figure : Développements dans différents domaines de l’IA au cours de la dernière décennie
Alex met en avant les trois principaux piliers de l’IA : les données, les modèles et le calcul. Bien qu’il y ait eu des avancées rapides dans les architectures de modèles — telles que les transformers, les mécanismes d’attention et les grands modèles de langage (LLM) pouvant être affinés pour des tâches spécifiques — des progrès significatifs ont également été réalisés dans le matériel, en particulier avec le développement de GPU hautes performances conçus pour entraîner des modèles complexes. Cependant, malgré ces avancées dans les modèles et la puissance de calcul, la qualité des données continue d’être à la traîne, demeurant à ses premiers stades de maturité.
Figure : Piliers de l’IA
Pourquoi la qualité des données est importante pour l’IA
Les modèles textuels entraînés sur des jeux de données bruités ou non nettoyés génèrent souvent des sorties comportant des erreurs logiques, voire des caractères absurdes. De même, les modèles d’image, comme certains modèles basés sur la diffusion, sont connus pour produire des visuels avec des artefacts inattendus, tels que des filigranes. La cause profonde ? Une mauvaise curation des données.
Figure : Nettoyage des données vs curation des données
Pour clarifier, la curation des données consiste à organiser, gérer et préparer les données pour l’étiquetage ou l’entraînement des modèles, en s’assurant qu’elles sont pertinentes et structurées pour la tâche spécifique. Le nettoyage des données se concentre sur l’identification et la correction des erreurs ou incohérences dans les données, comme la suppression des doublons, la réparation d’échantillons corrompus ou le traitement du bruit. Les deux processus garantissent que seules des données fiables et de haute qualité sont utilisées dans l’entraînement des modèles.
Nettoyer et affiner les données d’entraînement à grande échelle constitue un défi majeur. Prenons, par exemple, la tâche consistant à entraîner un modèle multimodal à l’aide de vidéos YouTube. Compte tenu du volume considérable de données, certains clips peuvent contenir un son corrompu, un langage inapproprié ou du contenu non pertinent. Sans une curation rigoureuse des données, ces problèmes peuvent dégrader les performances et la fiabilité des modèles d’IA.
Une curation efficace des données implique de filtrer et d’analyser méticuleusement les jeux de données afin de garantir que seules des données appropriées et de haute qualité sont fournies aux modèles. Alex souligne que le principe « de très bonnes données donnent de très bons modèles » est particulièrement vrai dans l’IA générative. Pour les applications propres à un domaine, comme la détection de défauts de soudure dans les environnements industriels ou l’assistance en robotique chirurgicale, les données d’entraînement doivent être hautement pertinentes et refléter précisément les cas d’utilisation visés. Ce niveau de curation aide le modèle à gérer efficacement les cas limites et réduit le risque d’échec.
Lors de sa présentation, Alex a partagé des exemples illustrant l’importance de données bien curées. Dans un cas, un modèle de langage basé sur la vision (VLM) comme GPT-4 avec vision n’a pas réussi à déterminer si un bus scolaire dans une image était orienté vers l’avant ou vers l’arrière. Cet échec souligne à quel point même des modèles sophistiqués peinent sans données curées et de haute qualité, renforçant la nécessité d’une curation et d’un nettoyage complets des données afin d’améliorer la précision et les performances des modèles.
Figure : Les LLM basés sur la vision ont de mauvaises performances de modèle en raison de données d’entraînement bruitées
Curation des données pour l’affinage de modèles propres à un domaine
Maintenant que nous avons compris l’importance de la qualité des données pour les performances de l’IA, explorons un exemple montrant comment la curation des données joue un rôle essentiel dans l’affinage des modèles pour des domaines spécifiques.
LLaVA est un grand modèle de langage polyvalent développé par Meta AI, très performant dans la compréhension du langage humain. Cependant, son adaptation à des domaines plus spécialisés, tels que le domaine médical, nécessite des efforts ciblés de curation des données. Ce processus de fine-tuning a conduit à la création de LLaVA-Med, un assistant IA spécialisé pour les applications médicales.
Voici les étapes clés impliquées dans ce processus :
Figure : Fine-tuning d’un LLM avec des connaissances médicales
Alignement des concepts médicaux
La première étape de fine-tuning n’a utilisé que 4 % de l’ensemble de données disponible — 600 000 paires image-texte provenant de manuels et d’articles de recherche. Un temps et des efforts considérables ont été consacrés à la curation d’un ensemble de données bien équilibré afin d’aider le modèle à apprendre les concepts médicaux essentiels. Ce processus a combiné expertise humaine et techniques semi-automatisées, garantissant que les données organisées reflétaient fidèlement les nuances du domaine médical.
Ajustement des instructions médicales
Lors de la deuxième étape, le modèle a été affiné avec 60 000 paires question-réponse afin de lui apprendre à répondre aux requêtes médicales. Cette phase a permis au modèle de comprendre les prompts d’entrée, de récupérer les informations pertinentes et de générer des réponses précises fondées sur le contexte médical. L’accent mis sur l’ajustement des instructions a amélioré la capacité du modèle à fournir une assistance sensible au contexte dans des situations médicales réelles.
En constituant un ensemble de données plus petit et de haute qualité pour l’entraînement, l’équipe a pu affiner efficacement LLaVA-Med et obtenir des résultats précis, tout en réduisant les coûts d’entraînement. Cette étude de cas souligne l’importance de la curation des données dans le développement de grands modèles de langage (LLMs) spécifiques à un domaine. Elle met également en évidence la manière dont une curation méticuleuse et un fine-tuning ciblé peuvent transformer un modèle polyvalent en un outil spécialisé capable d’exceller dans les domaines médicaux.
Tendances émergentes en matière de qualité et de curation des données
Dans les pipelines de données traditionnels, les données collectées passaient généralement par une annotation manuelle ou une pré-annotation à l’aide de modèles avec supervision humaine. Ensuite, les données annotées étaient utilisées pour entraîner le modèle, qui était ensuite déployé. Bien que cette approche linéaire puisse fonctionner dans certains scénarios, elle montre ses limites dans les cas d’utilisation spécialisés, en particulier lorsqu’il s’agit de traiter de vastes quantités de données non structurées.
Pour relever ces défis, Alex souligne la nécessité de pipelines de données plus flexibles et plus robustes. Les pipelines modernes peuvent intégrer des étapes supplémentaires pour améliorer la curation des données. Une fois les données collectées et stockées dans un data warehouse, des outils externes peuvent être exploités pour les vérifier, les nettoyer et les organiser avant qu’elles ne passent à l’entraînement du modèle. Ces outils garantissent la qualité de l’étiquetage des données après annotation, une étape essentielle pour affiner l’ensemble de données.
Figure- Outils de curation et de validation des données dans les pipelines de données modernes
De plus, Alex souligne l’importance de mettre en place des pipelines de monitoring après le déploiement du modèle. Ces pipelines permettent une évaluation et une amélioration continues, garantissant que le modèle s’adapte aux nouvelles données et reste précis. En affinant le pipeline et en mettant en œuvre ces étapes supplémentaires, les entreprises peuvent améliorer la qualité de leurs données et les performances du modèle.
Défis courants dans la curation et le nettoyage des données
La curation et le nettoyage des données s’accompagnent d’une série de défis susceptibles de nuire à l’efficacité et à la précision des modèles d’IA :
Examen manuel des données : Examiner manuellement de grands ensembles de données — comme faire défiler des heures de séquences vidéo — est non seulement chronophage, mais aussi sujet aux erreurs.
Approches ad hoc : S’appuyer sur des solutions improvisées sans couche de persistance appropriée entraîne souvent des incohérences et des difficultés à gérer efficacement le processus de curation des données.
Problèmes de qualité des données : Les jeux de données contiennent fréquemment des doublons, des échantillons corrompus ou des informations bruitées, ce qui peut dégrader les performances du modèle.
Interactions intermodales : L’analyse des relations entre différentes modalités de données (par exemple, texte, images, vidéo) peut être complexe, nécessitant des outils et techniques sophistiqués pour garantir une représentation et une interaction précises des données.
Comment les organisations peuvent surmonter les défis de la curation des données
Alex partage les approches innovantes développées chez Encord pour relever les défis courants liés à la qualité des données, tels que les doublons, les données corrompues et les échantillons bruités :
- Approches basées sur les embeddings : Les données non structurées peuvent être converties en vector embeddings de grande dimension grâce à des modèles d’embedding et stockées dans une base de données vectorielle comme Milvus. Les organisations peuvent rapidement identifier les anomalies et les valeurs aberrantes en visualisant les embeddings dans un espace de faible dimension. Cette approche facilite la recherche, l’organisation et la curation des données non structurées.
Figure : Utilisation des embeddings pour visualiser les échantillons de données d’entraînement
Métriques de qualité des données : Des métriques comme le flou, la luminosité et la similarité des embeddings peuvent être utilisées pour évaluer la qualité des jeux de données d’images dans les tâches de vision par ordinateur, aidant à signaler et à corriger les problèmes avant l’entraînement du modèle.
NLP pour la curation des données : Le traitement du langage naturel peut filtrer et sélectionner uniquement les échantillons de données les plus pertinents pour l’entraînement ou les tests, réduisant le bruit et améliorant la précision du modèle.
Couches de persistance : La mise en œuvre d’une couche de persistance appropriée est cruciale pour gérer le processus de curation des données, permettant la capture et le stockage cohérents des résultats.
Déduplication des données : Les mesures de similarité basées sur les embeddings aident à identifier et à supprimer les échantillons en double, améliorant la qualité des données et réduisant les besoins de stockage. Cela aide également à trouver des points de données similaires pour l’augmentation.
Validation des métadonnées : Des outils automatisés valident les métadonnées afin de garantir l’intégrité des données et de détecter les échantillons corrompus. Encord propose des outils spécifiques conçus pour cette tâche, rationalisant le processus.
Nettoyage des données : Des techniques comme la détection des valeurs aberrantes, l’imputation et la normalisation peuvent traiter le bruit dans les jeux de données, garantissant que les données sont adaptées à l’entraînement de modèles hautement performants.
Avantages d’une curation et d’un nettoyage efficaces des données
Amélioration des performances du modèle : Des données de haute qualité conduisent à des modèles plus précis et plus fiables.
Réduction du temps d’entraînement : Des données propres et curées peuvent accélérer le processus d’entraînement.
Réduction des coûts : En évitant la nécessité d’une collecte et d’un étiquetage supplémentaires des données, les organisations peuvent économiser de l’argent.
Meilleure explicabilité du modèle : Des données bien curées peuvent améliorer l’interprétabilité des sorties du modèle.
Conclusion
Une curation efficace des données devient de plus en plus essentielle à mesure que les applications d’IA gagnent en complexité, en particulier celles qui traitent plusieurs types de données comme la vidéo et le texte. Dans la présentation d’Alex, nous acquérons une compréhension plus approfondie des différents défis associés à la curation des jeux de données d’images et de texte, ainsi que de la manière dont ces problèmes influencent directement les performances du modèle.
Des techniques telles que les embeddings vectoriels et l’interrogation basée sur le NLP offrent aux équipes des outils précieux pour mieux visualiser leurs données, identifier les échantillons mal étiquetés ou en double, et nettoyer les jeux de données plus efficacement avant l’entraînement du modèle. Pour garantir le succès, les équipes de data science doivent sélectionner les modèles d’embedding appropriés, adaptés à leurs types de données spécifiques — qu’il s’agisse d’embeddings d’images ou de texte — et exploiter des bases de données vectorielles comme Milvus afin de rationaliser les processus de stockage et de recherche des données.
En définitive, investir dans une curation de données de haute qualité améliore non seulement les performances des modèles, mais réduit également le risque d’erreurs et renforce l’efficacité globale des workflows d’IA.
Ressources supplémentaires
Continuer à lire

How to Choose the Best Embedding Model for RAG in 2026: 10 Models Benchmarked
We benchmarked 10 embedding models on cross-modal, cross-lingual, long-document, and dimension compression tasks. See which one fits your RAG pipeline.

Zilliz Cloud BYOC Now Available Across AWS, GCP, and Azure
Zilliz Cloud BYOC is now generally available on all three major clouds. Deploy fully managed vector search in your own AWS, GCP, or Azure account — your data never leaves your VPC.

Legal Document Analysis: Harnessing Zilliz Cloud's Semantic Search and RAG for Legal Insights
Enhance legal document analysis with Zilliz Cloud’s Semantic Search and RAG. Improve accuracy, efficiency, and scalability for contracts, case law, and compliance.



