Garbage In, Garbage Out: Warum schlechte Datenkuratierung Ihre KI-Modelle zerstört
In der modernen Welt sind Daten so wertvoll geworden wie Öl. Während Unternehmen sich traditionell darauf konzentriert haben, riesige Datenmengen zu sammeln, um Modelle zu erstellen und Erkenntnisse zu gewinnen, verlagert sich der Fokus von Quantität auf Qualität. Viele Organisationen erkennen inzwischen, dass hochwertige Daten wichtiger sind als das bloße Anhäufen großer Datensätze. Dieser Wandel offenbart jedoch eine erhebliche Herausforderung: Viele Unternehmen haben Schwierigkeiten, ihre vorhandenen Daten vollständig zu verstehen und effektiv zu kuratieren.
Beim von Zilliz veranstalteten Unstructured Data Meetup sprach Alexandre Bonnet, Lead ML Solutions Engineer bei Encord, in seinem Vortrag über die Fallstricke schlechter Datenkuratierung und darüber, wie Unternehmen diese Herausforderungen bewältigen können. Er betonte die Bedeutung von Datenqualität und Markttrends und stellte eine Roadmap vor, die Organisationen dabei helfen soll, Produktionspipelines für hochwertige Daten aufzubauen. In diesem Blog fassen wir Alexandres wichtigste Punkte zusammen. Sie können sich auch seinen vollständigen Vortrag auf YouTube ansehen.
Sprecher Alexandre Bonnet von Encord beim Vortrag auf dem Unstructured Data Meetup im Juli in SF
Die Entwicklung der KI
Alex erläutert den Wandel von traditionellen KI-Anwendungen hin zu moderner generativer KI in Unternehmen. Vor etwa einem Jahrzehnt mussten KI-Modelle für jeden Anwendungsfall von Grund auf neu erstellt werden, und sie waren typischerweise darauf beschränkt, nur eine Art von Daten zu verarbeiten (unimodal). Diese frühen Modelle wurden hauptsächlich von technischen Teams aus Data Scientists und Ingenieuren genutzt. Die heutige KI-Landschaft hat sich jedoch durch Foundation Models wie YOLO, GPT und Claude erheblich weiterentwickelt, die sich mit relativer Leichtigkeit für spezifische Domänen feinabstimmen lassen. Darüber hinaus können moderne Architekturen mehrere Datentypen verarbeiten (multimodal), wodurch KI sogar für allgemeine Nutzer zugänglich wird, die möglicherweise keinen tiefen technischen Hintergrund haben. Dieser Wandel hat zu einer breiten Einführung von KI in verschiedenen Branchen geführt und Arbeitsabläufe sowie Prozesse optimiert.
Abbildung – Traditionelle KI vs. moderne KI
Alex weist darauf hin: „Die Forschung in allen Bereichen der Künstlichen Intelligenz ist in den letzten 10 Jahren explodiert.“ Trotz Fortschritten in Bereichen wie synthetischen Daten und generativer KI verlief der Fortschritt im Bereich Computer Vision vergleichsweise langsamer. Dies ist größtenteils auf die Komplexität des Verständnisses unstrukturierter Bilddaten zurückzuführen, die einzigartige Herausforderungen mit sich bringen.
Abbildung: Entwicklungen in verschiedenen Bereichen der KI im vergangenen Jahrzehnt
Alex hebt die drei Hauptsäulen der KI hervor: Daten, Modelle und Compute. Während es rasante Fortschritte bei Modellarchitekturen gegeben hat—wie etwa Transformers, Attention-Mechanismen und Large Language Models (LLMs), die für bestimmte Aufgaben feinabgestimmt werden können—gab es auch erhebliche Fortschritte bei der Hardware, insbesondere durch die Entwicklung leistungsstarker GPUs, die für das Training komplexer Modelle ausgelegt sind. Trotz dieser Fortschritte bei Modellen und Rechenleistung hinkt die Datenqualität jedoch weiterhin hinterher und befindet sich nach wie vor in einem frühen Reifestadium.
Abbildung: Säulen der KI
Warum Datenqualität für KI wichtig ist
Textbasierte Modelle, die auf verrauschten oder unbereinigten Datensätzen trainiert wurden, erzeugen häufig Ausgaben mit logischen Fehlern oder sogar unsinnigen Zeichen. Ebenso ist bekannt, dass Bildmodelle, wie einige diffusionsbasierte Modelle, Visualisierungen mit unerwarteten Artefakten wie Wasserzeichen erzeugen. Die Ursache? Schlechte Datenkuratierung.
Abbildung: Datenbereinigung vs. Datenkuratierung
Zur Klarstellung: Datenkuratierung bezieht sich auf das Organisieren, Verwalten und Vorbereiten von Daten für die Kennzeichnung oder das Modelltraining, wobei sichergestellt wird, dass sie für die spezifische Aufgabe relevant und strukturiert sind. Datenbereinigung konzentriert sich darauf, Fehler oder Inkonsistenzen in den Daten zu identifizieren und zu korrigieren, beispielsweise durch das Entfernen von Duplikaten, das Beheben beschädigter Stichproben oder das Beseitigen von Rauschen. Beide Prozesse stellen sicher, dass beim Modelltraining nur hochwertige, zuverlässige Daten verwendet werden.
Das Bereinigen und Verfeinern von Trainingsdaten im großen Maßstab ist eine große Herausforderung. Nehmen wir zum Beispiel die Aufgabe, ein multimodales Modell mithilfe von YouTube-Videos zu trainieren. Angesichts der schieren Datenmenge können einige Clips beschädigtes Audio, unangemessene Sprache oder irrelevante Inhalte enthalten. Ohne rigorose Datenkuratierung können diese Probleme die Leistung und Zuverlässigkeit der KI-Modelle beeinträchtigen.
Eine effektive Datenkuratierung umfasst das sorgfältige Filtern und Analysieren von Datensätzen, um sicherzustellen, dass nur hochwertige, geeignete Daten in die Modelle eingespeist werden. Alex betont, dass der Grundsatz „großartige Daten bedeuten großartige Modelle“ insbesondere in der generativen KI zutrifft. Für domänenspezifische Anwendungen, wie etwa die Erkennung von Schweißfehlern in industriellen Umgebungen oder die Unterstützung in der chirurgischen Robotik, müssen die Trainingsdaten hochrelevant sein und die beabsichtigten Anwendungsfälle präzise widerspiegeln. Dieses Maß an Kuratierung hilft dem Modell, Grenzfälle effektiv zu bewältigen, und reduziert das Ausfallrisiko.
Während seiner Präsentation teilte Alex Beispiele, die die Bedeutung gut kuratierter Daten veranschaulichten. In einem Fall konnte ein vision-basiertes Sprachmodell (VLM) wie GPT-4 mit Vision nicht erkennen, ob ein Schulbus in einem Bild nach vorne oder nach hinten zeigte. Dieses Versagen verdeutlicht, wie selbst ausgefeilte Modelle ohne hochwertige, kuratierte Daten Schwierigkeiten haben, und unterstreicht die Notwendigkeit umfassender Datenkuratierung und -bereinigung, um Modellgenauigkeit und Leistung zu verbessern.
Abbildung: Vision-basierte LLMs haben aufgrund verrauschter Trainingsdaten eine schlechte Modellleistung
Datenkuratierung für domänenspezifisches Modell-Fine-Tuning
Nachdem wir nun die Bedeutung der Datenqualität für die KI-Leistung kennengelernt haben, sehen wir uns ein Beispiel an, das zeigt, wie Datenkuratierung eine entscheidende Rolle beim Fine-Tuning von Modellen für bestimmte Domänen spielt.
LLaVA ist ein universelles großes Sprachmodell, das von Meta AI entwickelt wurde und äußerst leistungsfähig beim Verständnis menschlicher Sprache ist. Die Anpassung an spezialisiertere Bereiche, wie etwa den medizinischen Bereich, erfordert jedoch gezielte Maßnahmen zur Datenkuratierung. Dieser Fine-Tuning-Prozess führte zur Entwicklung von LLaVA-Med, einem spezialisierten KI-Assistenten für medizinische Anwendungen.
Hier sind die wichtigsten Schritte dieses Prozesses:
Abbildung: Fine-Tuning eines LLM mit medizinischem Wissen
Ausrichtung medizinischer Konzepte
In der ersten Fine-Tuning-Phase wurden nur 4 % des verfügbaren Datensatzes verwendet—600.000 Bild-Text-Paare aus Lehrbüchern und Forschungsarbeiten. Erhebliche Zeit und Mühe flossen in die Kuratierung eines ausgewogenen Datensatzes, um dem Modell dabei zu helfen, grundlegende medizinische Konzepte zu erlernen. Dieser Prozess umfasste eine Kombination aus menschlicher Expertise und halbautomatisierten Techniken, wodurch sichergestellt wurde, dass die kuratierten Daten die Nuancen des medizinischen Bereichs genau widerspiegelten.
Tuning medizinischer Anweisungen
In der zweiten Phase wurde das Modell mit 60.000 Frage-Antwort-Paaren feinabgestimmt, um zu lernen, wie es auf medizinische Anfragen reagieren soll. Diese Phase ermöglichte es dem Modell, Eingabeaufforderungen zu verstehen, relevante Informationen abzurufen und präzise Antworten auf Grundlage des medizinischen Kontexts zu generieren. Der Fokus auf Instruction Tuning verbesserte die Fähigkeit des Modells, in realen medizinischen Situationen kontextbewusste Unterstützung zu leisten.
Durch die Kuratierung eines kleineren, hochwertigen Datensatzes für das Training konnte das Team LLaVA-Med effizient feinabstimmen und genaue Ergebnisse erzielen—und dabei gleichzeitig die Trainingskosten senken. Diese Fallstudie unterstreicht die Bedeutung der Datenkuratierung bei der Entwicklung domänenspezifischer großer Sprachmodelle (LLMs). Sie zeigt außerdem, wie sorgfältige Kuratierung und gezieltes Fine-Tuning ein universelles Modell in ein spezialisiertes Werkzeug verwandeln können, das in medizinischen Bereichen glänzen kann.
Sich entwickelnde Trends bei Datenqualität & Kuratierung
In traditionellen Datenpipelines würden gesammelte Daten typischerweise manuell annotiert oder mithilfe von Modellen unter menschlicher Aufsicht vorannotiert. Anschließend würden die annotierten Daten zum Trainieren des Modells verwendet, das danach bereitgestellt würde. Während dieser lineare Ansatz in einigen Szenarien funktionieren mag, stößt er bei spezialisierten Anwendungsfällen an seine Grenzen, insbesondere beim Umgang mit großen Mengen unstrukturierter Daten.
Um diese Herausforderungen zu bewältigen, betont Alex die Notwendigkeit flexiblerer und robusterer Datenpipelines. Moderne Pipelines können zusätzliche Stufen für eine verbesserte Datenkuratierung integrieren. Sobald Daten gesammelt und in einem Data Warehouse gespeichert sind, können externe Tools genutzt werden, um sie zu überprüfen, zu bereinigen und zu kuratieren, bevor sie in das Modelltraining übergehen. Diese Tools stellen die Qualität der Datenkennzeichnung nach der Annotation sicher, ein entscheidender Schritt zur Verfeinerung des Datensatzes.
Abbildung- Tools zur Datenkuratierung & Validierung in modernen Datenpipelines
Darüber hinaus hebt Alex die Bedeutung der Einrichtung von Monitoring-Pipelines nach der Modellbereitstellung hervor. Diese Pipelines ermöglichen eine kontinuierliche Bewertung und Verbesserung und stellen sicher, dass sich das Modell an neue Daten anpasst und genau bleibt. Durch die Verfeinerung der Pipeline und die Implementierung dieser zusätzlichen Schritte können Unternehmen die Qualität ihrer Daten verbessern und die Modellleistung steigern.
Häufige Herausforderungen bei Datenkuratierung und -bereinigung
Datenkuratierung und -bereinigung bringen eine Reihe von Herausforderungen mit sich, die die Effizienz und Genauigkeit von KI-Modellen beeinträchtigen können:
Manuelle Datenprüfung: Das manuelle Überprüfen großer Datensätze—wie etwa das Durchsehen von stundenlangem Videomaterial—ist nicht nur zeitaufwendig, sondern auch fehleranfällig.
Ad-Hoc-Ansätze: Sich auf provisorische Lösungen ohne eine geeignete Persistenzschicht zu verlassen, führt häufig zu Inkonsistenzen und Schwierigkeiten, den Datenkuratierungsprozess effektiv zu verwalten.
Probleme mit der Datenqualität: Datensätze enthalten häufig Duplikate, beschädigte Beispiele oder verrauschte Informationen, was die Modellleistung beeinträchtigen kann.
Modalitätsübergreifende Interaktionen: Die Analyse der Beziehungen zwischen verschiedenen Datenmodalitäten (z. B. Text, Bilder, Video) kann komplex sein und erfordert ausgefeilte Tools und Techniken, um eine genaue Datendarstellung und Interaktion sicherzustellen.
Wie Organisationen Herausforderungen bei der Datenkuratierung bewältigen können
Alex stellt die innovativen Ansätze vor, die bei Encord entwickelt wurden, um häufige Herausforderungen der Datenqualität wie Duplikate, beschädigte Daten und verrauschte Beispiele zu bewältigen:
- Embedding-basierte Ansätze: Unstrukturierte Daten können mithilfe von Embedding-Modellen in hochdimensionale Vektor-Embeddings umgewandelt und in einer Vektordatenbank wie Milvus gespeichert werden. Organisationen können Anomalien und Ausreißer schnell identifizieren, indem sie Embeddings in einem niedrigdimensionalen Raum visualisieren. Dieser Ansatz erleichtert die Suche, Organisation und Kuratierung unstrukturierter Daten.
Abbildung: Verwendung von Embeddings zur Visualisierung von Trainingsdatenbeispielen
Datenqualitätsmetriken: Metriken wie Unschärfe, Helligkeit und Embedding-Ähnlichkeit können verwendet werden, um die Qualität von Bilddatensätzen bei Computer-Vision-Aufgaben zu bewerten und dabei zu helfen, Probleme vor dem Modelltraining zu kennzeichnen und zu beheben.
NLP für die Datenkuratierung: Verarbeitung natürlicher Sprache kann nur die relevantesten Datenbeispiele für Training oder Tests filtern und auswählen, wodurch Rauschen reduziert und die Modellgenauigkeit verbessert wird.
Persistenzschichten: Die Implementierung einer geeigneten Persistenzschicht ist entscheidend für die Verwaltung des Datenkuratierungsprozesses, da sie die konsistente Erfassung und Speicherung von Ergebnissen ermöglicht.
Datendeduplizierung: Embedding-basierte Ähnlichkeitsmessungen helfen dabei, doppelte Beispiele zu identifizieren und zu entfernen, wodurch die Datenqualität verbessert und der Speicherbedarf reduziert wird. Dies unterstützt auch das Auffinden ähnlicher Datenpunkte für die Augmentierung.
Metadatenvalidierung: Automatisierte Tools validieren Metadaten, um die Datenintegrität sicherzustellen und beschädigte Beispiele zu erkennen. Encord bietet spezielle Tools für diese Aufgabe an, die den Prozess optimieren.
Datenbereinigung: Techniken wie Ausreißererkennung, Imputation und Normalisierung können Rauschen in Datensätzen beheben und sicherstellen, dass die Daten für das Training leistungsstarker Modelle geeignet sind.
Vorteile effektiver Datenkuratierung und -bereinigung
Verbesserte Modellleistung: Hochwertige Daten führen zu genaueren und zuverlässigeren Modellen.
Reduzierte Trainingszeit: Saubere und kuratierte Daten können den Trainingsprozess beschleunigen.
Geringere Kosten: Durch die Vermeidung zusätzlicher Datenerfassung und -kennzeichnung können Organisationen Geld sparen.
Verbesserte Erklärbarkeit von Modellen: Gut kuratierte Daten können die Interpretierbarkeit von Modellausgaben verbessern.
Fazit
Effektive Datenkuratierung wird zunehmend wichtiger, da KI-Anwendungen komplexer werden, insbesondere solche, die mehrere Datentypen wie Video und Text verarbeiten. In Alex’ Vortrag gewinnen wir ein tieferes Verständnis der verschiedenen Herausforderungen, die mit der Kuratierung von Bild- und Textdatensätzen verbunden sind, und dafür, wie sich diese Probleme direkt auf die Modellleistung auswirken.
Techniken wie Vektor-Embeddings und NLP-basiertes Abfragen bieten Teams wertvolle Werkzeuge, um ihre Daten besser zu visualisieren, falsch gekennzeichnete oder doppelte Beispiele zu identifizieren und Datensätze vor dem Modelltraining effizienter zu bereinigen. Um den Erfolg sicherzustellen, müssen Data-Science-Teams die geeigneten Embedding-Modelle auswählen, die auf ihre spezifischen Datentypen zugeschnitten sind—ob es sich um Bild- oder Text-Embeddings handelt—und Vektordatenbanken wie Milvus nutzen, um Datenspeicherungs- und Suchprozesse zu optimieren.
Letztendlich verbessert die Investition in hochwertige Datenkuratierung nicht nur die Modellleistung, sondern verringert auch das Fehlerrisiko und steigert die Gesamteffizienz von KI-Workflows.
Weitere Ressourcen
Weiterlesen

Introducing Functions and Model Inference on Zilliz Cloud: Automatic Embedding and Reranking with Hosted Models
Zilliz Cloud Functions auto-generate embeddings via OpenAI, Voyage AI, Cohere, or Zilliz Hosted Models. Built-in reranking — just insert text and search.

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.



