Basura entra, basura sale: por qué una mala curación de datos está acabando con tus modelos de IA
En el mundo moderno, los datos se han vuelto tan valiosos como el petróleo. Si bien las empresas se han centrado tradicionalmente en recopilar enormes cantidades de datos para crear modelos y obtener información, el enfoque está cambiando hacia la calidad por encima de la cantidad. Muchas organizaciones ahora se dan cuenta de que contar con datos de alta calidad es más importante que simplemente acumular grandes conjuntos de datos. Sin embargo, este cambio revela un desafío significativo: muchas empresas tienen dificultades para comprender plenamente y seleccionar eficazmente sus datos existentes.
En el Unstructured Data Meetup organizado por Zilliz, Alexandre Bonnet, Lead ML Solutions Engineer en Encord, abordó este problema en su charla sobre los riesgos de una mala curación de datos y cómo las empresas pueden superar estos desafíos. Destacó la importancia de la calidad de los datos y las tendencias del mercado, presentando una hoja de ruta para ayudar a las organizaciones a establecer pipelines de producción de datos de alta calidad. En este blog, recapitularemos los puntos clave de Alexandre. También puedes ver su charla completa en YouTube.
El ponente Alexandre Bonnet de Encord hablando en el Unstructured Data Meetup de julio en SF
La evolución de la IA
Alex analiza el cambio de las aplicaciones tradicionales de IA a la IA generativa moderna en las empresas. Hace aproximadamente una década, los modelos de IA tenían que construirse desde cero para cada caso de uso, y normalmente se limitaban a manejar un solo tipo de datos (unimodales). Estos primeros modelos eran utilizados principalmente por equipos técnicos de científicos de datos e ingenieros. Sin embargo, el panorama actual de la IA ha evolucionado significativamente con modelos fundacionales como YOLO, GPT y Claude, que pueden ajustarse para dominios específicos con relativa facilidad. Además, las arquitecturas modernas pueden procesar múltiples tipos de datos (multimodales), lo que hace que la IA sea accesible incluso para usuarios generales que quizá no tengan una sólida formación técnica. Este cambio ha llevado a una adopción generalizada de la IA en diversas industrias, optimizando flujos de trabajo y procesos.
Figura- IA tradicional vs IA moderna
Alex señala: "La investigación en todos los frentes de la Inteligencia Artificial ha explotado en los últimos 10 años”. A pesar de los avances en áreas como los datos sintéticos y la IA generativa, el progreso en visión por computadora ha sido comparativamente más lento. Esto se debe en gran medida a las complejidades de comprender datos de imágenes no estructurados, lo que plantea desafíos únicos.
Figura: Desarrollos en diferentes espacios de la IA durante la última década
Alex destaca los tres pilares principales de la IA: Datos, Modelos y Cómputo. Si bien ha habido avances rápidos en las arquitecturas de modelos, como los transformers, los mecanismos de atención y los modelos de lenguaje grandes (LLMs) que pueden ajustarse para tareas específicas, también ha habido un progreso significativo en el hardware, particularmente con el desarrollo de GPU de alto rendimiento diseñadas para entrenar modelos complejos. Sin embargo, a pesar de estos avances en modelos y potencia de cómputo, la calidad de los datos sigue rezagada y permanece en sus primeras etapas de madurez.
Figura: Pilares de la IA
Por qué la calidad de los datos es importante para la IA
Los modelos basados en texto entrenados con conjuntos de datos ruidosos o sin limpiar a menudo generan resultados con errores lógicos o incluso caracteres sin sentido. Del mismo modo, se sabe que los modelos de imagen, como algunos basados en difusión, producen elementos visuales con artefactos inesperados, como marcas de agua. ¿La causa raíz? Mala curación de datos.
Figura: Limpieza de datos vs curación de datos
Para aclarar, curación de datos se refiere a organizar, gestionar y preparar datos para el etiquetado o el entrenamiento de modelos, asegurando que sean relevantes y estén estructurados para la tarea específica. Limpieza de datos se centra en identificar y corregir errores o inconsistencias en los datos, como eliminar duplicados, reparar muestras corruptas o abordar el ruido. Ambos procesos garantizan que solo se utilicen datos de alta calidad y confiables en el entrenamiento de modelos.
Limpiar y refinar datos de entrenamiento a gran escala es un gran desafío. Tomemos, por ejemplo, la tarea de entrenar un modelo multimodal usando videos de YouTube. Con el enorme volumen de datos, algunos clips pueden contener audio corrupto, lenguaje inapropiado o contenido irrelevante. Sin una curación de datos rigurosa, estos problemas pueden degradar el rendimiento y la fiabilidad de los modelos de IA.
La curación de datos efectiva implica filtrar y analizar meticulosamente los conjuntos de datos para garantizar que solo se introduzcan en los modelos datos de alta calidad y apropiados. Alex enfatiza que el principio "grandes datos equivalen a grandes modelos" es particularmente cierto en la IA generativa. Para aplicaciones específicas de dominio, como detectar defectos de soldadura en entornos industriales o ayudar en robótica quirúrgica, los datos de entrenamiento deben ser muy relevantes y reflejar con precisión los casos de uso previstos. Este nivel de curación ayuda al modelo a manejar casos límite de manera efectiva y reduce el riesgo de fallo.
Durante su presentación, Alex compartió ejemplos que ilustran la importancia de datos bien curados. En un caso, un modelo de lenguaje basado en visión (VLM) como GPT-4 con visión no logró identificar si un autobús escolar en una imagen estaba orientado hacia el frente o hacia atrás. Este fallo destaca cómo incluso los modelos sofisticados tienen dificultades sin datos curados de alta calidad, reforzando la necesidad de una curación y limpieza de datos integrales para mejorar la precisión y el rendimiento del modelo.
Figura: Los LLM basados en visión tienen un bajo rendimiento del modelo debido a datos de entrenamiento ruidosos
Curación de datos para el ajuste fino de modelos específicos de dominio
Ahora que hemos aprendido la importancia de la calidad de los datos para el rendimiento de la IA, exploremos un ejemplo que demuestra cómo la curación de datos desempeña un papel vital en el ajuste fino de modelos para dominios específicos.
LLaVA es un modelo de lenguaje grande de propósito general desarrollado por Meta AI que es altamente competente en la comprensión del lenguaje humano. Sin embargo, adaptarlo a campos más especializados, como el dominio médico, requiere esfuerzos específicos de curación de datos. Este proceso de ajuste fino llevó a la creación de LLaVA-Med, un asistente de IA especializado para aplicaciones médicas.
Estos son los pasos clave involucrados en este proceso:
Figura: Ajuste fino de LLM con conocimiento médico
Alineación de conceptos médicos
La primera etapa de ajuste fino utilizó solo el 4 % del conjunto de datos disponible: 600,000 pares imagen-texto provenientes de libros de texto y artículos de investigación. Se dedicó una cantidad considerable de tiempo y esfuerzo a curar un conjunto de datos bien equilibrado para ayudar al modelo a aprender conceptos médicos esenciales. Este proceso implicó una combinación de experiencia humana y técnicas semiautomatizadas, asegurando que los datos curados reflejaran con precisión los matices del dominio médico.
Ajuste de instrucciones médicas
En la segunda etapa, el modelo se ajustó finamente con 60,000 pares de preguntas y respuestas para ayudarlo a aprender cómo responder a consultas médicas. Esta fase permitió al modelo comprender las indicaciones de entrada, recuperar información relevante y generar respuestas precisas basadas en el contexto médico. El enfoque en el ajuste de instrucciones mejoró la capacidad del modelo para proporcionar asistencia consciente del contexto en situaciones médicas del mundo real.
Al curar un conjunto de datos más pequeño y de alta calidad para el entrenamiento, el equipo pudo ajustar finamente LLaVA-Med de manera eficiente y lograr resultados precisos, todo mientras reducía los costos de entrenamiento. Este caso de estudio subraya la importancia de la curación de datos en el desarrollo de modelos de lenguaje grandes (LLMs) específicos de dominio. También destaca cómo una curación meticulosa y un ajuste fino dirigido pueden transformar un modelo de propósito general en una herramienta especializada capaz de destacar en campos médicos.
Tendencias emergentes en calidad y curación de datos
En los pipelines de datos tradicionales, los datos recopilados normalmente se sometían a anotación manual o preanotación utilizando modelos con supervisión humana. Después, los datos anotados se usaban para entrenar el modelo, que luego se implementaba. Si bien este enfoque lineal puede funcionar para algunos escenarios, se queda corto en casos de uso especializados, especialmente cuando se trata de grandes cantidades de datos no estructurados.
Para abordar estos desafíos, Alex enfatiza la necesidad de pipelines de datos más flexibles y robustos. Los pipelines modernos pueden incorporar etapas adicionales para una curación de datos mejorada. Una vez que los datos se recopilan y almacenan en un almacén de datos, se pueden aprovechar herramientas externas para verificarlos, limpiarlos y curarlos antes de que pasen al entrenamiento del modelo. Estas herramientas aseguran la calidad del etiquetado de datos después de la anotación, un paso crítico para refinar el conjunto de datos.
Figura- Herramientas de curación y validación de datos en pipelines de datos modernos
Además, Alex destaca la importancia de establecer pipelines de monitoreo después de la implementación del modelo. Estos pipelines permiten una evaluación y mejora continuas, asegurando que el modelo se adapte a nuevos datos y siga siendo preciso. Al refinar el pipeline e implementar estos pasos adicionales, las empresas pueden mejorar la calidad de sus datos y mejorar el rendimiento del modelo.
Desafíos comunes en la curación y limpieza de datos
La curación y limpieza de datos conllevan una serie de desafíos que pueden obstaculizar la eficiencia y precisión de los modelos de IA:
Revisión manual de datos: Revisar manualmente grandes conjuntos de datos, como desplazarse por horas de material de video, no solo consume mucho tiempo, sino que también es propenso a errores.
Enfoques ad hoc: Depender de soluciones improvisadas sin una capa de persistencia adecuada a menudo conduce a inconsistencias y dificultades para gestionar eficazmente el proceso de curación de datos.
Problemas de calidad de datos: Los conjuntos de datos con frecuencia contienen duplicados, muestras corruptas o información ruidosa, lo que puede degradar el rendimiento del modelo.
Interacciones multimodales: Analizar las relaciones entre diferentes modalidades de datos (p. ej., texto, imágenes, video) puede ser complejo, y requiere herramientas y técnicas sofisticadas para garantizar una representación e interacción de datos precisas.
Cómo las organizaciones pueden superar los desafíos de curación de datos
Alex comparte los enfoques innovadores desarrollados en Encord para abordar desafíos comunes de calidad de datos, como duplicados, datos corruptos y muestras ruidosas:
- Enfoques basados en embeddings: Los datos no estructurados pueden convertirse en embeddings vectoriales de alta dimensionalidad mediante modelos de embedding y almacenarse en una base de datos vectorial como Milvus. Las organizaciones pueden identificar rápidamente anomalías y valores atípicos visualizando embeddings en un espacio de baja dimensionalidad. Este enfoque facilita la búsqueda, organización y curación de datos no estructurados.
Figura: Uso de embeddings para visualizar muestras de datos de entrenamiento
Métricas de calidad de datos: Métricas como el desenfoque, el brillo y la similitud de embeddings pueden usarse para evaluar la calidad de conjuntos de datos de imágenes en tareas de visión por computadora, ayudando a marcar y corregir problemas antes del entrenamiento del modelo.
NLP para la curación de datos: El procesamiento del lenguaje natural puede filtrar y seleccionar solo las muestras de datos más relevantes para el entrenamiento o las pruebas, reduciendo el ruido y mejorando la precisión del modelo.
Capas de persistencia: Implementar una capa de persistencia adecuada es crucial para gestionar el proceso de curación de datos, lo que permite la captura y el almacenamiento consistentes de los resultados.
Deduplicación de datos: Las mediciones de similitud basadas en embeddings ayudan a identificar y eliminar muestras duplicadas, mejorando la calidad de los datos y reduciendo las necesidades de almacenamiento. Esto también ayuda a encontrar puntos de datos similares para la aumentación.
Validación de metadatos: Las herramientas automatizadas validan metadatos para garantizar la integridad de los datos y detectar muestras corruptas. Encord ofrece herramientas específicas diseñadas para esta tarea, agilizando el proceso.
Limpieza de datos: Técnicas como la detección de valores atípicos, la imputación y la normalización pueden abordar el ruido en los conjuntos de datos, garantizando que los datos sean adecuados para entrenar modelos de alto rendimiento.
Beneficios de una curación y limpieza de datos efectivas
Mejor rendimiento del modelo: Los datos de alta calidad conducen a modelos más precisos y fiables.
Menor tiempo de entrenamiento: Los datos limpios y curados pueden acelerar el proceso de entrenamiento.
Costos más bajos: Al evitar la necesidad de recopilar y etiquetar datos adicionales, las organizaciones pueden ahorrar dinero.
Mayor explicabilidad del modelo: Los datos bien curados pueden mejorar la interpretabilidad de los resultados del modelo.
Conclusión
La curación de datos efectiva se vuelve cada vez más crítica a medida que las aplicaciones de IA se vuelven más complejas, en particular aquellas que manejan múltiples tipos de datos como video y texto. En la charla de Alex, obtenemos una comprensión más profunda de los diversos desafíos asociados con la curación de conjuntos de datos de imágenes y texto, y de cómo estos problemas impactan directamente en el rendimiento del modelo.
Técnicas como los embeddings vectoriales y las consultas basadas en NLP ofrecen herramientas valiosas para que los equipos visualicen mejor sus datos, identifiquen muestras mal etiquetadas o duplicadas y limpien conjuntos de datos de manera más eficiente antes del entrenamiento del modelo. Para garantizar el éxito, los equipos de ciencia de datos deben seleccionar los modelos de embedding apropiados adaptados a sus tipos de datos específicos —ya sean embeddings de imagen o texto— y aprovechar bases de datos vectoriales como Milvus para agilizar los procesos de almacenamiento y búsqueda de datos.
En última instancia, invertir en una curación de datos de alta calidad no solo mejora el rendimiento del modelo, sino que también reduce el riesgo de errores y aumenta la eficiencia general de los flujos de trabajo de IA.
Recursos adicionales
Sigue leyendo

Zilliz Cloud Now Available in AWS Europe (Ireland)
Zilliz Cloud launches in AWS eu-west-1 (Ireland) — bringing low-latency vector search, EU data residency, and full GDPR-ready infrastructure to European AI teams. Now live across 30 regions on five cloud providers.

Announcing VDBBench 1.0: Open-Source VectorDB Benchmarking with Your Real-World Production Workloads
Discover VDBBench 1.0, an open-source tool for benchmarking vector databases with real-world production data, streaming ingestion, and concurrent workloads.

Zilliz Cloud Introduces Advanced BYOC-I Solution for Ultimate Enterprise Data Sovereignty
Explore Zilliz Cloud BYOC-I, the solution that balances AI innovation with data control, enabling secure deployments in finance, healthcare, and education sectors.



