Entra lixo, sai lixo: por que a curadoria de dados ruim está matando seus modelos de IA
No mundo moderno, os dados se tornaram tão valiosos quanto o petróleo. Embora as empresas tradicionalmente tenham se concentrado em coletar grandes quantidades de dados para criar modelos e obter insights, o foco está mudando para qualidade em vez de quantidade. Muitas organizações agora percebem que ter dados de alta qualidade é mais importante do que simplesmente acumular grandes conjuntos de dados. No entanto, essa mudança revela um desafio significativo: muitas empresas têm dificuldade em compreender plenamente e curar seus dados existentes de forma eficaz.
No Unstructured Data Meetup organizado pela Zilliz, Alexandre Bonnet, Lead ML Solutions Engineer na Encord, abordou essa questão em sua palestra sobre as armadilhas da má curadoria de dados e como as empresas podem superar esses desafios. Ele destacou a importância da qualidade dos dados e das tendências de mercado, apresentando um roteiro para ajudar as organizações a estabelecer pipelines de produção de dados de alta qualidade. Neste blog, recapitularemos os principais pontos de Alexandre. Você também pode assistir à palestra completa dele no YouTube.
Palestrante Alexandre Bonnet da Encord falando no Unstructured Data Meetup de julho em SF
A evolução da IA
Alex discute a mudança das aplicações tradicionais de IA para a IA generativa moderna nas empresas. Cerca de uma década atrás, os modelos de IA precisavam ser criados do zero para cada caso de uso, e normalmente eram limitados a lidar com apenas um tipo de dado (unimodal). Esses primeiros modelos eram usados principalmente por equipes técnicas de cientistas de dados e engenheiros. No entanto, o cenário atual da IA evoluiu significativamente com modelos fundacionais como YOLO, GPT e Claude, que podem ser ajustados para domínios específicos com relativa facilidade. Além disso, arquiteturas modernas podem processar múltiplos tipos de dados (multimodal), tornando a IA acessível até mesmo para usuários gerais que talvez não tenham um profundo conhecimento técnico. Essa mudança levou à ampla adoção da IA em vários setores, simplificando fluxos de trabalho e processos.
Figura- IA tradicional vs IA moderna
Alex destaca: "A pesquisa em todas as frentes da Inteligência Artificial tem explodido nos últimos 10 anos.” Apesar dos avanços em áreas como dados sintéticos e IA generativa, o progresso em visão computacional tem sido comparativamente mais lento. Isso se deve em grande parte às complexidades de compreender dados de imagem não estruturados, o que apresenta desafios únicos.
Figura: Desenvolvimentos em diferentes áreas da IA ao longo da última década
Alex destaca os três principais pilares da IA: Dados, Modelos e Computação. Embora tenha havido avanços rápidos nas arquiteturas de modelos—como transformers, mecanismos de atenção e grandes modelos de linguagem (LLMs) que podem ser ajustados para tarefas específicas—também houve progresso significativo em hardware, especialmente com o desenvolvimento de GPUs de alto desempenho projetadas para treinar modelos complexos. No entanto, apesar desses avanços em modelos e poder computacional, a qualidade dos dados continua ficando para trás, permanecendo em seus estágios iniciais de maturidade.
Figura: Pilares da IA
Por que a qualidade dos dados importa para a IA
Modelos baseados em texto treinados em conjuntos de dados ruidosos ou não limpos frequentemente geram saídas com erros lógicos ou até mesmo caracteres sem sentido. Da mesma forma, modelos de imagem, como alguns baseados em difusão, são conhecidos por produzir visuais com artefatos inesperados, como marcas d'água. A causa raiz? Má curadoria de dados.
Figura: Limpeza de dados vs curadoria de dados
Para esclarecer, curadoria de dados refere-se à organização, gestão e preparação de dados para rotulagem ou treinamento de modelos, garantindo que sejam relevantes e estruturados para a tarefa específica. Limpeza de dados concentra-se em identificar e corrigir erros ou inconsistências nos dados, como remover duplicatas, corrigir amostras corrompidas ou lidar com ruído. Ambos os processos garantem que apenas dados de alta qualidade e confiáveis sejam usados no treinamento de modelos.
Limpar e refinar dados de treinamento em escala é um grande desafio. Tome, por exemplo, a tarefa de treinar um modelo multimodal usando vídeos do YouTube. Com o enorme volume de dados, alguns clipes podem conter áudio corrompido, linguagem inadequada ou conteúdo irrelevante. Sem uma curadoria de dados rigorosa, esses problemas podem degradar o desempenho e a confiabilidade dos modelos de IA.
A curadoria de dados eficaz envolve filtrar e analisar meticulosamente conjuntos de dados para garantir que apenas dados apropriados e de alta qualidade sejam alimentados nos modelos. Alex enfatiza que o princípio "ótimos dados equivalem a ótimos modelos" é particularmente verdadeiro na IA generativa. Para aplicações específicas de domínio, como detectar defeitos de solda em ambientes industriais ou auxiliar em robótica cirúrgica, os dados de treinamento devem ser altamente relevantes e refletir precisamente os casos de uso pretendidos. Esse nível de curadoria ajuda o modelo a lidar efetivamente com casos extremos e reduz o risco de falha.
Durante sua apresentação, Alex compartilhou exemplos que ilustram a importância de dados bem curados. Em um caso, um modelo de linguagem baseado em visão (VLM) como o GPT-4 com visão falhou em identificar se um ônibus escolar em uma imagem estava voltado para a frente ou para trás. Essa falha destaca como até mesmo modelos sofisticados têm dificuldades sem dados curados e de alta qualidade, reforçando a necessidade de curadoria e limpeza de dados abrangentes para melhorar a precisão e o desempenho do modelo.
Figura: LLMs baseados em visão têm baixo desempenho de modelo devido a dados de treinamento ruidosos
Curadoria de dados para ajuste fino de modelos específicos de domínio
Agora que aprendemos a importância da qualidade dos dados para o desempenho da IA, vamos explorar um exemplo que demonstra como a curadoria de dados desempenha um papel vital no ajuste fino de modelos para domínios específicos.
LLaVA é um modelo de linguagem de grande porte de uso geral desenvolvido pela Meta AI que é altamente proficiente em compreender a linguagem humana. No entanto, adaptá-lo a campos mais especializados, como o domínio médico, requer esforços direcionados de curadoria de dados. Esse processo de ajuste fino levou à criação do LLaVA-Med, um assistente de IA especializado para aplicações médicas.
Aqui estão as principais etapas envolvidas nesse processo:
Figura: Ajuste fino de LLM com conhecimento médico
Alinhamento de Conceitos Médicos
A primeira etapa de ajuste fino usou apenas 4% do conjunto de dados disponível—600.000 pares imagem-texto provenientes de livros didáticos e artigos de pesquisa. Considerável tempo e esforço foram dedicados à curadoria de um conjunto de dados bem equilibrado para ajudar o modelo a aprender conceitos médicos essenciais. Esse processo envolveu uma combinação de conhecimento especializado humano e técnicas semiautomatizadas, garantindo que os dados curados refletissem com precisão as nuances do domínio médico.
Ajuste de Instruções Médicas
Na segunda etapa, o modelo foi ajustado com 60.000 pares de perguntas e respostas para ajudá-lo a aprender como responder a consultas médicas. Essa fase permitiu que o modelo entendesse prompts de entrada, recuperasse informações relevantes e gerasse respostas precisas com base no contexto médico. O foco no ajuste de instruções melhorou a capacidade do modelo de fornecer assistência sensível ao contexto em situações médicas do mundo real.
Ao fazer a curadoria de um conjunto de dados menor e de alta qualidade para treinamento, a equipe conseguiu ajustar o LLaVA-Med de forma eficiente e obter resultados precisos—tudo isso enquanto reduzia os custos de treinamento. Este estudo de caso ressalta a importância da curadoria de dados no desenvolvimento de modelos de linguagem de grande porte (LLMs) específicos de domínio. Ele também destaca como uma curadoria meticulosa e um ajuste fino direcionado podem transformar um modelo de uso geral em uma ferramenta especializada capaz de se destacar em campos médicos.
Tendências em Evolução na Qualidade & Curadoria de Dados
Em pipelines de dados tradicionais, os dados coletados normalmente passariam por anotação manual ou pré-anotação usando modelos com supervisão humana. Depois disso, os dados anotados seriam usados para treinar o modelo, que então seria implantado. Embora essa abordagem linear possa funcionar para alguns cenários, ela fica aquém em casos de uso especializados, especialmente ao lidar com grandes volumes de dados não estruturados.
Para enfrentar esses desafios, Alex enfatiza a necessidade de pipelines de dados mais flexíveis e robustos. Pipelines modernos podem incorporar etapas adicionais para uma curadoria de dados aprimorada. Uma vez que os dados são coletados e armazenados em um data warehouse, ferramentas externas podem ser aproveitadas para verificá-los, limpá-los e curá-los antes que prossigam para o treinamento do modelo. Essas ferramentas garantem a qualidade da rotulagem de dados após a anotação, uma etapa crítica para refinar o conjunto de dados.
Figura- Ferramentas de Curadoria & Validação de Dados em pipelines de dados modernos
Além disso, Alex destaca a importância de configurar pipelines de monitoramento após a implantação do modelo. Esses pipelines permitem avaliação e melhoria contínuas, garantindo que o modelo se adapte a novos dados e permaneça preciso. Ao refinar o pipeline e implementar essas etapas adicionais, as empresas podem melhorar a qualidade de seus dados e aprimorar o desempenho do modelo.
Desafios Comuns na Curadoria e Limpeza de Dados
A curadoria e a limpeza de dados vêm com uma série de desafios que podem prejudicar a eficiência e a precisão dos modelos de IA:
Revisão Manual de Dados: Revisar manualmente grandes conjuntos de dados—como rolar por horas de filmagens em vídeo—não é apenas demorado, mas também propenso a erros.
Abordagens Ad-Hoc: Depender de soluções improvisadas sem uma camada de persistência adequada frequentemente leva a inconsistências e dificuldades para gerenciar o processo de curadoria de dados de forma eficaz.
Problemas de qualidade dos dados: Conjuntos de dados frequentemente contêm duplicatas, amostras corrompidas ou informações ruidosas, o que pode degradar o desempenho do modelo.
Interações multimodais: Analisar as relações entre diferentes modalidades de dados (por exemplo, texto, imagens, vídeo) pode ser complexo, exigindo ferramentas e técnicas sofisticadas para garantir uma representação e interação precisas dos dados.
Como as organizações podem superar os desafios da curadoria de dados
Alex compartilha as abordagens inovadoras desenvolvidas na Encord para enfrentar desafios comuns de qualidade dos dados, como duplicatas, dados corrompidos e amostras ruidosas:
- Abordagens baseadas em embeddings: Dados não estruturados podem ser convertidos em embeddings vetoriais de alta dimensão por meio de modelos de embedding e armazenados em um banco de dados vetorial como o Milvus. As organizações podem identificar rapidamente anomalias e outliers visualizando embeddings em um espaço de baixa dimensão. Essa abordagem facilita a busca, a organização e a curadoria de dados não estruturados.
Figura: Usando embeddings para visualizar amostras de dados de treinamento
Métricas de qualidade dos dados: Métricas como desfoque, brilho e similaridade de embeddings podem ser usadas para avaliar a qualidade de conjuntos de dados de imagens em tarefas de visão computacional, ajudando a sinalizar e corrigir problemas antes do treinamento do modelo.
NLP para curadoria de dados: O processamento de linguagem natural pode filtrar e selecionar apenas as amostras de dados mais relevantes para treinamento ou teste, reduzindo o ruído e melhorando a precisão do modelo.
Camadas de persistência: Implementar uma camada de persistência adequada é crucial para gerenciar o processo de curadoria de dados, permitindo a captura e o armazenamento consistentes dos resultados.
Deduplicação de dados: Medidas de similaridade baseadas em embeddings ajudam a identificar e remover amostras duplicadas, melhorando a qualidade dos dados e reduzindo as necessidades de armazenamento. Isso também auxilia na descoberta de pontos de dados semelhantes para aumento de dados.
Validação de metadados: Ferramentas automatizadas validam metadados para garantir a integridade dos dados e detectar amostras corrompidas. A Encord oferece ferramentas específicas projetadas para essa tarefa, simplificando o processo.
Limpeza de dados: Técnicas como detecção de outliers, imputação e normalização podem lidar com ruído em conjuntos de dados, garantindo que os dados sejam adequados para treinar modelos de alto desempenho.
Benefícios de uma curadoria e limpeza de dados eficazes
Melhor desempenho do modelo: Dados de alta qualidade levam a modelos mais precisos e confiáveis.
Tempo de treinamento reduzido: Dados limpos e selecionados podem acelerar o processo de treinamento.
Custos mais baixos: Ao evitar a necessidade de coleta e rotulagem adicionais de dados, as organizações podem economizar dinheiro.
Maior explicabilidade do modelo: Dados bem curados podem melhorar a interpretabilidade das saídas do modelo.
Conclusão
A curadoria eficaz de dados se torna cada vez mais crítica à medida que as aplicações de IA ficam mais complexas, especialmente aquelas que lidam com vários tipos de dados, como vídeo e texto. Na palestra de Alex, obtemos uma compreensão mais profunda dos diversos desafios associados à curadoria de conjuntos de dados de imagens e texto e de como esses problemas impactam diretamente o desempenho do modelo.
Técnicas como embeddings vetoriais e consultas baseadas em NLP oferecem ferramentas valiosas para que as equipes visualizem melhor seus dados, identifiquem amostras rotuladas incorretamente ou duplicadas e limpem conjuntos de dados com mais eficiência antes do treinamento do modelo. Para garantir o sucesso, as equipes de ciência de dados devem selecionar os modelos de embedding apropriados, adaptados aos seus tipos específicos de dados — sejam embeddings de imagem ou de texto — e aproveitar bancos de dados vetoriais como o Milvus para simplificar os processos de armazenamento e busca de dados.
Em última análise, investir em curadoria de dados de alta qualidade não apenas melhora o desempenho do modelo, mas também reduz o risco de erros e aumenta a eficiência geral dos fluxos de trabalho de IA.
Recursos Adicionais
Continue lendo

3 Easiest Ways to Use Claude Code on Your Mobile Phone
Run Claude Code from your phone with Remote Control, Happy Coder, or SSH + Tailscale. Comparison table, setup steps, and tools for typing, memory, and parallel tasks.

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Zilliz Cloud Update: Tiered Storage, Business Critical Plan, Cross-Region Backup, and Pricing Changes
This release offers a rebuilt tiered storage with lower costs, a new Business Critical plan for enhanced security, and pricing updates, among other features.



