Como os Lagos de Metadados Impulsionam Aplicações de IA/ML de Próxima Geração
À medida que tecnologias de IA como grandes modelos de linguagem (LLMs) e Geração Aumentada por Recuperação (RAG) continuam a evoluir, a demanda por uma infraestrutura de dados flexível e eficiente está crescendo. As organizações estão buscando arquiteturas de dados que possam dar suporte a essas novas ferramentas, ao mesmo tempo em que minimizam a dívida técnica e permitem escalabilidade contínua.
Lagos de metadados estão surgindo como uma solução-chave nesse sentido. Eles são repositórios centralizados que armazenam metadados de várias fontes em uma organização, oferecendo uma abordagem unificada para o gerenciamento de dados. Os metadados fornecem contexto e compreensão dos dados armazenados, incluindo fonte de dados, qualidade, linhagem, propriedade, conteúdo, estrutura e contexto.
Lisa N. Cao, Gerente de Produto na Datastrato, recentemente fez uma palestra no Unstructured Data Meetup promovido pela Zilliz, onde discutiu o papel crítico dos lagos de metadados no desenvolvimento de IA/ML de próxima geração. Com base em sua experiência como engenheira de dados, Lisa compartilhou insights sobre como os lagos de metadados podem simplificar o gerenciamento de dados e se integrar a várias tecnologias, como bancos de dados vetoriais, modelos de deep learning e LLMs em ambientes orientados por IA.
Lisa falando no Unstructured Data Meetup de junho em Palo Alto
Este blog recapitula os principais pontos de Lisa e explora os desafios de implantar pipelines RAG em produção. Mas, primeiro, vamos apresentar brevemente o RAG e os desafios no desenvolvimento e na implantação de RAG.
Introdução rápida ao RAG (Geração Aumentada por Recuperação)
RAG, ou Geração Aumentada por Recuperação, é uma estrutura avançada que aprimora as respostas de LLMs combinando módulos de recuperação e geração. O módulo de recuperação compreende um banco de dados vetorial como Milvus ou Zilliz Cloud (o Milvus totalmente gerenciado) e um modelo de embedding, e o módulo generativo geralmente é um LLM como o ChatGPT.
Figura 1 Como o RAG funciona
Figura 1: Como o RAG funciona
Quando o usuário insere uma consulta em uma aplicação RAG, o banco de dados vetorial no módulo de recuperação extrai os documentos mais relevantes do grande corpus de texto. Esses documentos recuperados são chamados de “principais candidatos” e são fornecidos ao LLM como o contexto da consulta do usuário para gerar uma resposta mais precisa. O RAG é particularmente útil em aplicações como perguntas e respostas, chatbots e sistemas de gerenciamento de conhecimento.
Desafios atuais no desenvolvimento de RAG
Recentemente, muitas técnicas avançadas foram introduzidas no pipeline RAG para maior precisão e desempenho, incluindo métodos sofisticados de recuperação baseados em reclassificação e recuperação recursiva, além de técnicas de embedding e ajuste fino baseadas em LLM. Além disso, frameworks agênticos projetados para roteamento e planejamento de consultas foram introduzidos para aprimorar as capacidades do RAG.
No entanto, esses avanços também introduzem novas complexidades. Lisa discutiu vários desafios que muitas equipes de IA enfrentam ao desenvolver e implantar RAG em produção:
Baixa observabilidade: Monitorar a velocidade de ingestão de documentos e as mudanças na distribuição de dados dentro de pipelines RAG é desafiador. Como o banco de dados vetorial em uma aplicação RAG muitas vezes armazena bilhões de documentos, rastrear mudanças e atualizações de dados para a gestão do conhecimento torna-se difícil.
Gerenciamento do ciclo de vida: Controle de versão e gerenciamento do ciclo de vida eficazes são cruciais para rastrear mudanças e atualizações de dados. As equipes precisam de ferramentas robustas para rastrear a linhagem dos dados de forma transparente e auditável para garantir a conformidade.
Latência e otimização: Embora o fine-tuning avançado e a recuperação recursiva possam melhorar a precisão das saídas geradas, eles também podem aumentar os tempos de resposta, levando a maior latência e menor satisfação do usuário.
Respostas contextuais a consultas: Consultas complexas dos usuários podem ser difíceis para os LLMs interpretarem com precisão, resultando em respostas sem contexto ou nuance.
Privacidade de dados: A governança de IA é outro desafio, particularmente quando se trata de adicionar mascaramento ou criptografia aos dados usados no treinamento.
Mecanismo de aprendizado contínuo: Lisa enfatizou manter as aplicações RAG atualizadas com dados recentes. "Há uma enorme diferença entre modelos que acessam dados continuamente atualizados e aqueles que dependem de dados obsoletos", observou ela. Implementar um mecanismo de aprendizado contínuo, no entanto, pode ser tecnicamente desafiador.
Aprisionamento a fornecedor: Depender fortemente de um único provedor de serviços em nuvem para as necessidades do pipeline pode levar ao aprisionamento a fornecedor, tornando difícil e custoso migrar para outro ecossistema.
Uma das questões subjacentes que contribuem para esses desafios é a presença de silos de dados nas organizações.
Silos de dados nas organizações: um fator-chave para os desafios de RAG
Silos de dados são um problema comum em organizações nas quais os dados não são facilmente acessíveis entre diferentes equipes ou departamentos devido a barreiras estruturais ou tecnológicas. Esses silos podem existir no nível operacional, entre várias equipes, ou devido à complexidade das ferramentas e aplicações em uso.
Figura 2- Silos de dados impactando a eficiência nas organizações
Figura 2: Silos de dados impactando a eficiência nas organizações
Lisa destacou a questão generalizada dos silos de dados, observando: "Toda empresa está tentando responder a esta pergunta: ‘Como criamos consistência operacional em nossos dados em toda a organização?’" Isso é particularmente desafiador quando as equipes estão distribuídas globalmente e trabalham com diferentes armazenamentos de dados.
Também há silos entre diferentes equipes. Por exemplo, analistas de BI e engenheiros de dados frequentemente usam ferramentas diferentes e podem não ter comunicação eficaz. Algumas equipes podem não possuir o conhecimento de programação ou as habilidades técnicas para acessar e processar os dados disponíveis. Por exemplo, engenheiros de DevOps podem ter dificuldade para entender a base de código dos engenheiros de ML.
Os silos de dados impactam diretamente a capacidade de construir e manter pipelines RAG eficazes, pois impedem o fluxo contínuo de dados por uma organização. Essa falta de integração pode levar a fontes de dados fragmentadas, inconsistências no uso de dados e, em última análise, desafios na implantação de sistemas RAG que dependem de dados abrangentes e atuais.
Lagos de metadados: preenchendo a lacuna para o gerenciamento unificado de dados
Para enfrentar os desafios de RAG mencionados acima, as empresas precisam de soluções de arquitetura de dados para unificar, padronizar e operacionalizar dados em toda a organização. Lagos de metadados oferecem uma arquitetura flexível para armazenar e gerenciar metadados—informações sobre a fonte, estrutura, formato, uso, linhagem e muito mais.
O que é um lago de metadados?
Um lago de metadados, ou gerenciamento de metadados de data lake, é um repositório centralizado que armazena metadados de várias fontes em uma organização. Metadados são as informações descritivas que fornecem contexto e compreensão dos dados no data lake. Geralmente incluem detalhes como fonte dos dados, qualidade, linhagem, propriedade, conteúdo, estrutura e contexto.
Figura 3- Um gerenciamento de metadados unificado .png
Figura 3: Um gerenciamento de metadados unificado
Diferentemente de um data lake tradicional, que armazena dados brutos, um lago de metadados se concentra em gerenciar, organizar e tornar acessíveis os metadados associados a ativos de dados em diferentes sistemas, bancos de dados e aplicações.
Figura 4- Comparando diferentes designs de arquitetura de dados
Figura 4: Comparando diferentes designs de arquitetura de dados
Benefícios dos Lagos de Metadados
Melhor Descoberta de Dados: Lagos de metadados servem como catálogos centralizados, armazenando todos os metadados e facilitando para equipes e usuários descobrirem ativos de dados em toda a organização.
Metadados Ativos: Esses lagos possibilitam metadados ativos, que podem acionar ações e se integrar a pipelines orquestrados, automatizando tarefas e reduzindo a necessidade de intervenção manual.
Metadados Incorporados: Metadados podem ser incorporados em diferentes aplicações, facilitando integração e interação contínuas em todo o ecossistema de dados.
Governança de IA Aprimorada: Centralizar o gerenciamento de metadados facilita a implementação de políticas de governança consistentes, garantindo conformidade e qualidade dos dados. Lagos de metadados também oferecem suporte a rastreamento detalhado da linhagem de dados, controles de acesso e recursos de auditoria.
Utilização Rica de Metadados: O gerenciamento unificado de metadados permite uma utilização mais rica de metadados, como enriquecimento, mascaramento de dados e classificação, aprimorando a qualidade, a segurança e a usabilidade dos dados.
De modo geral, os lagos de metadados simplificam e automatizam o gerenciamento do ciclo de vida dos dados, tornando a colaboração entre equipes técnicas mais fácil e ajudando a eliminar os silos de dados que dificultam o desenvolvimento de RAG.
Demonstração: Construindo Lagos de Metadados Usando Gravitino
Lisa compartilhou sua experiência trabalhando em um projeto de código aberto no qual um lago de metadados foi desenvolvido usando Gravitino. O projeto tinha como objetivo criar um catálogo de dados compatível com vários provedores de serviços em nuvem, incluindo AWS, Azure e GCP. Ele permite que os usuários registrem várias fontes de dados no lago de metadados, como buckets S3, banco de dados vetorial Milvus, HiMetastores e outros armazenamentos de dados. Gravitino também fornece controles de acesso e ferramentas para rastrear a linhagem dos dados e facilitar a auditoria.
Figura 5- A arquitetura do lago de metadados construída com Gravitino
Figura 5: A arquitetura do lago de metadados construída com Gravitino
A arquitetura usa APIs REST para fornecer metadados a diferentes aplicações. As camadas de conexão convertem todos os dados em um esquema comum antes de armazená-los no lago de metadados. Gravitino oferece suporte a formatos de dados tabulares e não tabulares e permite mascaramento baseado em tags para garantir a segurança dos dados.
Equipes de IA também podem integrar grafos de conhecimento e armazenamentos vetoriais dentro do framework de gerenciamento de metadados, criando um catálogo unificado. Devido à natureza federada do catálogo, as consultas podem acessar metadados sem mover os dados de origem. Operações de join ocorrem em memória ou em locais definidos, otimizando o desempenho e mantendo a integridade dos dados em ambientes distribuídos.
Conclusão
Lagos de metadados estão evoluindo para catálogos de IA que gerenciam metadados e se integram a fluxos de trabalho de IA e ML. Esses lagos podem auxiliar no desenvolvimento de RAG, no registro de modelos, na governança de IA e na implementação de análises avançadas. Ao fornecer um plano unificado para operações de dados, os lagos de metadados capacitam as equipes a manter a observabilidade na análise de metadados, garantir transições suaves entre diferentes ambientes de nuvem e fontes de dados como o banco de dados vetorial Milvus, e sustentar frameworks de governança de forma integrada. À medida que as tecnologias de IA avançam, os lagos de metadados desempenharão um papel fundamental no suporte a aplicações de IA/ML de próxima geração.
Recursos adicionais
Continue lendo

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

Zilliz Cloud Enterprise Vector Search Powers High-Performance AI on AWS
Zilliz Cloud on AWS powers secure, scalable, ultra-fast vector search for enterprise AI apps, with BYOC, sub-10ms latency, and zero-DevOps simplicity.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.



