A importância da engenharia de dados para uma IA bem-sucedida com Airbyte e Zilliz
Este artigo foi publicado originalmente na DBTA em 17 de outubro de 2024 e republicado com permissão.
Viabilizar a coleta e a utilização de dados é crucial para apoiar com sucesso projetos de IA em escala empresarial. Da integração de dados aos pipelines de dados, desempenho de IA, governança de dados, conformidade e muito mais, aderir às melhores práticas de engenharia de dados nunca foi tão prudente para viabilizar um futuro impulsionado por IA.
No webinar mais recente da DBTA, Data Engineering Best Practices for AI, Brian Leonard, diretor de engenharia da Airbyte, e Tim Spann, principal developer advocate, Milvus, Zilliz, ofereceram sua expertise sobre como a engenharia de dados pode resolver desafios comuns associados à implantação e ao escalonamento do uso eficaz de IA.
Como a empresa do movimento de dados de código aberto, a Airbyte torna os dados acionáveis em qualquer lugar, permitindo que mais de 20.000 profissionais de dados e IA gerenciem dados diversos em ambientes multi-cloud, segundo Leonard. Em relação ao caso de uso de IA da Airbyte, muitas empresas estão aproveitando a plataforma Airbyte para carregar dados próprios em aplicativos de IA, extraindo registros de fontes não estruturadas — como Google Drive ou Salesforce — e movendo esses dados para lakehouses, onde os usuários podem habilitar geração aumentada por recuperação (RAG) e fine-tuning.
Leonard então analisou mais de perto o pipeline de dados de IA, examinando a jornada da extração à normalização, processamento e uso. Cada fase do pipeline incorpora os seguintes processos:
- Extração: Criptografia de dados, mascaramento de PII, filtros pushdown, transferência de arquivos, permissões
- Normalização: Normalização de esquemas, limpeza de dados, deduplicação
- Processamento: Enriquecimento, sumarização, otimização de casos de uso, divisão de documentos em chunks, cálculo de embeddings
- Uso: Colocar embeddings em um armazenamento de dados consultável, como Milvus, um banco de dados vetorial
Spann ampliou as vantagens do Milvus da Zilliz, um banco de dados vetorial de código aberto e alto desempenho, criado para escala. A busca vetorial, observou Spann, é o novo paradigma para IA, pois “agora, imagens, texto, vídeo, documentos — tudo é dado, e a busca vetorial torna isso pesquisável.” De fato, a IDC prevê que 90% dos dados recém-gerados em 2025 serão não estruturados, refletindo uma necessidade crucial de busca vetorial.
Bancos de dados vetoriais são responsáveis por impulsionar a busca em uma variedade de casos de uso — de RAG a busca por similaridade molecular, detecção de fraude e anomalias, busca por similaridade multimodal e muito mais. Em sua essência, dados não estruturados — e a capacidade de extrair conhecimento deles — são fundamentais para viabilizar o sucesso da IA.
Desde 2017, a Zilliz ajuda organizações a dar sentido a dados não estruturados. Tendo sido criada por uma equipe de primeira linha de engenheiros de algoritmos e bancos de dados com forte histórico no desenvolvimento de sistemas distribuídos de alto desempenho, escaláveis e altamente disponíveis, exclusivamente adaptados para busca vetorial, a Zilliz foi construída do zero para enfrentar os diversos desafios de engenharia de dados associados à IA, observou Spann.
Como resultado, o Milvus é um banco de dados vetorial fácil de configurar e rico em recursos, que oferece escalabilidade elástica, código reutilizável e integrações amplas, sustentado por uma comunidade robusta e solidária. Spann então conduziu os espectadores do webinar pelo modo como o Milvus opera, detalhando sua estrutura, recursos e muito mais.
Para assistir ao webinar completo e aprofundado que discute engenharia de dados para a era da IA, você pode ver uma versão arquivada do webinar aqui.
Continue lendo

Introducing Loon: A New Storage Engine for Vector Data That Never Stops Changing
Loon is a new storage engine for Milvus 3.0 and Zilliz Vector Lakebase, built to manage evolving vector datasets with ColumnGroups, row ID alignment, and Manifests.

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Why Context Engineering Is Becoming the Full Stack of AI Agents
Discover how context engineering unifies prompts, RAG, and tools to build smarter, production-ready AI agents powered by Milvus.



