La importancia de la ingeniería de datos para una IA exitosa con Airbyte y Zilliz
Este artículo se publicó originalmente en DBTA el 17 de octubre de 2024 y se republicó con permiso.
Habilitar la recopilación y utilización de datos es crucial para respaldar con éxito proyectos de IA a escala empresarial. Desde la integración de datos hasta los pipelines de datos, el rendimiento de la IA, la gobernanza de datos, el cumplimiento normativo y más, adherirse a las mejores prácticas de ingeniería de datos nunca ha sido más prudente para posibilitar un futuro impulsado por la IA.
En el seminario web más reciente de DBTA, Mejores prácticas de ingeniería de datos para IA, Brian Leonard, director de ingeniería en Airbyte, y Tim Spann, principal developer advocate, Milvus, Zilliz, ofrecieron su experiencia sobre cómo la ingeniería de datos puede resolver desafíos comunes asociados con la implementación y el escalado del uso eficaz de la IA.
Como la empresa de movimiento de datos de código abierto, Airbyte hace que los datos sean accionables en cualquier lugar, permitiendo que más de 20.000 profesionales de datos e IA gestionen datos diversos en entornos multinube, según Leonard. Con respecto al caso de uso de IA de Airbyte, muchas empresas están aprovechando la plataforma Airbyte para cargar datos propios en aplicaciones de IA extrayendo registros de fuentes no estructuradas —como Google Drive o Salesforce— y moviendo esos datos a lakehouses, donde los usuarios pueden habilitar la generación aumentada por recuperación (RAG) y el ajuste fino.
Luego, Leonard analizó más de cerca el pipeline de datos de IA, examinando el recorrido desde la extracción hasta la normalización, el procesamiento y el uso. Cada fase del pipeline incorpora los siguientes procesos:
- Extracción: Cifrado de datos, enmascaramiento de PII, filtros pushdown, transferencia de archivos, permisos
- Normalización: Normalización de esquemas, limpieza de datos, deduplicación
- Procesamiento: Enriquecimiento, resumen, optimización de casos de uso, fragmentación de documentos, cálculo de embeddings
- Uso: Colocar embeddings en un almacén de datos consultable, como Milvus, una base de datos vectorial
Spann amplió las ventajas de Milvus de Zilliz, una base de datos vectorial de código abierto y alto rendimiento creada para escalar. La búsqueda vectorial, señaló Spann, es el nuevo paradigma para la IA, ya que “ahora, las imágenes, el texto, el video, los documentos: todo es dato, y la búsqueda vectorial lo hace buscable.” De hecho, IDC predice que el 90% de los datos recién generados en 2025 serán no estructurados, lo que refleja una necesidad crucial de búsqueda vectorial.
Las bases de datos vectoriales son responsables de impulsar la búsqueda en una variedad de casos de uso, desde RAG hasta la búsqueda de similitud molecular, la detección de fraude y anomalías, la búsqueda de similitud multimodal y más. En esencia, los datos no estructurados —y la capacidad de extraer conocimiento de ellos— son fundamentales para posibilitar el éxito de la IA.
Desde 2017, Zilliz ha estado ayudando a las organizaciones a dar sentido a los datos no estructurados. Al haber sido creada por un equipo de primer nivel de ingenieros de algoritmos y bases de datos con una sólida trayectoria en el desarrollo de sistemas distribuidos de alto rendimiento, escalables y de alta disponibilidad, adaptados de forma única para la búsqueda vectorial, Zilliz se construyó desde cero para abordar los diversos desafíos de ingeniería de datos asociados con la IA, señaló Spann.
Como resultado, Milvus es una base de datos vectorial fácil de configurar y rica en funcionalidades que ofrece escalado elástico, código reutilizable e integraciones amplias, respaldada por una comunidad sólida y de apoyo. Luego, Spann guió a los asistentes del seminario web a través de la forma en que opera Milvus, detallando su estructura, características y más.
Para ver el seminario web completo y detallado que analiza la ingeniería de datos para la era de la IA, puede ver una versión archivada del seminario web aquí.
Sigue leyendo

Introducing Loon: A New Storage Engine for Vector Data That Never Stops Changing
Loon is a new storage engine for Milvus 3.0 and Zilliz Vector Lakebase, built to manage evolving vector datasets with ColumnGroups, row ID alignment, and Manifests.

Zilliz Cloud BYOC Now Available Across AWS, GCP, and Azure
Zilliz Cloud BYOC is now generally available on all three major clouds. Deploy fully managed vector search in your own AWS, GCP, or Azure account — your data never leaves your VPC.

Vector Databases vs. Object-Relational Databases
Use a vector database for AI-powered similarity search; use an object-relational database for complex data modeling with both relational integrity and object-oriented features.



