Cómo los lagos de metadatos potencian las aplicaciones de IA/ML de próxima generación
A medida que las tecnologías de IA como los modelos de lenguaje grandes (LLMs) y la Generación Aumentada por Recuperación (RAG) continúan evolucionando, la demanda de una infraestructura de datos flexible y eficiente está creciendo. Las organizaciones buscan arquitecturas de datos que puedan respaldar estas nuevas herramientas a la vez que minimizan la deuda técnica y permiten una escalabilidad fluida.
Los lagos de metadatos están surgiendo como una solución clave en este sentido. Son repositorios centralizados que almacenan metadatos de diversas fuentes en una organización, ofreciendo un enfoque unificado para la gestión de datos. Los metadatos proporcionan contexto y comprensión de los datos almacenados, incluida la fuente de datos, la calidad, el linaje, la propiedad, el contenido, la estructura y el contexto.
Lisa N. Cao, Product Manager en Datastrato, ofreció recientemente una charla en el Unstructured Data Meetup organizado por Zilliz, donde habló sobre el papel crítico de los lagos de metadatos en el desarrollo de IA/ML de próxima generación. Basándose en su experiencia como ingeniera de datos, Lisa compartió ideas sobre cómo los lagos de metadatos pueden agilizar la gestión de datos e integrarse con diversas tecnologías como bases de datos vectoriales, modelos de deep learning y LLMs en entornos impulsados por IA.
Lisa hablando en el Unstructured Data Meetup de junio en Palo Alto
Este blog resume los puntos clave de Lisa y explora los desafíos de implementar pipelines de RAG en producción. Pero primero, presentemos brevemente RAG y los desafíos en el desarrollo y la implementación de RAG.
Introducción rápida a RAG (Generación Aumentada por Recuperación)
RAG, o Generación Aumentada por Recuperación, es un framework avanzado que mejora las respuestas de los LLM combinando módulos de recuperación y generativos. El módulo de recuperación consta de una base de datos vectorial como Milvus o Zilliz Cloud (el Milvus totalmente gestionado) y un modelo de embedding, y el módulo generativo suele ser un LLM como ChatGPT.
Figura 1 Cómo funciona RAG
Figura 1: Cómo funciona RAG
Cuando el usuario introduce una consulta en una aplicación RAG, la base de datos vectorial en el módulo de recuperación extrae los documentos más relevantes del gran corpus de texto. Estos documentos recuperados se denominan “candidatos principales” y se proporcionan al LLM como contexto de la consulta del usuario para generar una respuesta más precisa. RAG es particularmente útil en aplicaciones como respuesta a preguntas, chatbots y sistemas de gestión del conocimiento.
Desafíos actuales en el desarrollo de RAG
Recientemente, se han introducido muchas técnicas avanzadas en el pipeline de RAG para mejorar la precisión y el rendimiento, incluidos métodos de recuperación sofisticados basados en re-rankeo y recuperación recursiva, así como técnicas de ajuste fino basadas en embeddings y LLM. Además, se han introducido frameworks agénticos diseñados para el enrutamiento y la planificación de consultas con el fin de mejorar las capacidades de RAG.
Sin embargo, estos avances también introducen nuevas complejidades. Lisa analizó varios desafíos a los que se enfrentan muchos equipos de IA al desarrollar e implementar RAG en producción:
Baja observabilidad: Monitorear la velocidad de ingesta de documentos y los cambios en la distribución de datos dentro de las canalizaciones RAG es un desafío. Dado que la base de datos vectorial en una aplicación RAG a menudo almacena miles de millones de documentos, rastrear los cambios y actualizaciones de datos para la gestión del conocimiento se vuelve difícil.
Gestión del ciclo de vida: El control de versiones y la gestión del ciclo de vida efectivos son cruciales para rastrear los cambios y actualizaciones de datos. Los equipos necesitan herramientas robustas para trazar el linaje de los datos de manera transparente y auditable para garantizar el cumplimiento.
Latencia y optimización: Si bien el ajuste fino avanzado y la recuperación recursiva pueden mejorar la precisión de los resultados generados, también pueden aumentar los tiempos de respuesta, lo que lleva a una mayor latencia y una menor satisfacción del usuario.
Respuestas contextuales a consultas: Las consultas de usuario complejas pueden ser difíciles de interpretar con precisión para los LLM, lo que resulta en respuestas que carecen de contexto o matices.
Privacidad de datos: La gobernanza de IA es otro desafío, particularmente cuando se trata de agregar enmascaramiento o cifrado a los datos utilizados en el entrenamiento.
Mecanismo de aprendizaje continuo: Lisa enfatizó mantener las aplicaciones RAG actualizadas con datos recientes. "Hay una gran diferencia entre los modelos que acceden a datos actualizados continuamente y aquellos que dependen de datos obsoletos", señaló. Implementar un mecanismo de aprendizaje continuo, sin embargo, puede ser técnicamente desafiante.
Dependencia de un proveedor: Depender en gran medida de un único proveedor de servicios en la nube para las necesidades de la canalización puede llevar a una dependencia del proveedor, lo que hace que sea difícil y costoso pasar a otro ecosistema.
Uno de los problemas subyacentes que contribuyen a estos desafíos es la presencia de silos de datos en las organizaciones.
Silos de datos en las organizaciones: un factor clave que contribuye a los desafíos de RAG
Los silos de datos son un problema común en organizaciones donde los datos no son fácilmente accesibles entre diferentes equipos o departamentos debido a barreras estructurales o tecnológicas. Estos silos pueden existir a nivel operativo, entre varios equipos, o debido a la complejidad de las herramientas y aplicaciones en uso.
Figura 2- Silos de datos que afectan la eficiencia en las organizaciones
Figura 2: Silos de datos que afectan la eficiencia en las organizaciones
Lisa destacó el problema generalizado de los silos de datos, señalando: "Todas las empresas están tratando de abordar esta pregunta: ‘¿Cómo creamos consistencia operativa en nuestros datos en toda la organización?’" Esto es particularmente desafiante cuando los equipos están distribuidos globalmente y trabajan con diferentes almacenes de datos.
También existen silos entre diferentes equipos. Por ejemplo, los analistas de BI y los ingenieros de datos a menudo utilizan diferentes herramientas y pueden carecer de comunicación efectiva. Algunos equipos pueden no poseer los conocimientos de programación o las habilidades técnicas para acceder y procesar los datos disponibles. Por ejemplo, los ingenieros de DevOps podrían tener dificultades para comprender la base de código de los ingenieros de ML.
Los silos de datos impactan directamente la capacidad de construir y mantener canalizaciones RAG efectivas, ya que impiden el flujo fluido de datos en una organización. Esta falta de integración puede llevar a fuentes de datos fragmentadas, inconsistencias en el uso de datos y, en última instancia, desafíos al desplegar sistemas RAG que dependen de datos completos y actuales.
Lagos de metadatos: cerrar la brecha para una gestión de datos unificada
Para abordar los desafíos de RAG mencionados anteriormente, las empresas necesitan soluciones de arquitectura de datos para unificar, estandarizar y operacionalizar los datos en toda la organización. Los lagos de metadatos ofrecen una arquitectura flexible para almacenar y gestionar metadatos: información sobre la fuente, estructura, formato, uso, linaje y más.
¿Qué es un lago de metadatos?
Un lago de metadatos, o gestión de metadatos de lago de datos, es un repositorio centralizado que almacena metadatos de diversas fuentes en una organización. Los metadatos son la información descriptiva que proporciona contexto y comprensión de los datos en el lago de datos. Por lo general, incluyen detalles como la fuente de datos, la calidad, el linaje, la propiedad, el contenido, la estructura y el contexto.
Figura 3- Una gestión unificada de metadatos .png
Figura 3: Una gestión unificada de metadatos
A diferencia de un lago de datos tradicional, que almacena datos sin procesar, un lago de metadatos se centra en gestionar, organizar y hacer accesibles los metadatos asociados con los activos de datos en diferentes sistemas, bases de datos y aplicaciones.
Figura 4- Comparación de diferentes diseños de arquitectura de datos
Figura 4: Comparación de diferentes diseños de arquitectura de datos
Beneficios de los lagos de metadatos
Mejor descubribilidad de los datos: Los lagos de metadatos sirven como catálogos centralizados, almacenando todos los metadatos y facilitando que los equipos y usuarios descubran activos de datos en toda la organización.
Metadatos activos: Estos lagos habilitan metadatos activos, que pueden desencadenar acciones e integrarse con canalizaciones orquestadas, automatizando tareas y reduciendo la necesidad de intervención manual.
Metadatos integrados: Los metadatos pueden integrarse en diferentes aplicaciones, facilitando una integración e interacción fluidas en todo el ecosistema de datos.
Gobernanza de IA mejorada: Centralizar la gestión de metadatos facilita la implementación de políticas de gobernanza coherentes, garantizando el cumplimiento y la calidad de los datos. Los lagos de metadatos también admiten un seguimiento detallado del linaje de datos, controles de acceso y capacidades de auditoría.
Uso enriquecido de metadatos: La gestión unificada de metadatos permite un uso más enriquecido de los metadatos, como el enriquecimiento, el enmascaramiento de datos y la clasificación, mejorando la calidad, la seguridad y la usabilidad de los datos.
En general, los lagos de metadatos simplifican y automatizan la gestión del ciclo de vida de los datos, facilitando la colaboración entre equipos técnicos y ayudando a eliminar los silos de datos que obstaculizan el desarrollo de RAG.
Demo: Creación de lagos de metadatos usando Gravitino
Lisa compartió su experiencia trabajando en un proyecto de código abierto en el que se desarrolló un lago de metadatos usando Gravitino. El proyecto tenía como objetivo crear un catálogo de datos que admita múltiples proveedores de servicios en la nube, incluidos AWS, Azure y GCP. Permite a los usuarios registrar diversas fuentes de datos en el lago de metadatos, como buckets de S3, base de datos vectorial Milvus, HiMetastores y otros almacenes de datos. Gravitino también proporciona controles de acceso y herramientas para rastrear el linaje de datos y facilitar la auditoría.
Figura 5- La arquitectura del lago de metadatos creada con Gravitino
Figura 5: La arquitectura del lago de metadatos creada con Gravitino
La arquitectura utiliza API REST para servir metadatos a diferentes aplicaciones. Las capas de conexión convierten todos los datos en un esquema común antes de almacenarlos en el lago de metadatos. Gravitino admite formatos de datos tanto tabulares como no tabulares y permite el enmascaramiento basado en etiquetas para garantizar la seguridad de los datos.
Los equipos de IA también pueden integrar grafos de conocimiento y almacenes vectoriales dentro del marco de gestión de metadatos, creando un catálogo unificado. Debido a la naturaleza federada del catálogo, las consultas pueden acceder a los metadatos sin mover los datos de origen. Las operaciones de unión se producen ya sea en memoria o en ubicaciones definidas, optimizando el rendimiento y manteniendo la integridad de los datos en entornos distribuidos.
Conclusión
Los lagos de metadatos están evolucionando hacia catálogos de IA que gestionan metadatos y se integran con flujos de trabajo de IA y ML. Estos lagos pueden ayudar con el desarrollo de RAG, el registro de modelos, la gobernanza de IA y la implementación de análisis avanzados. Al proporcionar un plano unificado para las operaciones de datos, los lagos de metadatos permiten a los equipos mantener la observabilidad en el análisis de metadatos, garantizar transiciones fluidas entre diferentes entornos de nube y fuentes de datos como la base de datos vectorial Milvus, y sostener marcos de gobernanza sin interrupciones. A medida que las tecnologías de IA avanzan, los lagos de metadatos desempeñarán un papel clave en el apoyo a las aplicaciones de IA/ML de próxima generación.
Recursos adicionales
Sigue leyendo

Zilliz Cloud Delivers Better Performance and Lower Costs with Arm Neoverse-based AWS Graviton
Zilliz Cloud adopts Arm-based AWS Graviton3 CPUs to cut costs, speed up AI vector search, and power billion-scale RAG and semantic search workloads.

Vector Databases vs. Graph Databases
Use a vector database for AI-powered similarity search; use a graph database for complex relationship-based queries and network analysis.

DeepSeek Always Busy? Deploy It Locally with Milvus in Just 10 Minutes—No More Waiting!
Learn how to set up DeepSeek-R1 on your local machine using Ollama, AnythingLLM, and Milvus in just 10 minutes. Bypass busy servers and enhance AI responses with custom data.



