Pipelines multimodales para aplicaciones de IA
El éxito en las aplicaciones de inteligencia artificial (IA) requiere una preparación y gestión de datos eficientes. Un pipeline de datos más sólido conduce a resultados más precisos, fiables y conscientes del contexto. A medida que los flujos de trabajo de IA se vuelven cada vez más complejos, la necesidad de pipelines escalables e inteligentes que los respalden se ha vuelto urgente.
Los sistemas modernos de IA tienen dificultades con los datos no estructurados, como informes, imágenes y PDFs. Los sistemas que emplean generación aumentada por recuperación (RAG) requieren estrategias precisas para manejar datos complejos mientras mantienen la precisión de los resultados y reducen los costos.
Crear tales sistemas significa analizar datos de diferentes formatos, lidiar con resultados de IA impredecibles y construir pipelines que puedan escalar de manera eficiente. Recientemente, en el Unstructured Data Meetup organizado por Zilliz, Sam, CTO de Datavolo con más de 18 años de experiencia en ingeniería de datos e IA, abordó estos desafíos.
Se destacó una plataforma construida sobre Apache NiFi, DataVolo, para abordar estos problemas. Simplifica el procesamiento de datos no estructurados y permite la creación de pipelines escalables y nativos de la nube. DataVolo también admite capacidad de respuesta en tiempo real a metadatos, cambios de permisos y marcos de evaluación sólidos para abordar modelos de IA no deterministas.
Este artículo explica las conclusiones clave de la sesión sobre mejores prácticas para pipelines multimodales. Exploraremos la gestión de datos no estructurados y bases de datos vectoriales como Milvus para una recuperación eficiente y estrategias prácticas para mejorar los flujos de trabajo de IA.
El video completo del meetup se puede encontrar aquí.
Por qué los pipelines multimodales son fundamentales para la IA
Un desafío principal al que pueden enfrentarse las empresas al implementar IA a gran escala es lidiar con masas de datos complicados. Las herramientas convencionales de extracción, transformación y carga (ETL) no pueden manejar tareas que impliquen gestionar diferentes formatos como texto, imágenes, videos y audio. He aquí por qué:
Predominan los datos no estructurados: Más del 80% de los datos de una empresa son no estructurados, incluidos documentos, imágenes y videos. Esto presenta un desafío que no puede abordarse utilizando herramientas tradicionales. Los pipelines multimodales proporcionan un flujo de trabajo integrado con algoritmos avanzados de IA para transformar datos no estructurados en inteligencia accionable. Estos pipelines cierran la brecha entre los datos sin procesar y los modelos de IA, permitiendo a las organizaciones usar los datos para una mejor toma de decisiones.
Mejora de la precisión de la IA: Los grandes modelos de lenguaje (LLMs), como GPT, son sólidos pero propensos a errores, como producir resultados irrelevantes o incorrectos. La precisión de los modelos de IA mejora debido a la capacidad de los pipelines multimodales para procesar varios tipos de datos en un marco unificado enriquecido con metadatos. Estos metadatos luego actúan como una guía para ayudar a los sistemas de IA a recuperar la información más relevante relacionada con una consulta dada.
Mejora de la generación aumentada por recuperación: RAG combina la recuperación de datos con IA generativa para producir resultados más innovadores y relacionados con el contexto. Los pipelines multimodales proporcionan embeddings y metadatos para optimizaciones fluidas del flujo de trabajo. Garantiza que los modelos generativos den respuestas relevantes al extraer siempre los datos relevantes durante la recuperación.
Escalado de flujos de trabajo de IA: Las empresas modernas manejan volúmenes de datos cada vez mayores. Las canalizaciones multimodales automatizan tareas como la fragmentación, la incrustación y la gestión de metadatos. Esto facilita mantener el rendimiento mientras los flujos de trabajo escalan hacia arriba. Estas canalizaciones proporcionan la escalabilidad necesaria para satisfacer esas demandas crecientes sin renunciar a la eficiencia.
Actualizaciones en tiempo real: Los datos empresariales cambian constantemente, desde actualizaciones de contenido hasta permisos de acceso. Las canalizaciones multimodales garantizan la sincronización en tiempo real. Esto mantiene los sistemas de IA operando con la información más reciente y relevante. También admite casos de uso dinámicos en los que los datos en tiempo real son fundamentales para obtener resultados de IA precisos.
Estas canalizaciones sientan las bases para sistemas de IA eficientes e innovadores. Agilizan la integración de diversas fuentes de datos y mejoran el rendimiento de los modelos de IA en el mundo real.
Desafíos en el panorama de datos de IA
Los sistemas de IA requieren datos de alta calidad para el entrenamiento. Sin embargo, gestionar varios tipos de datos conlleva desafíos. La complejidad aumenta cuando la empresa maneja enormes cantidades de datos no estructurados. Veamos algunos de los desafíos en el panorama de datos de IA:
Complejidad de los tipos de datos: Los formatos de datos requieren herramientas o flujos de trabajo específicos para extraer información significativa. Por ejemplo, PDF contiene datos mixtos, incluidas tablas, texto e imágenes. Por lo tanto, debe analizarse para recuperar datos esenciales. Modelos como la detección de diseño pueden procesar y organizar con precisión dichos datos para preservar toda la información vital.
Metadatos como columna vertebral: Los metadatos son esenciales para aumentar la productividad de los flujos de trabajo de IA. Proporcionan búsqueda avanzada, recuperación y control de acceso para que los usuarios puedan acceder rápidamente a los datos que necesitan. Los metadatos son cruciales para filtrar, clasificar y asegurar el acceso a la información recuperada y, por lo tanto, un componente clave de los sistemas de IA exitosos. Enriquecer los datos con metadatos potencia los enfoques de búsqueda híbrida, vinculando las incrustaciones semánticas al filtro de metadatos. Esto mejorará la precisión y la relevancia en los sistemas de IA.
Gestión de datos: Los datos pueden cambiar debido a actualizaciones, correcciones o adiciones en grandes empresas. Deben contar con sistemas que puedan respaldar eficazmente esos flujos dinámicos en tiempo real. Por ejemplo, los sistemas de ingesta activa garantizan la sincronización de los archivos fuente en los sistemas de flujo de trabajo de IA sin interrupciones.
Enfoque centrado en la evaluación: La supervisión y evaluación continuas de los resultados del sistema de IA son fundamentales para lograr una salida consistente y confiable. Antes de que el sistema pase a producción, las empresas deben crear conjuntos de evaluación y métricas. Esto ayudará a las organizaciones a medir cómo sus sistemas procesan datos complejos para cumplir los objetivos empresariales. Los conjuntos de datos sintéticos pueden utilizarse para probar y perfeccionar estrategias, incluida la fragmentación y la incrustación.
Escalabilidad e integración: A medida que el volumen de datos aumenta gradualmente, la escalabilidad se vuelve muy importante. Los sistemas de IA deben integrarse con las herramientas empresariales existentes sin degradación del rendimiento ni aumento de las cargas de trabajo. Las soluciones escalables mejoran la eficiencia del flujo de trabajo a medida que aumentan el tamaño y la complejidad de los datos. Integrar sistemas avanzados como bases de datos vectoriales mejora funcionalidades como la búsqueda vectorial, garantizando un funcionamiento fluido en escenarios del mundo real.
Al abordar estos aspectos, la empresa puede liberar todo el poder de los datos y establecer una base sólida para que los sistemas de IA funcionen eficazmente en entornos dinámicos. Las canalizaciones modernas aportan resultados transformadores al cerrar la brecha entre los datos sin procesar y los flujos de trabajo operativos en IA.
El lugar de DataVolo dentro del stack de IA
DataVolo es una plataforma revolucionaria para crear canalizaciones de datos multimodales. Impulsada por Apache NiFi, DataVolo cuenta con una base sólida para los sistemas de IA modernos. Las características clave incluyen:
Canalizaciones de datos continuas y automatizadas: Datavolo está diseñado para la ingesta continua y basada en eventos. Escala dinámicamente según la fluctuación del volumen de datos para un rendimiento predecible en momentos de alto rendimiento. La plataforma admite varios formatos de datos, incluidos audio, video, imágenes, señales de sensores, JSON o XML estructurado y registros basados en texto.
Análisis y fragmentación: DataVolo puede manejar datos no estructurados con facilidad. Cuenta con procesadores especializados para el análisis avanzado de documentos con el fin de descomponer documentos complejos en secciones manejables. Por ejemplo, el procesador ChunkDocument utiliza información estructural para formar fragmentos coherentes, mientras que el procesador ChunkText refina aún más estos en otros más pequeños en función del significado semántico.
Implementación nativa en la nube: DataVolo es intrínsecamente nativo en la nube, y su arquitectura permite implementaciones flexibles en los principales proveedores como AWS, GCP y Azure. Permite a las organizaciones utilizar sus infraestructuras en la nube existentes. Permite una operación fluida en entornos de nube híbrida, garantizando rendimiento y facilidad de gestión.
Observabilidad: DataVolo se integra con OpenTelemetry para la recopilación de datos estandarizada, lo que permite su interoperabilidad con una variedad de herramientas de monitoreo y análisis. Además, también se integra con un Generador de flujos basado en GenAI que traduce el lenguaje natural en flujos de NiFi. Esto facilita la creación o gestión de canalizaciones de datos.
Enfoque en la persona del ingeniero de datos: Datavolo se dirige a los ingenieros de datos, presentándoles una interfaz visual y de bajo código para diseñar, planificar y mantener canalizaciones. La plataforma ofrece una amplia variedad de distintos procesadores y conectores preconstruidos, respaldando así eficazmente una amplia variedad de fuentes y destinos. Proporciona flexibilidad para adaptarse rápidamente a los cambios en las tecnologías de IA y los requisitos de datos. Esto hace que los ingenieros de datos sean eficaces a la hora de proporcionar soluciones de IA impactantes sin estas complejidades de infraestructura.
Integración con bases de datos vectoriales: DataVolo se integra muy bien con Zilliz y Milvus para una gestión eficiente de bases de datos vectoriales. Estos dos funcionan sinérgicamente para potenciar el desarrollo empresarial de flujos de trabajo de IA que escalen y funcionen bien.
Funcionamiento de DATAVOLO: Fuente
Caso práctico: Chatbot de análisis de datos financieros
Procesar documentos no estructurados, como informes financieros, requiere enfoques innovadores para manejar la complejidad intrínseca. La mayoría de las empresas enfrentan serios desafíos al extraer información significativa de dichos documentos. Descubramos cómo procesar dichos documentos y crear una solución escalable.
Desafío
El procesamiento de documentos financieros, como los informes 10-K, es complejo para una empresa. Estos informes suelen tener cientos de páginas y contienen tablas, gráficos y datos en texto. El procesamiento consume mucho tiempo, es propenso a errores e ineficiente si se realiza manualmente.
Solución
Una canalización automatizada y escalable debe integrar técnicas avanzadas para el procesamiento de datos con bases de datos vectoriales. La solución contiene los siguientes procesos:
Ingesta de datos: Los datos se extraen de diversas fuentes, incluidos buckets de S3, mediante ingesta automatizada. Añade detalles esenciales como el tipo de documento y la fuente para hacer que cada documento sea relevante y útil en la toma de decisiones. Al manejar datos no estructurados con flujos de datos dinámicos, se implementa CDC (Change Data Capture). Garantiza que cada actualización, corrección o adición en los archivos de origen se capture y sincronice con los sistemas de destino en tiempo real.
CDC evita el uso de información irrelevante y mantiene la integridad de los datos en todos los flujos de trabajo. La ingesta se optimiza aún más con estas estrategias de listado para evitar reprocesar los más antiguos:
Listado basado en marcas de tiempo: Permite listar solo aquellos archivos que se han añadido o modificado después de una determinada marca de tiempo. Esto verifica que la ingesta de datos nuevos o actualizados ocurra sin redundancia.
Técnicas de hashing: Compara el contenido para identificar y omitir archivos procesados previamente, incluso cuando los nombres de archivo siguen siendo los mismos.
Estas capacidades garantizan canalizaciones de ingesta de datos robustas y eficientes que se adaptan a los cambios, manteniendo dinámicamente los sistemas de IA alimentados con información precisa y actual.
Preprocesamiento: El preprocesamiento del documento implica seguir los siguientes pasos:
Detección de diseño: La detección de diseño desempeña un papel importante en el procesamiento de documentos complejos como PDF e informes financieros. Aplica el modelo YOLO-X ajustado para identificar y etiquetar los componentes como tablas, imágenes y secciones con cuadros delimitadores. Las tablas conservan la estructura, mientras que existe una vinculación contextual del texto narrativo o las descripciones. Un grafo de documentos organiza estos elementos jerárquicamente para una mejor navegación y recuperación. OCR se utiliza cuando las capas de texto no están presentes y es necesario capturar todos los elementos del documento. Garantiza que la estructura y el contexto se mantengan para que la extracción de datos sea precisa y confiable.
Fragmentación: Los documentos se dividen en fragmentos manejables para un procesamiento eficiente. El enfoque más ingenuo es la fragmentación por un número fijo de caracteres, como 400. Sin embargo, esto puede dividir información conectada semánticamente y, por lo tanto, no es eficaz. Un método más refinado es la fragmentación basada en secciones, donde las secciones detectadas mediante la detección de diseño proporcionan los límites. En consecuencia, cada fragmento conserva el contexto de una sección, incluido el encabezado y el texto narrativo que aparece en ella. La otra estrategia de fragmentación utiliza el significado del texto aplicando la similitud del coseno de oraciones consecutivas. Cuando es menor que el umbral dado, realiza el fragmento. Esta estrategia de recuperación hace que cada uno sea semánticamente incoherente con una mayor precisión de la consulta de un usuario.
Extracción de metadatos: Algunos metadatos, como el tipo de documento y la URL de origen, se establecen estáticamente mediante la configuración en la canalización. Otros metadatos se derivan automáticamente del flujo de procesamiento, como los detalles extraídos mediante la detección de diseño o el enriquecimiento con fuentes de datos externas. Por ejemplo, los símbolos presentes en el documento financiero consultarían el mismo símbolo en una tabla PostgreSQL y añadirían metadatos apropiados a nivel de empresa. Esto permitirá casos de uso más avanzados como búsqueda híbrida, resultados clasificados y control de acceso seguro basado en metadatos mejorados.
Embedding: Los fragmentos de texto se transforman en vectores dinámicos de alta dimensionalidad mediante embeddings de vanguardia. Estos vectores capturan la esencia de los datos y revelan conexiones semánticas significativas. Hace que la recuperación de información sea una experiencia intuitiva al responder consultas de los usuarios.
Almacenamiento: Estos embeddings y metadatos se almacenan en una base de datos vectorial de alto rendimiento como Milvus. Esto permite una recuperación rápida incluso entre millones de vectores almacenados mediante indexación. El filtrado de metadatos aporta precisión al permitir que las consultas consideren más contexto, como rangos de fechas o secciones de documentos.
Actualizaciones en tiempo real: Las canalizaciones de ingesta continua actualizan automáticamente los datos para mantener la precisión y relevancia del sistema. Garantiza que los usuarios tengan acceso a los datos más recientes.
Resultado
Esto ayudará a crear un chatbot específicamente para analistas financieros. El bot puede recibir consultas de cola larga como, "¿Cuál fue el beneficio neto de la Empresa X en 2023?" o "¿Cuáles son los principales riesgos identificados en la sección de evaluación de riesgos?" Proporcionará respuestas correctas y contextualmente relevantes en segundos, con citas adecuadas de los documentos originales.
Beneficios clave
Eficiencia: La ingesta, el preprocesamiento y los embeddings se automatizan para ahorrar tiempo al equipo financiero en tareas de mayor nivel.
Escalabilidad: El soporte escalable para almacenar y recuperar millones de vectores en bases de datos vectoriales avanzadas simplifica el análisis a medida que aumentan los volúmenes de datos.
Información en tiempo real: Las actualizaciones continuas garantizan que los analistas tengan la información más reciente para decisiones sensibles al tiempo.
Este caso de uso destaca el poder de los pipelines multimodales para simplificar flujos de trabajo complejos. Ilustra cómo la integración del procesamiento avanzado de datos con soluciones de bases de datos vectoriales puede aportar un valor significativo.
Milvus: Acelerando la búsqueda vectorial
Milvus amplía el soporte mejorado para pipelines de IA multimodal al introducir una serie de funciones para facilitar la integración y el procesamiento de diferentes variedades de datos como textos, imágenes y videos. Algunas de las mejoras clave incluyen:
Búsqueda híbrida vectorial-palabras clave: Milvus integra la similitud vectorial y las búsquedas de palabras clave de texto completo en una sola plataforma. Permite una recuperación eficiente en diferentes modalidades de datos. Esto permite aplicaciones de IA sofisticadas que requieren comprensión semántica y coincidencia precisa de palabras clave.
Tecnología Sparse-BM25: Milvus introdujo la tecnología Sparse-BM25 para habilitar una versión de vector disperso del algoritmo BM25. Es uno de los algoritmos más populares utilizados en sistemas de búsqueda de texto completo. Esta tecnología mejora notablemente la velocidad y la precisión de la búsqueda por palabras clave para complementar las búsquedas semánticas basadas en vectores. Esto mejora el rendimiento de los pipelines de IA multimodal.
Integración de toolkits de desarrollo de IA: Milvus se integra de forma nativa con el conjunto completo de toolkits de desarrollo de IA, incluidos LangChain, LlamaIndex, OpenAI y HuggingFace. Estos toolkits hacen de Milvus el almacén vectorial preferido para aplicaciones de IA generativa que admiten RAG en diversas modalidades de datos y reducen la fricción para desarrollar IA multimodal.
Estas mejoras hacen que Milvus sea robusto y eficiente para crear y desplegar un pipeline de IA multimodal. Esto permite a las organizaciones procesar y analizar diferentes tipos de datos no estructurados en un solo lugar.
Pipelines de datos continuos y automatizados
La naturaleza dinámica y en constante cambio de los datos empresariales requiere flujos de trabajo automatizados para los conjuntos de datos que alimentan los sistemas de IA. DataVolo aborda esto con lo siguiente:
Ingesta en tiempo real: DataVolo permite la ingesta en tiempo real al conectarse a fuentes de datos como buckets de S3, Google Drive y SharePoint. Automatiza la ingesta mediante mecanismos basados en eventos, reduciendo la intervención humana. También proporciona estrategias de ingesta configurables para procesarlos de manera eficiente. Estas estrategias incluyen el listado basado en marcas de tiempo para identificar y gestionar solo archivos nuevos o actualizados sin crear redundancia, optimizando así los recursos.
Arquitectura basada en eventos: Los pipelines de DataVolo están basados en eventos y responden automáticamente a cualquier cambio en los sistemas upstream. Eventos como cambios en archivos, actualizaciones de metadatos o permisos de usuario desencadenan la actualización automática en el pipeline. Incluso los metadatos sensibles, como las ACL, se gestionan de forma segura durante todo este proceso.
Diseño escalable y tolerante a fallos: Presenta escalabilidad y tolerancia a fallos, reduciendo drásticamente la degradación del rendimiento durante la ingesta de alto rendimiento. El escalado horizontal se gestiona mediante orquestación impulsada por Kubernetes. Con lógica de reintentos integrada, procesos de backfill y gestión del tiempo de inactividad upstream, ofrece fiabilidad y resiliencia al gestionar pipelines de datos.
Éxito de la IA mediante la evaluación
La evaluación constituye un pilar esencial para una implementación eficaz de la IA. Mide el refinamiento de los sistemas hacia la precisión, la fiabilidad y la satisfacción. Las siguientes métricas pueden ayudar a evaluar los modelos de IA:
Métricas de recuperación
Precisión: La proporción de datos relevantes recuperados respecto al total de resultados, para que el sistema devuelva solo la información más pertinente.
Recall: La proporción de datos relevantes recuperados respecto al total de datos relevantes, asegurando que no se pierda información valiosa.
Puntuación F1: Esta métrica combina precisión y recall en una sola puntuación. Equilibra las compensaciones entre ambas y ofrece una evaluación integral.
Métricas del modelo de lenguaje
Fidelidad: Verifica si las respuestas de la IA provienen del contexto obtenido y reduce las alucinaciones para mantener la factualidad.
Corrección: Compara las respuestas generadas por la IA con los datos de prueba para medir la exactitud de los resultados.
El desafío radica en evaluar modelos no deterministas, para los cuales los sistemas pueden dar diferentes salidas para la misma entrada debido a su naturaleza probabilística. Determinar y evaluar respuestas "correctas" es inherentemente complejo. Las percepciones de precisión y relevancia suelen variar según el usuario y el contexto específico. Se necesitan bucles de retroalimentación dinámicos, iteraciones, diversos conjuntos de prueba y métricas sensibles al contexto para resolver esto.
El ajuste de hiperparámetros es crucial para refinar los flujos de trabajo de IA, especialmente los sistemas de generación aumentada por recuperación (RAG). Diferentes estrategias de segmentación requieren una configuración cuidadosa de parámetros como el tamaño del fragmento, la superposición y los umbrales de similitud. Estas incluyen la segmentación basada en secciones para un contexto más amplio o la segmentación semántica para una mayor precisión.
Las pruebas iterativas, combinadas con métricas de recuperación, ayudan a identificar el equilibrio óptimo entre precisión y riqueza contextual, garantizando una recuperación y generación de alta calidad.
Los flujos de trabajo centrados primero en la evaluación permiten que los sistemas de IA sigan el ritmo de los panoramas de datos y necesidades de los usuarios en constante cambio. Con refinamientos iterativos y énfasis en métricas robustas, los resultados seguirían siendo creíbles, accionables y contextuales. Al hacerlo, se cierra la brecha entre la experimentación y la implementación fiable en el mundo real, generando así confianza y satisfacción con los resultados de las aplicaciones de IA.
Conclusión
Los pipelines multimodales robustos son la columna vertebral para escalar los sistemas de IA desde etapas experimentales hasta producción a gran escala. Estos pipelines gestionan sin problemas diversos tipos de datos, lo que permite a las empresas crear flujos de trabajo más innovadores.
Ofrece una gestión de datos escalable, segura y de alto rendimiento al integrar plataformas avanzadas de pipelines de datos y bases de datos vectoriales como Zilliz y Milvus. Además, automatizar tareas como el preprocesamiento de datos, la incrustación y el enriquecimiento de metadatos reduciría el esfuerzo manual sin comprometer la precisión ni la escalabilidad.
Las transformaciones y la sincronización en tiempo real de los sistemas de IA los harán eficaces. Facilita la creación de flujos de trabajo de IA, permitiendo una evaluación y mejora continuas.
Esto ayuda a las empresas a mejorar continuamente el rendimiento de las aplicaciones, adaptarse a panoramas de datos en evolución y satisfacer necesidades empresariales dinámicas. Estas tecnologías pueden ayudar a las empresas en cómo procesan datos e implementan aplicaciones impulsadas por IA.
Recursos adicionales
Sigue leyendo

Notion's Vector Search Is Excellent. Their Next Problem Is Harder.
Notion solved vector search scaling in two years. The next bottleneck — offline context engineering, unified data, and the real-time/offline gap — is harder.

AI Agents Are Quietly Transforming E-Commerce — Here’s How
Discover how AI agents transform e-commerce with autonomous decision-making, enhanced product discovery, and vector search capabilities for today's retailers.

Proactive Monitoring for Vector Database: Zilliz Cloud Integrates with Datadog
we're excited to announce Zilliz Cloud's integration with Datadog, enabling comprehensive monitoring and observability for your vectorDB deployments.



