Evaluación de sistemas RAG multimodales usando Trulens
A medida que las arquitecturas multimodales adquieren mayor protagonismo en la IA generativa (GenAI), las organizaciones crean cada vez más soluciones usando modelos multimodales como GPT-4V y Gemini Pro Vision. Estos modelos ofrecen una ventaja clave: pueden incrustar e interpretar semánticamente varios tipos de datos —texto, imágenes y más—, lo que los hace más versátiles y eficaces que los modelos de lenguaje grandes tradicionales (LLMs) en una gama más amplia de aplicaciones.
Sin embargo, a medida que crece el interés por los modelos multimodales, también aumentan los desafíos para garantizar su fiabilidad y precisión. Al igual que los LLMs, los modelos multimodales son propensos a las "alucinaciones", en las que producen resultados incorrectos o irrelevantes, particularmente cuando se les encarga procesar simultáneamente diferentes tipos de datos de entrada. La generación aumentada por recuperación multimodal (RAG) aborda estas limitaciones enriqueciendo los modelos con información contextual relevante de fuentes externas.
En un Unstructured Data Meetup organizado por Zilliz, Josh Reini, Developer Advocate en TruEra (ahora adquirida por Snowflake), compartió ideas sobre los desafíos y soluciones de trabajar con marcos multimodales. Josh destacó cómo podríamos mitigar las alucinaciones de la IA usando herramientas de código abierto como Trulens y cómo la integración de la base de datos vectorial Milvus puede mejorar el rendimiento de los sistemas RAG multimodales.
Josh Reini hablando en el SF Unstructured Data Meetup de noviembre
En este blog, recapitularemos las ideas de Josh y analizaremos el papel crítico que desempeñan las evaluaciones (o "Evals") en la mejora de los sistemas RAG multimodales, garantizando que estos sistemas ofrezcan resultados precisos y relevantes al manejar datos complejos. También puedes ver la charla completa de Josh en YouTube para obtener más ideas.
Comprender los modelos multimodales y RAG multimodal
Los modelos multimodales son modelos de aprendizaje automático que pueden procesar e integrar múltiples tipos de datos o modalidades, como texto, imágenes, audio y video. A diferencia de los modelos de lenguaje tradicionales que se centran en un solo tipo de entrada, los modelos multimodales combinan información de diversas fuentes para crear resultados más precisos contextualmente. Esta versatilidad los hace especialmente útiles en escenarios donde los datos provienen de diferentes formatos. Por ejemplo, un modelo multimodal podría usar una imagen y una descripción de texto para generar una respuesta más precisa que un modelo que depende de un solo tipo de entrada.
Al igual que los LLMs, los modelos multimodales están optimizados para la generalización, lo que les permite responder a diversas entradas. Sin embargo, esta optimización tiene un coste. A menudo se penaliza a los modelos por memorizar datos específicos, lo que crea una tensión entre ser flexibles y precisos. Este acto de equilibrio se vuelve complicado cuando la tarea implica cruzar múltiples modalidades, como diagnosticar una enfermedad basándose en síntomas descritos en texto e imágenes de rayos X.
Para dotar a estos modelos de propósito general de memorias a largo plazo, podemos descargar conocimientos específicos "memorizados" a recursos externos, como un almacén vectorial (p. ej., Milvus). Esta técnica se conoce como RAG multimodal.
Los sistemas RAG tradicionales se centran en recuperar texto relevante para mejorar el proceso generativo de los LLMs, produciendo respuestas más precisas y personalizadas. RAG multimodal va más allá del texto al integrar tipos de datos adicionales—imágenes, audio, videos y más—en el proceso de recuperación y generación usando modelos multimodales y bases de datos vectoriales. Este enfoque permite que los sistemas RAG multimodales funcionen de manera más eficaz en tareas que requieren una comprensión más profunda de entradas textuales y no textuales.
Por ejemplo, RAG multimodal puede recuperar imágenes o videos relevantes en sistemas visuales de preguntas y respuestas para generar respuestas más precisas. Del mismo modo, en tareas como la generación de descripciones de imágenes o sistemas de diálogo multimodal, la capacidad de combinar datos visuales y textuales garantiza que el sistema proporcione resultados más relevantes y precisos en contexto.
Al aprovechar las fortalezas complementarias de los modelos multimodales y los mecanismos avanzados de recuperación, RAG multimodal ofrece una solución potente para manejar datos complejos y multiformato y generar respuestas ricas y conscientes del contexto en una amplia gama de aplicaciones.
¿Cómo funciona RAG multimodal?
Ahora que hemos introducido el concepto de RAG multimodal, exploremos cómo operan estos sistemas. Usaremos un sistema visual de preguntas y respuestas aumentado por recuperación como ejemplo para ilustrar el proceso:
Figura- Cómo funciona un sistema RAG multimodal
Procesamiento de entrada multimodal: El sistema RAG recibe una consulta del usuario junto con una imagen.
Embedding: Tanto la imagen como la consulta de texto se transforman en embeddings vectoriales usando un modelo de embeddings multimodal. Estos embeddings permiten al sistema analizar y comparar la entrada entre diferentes modalidades (texto e imagen), lo que lo hace capaz de comprender las relaciones entre ambas.
Recuperación de base de datos vectorial: El sistema usa embeddings de imágenes para consultar una base de datos vectorial, como Milvus o su versión gestionada, Zilliz Cloud, para recuperar imágenes similares y sus anotaciones asociadas o datos relevantes. Este paso de recuperación enriquece el conocimiento del modelo al proporcionar contexto adicional a partir de datos del mundo real.
Completion: Los datos recuperados (imágenes similares y sus anotaciones) se combinan con la consulta de entrada original. El modelo multimodal usa este contexto enriquecido para generar una respuesta integral o completion que aprovecha tanto la entrada original como la información recuperada.
Respuesta: Finalmente, el sistema genera una respuesta precisa integrando los datos externos recuperados con la entrada original. Esto permite que el modelo produzca una respuesta más consciente del contexto, relevante y precisa a la consulta del usuario.
Al incorporar datos externos mediante recuperación, los sistemas RAG multimodales van más allá de lo que el modelo sabe internamente, garantizando resultados más precisos y relevantes en contexto.
La necesidad de evaluaciones sistemáticas
A pesar de la potente combinación de modelos multimodales y sistemas de recuperación, persisten desafíos. Aunque las demostraciones impresionantes pueden mostrar el potencial de RAG multimodal, convertir una demostración en una aplicación robusta y lista para producción es mucho más difícil.
La clave para superar estos desafíos es la evaluación sistemática. Estas evaluaciones ayudan a identificar debilidades, modos de fallo y áreas de mejora en aplicaciones multimodales, lo que permite a los desarrolladores refinarlas y optimizarlas con el tiempo. En el campo de la IA, a menudo vemos dos tipos de equipos:
Equipos que crean prototipos emocionantes que funcionan alrededor del 80% del tiempo.
Equipos que despliegan con éxito estos sistemas en producción, lo cual es una tarea mucho más compleja y exigente.
Para el segundo grupo—aquellos enfocados en producción—la iteración y evaluación sistemáticas son esenciales, particularmente en campos como la educación (tutores basados en LLM), atención al cliente (resumen de transcripciones) y servicios financieros (chatbots internos o orientados al cliente), donde la fiabilidad y la precisión son críticas.
Aquí es donde las herramientas de evaluación, a menudo llamadas Evals, se vuelven indispensables. Las herramientas de evaluación permiten a los desarrolladores monitorear el rendimiento, probar la fiabilidad e identificar áreas de mejora a medida que iteran hacia una solución apta para producción. Las herramientas de evaluación populares incluyen Trulens, Ragas, LangFuse, OpenAI Evals, DeepEval, Phoenix y LangSmith.
En las siguientes secciones, usaremos TruLens, una herramienta de evaluación de código abierto, como caso de estudio para demostrar cómo las evaluaciones sistemáticas pueden aplicarse a sistemas RAG multimodales.
Cómo ayuda TruLens con la evaluación de RAG multimodal
Trulens es una herramienta de código abierto para evaluar modelos de lenguaje grandes (LLM) y aplicaciones RAG multimodales. Su fortaleza radica en su capacidad para monitorear, probar y depurar aplicaciones, lo que la hace especialmente útil para identificar áreas de mejora y garantizar la fiabilidad de la aplicación.
Una vez que los desarrolladores conectan su aplicación a TruLens, pueden registrar entradas y definir funciones de evaluación que evalúan sistemáticamente el rendimiento del modelo. Estas evaluaciones son cruciales para detectar alucinaciones, que pueden llevar a respuestas inexactas o irrelevantes, especialmente en sistemas RAG multimodales complejos.
En un sistema RAG típico, tres componentes principales necesitan evaluación:
Figura- Tres pilares de RAG (Tríada RAG)
Consulta: El usuario envía una consulta, que podría ser en forma de texto o de texto e imágenes combinados.
Contexto: El sistema recupera información relevante, como imágenes y texto, desde una base de datos vectorial para proporcionar contexto al modelo.
Respuesta: El LLM o modelo multimodal genera una respuesta basada en el contexto recuperado y la consulta original.
Para garantizar que el modelo siga siendo preciso y fiable, se realizan evaluaciones en cada paso para detectar alucinaciones y evaluar qué tan bien funciona el sistema. Esto a menudo se llama la Tríada RAG, como se muestra en el diagrama adjunto.
Hay tres tipos críticos de evaluaciones para garantizar que la salida del sistema sea confiable:
Relevancia del contexto: Esto comprueba qué tan estrechamente la información recuperada (texto o imágenes) se alinea con la consulta original. ¿El contexto recuperado es relevante y útil para la consulta en cuestión?
Fundamentación: La fundamentación evalúa si el contexto recuperado respalda la respuesta generada. ¿La respuesta se basa en información recuperada, o está generando datos no respaldados o incorrectos?
Relevancia de la respuesta: Esto mide la utilidad y precisión de la respuesta del modelo. ¿La respuesta es significativa y relevante para la pregunta del usuario?
Al integrar TruLens, los desarrolladores pueden rastrear y mejorar continuamente el rendimiento de sus sistemas RAG multimodales, garantizando que el modelo siga siendo preciso, fundamentado en evidencia y contextualmente relevante, al tiempo que minimizan las alucinaciones.
Para obtener una guía paso a paso sobre cómo implementar y evaluar RAG usando Trulens, lee este tutorial: Evaluations for Retrieval Augmented Generation: TruLens + Milvus.
Ejemplo del mundo real: Evaluación de un sistema RAG visual de preguntas y respuestas
Para comprender mejor esto, consideremos un ejemplo de un sistema RAG visual de preguntas y respuestas. En este sistema, el usuario proporciona tanto una consulta como una imagen. El modelo genera un embedding a partir de la imagen y busca en una base de datos vectorial imágenes similares, que luego se emparejan con anotaciones para generar la respuesta final.
En cada paso, debemos evaluar si las imágenes recuperadas son relevantes para la consulta original, si la respuesta del LLM está fundamentada en el contexto proporcionado y si la respuesta final es relevante para la pregunta original. Si el sistema recupera imágenes irrelevantes o genera diagnósticos incorrectos, las evaluaciones nos ayudarán a identificar el modo de fallo y mejorar el modelo.
Un equipo, X-ray Insight, creó una app durante un hackathon que ilustra estas evaluaciones en acción. Recopilaron imágenes de rayos X y anotaciones (diagnósticos), transformaron las imágenes en embeddings de imagen, cargaron estos embeddings junto con metadatos (los diagnósticos) en la base de datos vectorial Milvus/Zilliz y usaron una imagen proporcionada por el usuario (que también se ha transformado en embeddings) para recuperar casos similares. Los metadatos (p. ej., diagnósticos) asociados con estas imágenes se utilizaron para generar un diagnóstico final mediante un modelo multimodal.
Figura: Cómo funciona el sistema X-ray Insight
Usando TruLens, el equipo de X-ray Insight pudo evaluar el rendimiento de su modelo en múltiples etapas:
Generación de embeddings: Preprocesar la imagen, calcular el embedding (un proceso que consume mucho tiempo) y garantizar la calidad del embedding.
Recuperación de casos: Buscar casos relevantes en la base de datos vectorial en función de los embeddings calculados.
Diagnóstico final: Generar un diagnóstico a partir de las notas del paciente y compararlo con los datos recuperados.
Una vez que estas evaluaciones están implementadas, TruLens permite al equipo analizar características compartidas entre diagnósticos, identificar modos de fallo y mejorar basándose en los conocimientos obtenidos.
Conclusión
En resumen, desplegar modelos multimodales y sistemas RAG en producción requiere más que crear un prototipo interesante. La iteración sistemática mediante evaluaciones como la relevancia del contexto, la fundamentación y la relevancia de la respuesta es esencial para garantizar que estos modelos sean fiables y precisos. Herramientas como TruLens proporcionan un marco para rastrear, probar y depurar estas apps, ayudando a los desarrolladores a perfeccionar sus modelos y evitar alucinaciones.
A medida que seguimos ampliando los límites de lo que los modelos multimodales pueden hacer, las evaluaciones seguirán siendo una piedra angular del proceso de desarrollo. Garantizarán que estos modelos generen resultados de una manera fundamentada y relevante.
Recursos adicionales
Sigue leyendo

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

Zilliz Cloud Now Available in AWS Europe (Ireland)
Zilliz Cloud launches in AWS eu-west-1 (Ireland) — bringing low-latency vector search, EU data residency, and full GDPR-ready infrastructure to European AI teams. Now live across 30 regions on five cloud providers.

Vector Databases vs. Hierarchical Databases
Use a vector database for AI-powered similarity search; use a hierarchical database for organizing data in parent-child relationships with efficient top-down access patterns.



