Técnicas avanzadas de RAG: conectando texto e imágenes para respuestas más precisas
Los modelos de lenguaje grandes (LLMs) han demostrado capacidades excepcionales para comprender y generar diversos tipos de contenido, textual o visual, lo que los ha llevado a una amplia adopción en diversas industrias. A pesar de su versatilidad, los LLMs suelen producir información inexacta o fabricada—conocida como alucinaciones—debido a un conocimiento limitado del dominio y datos desactualizados.
Retrieval-Augmented Generation (RAG) es una técnica que aborda estos desafíos combinando las capacidades generativas de los LLMs con sistemas de recuperación que obtienen información relevante de fuentes externas. Al fundamentar las respuestas de los LLMs en datos reales y actualizados, RAG mejora la precisión y la relevancia contextual de las respuestas y aumenta la eficiencia general del sistema. Esta combinación de generación y recuperación impulsa la innovación, transforma el procesamiento de datos y hace que los LLMs sean más fiables en aplicaciones del mundo real.
En un reciente Unstructured Data Meetup organizado por Zilliz, Yi Ding, anteriormente Head of Typescript and Partnerships en LlamaIndex, compartió ideas sobre un nuevo enfoque de RAG: Small to Slide. Este método mejora el rendimiento de los LLMs multimodales al tratar con datos visuales como presentaciones o documentos con imágenes. En este blog, exploraremos cómo funciona RAG, los desafíos de RAG y técnicas avanzadas de RAG como Small to Slide RAG.
Comprender RAG
RAG combina el poder de los LLMs con la capacidad de recuperar información específica de una base de conocimiento impulsada por bases de datos vectoriales. Cuando un usuario hace una pregunta, el sistema RAG busca en la base de datos información relevante y utiliza esta información para generar una respuesta más precisa. Veamos cómo funciona el proceso de RAG.
Figura: Cómo funciona RAG
Un sistema RAG consta de tres componentes clave: un modelo de embedding, una base de datos vectorial y un LLM.
El modelo de embedding convierte documentos en embeddings vectoriales, que se almacenan en una base de datos vectorial como Milvus.
Cuando un usuario hace una pregunta, el sistema transforma la consulta en un vector utilizando el mismo modelo de embedding.
Luego, la base de datos vectorial realiza una búsqueda de similitud para recuperar la información más relevante. Esta información recuperada se combina con la pregunta original para formar una "pregunta con contexto", que luego se envía al LLM.
El LLM procesa esta entrada enriquecida para generar una respuesta más precisa y contextualmente relevante.
Este método es especialmente valioso para manejar conocimiento especializado o información dinámica y actualizada con frecuencia, asegurando que los sistemas de IA proporcionen respuestas precisas y fiables.
Por ejemplo, una gran plataforma de comercio electrónico podría usar este enfoque para impulsar su sistema de recomendación de productos. El sistema podría procesar millones de descripciones de productos, reseñas de clientes y datos de uso, y almacenarlos como vectores. Cuando un usuario busca un producto, el sistema recupera rápidamente los artículos más relevantes, considerando no solo las palabras clave, sino también el significado semántico de la consulta.
Desafíos de RAG y técnicas avanzadas de RAG
Aunque RAG ofrece capacidades potentes, también enfrenta desafíos que pueden afectar su eficacia, especialmente a medida que los datos se vuelven grandes y complejos.
Velocidad: Buscar en bases de datos más grandes lleva más tiempo. Esto puede mitigarse aprovechando la computación acelerada por hardware, como la optimización para GPUs u otros sistemas de alto rendimiento.
Precisión: Garantizar que estemos recuperando la información más relevante es un desafío. Los desarrolladores necesitan formas de equilibrar el rendimiento y la precisión de los datos según sus necesidades.
Datos multimodales: Un RAG básico tiene dificultades con datos no textuales, como imágenes o gráficos. Manejar diferentes tipos de datos vectoriales se vuelve crucial en estos casos.
En las siguientes secciones, exploraremos varias técnicas avanzadas de RAG—Small to Big RAG, Small to Slide RAG y ColPali—que abordan estos desafíos, mejorando la velocidad, la precisión y la versatilidad de los sistemas RAG.
Small to Big RAG
Small to Big RAG es un método para mejorar la precisión de los sistemas RAG. La idea central es dividir los documentos en fragmentos más pequeños y centrados en la intención para búsquedas precisas, pero recuperar secciones de contexto más grandes en lugar de devolver solo las piezas coincidentes exactas, para garantizar que los LLMs puedan generar respuestas significativas y completas. Esto se debe a que, si bien los fragmentos más pequeños mejoran la precisión de la búsqueda al centrarse en detalles específicos, también pueden pasar por alto contexto crítico, lo que lleva a respuestas incompletas o inexactas.
Veamos un ejemplo.
Considera la consulta: “¿Dónde trabaja la Sra. Churilo?”
Cuando se procesa, el modelo de embedding podría priorizar la palabra menos común “Churilo” por encima de términos más importantes como “trabaja.” Como resultado, el sistema podría recuperar frases que mencionen “Churilo” pero no proporcionar la información clave: “Chris es actualmente VP of Marketing en Zilliz.”
Small to Big RAG aborda esta limitación recuperando todo el párrafo donde se menciona su rol, dando al LLM el contexto completo necesario para ofrecer una respuesta correcta y completa.
Figura: Recuperación incorrecta en RAG tradicional
Small to Big RAG es particularmente eficaz para manejar datos de texto complejos o de múltiples capas. En un sistema de soporte técnico, por ejemplo, recuperar una sola frase con una palabra clave relevante podría omitir detalles circundantes que son críticos para la comprensión. En cambio, Small to Big RAG recupera todas las secciones relacionadas con la consulta. Por ejemplo, cuando un usuario pregunta, “¿Cómo restablezco mi contraseña?” el sistema podría recuperar el párrafo con la respuesta directa e incluir contexto adicional, como recomendaciones de seguridad, haciendo que la respuesta sea más completa y útil.
Al combinar la precisión de embeddings más pequeños con la profundidad contextual de una recuperación más amplia, Small to Big RAG garantiza un equilibrio entre precisión e integridad. Este enfoque permite que los sistemas de IA proporcionen respuestas que no solo sean precisas, sino también ricas en contexto, mejorando su fiabilidad en aplicaciones del mundo real.
Small to Slide RAG
Si bien Small to Big RAG sobresale en el manejo de datos basados en texto, tiene dificultades para capturar información incrustada en elementos visuales como diapositivas, charts o gráficos. Small to Slide RAG es un método RAG mejorado que resuelve este problema al incrustar texto de elementos visuales como diapositivas, pero recuperando la imagen completa de la diapositiva. Este resultado recuperado se proporciona luego a un LLM multimodal capaz de analizar tanto texto como imágenes, y es procesado por él.
Así es como funciona:
Incrustación de texto: El sistema extrae e incrusta texto de las diapositivas.
Recuperación visual: En lugar de recuperar solo texto, recupera la imagen completa de la diapositiva que contiene la información relevante.
Procesamiento multimodal: Las imágenes de diapositivas recuperadas se introducen en un LLM multimodal (por ejemplo, GPT-4 con capacidades de visión) que puede procesar tanto los componentes visuales como los textuales simultáneamente.
Este método es particularmente útil para manejar documentos complejos donde la información crucial se transmite mediante elementos visuales. Por ejemplo, en informes financieros trimestrales, los insights clave a menudo se encuentran en gráficos o charts que los sistemas RAG tradicionales basados en texto podrían pasar por alto. Al recuperar y analizar la imagen completa de la diapositiva, Small to Slide RAG garantiza que no se pase por alto ningún detalle crítico, proporcionando una respuesta más precisa y completa.
Para demostrar el poder de Small to Slide RAG, Yi Ding hizo una demostración de un ejemplo práctico usando una presentación de Nvidia. Puedes ver la demostración aquí.
Figura: Una comparación entre el contexto recuperado por un RAG tradicional y un Small to Slide RAG
En esta demostración, Yi Ding comparó el contexto recuperado por un sistema RAG tradicional con Small to Slide RAG al responder la misma pregunta: "¿Qué plataformas SaaS admite NVIDIA AI Enterprise?"
RAG tradicional: El sistema RAG tradicional basado en texto tuvo dificultades para proporcionar una respuesta completa. Se basó únicamente en el texto extraído de las diapositivas, perdiendo información crítica incrustada en charts y diagramas. Esta limitación dio como resultado una respuesta incompleta y menos informativa.
Small to Slide RAG: En contraste, Small to Slide RAG ofreció resultados mucho mejores. El sistema recuperó las imágenes reales de las diapositivas que contenían la información relevante y las introdujo en un LLM multimodal (por ejemplo, GPT-4 con capacidades de visión). Esto permitió al modelo interpretar tanto el texto como los elementos visuales, generando una respuesta mucho más completa y precisa.
Este ejemplo ilustra la fortaleza única de Small to Slide RAG: su capacidad para manejar documentos complejos donde la información clave se distribuye entre texto y elementos visuales, lo que lo convierte en una herramienta invaluable para procesar contenido visualmente rico.
Para que estos métodos RAG funcionen sin problemas, requieren infraestructura para gestionar consultas complejas y operaciones de recuperación.
ColPali: Superando los límites
Al final de su charla, Yi presentó una técnica emergente llamada ColPali, un novedoso modelo de recuperación de documentos que supera los límites de la generación aumentada por recuperación (Retrieval-Augmented Generation, RAG). A diferencia de los métodos tradicionales que convierten documentos con datos visuales (como diapositivas y PDFs) en texto, ColPali trabaja directamente con las características visuales de los documentos, lo que le permite indexar y recuperar información sin el paso propenso a errores de la extracción de texto.
Cómo funciona ColPali
Aunque todavía se encuentra en sus primeras etapas, ColPali cambia la forma en que normalmente realizamos la recuperación de documentos al centrarse en los datos visuales:
Los documentos se tratan como imágenes, omitiendo por completo la conversión de texto.
Se generan múltiples incrustaciones, similares a los n-gramas visuales, por imagen para capturar características visuales detalladas.
Las búsquedas se realizan comparando las incrustaciones visuales con la consulta, identificando las áreas más relevantes del documento.
Figura: documento en francés sobre la producción de petróleo en Kazajistán, con ciertas áreas resaltadas
Veamos el ejemplo mostrado en la imagen anterior: un documento en francés sobre la producción de petróleo en Kazajistán. Cuando se pregunta sobre la producción de petróleo en alta mar, ColPali resalta áreas específicas del documento—como gráficos y diagramas—que son más relevantes para la consulta. Esto garantiza que se tengan en cuenta tanto los elementos textuales como los visuales, ofreciendo una comprensión integral del contenido.
Por qué ColPali es emocionante
ColPali ofrece varias ventajas clave sobre los sistemas RAG tradicionales:
Al trabajar directamente con imágenes, evita las imprecisiones introducidas al convertir documentos complejos (p. ej., PDFs) a texto.
Captura información visual, como diseños, diagramas y formato, que a menudo se pierde en los métodos basados en texto.
ColPali permite la recuperación y búsqueda de datos visuales, abriendo posibilidades en campos como el diseño técnico, la documentación legal y más.
Una aplicación práctica de ColPali podría ser en revisiones de diseño arquitectónico. Imagina un sistema de IA que analiza planos y dibujos técnicos directamente. Cuando se le consulta sobre elementos de diseño específicos, el sistema podría resaltar partes relevantes de los dibujos, incorporando tanto anotaciones textuales como características visuales.
Desafíos y limitaciones de ColPali
Aunque ColPali es prometedor, todavía se encuentra en sus primeras etapas y presenta algunos desafíos:
Alta demanda computacional: Generar y comparar múltiples incrustaciones por imagen es computacionalmente intensivo, lo que hace que la aceleración por GPU sea esencial para un uso práctico.
Ecosistema limitado: En comparación con técnicas RAG más establecidas, hay menos herramientas y recursos disponibles para implementar ColPali.
Modelos específicos de idioma y entrenamiento: Actualmente, los modelos de ColPali dependen de conjuntos de datos de entrenamiento específicos, lo que puede limitar la generalización en diferentes dominios.
Ventajas y desventajas de cada técnica RAG
Cada una de las técnicas que hemos discutido anteriormente ofrece ventajas y limitaciones distintas.
Figura: Comparación de diferentes técnicas RAG
RAG basado en texto es el más sencillo de implementar, beneficiándose de un amplio soporte de herramientas. Sin embargo, tiene dificultades para mantener información multimodal y no siempre maneja la fragmentación perfectamente. Por otro lado, Small to Slide mejora la captura de datos multimodales, aunque exige una configuración más compleja y funciona mejor con tipos de datos específicos. Por último, ColPali simplifica el proceso al evitar la necesidad de conversión de texto e integrar atribución incorporada, pero requiere GPUs y modelos personalizados, lo que puede limitar la accesibilidad para algunos proyectos.
Implementación de RAG avanzado: consideraciones prácticas
Si estás considerando implementar estas técnicas avanzadas de RAG en tus propios proyectos, aquí tienes algunos puntos a tener en cuenta.
Evaluación de datos
Observa los tipos de datos con los que estás trabajando. Si tienes muchos documentos con gráficos, imágenes o diseños complejos, enfoques como Small to Slide RAG podrían ser particularmente beneficiosos. Por ejemplo, si estás construyendo un sistema para analizar informes financieros, que a menudo contienen una mezcla de texto, tablas y gráficos, Small to Slide RAG podría proporcionar información más completa que un enfoque solo de texto.
Recursos computacionales
Métodos como Small to Slide RAG y ColPali pueden ser más intensivos computacionalmente que el RAG tradicional. Asegúrate de contar con los recursos necesarios, especialmente cuando trabajes con grandes conjuntos de datos.
Selección del modelo
Estas técnicas avanzadas a menudo requieren tipos específicos de modelos. Para Small to Slide RAG, necesitarás un LLM multimodal capaz de procesar texto e imágenes. Asegúrate de elegir un modelo que se ajuste a tus necesidades y de contar con los recursos para ejecutarlo.
Capacidades de la base de datos vectorial
Elegir la base de datos vectorial adecuada es crucial para implementar un sistema RAG adaptado a tus necesidades. Por ejemplo, si estás implementando un Small to Big RAG, necesitarás una base de datos vectorial capaz de recuperar eficientemente fragmentos de texto más grandes utilizando embeddings generados a partir de fragmentos más pequeños. La escalabilidad se vuelve clave si tu aplicación trabaja con cantidades masivas de datos vectoriales, como conjuntos de datos a escala de miles de millones. Soluciones como Milvus y su servicio gestionado, Zilliz Cloud, están diseñadas para estos escenarios y ofrecen recuperación vectorial altamente escalable y eficiente.
Métricas de evaluación
Desarrolla métricas claras para evaluar el rendimiento de tu sistema RAG, incluida la relevancia de la información recuperada, la precisión de las respuestas generadas y la velocidad de recuperación y generación.
Desarrollo iterativo
RAG está evolucionando rápidamente. Planifica un proceso de desarrollo iterativo que te permita probar y comparar fácilmente diferentes enfoques. Comienza con una implementación básica de RAG y luego introduce gradualmente técnicas más avanzadas como Small to Big RAG o Small to Slide RAG. Evalúa continuamente el rendimiento y los comentarios de los usuarios para guiar tu proceso de desarrollo.
Conclusión
Las técnicas RAG continúan evolucionando y ofrecen diferentes enfoques como RAG basado en texto, Small to Slide RAG y ColPali para abordar necesidades diversas. Si bien el RAG basado en texto proporciona un punto de partida sólido para aplicaciones generales, los casos más especializados, especialmente aquellos que manejan datos visuales, pueden beneficiarse de métodos avanzados como Small to Slide RAG o ColPali.
Elegir el método adecuado depende de tus datos y de los recursos disponibles. Cada enfoque proporciona una forma de mejorar la eficiencia y la precisión de los sistemas de IA, lo que permite un mejor equilibrio entre complejidad, velocidad y coste. Al alinear tu enfoque con tus requisitos específicos, puedes aprovechar RAG para crear sistemas que ofrezcan a los usuarios la información adecuada en el momento adecuado y en el formato adecuado.
Recursos adicionales
RAG multimodal: ir más allá del texto para una IA más inteligente
ColPali: recuperación eficiente de documentos con modelos de visión-lenguaje
Implementación de un sistema RAG multimodal con vLLM y Milvus
El panorama del ecosistema GenAI: más allá de los LLM y las bases de datos vectoriales
Modelos de IA con mejor rendimiento para tus aplicaciones GenAI | Zilliz
Sigue leyendo

Data Deduplication at Trillion Scale: How to Solve the Biggest Bottleneck of LLM Training
Explore how MinHash LSH and Milvus handle data deduplication at the trillion-scale level, solving key bottlenecks in LLM training for improved AI model performance.

Zilliz Named "Highest Performer" and "Easiest to Use" in G2's Summer 2025 Grid® Report for Vector Databases
Zilliz shines in G2's Summer 2025 Grid® Report as both "Highest Performer" and "Easiest to Use," solving the performance-usability dilemma.

OpenAI o1: What Developers Need to Know
In this article, we will talk about the o1 series from a developer's perspective, exploring how these models can be implemented for sophisticated use cases.



