8 avances más recientes de RAG que todo desarrollador debería conocer
Los modelos de lenguaje grandes (LLMs) son potentes, pero solo tan buenos como sus datos de entrenamiento. Cuando haces una pregunta compleja, quieres que la IA combine su conocimiento incorporado con información nueva y relevante de fuentes externas. Eso es exactamente lo que hace la generación aumentada por recuperación: cierra la brecha entre los datos de entrenamiento estáticos y la información dinámica y actualizada.
El RAG tradicional ha sido significativo, pero los desarrolladores han estado ampliando los límites de lo posible. En este artículo, exploraremos ocho variantes avanzadas de RAG que pueden resolver problemas reales que podrías estar enfrentando: recuperación lenta, mala comprensión del contexto, manejo de datos multimodales y optimización de recursos.
Por qué importan estos nuevos tipos de RAG
Los sistemas RAG tradicionales combinaban dos pasos: recuperar datos relevantes como contexto desde una base de conocimiento impulsada por una base de datos vectorial, como Milvus, y generar respuestas usando un modelo de lenguaje.
Aunque eran eficaces, las primeras implementaciones de RAG enfrentaban desafíos de eficiencia, escalabilidad y gestión del flujo de datos. A menudo dependían de medidas de similitud simples que podían pasar por alto matices cruciales, lo que resultaba en respuestas genéricas para consultas complejas. Para superar estas limitaciones, los investigadores han introducido nuevas estrategias que permiten a los modelos:
Decidir dinámicamente los pasos de recuperación: En lugar de recuperar siempre los datos de una sola vez, los métodos más nuevos determinan los momentos óptimos para recuperar información externa.
Incorporar datos multimodales: Más allá del texto, algunos sistemas pueden recuperar imágenes y videos para enriquecer el contenido generado.
Optimizar el uso de recursos: Los frameworks RAG avanzados ajustan la asignación de cómputo según la complejidad de la consulta.
Aquí es donde entran en juego los emocionantes avances en RAG. Estas mejoras han llevado a resultados más precisos y conscientes del contexto que satisfacen mejor las necesidades tanto de los desarrolladores como de las empresas.
Referencia rápida: ¿Qué RAG deberías usar?
Aquí tienes una descripción general amigable para desarrolladores de lo que cubriremos:
| Tipo de RAG | Innovación clave | Ideal para |
| DeepRAG | Proceso de decisión de recuperación paso a paso | Análisis legal o médico |
| RealRAG | Procesamiento de datos en tiempo real | Monitoreo de redes sociales, aplicación de noticias |
| CoRAG | Recuperación secuencial, adaptativa y de varios pasos | Solución de problemas técnicos |
| VideoRAG | Comprensión de video a texto | Resumen de conferencias |
| CFT-RAG | Recuperación basada en árboles (texto + imagen) | Detección de fraude |
| CG-RAG | Razonamiento contextual basado en grafos | Investigación académica con citas |
| GFM-RAG | Conexiones de conocimiento con redes neuronales de grafos | Análisis de patentes |
| URAG | Soporte unificado (texto + imagen + audio) | Chatbots educativos |
DeepRAG
DeepRAG reemplaza los pipelines de recuperación tradicionales con una única red neuronal entrenada de extremo a extremo. Modela el razonamiento aumentado por recuperación como un proceso de decisión. En lugar de tratar la recuperación y la generación como tareas separadas, decide dinámicamente cuándo depender de datos externos frente al razonamiento interno. Este enfoque paso a paso aborda eficazmente lagunas de conocimiento específicas.
Mejora la profundidad y la precisión al mejorar las tareas intensivas en razonamiento en alrededor de un 8-15% y reduce la recuperación innecesaria de datos, ahorrando recursos de cómputo. Si bien puede aumentar la complejidad del diseño del sistema y requerir ajuste fino para equilibrar la frecuencia de recuperación. Es ideal para la verificación de hechos, tareas de razonamiento de varios pasos, dominios intensivos en investigación y la generación de informes detallados (por ejemplo, análisis de documentos legales o soporte para diagnósticos médicos).
Características clave:
Recuperación dinámica: Evalúa cada paso para decidir si se necesita recuperación.
Toma de decisiones estratégica: Utiliza un proceso de decisión similar a un Proceso de Decisión de Markov.
GitHub: https://github.com/microsoft/deepRAG
Artículo: https://arxiv.org/html/2502.01142v1
RealRAG
RealRAG mejora los modelos generativos de texto a imagen (por ejemplo, Flux y Stable Diffusion V3) mediante la recuperación de imágenes del mundo real. Al comparar las imágenes generadas con ejemplos recuperados, el sistema cubre lagunas de conocimiento para mejorar el realismo.
Produce salidas de imagen más realistas y mejora la calidad del contenido visual. Sin embargo, tiene altos costos de infraestructura para el procesamiento multimodal 24/7. También puede tener dificultades en dominios con conjuntos de datos de imágenes de calidad limitados. Es particularmente útil para el diseño de productos y la imagen médica, donde las representaciones visuales precisas son esenciales.
Figura- Descripción general de RealRAG
Figura: Descripción general de RealRAG (Fuente).
Características clave:
Aumento de la puntuación FID: 16.18% en el benchmark Stanford Car
Recuperación basada en imágenes: Mejora la generación con datos visuales externos.
Aprendizaje autorreflexivo: Refina las salidas mediante retroalimentación de comparaciones de imágenes.
Artículo: https://arxiv.org/abs/2502.00848
CoRAG: Generación aumentada por cadena de recuperación
Inspirado en chain-of-thought prompting, CoRAG divide las consultas en subpreguntas y recupera información de forma secuencial. Ajusta la profundidad y amplitud de la recuperación según la complejidad de la consulta y reformula las consultas según sea necesario.
Maneja preguntas multifacéticas con hasta un 30% más de precisión y prioriza la información esencial mediante recuperación secuencial. Sin embargo, múltiples rondas de recuperación aumentan la latencia. Es ideal para la resolución de problemas técnicos o la investigación donde las consultas requieren información de múltiples capas.
Características clave:
Recuperación secuencial: Recupera datos en múltiples pasos para refinar la respuesta.
Asignación adaptativa de cómputo: Equilibra los recursos según las necesidades de datos.
Artículo: https://arxiv.org/abs/2501.14342
VideoRAG: Generación aumentada por recuperación sobre corpus de video
El contenido de video es una rica fuente de información, pero el RAG tradicional está diseñado principalmente para documentos basados en texto. VideoRAG extiende las capacidades de RAG al contenido de video mediante el uso de modelos de visión-lenguaje (VLMs) como CLIP, junto con conversión de voz a texto, análisis de fotogramas y procesamiento de audio para extraer información. Esto permite que los LLMs comprendan, procesen y respondan a consultas relacionadas con videos. Convierte los fotogramas de video en incrustaciones de texto para permitir consultas como “Encuentra escenas con conflicto emocional”.
VideoRAG puede manejar contenido de video extremadamente largo sin comprometer la precisión. Su arquitectura de doble canal proporciona resúmenes detallados y ricos en contexto de datos de video. Desafortunadamente, requiere altos recursos de GPU para el procesamiento de video 4K y complejidad en la gestión de flujos de datos multimodales. Es adecuado para el análisis de contenido de video, la síntesis de conferencias y la generación de contenido multimedia.
Características clave:
Arquitectura de doble canal: Procesa por separado los datos textuales y visuales.
Procesamiento de video de longitud ilimitada: Mantiene el contexto a lo largo de secuencias de video largas.
A continuación se muestra un flujo de trabajo simple de cómo funciona:
Divide el video en fotogramas.
Genera incrustaciones usando CLIP.
Almacena embeddings en una base de datos vectorial (Milvus) para búsqueda por similitud.
Recupera clips relevantes y genera resúmenes.
Artículo: https://arxiv.org/abs/2501.05874
GitHub: https://github.com/starsuzi/VideoRAG
CFT-RAG: RAG basado en árbol de filtros Cuckoo
CFT-RAG utiliza un método de aceleración basado en árboles mediante un filtro Cuckoo mejorado con datos estructurados (p. ej., archivos CSV, tablas SQL). Esto acelera la localización de entidades durante la recuperación, garantizando un acceso más rápido a la información relevante. Admite tanto texto como imágenes. Por ejemplo, preguntar “Muéstrame recetas de comidas saludables” devuelve listas de ingredientes y videos de cocina.
Acelera significativamente el proceso de recuperación y mejora la precisión al centrarse en entidades clave. Aunque requiere datos limpios y bien estructurados, y mantener la estructura de árbol requiere actualizaciones periódicas. Es ideal para sistemas de soporte en tiempo real, detección de fraude o plataformas de trading de alta frecuencia.
Características clave:
Recuperación y generación: Milvus para embeddings multimodales, GPT-4 con capacidades de visión.
Estructura de árbol de entidades: Organiza la información en un árbol jerárquico.
Optimización del filtro Cuckoo: Mejora la velocidad y la precisión de la recuperación.
Artículo: https://arxiv.org/abs/2501.15098
CG-RAG: RAG de grafos contextualizado
CG-RAG mejora el contexto utilizando grafos de conocimiento para capturar relaciones entre entidades (como personas o eventos). Utiliza Lexical-Semantic Graph Retrieval (LeSeGR) para mejorar la calidad de las respuestas al considerar las interconexiones entre conceptos. Por ejemplo, consultar “lanzamientos de productos de Apple” recupera entidades (p. ej., iPhones, CEOs) y sus relaciones. Herramientas como Neo4j se utilizan para el almacenamiento de grafos, y Graph Neural Networks (GNNs) para el recorrido.
Esta innovación de RAG destaca en temas complejos o preguntas de investigación al mapear relaciones de citas. Pero también requiere un diseño de esquema previo, y las consultas de grafos pueden consumir muchos recursos. En general, es muy eficaz en investigación académica, documentación técnica y escenarios que necesitan perspectivas profundas sobre datos interrelacionados.
Características clave:
Recuperación basada en grafos: Estructura la información como nodos interconectados.
Relaciones de citas: Captura cómo se relacionan diferentes piezas de información.
Figura- Descripción general de CG-RAG
Figura: Descripción general de CG-RAG (Fuente).
Artículo: https://arxiv.org/abs/2501.15067
Otras innovaciones de GraphRAG:
GFM-RAG: Modelo fundacional de grafos para RAG
GFM-RAG emplea un modelo fundacional de grafos que utiliza GNNs para refinar las conexiones entre consultas en conjuntos de datos de nicho (p. ej., artículos académicos, solicitudes de patentes) para dominios con mucha jerga. Este enfoque permite razonamiento multi-salto sobre un grafo de conocimiento estructurado, aumentando significativamente la precisión en consultas intensivas en conocimiento.
Mejora la precisión en consultas intensivas en conocimiento y es capaz de gestionar relaciones complejas en grandes conjuntos de datos. Sin embargo, requiere conjuntos de características bien definidos, y las consultas complejas pueden ralentizar las respuestas. Es eficaz en la investigación científica que requiere un mapeo de datos preciso.
Características clave:
Graph Neural Network (GNN): Enriquece semánticamente los datos recuperados.
Razonamiento multi-salto: Conecta información dispar entre documentos.
Artículo: https://arxiv.org/abs/2502.01113
URAG: RAG unificado
URAG combina texto, imágenes, audio y video bajo una sola arquitectura. Utiliza métodos basados en reglas con técnicas RAG para admitir LLMs ligeros, proporcionando respuestas precisas en entornos con recursos computacionales limitados.
Ofrece respuestas precisas con una sobrecarga computacional reducida. Sin embargo, los componentes basados en reglas pueden limitar la flexibilidad. Equilibrar la recuperación y la lógica basada en reglas puede ser un desafío. Es ideal para chatbots educativos que responden mediante texto y diagramas.
Características clave:
Diseño modular: Intercambia componentes de recuperación/generación.
Soporte multiformato: Maneja más de 10 formatos de datos.
Sistema híbrido: Integra lógica basada en reglas con técnicas RAG modernas.
Soporte para modelos ligeros: Optimiza el rendimiento para modelos más pequeños.
Figura- Marco URAG para mejorar el rendimiento de LLM en chatbots universitarios
Figura: Marco URAG para mejorar el rendimiento de LLM en chatbots universitarios (Fuente).
Artículo: https://arxiv.org/abs/2501.16276
Comparación de requisitos de recursos
| Tipo de RAG | Memoria GPU | Latencia | Complejidad de configuración | Mejor rendimiento |
|---|---|---|---|---|
| DeepRAG | Media | Media | Media | Tareas de razonamiento |
| RealRAG | Alta | Alta | Alta | Flujos de datos en vivo |
| CoRAG | Media | Alta | Media | Consultas de varios pasos |
| VideoRAG | Muy alta | Muy alta | Alta | Contenido de video |
| CFT-RAG | Baja | Baja | Media | Datos estructurados |
| CG-RAG | Media | Media | Alta | Consultas de relaciones |
| GFM-RAG | Alta | Media | Muy alta | Razonamiento complejo |
| URAG | Media | Media | Media | Contenido mixto |
Las ocho variantes de RAG que hemos explorado representan desarrollos recientes y emocionantes en el campo, y la mayoría proviene de artículos de investigación e implementaciones en etapas tempranas. Si bien estas innovaciones muestran un gran potencial y demuestran enfoques interesantes para los desafíos comunes de RAG, todavía están evolucionando a medida que la comunidad experimenta con ellas en diferentes contextos.
Como con cualquier tecnología emergente, recomendamos comenzar con pequeños experimentos para ver cómo funcionan estos enfoques con tus datos y casos de uso específicos. Los ejemplos de código y las recomendaciones a continuación están pensados para ayudarte a comenzar la exploración, en lugar de servir como modelos de producción. Cada variante puede requerir cierta adaptación para ajustarse a tus requisitos e infraestructura particulares.
Conclusión
Los últimos avances en RAG están resolviendo desafíos críticos en la IA al mejorar la precisión, la velocidad y la conciencia del contexto, por lo que siempre hay una variante de RAG adaptada a tus necesidades. Estas innovaciones permiten sistemas más inteligentes y con mayor capacidad de respuesta que pueden desbloquear nuevas posibilidades y ampliar las aplicaciones de los LLM en todas las industrias.
Al aprovechar el servicio gestionado de Milvus de Zilliz Cloud, los desarrolladores pueden implementar fácilmente estas variantes de RAG con facilidad. A medida que RAG continúa evolucionando, desempeñará un papel fundamental en la configuración del futuro de la IA, garantizando que las respuestas sean fluidas y estén profundamente informadas por los datos más recientes y las señales contextuales.
Recursos relacionados
Evaluating Retrieval-Augmented Generation (RAG) | Zilliz Blog
Build Custom RAG Pipelines with Step-by-Step Code Tutorials | Zilliz Tutorials
Advancements in RAG: A Comprehensive Survey of Techniques and Applications
¡Los últimos avances en RAG que todo desarrollador debería conocer!
Construye RAG con Milvus y DeepSeek | Documentación de Milvus
Sigue leyendo

From Vector Database to Vector Lakebase
Zilliz offers a fully managed Vector Lakebase powered by Milvus, unifying real-time vector search, lake-scale discovery, and Al data operations.

Balancing Precision and Performance: How Zilliz Cloud's New Parameters Help You Optimize Vector Search
Optimize vector search with Zilliz Cloud’s level and recall features to tune accuracy, balance performance, and power AI applications.
Milvus/Zilliz + Surveillance: How Vector Databases Transform Multi-Camera Tracking
See how Milvus vector database enhances multi-camera tracking with similarity-based matching for better surveillance in retail, warehouses and transport hubs.



