8 avanços mais recentes em RAG que todo desenvolvedor deve conhecer
Modelos de Linguagem Grandes (LLMs) são poderosos, mas apenas tão bons quanto seus dados de treinamento. Quando você faz uma pergunta complexa, quer que a IA combine seu conhecimento integrado com informações novas e relevantes de fontes externas. É exatamente isso que a Geração Aumentada por Recuperação faz - ela preenche a lacuna entre dados de treinamento estáticos e informações dinâmicas e atualizadas.
O RAG tradicional tem sido significativo, mas os desenvolvedores têm expandido os limites do que é possível. Neste artigo, exploraremos oito variantes avançadas de RAG que podem resolver problemas reais que você pode estar enfrentando: recuperação lenta, má compreensão do contexto, tratamento de dados multimodais e otimização de recursos.
Por que esses novos tipos de RAG importam
Os sistemas RAG tradicionais combinavam duas etapas: recuperar dados relevantes como contexto de uma base de conhecimento alimentada por um banco de dados vetorial, como Milvus, e gerar respostas usando um modelo de linguagem.
Embora eficazes, as primeiras implementações de RAG enfrentavam desafios de eficiência, escalabilidade e gerenciamento de fluxo de dados. Elas frequentemente dependiam de medidas simples de similaridade que podiam deixar passar nuances cruciais, resultando em respostas genéricas para consultas complexas. Para superar essas limitações, pesquisadores introduziram novas estratégias que permitem que os modelos:
Decidam dinamicamente as etapas de recuperação: Em vez de sempre recuperar dados de uma só vez, métodos mais recentes determinam os momentos ideais para recuperar informações externas.
Incorporem dados multimodais: Além de texto, alguns sistemas podem recuperar imagens e vídeos para enriquecer o conteúdo gerado.
Otimizem o uso de recursos: Frameworks avançados de RAG ajustam a alocação de computação com base na complexidade da consulta.
É aqui que os avanços empolgantes em RAG entram em cena. Essas melhorias levaram a resultados mais precisos e conscientes do contexto, que atendem melhor às necessidades tanto de desenvolvedores quanto de empresas.
Referência rápida: qual RAG você deve usar?
Aqui está uma visão geral amigável para desenvolvedores do que abordaremos:
| Tipo de RAG | Inovação-chave | Melhor para |
| DeepRAG | Processo de decisão de recuperação passo a passo | Análise jurídica ou médica |
| RealRAG | Processamento de dados em tempo real | Monitoramento de redes sociais, app de notícias |
| CoRAG | Recuperação sequencial, adaptativa e em várias etapas | Solução de problemas técnicos |
| VideoRAG | Compreensão de vídeo para texto | Resumo de aulas |
| CFT-RAG | Recuperação baseada em árvore (texto + imagem) | Detecção de fraude |
| CG-RAG | Raciocínio contextual baseado em grafos | Pesquisa acadêmica com citações |
| GFM-RAG | Conexões de conhecimento por redes neurais de grafos | Análise de patentes |
| URAG | Suporte unificado (texto + imagem + áudio) | Chatbots educacionais |
DeepRAG
DeepRAG substitui pipelines tradicionais de recuperação por uma única rede neural treinada de ponta a ponta. Ele modela o raciocínio aumentado por recuperação como um processo de decisão. Em vez de tratar recuperação e geração como tarefas separadas, ele decide dinamicamente quando confiar em dados externos versus raciocínio interno. Essa abordagem passo a passo mira lacunas de conhecimento específicas de forma eficaz.
Ele aumenta a profundidade e a precisão ao melhorar tarefas intensivas em raciocínio em cerca de 8-15% e reduz a recuperação desnecessária de dados, economizando recursos computacionais. Embora possa aumentar a complexidade do design do sistema e exigir ajuste fino para equilibrar a frequência de recuperação. É ideal para verificação de fatos, tarefas de raciocínio em múltiplas etapas, domínios intensivos em pesquisa e geração de relatórios detalhados (por exemplo, análise de documentos jurídicos ou suporte a diagnóstico médico).
Principais recursos:
Recuperação dinâmica: Avalia cada etapa para decidir se a recuperação é necessária.
Tomada de decisão estratégica: Usa um processo de decisão semelhante a um Processo de Decisão de Markov.
GitHub: https://github.com/microsoft/deepRAG
Artigo: https://arxiv.org/html/2502.01142v1
RealRAG
O RealRAG aprimora modelos generativos de texto para imagem (por exemplo, Flux e Stable Diffusion V3) recuperando imagens do mundo real. Ao comparar imagens geradas com exemplos recuperados, o sistema preenche lacunas de conhecimento para melhorar o realismo.
Ele produz saídas de imagem mais realistas e melhora a qualidade do conteúdo visual. No entanto, tem altos custos de infraestrutura para processamento multimodal 24/7. Também pode ter dificuldades em domínios com conjuntos de dados de imagens de qualidade limitada. É particularmente útil para design de produtos e imagem médica, onde representações visuais precisas são essenciais.
Figura- Visão geral do RealRAG
Figura: Visão geral do RealRAG (Fonte).
Principais recursos:
Aumento da pontuação FID: 16,18% no benchmark Stanford Car
Recuperação baseada em imagens: Aprimora a geração com dados visuais externos.
Aprendizado autorreflexivo: Refina as saídas por meio de feedback de comparações de imagens.
Artigo: https://arxiv.org/abs/2502.00848
CoRAG: Geração Aumentada por Cadeia de Recuperação
Inspirado por prompting de cadeia de pensamento, o CoRAG divide consultas em subperguntas e recupera informações sequencialmente. Ele ajusta a profundidade e a amplitude da recuperação com base na complexidade da consulta e reformula consultas conforme necessário.
Ele lida com perguntas multifacetadas com até 30% mais precisão e prioriza informações essenciais por meio de recuperação sequencial. No entanto, múltiplas rodadas de recuperação aumentam a latência. É ideal para solução de problemas técnicos ou pesquisa em que as consultas exigem informações em múltiplas camadas.
Principais recursos:
Recuperação sequencial: Recupera dados em várias etapas para refinar a resposta.
Alocação adaptativa de computação: Equilibra recursos com base nas necessidades de dados.
Artigo: https://arxiv.org/abs/2501.14342
VideoRAG: Geração Aumentada por Recuperação sobre Corpus de Vídeo
O conteúdo de vídeo é uma rica fonte de informações, mas o RAG tradicional é projetado principalmente para documentos baseados em texto. O VideoRAG estende os recursos do RAG para conteúdo de vídeo usando modelos de visão-linguagem (VLMs) como CLIP, juntamente com conversão de fala em texto, análise de quadros e processamento de áudio para extrair informações. Isso permite que LLMs compreendam, processem e respondam a consultas relacionadas a vídeos. Ele converte quadros de vídeo em embeddings de texto para permitir consultas como “Encontre cenas com conflito emocional”.
O VideoRAG pode lidar com conteúdo de vídeo extremamente longo sem comprometer a precisão. Sua arquitetura de canal duplo fornece resumos detalhados e ricos em contexto de dados de vídeo. Infelizmente, ele exige altos recursos de GPU para processamento de vídeo 4K e complexidade no gerenciamento de fluxos de dados multimodais. É adequado para análise de conteúdo de vídeo, resumo de palestras e geração de conteúdo multimídia.
Principais recursos:
Arquitetura de canal duplo: Processa separadamente dados textuais e visuais.
Processamento de vídeo de comprimento ilimitado: Mantém o contexto ao longo de sequências longas de vídeo.
Abaixo está um fluxo de trabalho simples de como ele funciona:
Divida o vídeo em quadros.
Gere embeddings usando CLIP.
Armazene embeddings em um banco de dados vetorial (Milvus) para busca por similaridade.
Recupere clipes relevantes e gere resumos.
Artigo: https://arxiv.org/abs/2501.05874
GitHub: https://github.com/starsuzi/VideoRAG
CFT-RAG: RAG baseado em Árvore de Filtro Cuckoo
O CFT-RAG usa um método de aceleração baseado em árvore utilizando um Filtro Cuckoo aprimorado com dados estruturados (por exemplo, arquivos CSV, tabelas SQL). Isso acelera a localização de entidades durante a recuperação, garantindo acesso mais rápido a informações relevantes. Ele oferece suporte tanto a texto quanto a imagens. Por exemplo, perguntar “Mostre-me receitas de refeições saudáveis” retorna listas de ingredientes e vídeos de culinária.
Ele acelera significativamente o processo de recuperação e melhora a precisão ao se concentrar em entidades-chave. Embora exija dados limpos e bem estruturados, e a manutenção da estrutura em árvore exija atualizações regulares. É mais indicado para sistemas de suporte em tempo real, detecção de fraudes ou plataformas de negociação de alta frequência.
Principais recursos:
Recuperação e Geração: Milvus para embeddings multimodais, GPT-4 com recursos de visão.
Estrutura de Árvore de Entidades: Organiza informações em uma árvore hierárquica.
Otimização do Filtro Cuckoo: Aumenta a velocidade e a precisão da recuperação.
Artigo: https://arxiv.org/abs/2501.15098
CG-RAG: RAG de Grafo Contextualizado
O CG-RAG aprimora o contexto usando grafos de conhecimento para capturar relações entre entidades (como pessoas ou eventos). Ele utiliza a Recuperação de Grafo Léxico-Semântico (LeSeGR) para melhorar a qualidade das respostas ao considerar as interconexões entre conceitos. Por exemplo, consultar “lançamentos de produtos da Apple” recupera entidades (por exemplo, iPhones, CEOs) e seus relacionamentos. Ferramentas como Neo4j são usadas para armazenamento de grafos, e Redes Neurais de Grafos (GNNs) para travessia.
Essa inovação em RAG se destaca em tópicos complexos ou perguntas de pesquisa ao mapear relações de citação. Mas também exige design de esquema antecipado, e consultas em grafos podem consumir muitos recursos. No geral, é altamente eficaz em pesquisa acadêmica, documentação técnica e cenários que exigem insights profundos sobre dados inter-relacionados.
Principais recursos:
Recuperação baseada em grafos: Estrutura informações como nós interconectados.
Relações de citação: Captura como diferentes partes de informação se relacionam.
Figura- Visão geral do CG-RAG
Figura: Visão geral do CG-RAG (Fonte).
Artigo: https://arxiv.org/abs/2501.15067
Outras inovações em GraphRAG:
GFM-RAG: Modelo Fundacional de Grafo para RAG
O GFM-RAG emprega um modelo fundacional de grafo usando GNNs para refinar conexões entre consultas em conjuntos de dados de nicho (por exemplo, artigos acadêmicos, pedidos de patente) para domínios com muito jargão. Essa abordagem permite raciocínio multi-hop sobre um grafo de conhecimento estruturado, aumentando significativamente a precisão em consultas intensivas em conhecimento.
Ele melhora a precisão em consultas intensivas em conhecimento e é capaz de lidar com relações complexas em grandes conjuntos de dados. No entanto, exige conjuntos de recursos bem definidos, e consultas complexas podem retardar as respostas. É eficaz em pesquisas científicas que exigem mapeamento preciso de dados.
Principais recursos:
Rede Neural de Grafo (GNN): Enriquece semanticamente os dados recuperados.
Raciocínio Multi-Hop: Conecta informações díspares entre documentos.
Artigo: https://arxiv.org/abs/2502.01113
URAG: RAG Unificado
O URAG combina texto, imagens, áudio e vídeo sob uma única arquitetura. Ele usa métodos baseados em regras com técnicas de RAG para dar suporte a LLMs leves, fornecendo respostas precisas em ambientes com recursos computacionais limitados.
Ele oferece respostas precisas com sobrecarga computacional reduzida. No entanto, componentes baseados em regras podem limitar a flexibilidade. Equilibrar entre recuperação e lógica baseada em regras pode ser desafiador. É ideal para chatbots educacionais que respondem por meio de texto e diagramas.
Principais Recursos:
Design modular: Troque componentes de recuperação/geração.
Suporte a múltiplos formatos: Lida com mais de 10 formatos de dados.
Sistema híbrido: Integra lógica baseada em regras com técnicas modernas de RAG.
Suporte a modelos leves: Otimiza o desempenho para modelos menores.
Figura- Framework URAG para Melhorar o Desempenho de LLMs em Chatbots Universitários
Figura: Framework URAG para Melhorar o Desempenho de LLMs em Chatbots Universitários (Fonte).
Artigo: https://arxiv.org/abs/2501.16276
Comparação de Requisitos de Recursos
| Tipo de RAG | Memória da GPU | Latência | Complexidade de Configuração | Melhor Desempenho |
|---|---|---|---|---|
| DeepRAG | Média | Média | Média | Tarefas de raciocínio |
| RealRAG | Alta | Alta | Alta | Fluxos de dados em tempo real |
| CoRAG | Média | Alta | Média | Consultas em várias etapas |
| VideoRAG | Muito alta | Muito alta | Alta | Conteúdo de vídeo |
| CFT-RAG | Baixa | Baixa | Média | Dados estruturados |
| CG-RAG | Média | Média | Alta | Consultas de relacionamento |
| GFM-RAG | Alta | Média | Muito alta | Raciocínio complexo |
| URAG | Média | Média | Média | Conteúdo misto |
As oito variantes de RAG que exploramos representam desenvolvimentos recentes empolgantes na área, com a maioria surgindo de artigos de pesquisa e implementações em estágio inicial. Embora essas inovações mostrem grande promessa e demonstrem abordagens interessantes para desafios comuns de RAG, elas ainda estão evoluindo à medida que a comunidade experimenta com elas em diferentes contextos.
Como acontece com qualquer tecnologia emergente, recomendamos começar com pequenos experimentos para ver como essas abordagens funcionam com seus dados e casos de uso específicos. Os exemplos de código e recomendações abaixo destinam-se a ajudá-lo a começar a exploração, em vez de servir como modelos de produção. Cada variante pode exigir alguma adaptação para se adequar aos seus requisitos e à sua infraestrutura específicos.
Conclusão
Os avanços mais recentes em RAG estão resolvendo desafios críticos em IA ao aprimorar precisão, velocidade e consciência de contexto, portanto, sempre há uma variante de RAG adaptada às suas necessidades. Essas inovações permitem sistemas mais inteligentes e responsivos, capazes de desbloquear novas possibilidades e expandir as aplicações de LLMs em todos os setores.
Ao aproveitar o serviço gerenciado Milvus da Zilliz Cloud, os desenvolvedores podem implantar facilmente essas variantes de RAG com facilidade. À medida que RAG continua a evoluir, ele desempenhará um papel crítico na formação do futuro da IA, garantindo que as respostas sejam fluentes e profundamente informadas pelos dados mais recentes e por sinais contextuais.
Recursos Relacionados
Continue lendo

Zilliz Cloud BYOC Now Available Across AWS, GCP, and Azure
Zilliz Cloud BYOC is now generally available on all three major clouds. Deploy fully managed vector search in your own AWS, GCP, or Azure account — your data never leaves your VPC.

What Exactly Are AI Agents? Why OpenAI and LangChain Are Fighting Over Their Definition?
AI agents are software programs powered by AI that can perceive their environment, make decisions, and take actions to achieve a goal—often autonomously.

AI Integration in Video Surveillance Tools: Transforming the Industry with Vector Databases
Discover how AI and vector databases are revolutionizing video surveillance with real-time analysis, faster threat detection, and intelligent search capabilities for enhanced security.



