모든 개발자가 알아야 할 최신 RAG 발전 8가지
대규모 언어 모델 (LLMs)은 강력하지만, 그 성능은 학습 데이터의 품질에 달려 있습니다. 복잡한 질문을 할 때, 여러분은 AI가 내장된 지식과 외부 소스의 최신 관련 정보를 결합하기를 원합니다. 이것이 바로 검색 증강 생성이 하는 일입니다 - 정적인 학습 데이터와 동적이고 최신의 정보 사이의 간극을 메웁니다.
전통적인 RAG는 중요했지만, 개발자들은 가능한 것의 한계를 계속 넓혀 왔습니다. 이 글에서는 여러분이 직면할 수 있는 실제 문제, 즉 느린 검색, 부족한 맥락 이해, 멀티모달 데이터 처리, 리소스 최적화를 해결할 수 있는 여덟 가지 고급 RAG 변형을 살펴보겠습니다.
이러한 새로운 RAG 유형이 중요한 이유
전통적인 RAG 시스템은 두 단계를 결합했습니다: Milvus,와 같은 벡터 데이터베이스,로 구동되는 지식 베이스에서 맥락으로 관련 데이터를 검색하고, 언어 모델을 사용해 답변을 생성하는 것입니다.
효과적이기는 했지만, 초기 RAG 구현은 효율성, 확장성, 데이터 흐름 관리 측면의 어려움에 직면했습니다. 종종 중요한 뉘앙스를 놓칠 수 있는 단순한 유사도 측정에 의존하여, 복잡한 질의에 대해 일반적인 응답을 생성하곤 했습니다. 이러한 한계를 극복하기 위해 연구자들은 모델이 다음을 수행할 수 있도록 하는 새로운 전략을 도입했습니다:
검색 단계를 동적으로 결정: 항상 한 번에 데이터를 검색하는 대신, 새로운 방법들은 외부 정보를 검색할 최적의 시점을 결정합니다.
멀티모달 데이터 통합: 텍스트를 넘어, 일부 시스템은 생성된 콘텐츠를 풍부하게 하기 위해 이미지와 비디오를 검색할 수 있습니다.
리소스 사용 최적화: 고급 RAG 프레임워크는 질의의 복잡성에 따라 컴퓨팅 할당을 조정합니다.
바로 여기서 RAG의 흥미로운 발전이 등장합니다. 이러한 개선은 개발자와 기업 모두의 요구를 더 잘 충족하는, 더 정확하고 맥락을 인식하는 출력으로 이어졌습니다.
빠른 참조: 어떤 RAG를 사용해야 할까요?
다음은 우리가 다룰 내용을 개발자 친화적으로 개괄한 것입니다:
| RAG 유형 | 핵심 혁신 | 가장 적합한 용도 |
| DeepRAG | 단계별 검색 결정 프로세스 | 법률 또는 의료 분석 |
| RealRAG | 실시간 데이터 처리 | 소셜 미디어 모니터링, 뉴스 앱 |
| CoRAG | 순차적이고 적응적인 다단계 검색 | 기술 문제 해결 |
| VideoRAG | 비디오-텍스트 이해 | 강의 요약 |
| CFT-RAG | 트리 기반(텍스트 + 이미지) 검색 | 사기 탐지 |
| CG-RAG | 그래프 기반 맥락 추론 | 인용이 포함된 학술 연구 |
| GFM-RAG | 그래프 신경망 지식 연결 | 특허 분석 |
| URAG | 통합(텍스트 + 이미지 + 오디오) 지원 | 교육용 챗봇 |
DeepRAG
DeepRAG는 전통적인 검색 파이프라인을 엔드투엔드로 학습된 단일 신경망으로 대체합니다. 검색 증강 추론을 의사 결정 과정으로 모델링합니다. 검색과 생성을 별개의 작업으로 취급하는 대신, 외부 데이터에 의존할 때와 내부 추론에 의존할 때를 동적으로 결정합니다. 이러한 단계별 접근 방식은 특정 지식 격차를 효과적으로 겨냥합니다.
이는 추론 집약적 작업을 약 8~15% 개선하여 깊이와 정확성을 높이고, 불필요한 데이터 검색을 줄여 컴퓨팅 리소스를 절약합니다. 다만 시스템 설계 복잡성이 증가할 수 있으며 검색 빈도의 균형을 맞추기 위한 미세 조정이 필요할 수 있습니다. 사실 검증, 다단계 추론 작업, 연구 집약적 도메인, 상세 보고서 생성(예: 법률 문서 분석 또는 의료 진단 지원)에 이상적입니다.
주요 기능:
동적 검색: 각 단계를 평가하여 검색이 필요한지 결정합니다.
전략적 의사결정: Markov Decision Process와 유사한 의사결정 프로세스를 사용합니다.
GitHub: https://github.com/microsoft/deepRAG
논문: https://arxiv.org/html/2502.01142v1
RealRAG
RealRAG는 실제 이미지 검색을 통해 텍스트-이미지 생성 모델(예: Flux 및 Stable Diffusion V3)을 향상합니다. 생성된 이미지를 검색된 예시와 비교함으로써, 시스템은 지식 격차를 메워 현실감을 개선합니다.
더 현실적인 이미지 출력을 생성하고 시각 콘텐츠 품질을 향상합니다. 그러나 24/7 멀티모달 처리를 위한 인프라 비용이 높습니다. 또한 품질 높은 이미지 데이터셋이 제한적인 도메인에서는 어려움을 겪을 수 있습니다. 정확한 시각적 표현이 필수적인 제품 디자인 및 의료 영상 분야에 특히 유용합니다.
Figure- RealRAG 개요
그림: RealRAG 개요(출처).
주요 기능:
FID 점수 증가: Stanford Car 벤치마크에서 16.18%
이미지 기반 검색: 외부 시각 데이터를 통해 생성을 향상합니다.
자기 반영 학습: 이미지 비교에서 얻은 피드백을 통해 출력을 개선합니다.
논문: https://arxiv.org/abs/2502.00848
CoRAG: Chain-of-Retrieval Augmented Generation
chain-of-thought prompting에서 영감을 받은 CoRAG는 쿼리를 하위 질문으로 나누고 정보를 순차적으로 검색합니다. 쿼리의 복잡성에 따라 검색의 깊이와 폭을 조정하고 필요에 따라 쿼리를 재구성합니다.
다각적인 질문을 최대 30% 더 높은 정확도로 처리하며 순차적 검색을 통해 필수 정보를 우선시합니다. 그러나 여러 번의 검색 라운드는 지연 시간을 증가시킵니다. 쿼리에 다층적인 정보가 필요한 기술 문제 해결 또는 연구에 이상적입니다.
주요 기능:
순차적 검색: 답변을 정제하기 위해 여러 단계로 데이터를 검색합니다.
적응형 컴퓨팅 할당: 데이터 요구 사항에 따라 리소스의 균형을 맞춥니다.
논문: https://arxiv.org/abs/2501.14342
VideoRAG: Retrieval-Augmented Generation over Video Corpus
비디오 콘텐츠는 풍부한 정보원지만, 전통적인 RAG는 주로 텍스트 기반 문서를 위해 설계되었습니다. VideoRAG는 CLIP과 같은 vision-language models (VLMs)를 음성-텍스트 변환, 프레임 분석, 오디오 처리와 함께 사용하여 정보를 추출함으로써 RAG 기능을 비디오 콘텐츠로 확장합니다. 이를 통해 LLMs가 비디오와 관련된 쿼리를 이해하고, 처리하고, 응답할 수 있습니다. 비디오 프레임을 텍스트 임베딩으로 변환하여 “감정적 갈등이 있는 장면 찾기” 와 같은 쿼리를 가능하게 합니다.
VideoRAG는 정확도를 저하하지 않고도 매우 긴 비디오 콘텐츠를 처리할 수 있습니다. 듀얼 채널 아키텍처는 비디오 데이터에 대한 상세하고 맥락이 풍부한 요약을 제공합니다. 안타깝게도 4K 비디오 처리를 위해 높은 GPU 리소스가 필요하며 멀티모달 데이터 스트림 관리가 복잡합니다. 비디오 콘텐츠 분석, 강의 요약, 멀티미디어 콘텐츠 생성에 적합합니다.
주요 기능:
듀얼 채널 아키텍처: 텍스트 데이터와 시각 데이터를 별도로 처리합니다.
무제한 길이 비디오 처리: 긴 비디오 시퀀스에서도 맥락을 유지합니다.
아래는 작동 방식의 간단한 워크플로입니다.
비디오를 프레임으로 분할합니다.
CLIP을 사용하여 임베딩을 생성합니다.
유사도 검색을 위해 벡터 데이터베이스(Milvus)에 임베딩을 저장합니다.
관련 클립을 검색하고 요약을 생성합니다.
논문: https://arxiv.org/abs/2501.05874
GitHub: https://github.com/starsuzi/VideoRAG
CFT-RAG: Cuckoo Filter Tree 기반 RAG
CFT-RAG는 구조화된 데이터(예: CSV 파일, SQL 테이블)와 함께 개선된 Cuckoo Filter를 사용하는 트리 기반 가속 방법을 사용합니다. 이는 검색 중 엔티티 위치 파악 속도를 높여 관련 정보에 더 빠르게 접근할 수 있도록 합니다. 텍스트와 이미지를 모두 지원합니다. 예를 들어, “건강한 식사 레시피를 보여줘”라고 물으면 재료 목록과 요리 동영상을 반환합니다.
핵심 엔티티에 집중함으로써 검색 프로세스를 크게 가속하고 정밀도를 향상시킵니다. 다만 깨끗하고 잘 구조화된 데이터가 필요하며, 트리 구조를 유지하려면 정기적인 업데이트가 필요합니다. 실시간 지원 시스템, 사기 탐지 또는 고빈도 거래 플랫폼에 가장 적합합니다.
주요 기능:
검색 및 생성: 멀티모달 임베딩을 위한 Milvus, 비전 기능을 갖춘 GPT-4.
엔티티 트리 구조: 정보를 계층적 트리로 구성합니다.
Cuckoo Filter 최적화: 검색 속도와 정확도를 향상시킵니다.
논문: https://arxiv.org/abs/2501.15098
CG-RAG: 맥락화된 그래프 RAG
CG-RAG는 엔티티(예: 사람 또는 사건) 간의 관계를 포착하기 위해 지식 그래프를 사용하여 맥락을 강화합니다. 개념 간의 상호 연결성을 고려하여 답변 품질을 높이기 위해 Lexical-Semantic Graph Retrieval(LeSeGR)을 활용합니다. 예를 들어, “Apple의 제품 출시”를 질의하면 엔티티(예: iPhone, CEO)와 그 관계를 검색합니다. 그래프 저장에는 Neo4j 같은 도구가 사용되며, 순회에는 Graph Neural Networks(GNNs)가 사용됩니다.
이 RAG 혁신은 인용 관계를 매핑함으로써 복잡한 주제나 연구 질문에서 뛰어난 성능을 발휘합니다. 하지만 사전 스키마 설계도 필요하며, 그래프 쿼리는 리소스를 많이 사용할 수 있습니다. 전반적으로 학술 연구, 기술 문서, 상호 관련된 데이터에 대한 깊은 통찰이 필요한 시나리오에서 매우 효과적입니다.
주요 기능:
그래프 기반 검색: 정보를 상호 연결된 노드로 구조화합니다.
인용 관계: 서로 다른 정보 조각들이 어떻게 관련되는지 포착합니다.
Figure- CG-RAG 개요
그림: CG-RAG 개요 (출처).
논문: https://arxiv.org/abs/2501.15067
기타 GraphRAG 혁신:
GFM-RAG: RAG를 위한 Graph Foundation Model
GFM-RAG는 전문 용어가 많은 도메인을 위해 틈새 데이터셋(예: 학술 논문, 특허 출원)에서 쿼리 간 연결을 정교화하기 위해 GNN을 사용하는 그래프 파운데이션 모델을 활용합니다. 이 접근 방식은 구조화된 지식 그래프 전반에서 멀티홉 추론을 가능하게 하여 지식 집약적 쿼리의 정확도를 크게 높입니다.
지식 집약적 쿼리에서 정확도를 향상시키며 대규모 데이터셋의 복잡한 관계를 처리할 수 있습니다. 그러나 잘 정의된 특징 세트가 필요하고, 복잡한 쿼리는 응답 속도를 늦출 수 있습니다. 정밀한 데이터 매핑이 필요한 과학 연구에서 효과적입니다.
주요 기능:
Graph Neural Network (GNN): 검색된 데이터를 의미적으로 풍부하게 합니다.
멀티홉 추론: 문서 전반의 서로 다른 정보를 연결합니다.
논문: https://arxiv.org/abs/2502.01113
URAG: 통합 RAG
URAG는 텍스트, 이미지, 오디오, 비디오를 하나의 아키텍처 아래 결합합니다. RAG 기법과 규칙 기반 방법을 사용하여 경량 LLM을 지원하며, 제한된 컴퓨팅 리소스가 있는 환경에서 정확한 답변을 제공합니다.
계산 오버헤드를 줄이면서 정확한 응답을 제공합니다. 그러나 규칙 기반 구성 요소는 유연성을 제한할 수 있습니다. 검색과 규칙 기반 로직 사이의 균형을 맞추는 것은 어려울 수 있습니다. 텍스트와 다이어그램을 통해 답변하는 교육용 챗봇에 이상적입니다.
주요 기능:
모듈식 설계: 검색/생성 구성 요소를 교체할 수 있습니다.
다중 형식 지원: 10개 이상의 데이터 형식을 처리합니다.
하이브리드 시스템: 규칙 기반 로직을 최신 RAG 기법과 통합합니다.
경량 모델 지원: 더 작은 모델의 성능을 최적화합니다.
그림- 대학 챗봇에서 LLM 성능 향상을 위한 URAG 프레임워크
그림: 대학 챗봇에서 LLM 성능 향상을 위한 URAG 프레임워크 (출처).
논문: https://arxiv.org/abs/2501.16276
리소스 요구 사항 비교
| RAG 유형 | GPU 메모리 | 지연 시간 | 설정 복잡도 | 최적 성능 |
|---|---|---|---|---|
| DeepRAG | 중간 | 중간 | 중간 | 추론 작업 |
| RealRAG | 높음 | 높음 | 높음 | 실시간 데이터 스트림 |
| CoRAG | 중간 | 높음 | 중간 | 다단계 쿼리 |
| VideoRAG | 매우 높음 | 매우 높음 | 높음 | 비디오 콘텐츠 |
| CFT-RAG | 낮음 | 낮음 | 중간 | 구조화된 데이터 |
| CG-RAG | 중간 | 중간 | 높음 | 관계 쿼리 |
| GFM-RAG | 높음 | 중간 | 매우 높음 | 복잡한 추론 |
| URAG | 중간 | 중간 | 중간 | 혼합 콘텐츠 |
우리가 살펴본 여덟 가지 RAG 변형은 이 분야의 흥미로운 최신 발전을 보여주며, 대부분 연구 논문과 초기 단계 구현에서 등장했습니다. 이러한 혁신은 큰 가능성을 보여주고 일반적인 RAG 과제에 대한 흥미로운 접근 방식을 입증하지만, 커뮤니티가 다양한 맥락에서 이를 실험함에 따라 여전히 진화하고 있습니다.
모든 신흥 기술과 마찬가지로, 이러한 접근 방식이 여러분의 특정 데이터와 사용 사례에서 어떻게 작동하는지 확인하기 위해 작은 실험부터 시작하는 것을 권장합니다. 아래의 코드 예제와 권장 사항은 프로덕션 청사진으로 사용하기보다는 탐색을 시작하는 데 도움을 주기 위한 것입니다. 각 변형은 여러분의 특정 요구 사항과 인프라에 맞추기 위해 어느 정도의 조정이 필요할 수 있습니다.
결론
RAG의 최신 발전은 정확도, 속도, 컨텍스트 인식을 향상시켜 AI의 중요한 과제를 해결하고 있으므로, 여러분의 필요에 맞춘 RAG 변형은 항상 존재합니다. 이러한 혁신은 더 스마트하고 반응성이 뛰어난 시스템을 가능하게 하며, 새로운 가능성을 열고 산업 전반에서 LLM의 응용 범위를 확장할 수 있습니다.
Zilliz Cloud의 관리형 Milvus 서비스를 활용하면 개발자는 이러한 RAG 변형을 쉽게 배포할 수 있습니다. RAG가 계속 발전함에 따라, 응답이 유창할 뿐만 아니라 최신 데이터와 컨텍스트 단서에 깊이 기반하도록 보장하면서 AI의 미래를 형성하는 데 중요한 역할을 할 것입니다.
관련 리소스
계속 읽기

3 Easiest Ways to Use Claude Code on Your Mobile Phone
Run Claude Code from your phone with Remote Control, Happy Coder, or SSH + Tailscale. Comparison table, setup steps, and tools for typing, memory, and parallel tasks.

DeepSeek-OCR Explained: Optical Compression for Scalable Long-Context and RAG Systems
Discover how DeepSeek-OCR uses visual tokens and Contexts Optical Compression to boost long-context LLM efficiency and reshape RAG performance.

What is the K-Nearest Neighbors (KNN) Algorithm in Machine Learning?
KNN is a supervised machine learning technique and algorithm for classification and regression. This post is the ultimate guide to KNN.



