멀티모달 RAG: 더 스마트한 AI를 위해 텍스트를 넘어 확장하기
지난 1년 반 동안 검색 증강 생성 (RAG)은 관련성 있는 맥락 정보를 통해 대규모 언어 모델 (LLM) 응답을 개선하는 강력한 기법이 되었으며, LLM이 그럴듯하게 들리지만 사실적으로는 부정확한 응답을 생성하는 환각의 위험을 크게 줄여줍니다.
하지만 실제 데이터는 종종 텍스트를 훨씬 넘어섭니다. 우리는 이미지, 비디오, 표, 다양한 문서 형식도 마주합니다. 바로 여기서 멀티모달 RAG 가 중요해지며, 다양한 데이터 유형을 통합하여 AI 모델에 훨씬 더 신뢰할 수 있는 지식을 제공할 수 있게 합니다.
이 글에서는 다음에 대해 이야기하겠습니다:
- 전통적인 텍스트 기반 RAG에서 멀티모달 RAG로의 RAG의 진화
- Milvus 벡터 데이터베이스가 다양한 데이터 유형의 저장과 검색을 가능하게 하는 방식
- 이러한 복잡한 작업을 가속화하는 데 있어 NVIDIA GPUs의 역할
- 이 기술의 잠재적 응용 분야와 이점
AI 애호가이든 프로젝트에 RAG를 추가하려는 개발자이든, 이 글은 RAG 시스템의 역량을 재정의할 기술에 대한 귀중한 통찰을 제공할 것입니다.
RAG의 진화: 텍스트 중심에서 멀티모달로
전통적인 RAG
텍스트 기반 RAG는 지식 베이스에서 관련 텍스트 기반 맥락을 검색하여 LLM 응답을 향상합니다. 아래는 일반적인 RAG 워크플로의 개요입니다:
- 사용자가 시스템에 텍스트 쿼리를 제출합니다.
- 쿼리는 벡터 임베딩으로 변환되며, 그런 다음 벡터 데이터베이스 , 예를 들어 텍스트 구절이 임베딩으로 저장된 Milvus를 검색하는 데 사용됩니다. 벡터 데이터베이스는 벡터 유사도를 기반으로 쿼리와 밀접하게 일치하는 구절을 검색합니다.
- 관련 텍스트 구절은 보충 맥락으로 LLM에 전달되어 쿼리에 대한 이해를 풍부하게 합니다.
- LLM은 제공된 맥락과 함께 쿼리를 처리하여 더 많은 정보를 바탕으로 한 정확한 응답을 생성합니다.
그림 1- RAG 작동 방식.png
그림: RAG 작동 방식
전통적인 RAG는 LLM 출력 개선에 매우 효과적이었지만, 여전히 텍스트 데이터로 제한됩니다. 많은 실제 응용 분야에서 지식은 텍스트를 훨씬 넘어 확장되며, 중요한 맥락을 제공하는 이미지, 차트 및 기타 양식을 포함합니다.
멀티모달 RAG: 텍스트를 넘어 확장
멀티모달 RAG는 다양한 데이터 유형의 사용을 가능하게 하여 LLM에 더 나은 맥락을 제공함으로써 위의 한계를 해결합니다.
이러한 진화의 핵심 주체는 LLaVA (Large Language and Vision Assistant)로, 언어(텍스트)와 비전(이미지)을 모두 통합하여 대규모 언어 모델(LLM)의 역량을 향상하도록 설계된 멀티모달 모델입니다. LLaVA는 시각 콘텐츠에서 의미 있는 정보를 추출하고 이를 텍스트 설명으로 변환하며, 이는 임베딩 모델로 처리되어 Milvus와 같은 벡터 데이터베이스에 저장될 수 있습니다.
아래는 LlaVA가 임베딩 모델 및 벡터 데이터베이스와 함께 작동하는 방식의 예입니다.
그림: 이미지에 대해 질문했을 때 LlaVa가 생성할 수 있는 결과의 예
그림: 이미지에 대해 질문했을 때 LlaVa가 생성할 수 있는 결과의 예
멀티모달 RAG 파이프라인의 핵심 구성 요소
다양한 데이터 유형을 처리하기 위해, Multimodal RAG pipeline은 모든 모달리티를 통합된 형식, 일반적으로 텍스트로 변환합니다. 이러한 변환은 보통 일반 이미지와 차트 같은 그래픽 데이터를 처리하는 특화된 Vision Language Models (VLMs)를 사용하여 이루어집니다. VLM은 이러한 비텍스트 소스에서 의미 있는 정보를 추출하고, 이를 대규모 언어 모델(LLMs)이 컨텍스트 생성에 사용할 수 있는 텍스트 기반 임베딩으로 변환합니다.
VLMs 외에도, 여러 다른 핵심 구성 요소가 Multimodal RAG 시스템이 효율적이고 대규모로 운영되도록 보장합니다. 아래는 이러한 파이프라인의 주요 구성 요소와, 이러한 구성 요소가 어떻게 구현되는지 보여주는 대표적인 예시입니다.
Vision Language Models (VLMs): 이러한 모델은 이미지, 차트, 그래프와 같은 시각 콘텐츠를 LLM이 활용할 수 있는 텍스트 또는 임베딩 형식으로 처리하고 변환합니다.
- Example: Neva 22B (NVIDIA): LLaVA의 파인튜닝된 변형으로, 일반 이미지 이해에 최적화되어 있으며, 시각 입력을 해석하고 텍스트 설명을 생성할 수 있습니다.
- Example: DePlot (Google): 차트와 플롯 같은 그래픽 데이터의 처리 및 분석에 특화되어 있어, 보다 기술적인 시각 콘텐츠에 이상적입니다.
Vector Databases: 벡터 데이터베이스는 텍스트, 이미지 및 기타 모달리티를 포함한 다양한 데이터 유형의 벡터 임베딩을 저장하고 검색하는 멀티모달 RAG 시스템의 중요한 구성 요소입니다. 이들은 유사도 검색을 수행하여 가장 관련성 높은 정보가 LLM에 빠르게 접근 가능하도록 보장합니다.
Example: Milvus는 NVIDIA GPU 가속 벡터 검색을 지원하는 벡터 데이터베이스의 대표적인 예로, 대규모 멀티모달 데이터에 탁월한 성능을 제공합니다.
- GPU Acceleration: Milvus는 NVIDIA GPU를 사용하여 벡터 인덱싱 및 쿼리를 가속화합니다.
- Scalability: 10억 규모의 유사도 검색을 처리하여, 대용량 애플리케이션에 적합합니다.
- Efficiency: GPU 인덱싱과 쿼리의 조합은 최소 지연 시간으로 최대 처리량과 실시간 응답을 보장합니다.
Text Embedding Models: 이러한 모델은 텍스트 입력을 벡터 임베딩으로 변환하며, 이는 RAG 시스템의 유사도 검색에 필수적입니다.
- Example: NV Embed: 텍스트를 벡터 데이터베이스에서 빠른 검색을 위한 임베딩으로 효율적으로 변환하는 GPU 가속 임베딩 모델로, CPU 기반 솔루션에 비해 상당한 속도 이점을 제공합니다.
Large Language Models (LLMs): LLM은 RAG 시스템의 핵심을 이루며, 쿼리와 검색된 컨텍스트 데이터를 기반으로 응답을 생성합니다. 이러한 모델은 응답 정확도를 향상시키기 위해 특정 작업에 맞게 파인튜닝되는 경우가 많습니다.
- Example: Llama 3.1 (70B Instruct Variant): Meta가 개발한 이 버전은 지시 따르기 작업에 맞게 파인튜닝되어, 정확하고 작업 지향적인 응답을 생성하는 능력을 향상시킵니다.
Orchestration Frameworks: 이러한 프레임워크는 초기 쿼리 처리, 관련 멀티모달 콘텐츠 검색, 최종 응답 생성에 이르기까지 전체 파이프라인 전반의 데이터 흐름을 관리합니다.
- Example: LlamaIndex: 쿼리 처리, 컨텍스트 검색, 응답 생성을 오케스트레이션하여 멀티모달 RAG 시스템의 모든 구성 요소 간 원활한 조정을 보장하는 프레임워크입니다
Figure: 멀티모달 RAG 아키텍처 (Credit NVIDIA)
Figure: 멀티모달 RAG 아키텍처 (Credit NVIDIA)
위 다이어그램은 NVIDIA가 제시한 예시 Multimodal RAG 파이프라인의 아키텍처를 보여주며, 여러 핵심 구성 요소를 기반으로 구축되었습니다. Llama 3는 기반 대규모 언어 모델(LLM) 역할을 하며, LlamaIndex는 전체 워크플로를 오케스트레이션합니다. NV Embed는 텍스트 임베딩을 처리하고, Milvus는 빠른 검색을 위한 벡터 데이터베이스 역할을 합니다. NeVA 22B는 이미지를 처리하고, DePlot은 차트와 플롯을 관리하여 시스템이 다양한 데이터 형식을 처리할 수 있도록 합니다.
멀티모달 RAG를 구축하는 방법에 대한 자세한 내용은 아래 리소스를 확인하세요:
- Video: LlamaIndex, NVIDIA NIM, Milvus로 Multimodal AI RAG 구축하기 | LLM 앱 개발
- Tutorial: Gemini, BGE-M3, Milvus, LangChain으로 Multimodal RAG 구축하기
- Tutorial: FiftyOne, LlamaIndex, Milvus로 더 나은 Multimodal RAG 파이프라인 구축하기
- Tutorial: CLIP과 Llama3로 로컬에서 Multimodal RAG 구현하기
Multimodal RAG 시스템의 주요 기능
이 Multimodal RAG 시스템은 다양한 데이터 유형을 처리하고 이해할 수 있게 해주는 여러 고급 기능을 사용합니다:
- 다중 형식 처리: 이 멀티모달 RAG 시스템은 텍스트 파일, PDF, PowerPoint 프레젠테이션, 이미지 등 광범위한 문서 유형을 처리합니다. 연구, 비즈니스 인텔리전스 등 다양한 목적에 유용합니다.
- 비전 언어 모델을 통한 이미지 분석: NeVA 22B와 같은 모델의 통합을 통해 시스템은 이미지와 다이어그램 같은 시각 콘텐츠를 분석하고 설명할 수 있습니다.
- 효율적인 인덱싱 및 검색: NVIDIA GPU와 함께 Milvus를 활용하여 시스템은 매우 빠른 벡터 인덱싱과 유사도 검색을 제공합니다. 이 기능을 통해 방대한 양의 데이터를 효율적으로 처리할 수 있어, 멀티모달 정보의 실시간 검색이 필요한 애플리케이션에 이상적입니다.
이러한 강력한 기능을 결합함으로써, 이 Multimodal RAG 시스템은 다양한 유형의 데이터에서 인사이트를 추출하기 위한 포괄적인 솔루션을 제공합니다. 텍스트, 이미지 또는 둘의 조합을 다루든, 이 시스템을 통해 다양한 형식을 활용하여 이해와 의사결정을 향상시킬 수 있습니다.
결론: AI 기반 콘텐츠 이해의 발전
이 블로그 게시물에서는 NVIDIA GPU와 Milvus를 사용하여 멀티모달 RAG 애플리케이션을 구축하는 방법을 다루었습니다. GPU 가속 벡터 검색 기능을 갖춘 Milvus는 여기서 중요한 역할을 하며, 높은 성능과 확장성을 보장합니다. Github의 Notebook을 확인하고 더 탐색해 보며 직접 실험해 보시기를 권장합니다.
여러분의 의견을 듣고 싶습니다!
이 블로그 게시물이 마음에 드셨다면 GitHub에서 별을 눌러주시면 정말 감사하겠습니다! 또한 Discord의 Milvus 커뮤니티에 참여하여 여러분의 경험을 공유하셔도 좋습니다. 더 자세히 알아보고 싶다면, Milvus로 Multimodal RAG 앱을 구축하는 방법에 대한 예제를 확인할 수 있는 GitHub의 Bootcamp repository를 확인해 보세요.
추가 리소스
계속 읽기

A Few Notes from Databricks Data + AI Summit 2026: Why the Data Layer Matters Again
James Luan shares notes from Databricks Data + AI Summit 2026 on why production AI is pushing the data layer back to the center of infrastructure.

DeepSeek-OCR Explained: Optical Compression for Scalable Long-Context and RAG Systems
Discover how DeepSeek-OCR uses visual tokens and Contexts Optical Compression to boost long-context LLM efficiency and reshape RAG performance.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.



