GenAI 생태계의 지형: LLM과 벡터 데이터베이스를 넘어
ChatGPT가 20개월 전 획기적으로 출시된 이후, GenAI 분야는 상당한 발전과 혁신을 경험했습니다. 처음에는 Large Language Models (LLMs)와 벡터 데이터베이스가 가장 많은 주목을 받았습니다. 그러나 GenAI 생태계는 이 두 구성 요소만으로 설명하기에는 훨씬 더 광범위하고 복잡합니다. GenAI 애플리케이션을 가능하게 하는 핵심 인프라 중 하나인 벡터 데이터베이스를 구축하는 사람으로서, 저는 빠른 기술 발전과 그것이 업계에 미치는 영향을 지켜보는 것이 매우 흥미롭습니다. 이 글에서는 지금까지 어떤 일이 있었는지 되짚어 보고, GenAI 생태계의 지형에 대한 인사이트를 공유하고자 합니다.
생성형 AI 애플리케이션은 크게 두 가지 주요 유형으로 분류할 수 있습니다: Retrieval-Augmented Generation (RAG)과 멀티미디어 생성입니다. RAG는 정보 검색 기법과 생성형 언어 모델을 결합하여 관련성 있고 일관된 출력을 생성합니다. 반면, 멀티미디어 생성은 생성형 모델을 활용하여 창의적인 광고와 디지털 트윈을 포함한 복잡한 시각 콘텐츠를 만듭니다.
Retrieval-Augmented Generation
Retrieval-Augmented Generation (RAG)은 현재 생성형 AI의 가장 인기 있는 사용 사례 중 하나입니다. 간단한 RAG 시스템은 기본적인 데이터 정제, 임베딩 모델, 벡터 데이터베이스, LLM 등 다양한 구성 요소로 이루어져 있습니다. 더 고도화된 프로덕션 수준의 RAG 시스템은 일반적으로 품질과 사용자 경험을 향상하기 위한 추가 구성 요소를 포함합니다. RAG 시스템은 전통적인 검색 시스템의 아키텍처와 유사하기 때문에, 검색 시스템의 많은 구성 요소는 오늘날 RAG에도 여전히 적용 가능합니다.
일반적인 검색 시스템은 오프라인 인덱싱 부분과 온라인 쿼리 서빙 부분이라는 두 가지 주요 부분으로 나눌 수 있습니다. 마찬가지로, RAG는 인덱싱 단계와 온라인 쿼리 서빙 단계로 구성됩니다:
인덱싱 단계: 인덱싱 단계는 데이터베이스, API, 파일 시스템을 포함한 다양한 소스에서 데이터를 수집하는 과정을 포함합니다. 이 데이터는 분석 준비를 위해 파일 파싱과 텍스트 청킹을 거칩니다. 처리 후에는 데이터가 적합한 형식으로 임베딩되고 효율적인 검색을 위해 벡터 데이터베이스에 로드됩니다. 일부 RAG 시스템은 데이터를 풍부하게 하고 검색 프로세스를 개선하기 위해 라벨 추출, Knowledge Graph 구축, 요약과 같은 고급 데이터 마이닝 기법까지 통합합니다.
서빙 단계: 온라인 쿼리 서빙 단계는 사용자의 쿼리 의도를 이해하는 데 초점을 맞추며, 가장 관련성 높은 정보를 찾기 위해 벡터 유사도 검색을 포함한 다양한 검색 방법을 사용합니다. 그런 다음 검색 결과는 생성을 위해 Large Language Model (LLM)로 전송됩니다. 이 단계에서 LLM은 검색된 데이터를 바탕으로 일관되고 맥락적으로 관련성 있는 출력을 생성합니다. 또한 LLM은 에이전트로 작동하여 외부 도구를 활용함으로써 역량을 강화하고 더 포괄적이며 정확한 응답을 제공할 수 있습니다.
그 결과, 많은 오케스트레이션 프로젝트가 다양한 구성 요소의 구현과 설정 옵션을 제공합니다. 아키텍처의 복잡한 특성은 시스템을 화이트박스와 블랙박스 양쪽 관점에서 평가할 필요성도 만들며, 이는 평가 프레임워크의 발전으로 이어집니다.
각 구성 요소는 또한 각 데이터 소스용 커넥터와 특정 사용 사례에 맞춤화된 임베딩 모델처럼 더 뛰어나고 풍부한 기능을 구축하려는 개발자들을 끌어들입니다. LLM 추론 프레임워크는 단순한 API 서비스 이상의, LLM을 위한 더 유연한 배포 옵션을 제공합니다. 또한 에이전트형 프레임워크는 LLM의 추론 및 도구 사용 역량을 더 잘 활용하도록 돕습니다.
또한 일부 프로젝트는 다양한 관점에서 RAG에 접근하여, 지식 그래프와 같은 대안적 검색 방법을 탐구하고, 향상된 UI 경험을 위한 웹 프런트엔드 프레임워크를 개발하며, 챗봇 UI를 포함한 전체 RAG 워크플로를 제공하는 즉시 사용 가능한 솔루션을 만들고 있습니다.
워크플로 오케스트레이션 및 최적화
RAG 애플리케이션의 복잡한 워크플로를 관리하기 위해 LangChain, LlamaIndex, Haystack, DSPy, Semantic Kernel과 같은 SDK가 널리 활용됩니다. 이러한 오케스트레이션 프레임워크를 통해 개발자는 RAG 파이프라인을 구축, 사용자 지정, 테스트할 수 있으며, 특정 사용 사례에 대해 최상의 생성형 답변 품질을 달성하도록 파이프라인이 구성되도록 보장할 수 있습니다.
예: LlamaIndex
LlamaIndex는 LLM을 사용하여 컨텍스트 증강 애플리케이션을 구축하기 위한 프레임워크입니다. 데이터 수집, 파싱, 인덱싱, 쿼리를 위한 도구를 제공함으로써 개발자가 LLM을 프라이빗 데이터와 통합할 수 있도록 합니다. 이 접근 방식은 API, SQL 데이터베이스, 문서와 같은 사용자별 데이터 소스의 컨텍스트를 통합하여 질의응답, 챗봇, 문서 이해와 같은 특정 애플리케이션에 LLM을 더 쉽게 사용할 수 있게 합니다. LlamaIndex는 다양한 청킹 전략 및 하이브리드 검색 방법과 같이 일반적으로 사용되는 구성 요소에 대한 편리한 프로그래밍 추상화를 제공합니다.
품질 평가 및 관측 가능성
RAG는 복잡한 시스템이므로 특정 시나리오에서 최적의 결과를 달성하는 것은 어려울 수 있습니다. 이러한 과제를 해결하기 위해서는 과학적인 평가 방법론이 필수적입니다. Ragas, Arize, Langfuse, Relari AI, Giskard, DeepEval과 같은 프로젝트는 평가 및 관측 가능성에 필요한 지표와 도구를 제공합니다. 이를 통해 개발자는 RAG 시스템을 정량적으로 측정, 모니터링, 문제 해결할 수 있습니다.
예: Ragas
Ragas는 RAG 파이프라인을 평가하기 위한 포괄적인 프레임워크입니다. Ragas는 충실성, 관련성, 컨텍스트 정밀도와 같은 답변 품질 지표를 평가하기 위한 도구를 제공합니다. 합성 테스트 데이터셋 생성, 프로덕션 환경의 RAG 애플리케이션 모니터링, LangChain 및 LlamaIndex와 같은 AI 도구 및 플랫폼과의 통합을 지원합니다. 핵심 성능 측면을 포괄하는 조화된 Ragas 점수를 제공함으로써, 이 프레임워크는 평가 프로세스를 단순화하고 정량화하여 궁극적으로 RAG 파이프라인의 효과성과 신뢰성을 향상시킵니다.
데이터 커넥터 및 웹 스크래핑
여러 소스의 데이터를 원활하게 통합하고 처리하는 능력은 매우 중요합니다. Airbyte, Fivetran과 같은 플랫폼은 강력한 데이터 커넥터를 제공하는 데 앞장서고 있으며, 웹 스크래핑을 위한 Apify 및 Zyte도 마찬가지입니다. 이들은 기업이 데이터를 효율적으로 수집, 변환, 통합하여 RAG 워크플로에 적용할 수 있게 하며, 중요한 미션을 위해 AI의 힘을 더 쉽게 활용할 수 있도록 합니다. 데이터 수집과 연결성은 전통적인 검색 시스템에서 중요했으며, 어느 정도 새로운 형태의 검색인 오늘날의 RAG에서도 그 중요성은 그대로 유지됩니다.
예: Airbyte
Airbyte는 추출 및 로드(EL) 데이터 파이프라인을 구축하도록 설계된 오픈 소스 데이터 이동 플랫폼입니다. 주로 주요 서비스에 초점을 맞추는 많은 데이터 파이프라인 플랫폼과 달리, Airbyte는 규모가 작고 종종 간과되는 서비스의 통합도 지원합니다. 방대한 커넥터를 유지 관리하고 맞춤형 커넥터를 공유하는 커뮤니티를 육성함으로써, Airbyte는 기업이 특정 요구 사항에 맞춘 솔루션을 만들 수 있도록 지원합니다. 강력한 데이터 커넥터는 비정형 데이터를 임베딩으로 처리하고 Milvus와 같은 벡터 데이터베이스에 로드하여 의미적 유사도 검색을 수행할 수 있습니다. 이 기능은 기업이 데이터를 효율적으로 수집, 변환, 통합하여 RAG 워크플로에 적용하고, AI 기반 의사결정 및 검색 애플리케이션을 향상하는 데 도움이 됩니다.
임베딩 및 리랭커 모델
임베딩 모델과 같은 심층 신경망은 비정형 데이터가 처리되고 이해되는 방식을 변화시키고 있습니다. OpenAI, Cohere, Voyage AI, Jina AI, Twelve Labs와 같은 기업들은 텍스트 및 멀티모달 데이터를 숫자 벡터로 변환하는 고급 모델 개발의 최전선에 있습니다. 이러한 임베딩은 근사 최근접 이웃(ANN) 벡터 검색을 가능하게 하여, 애플리케이션이 매우 관련성 높은 결과와 인사이트를 제공할 수 있도록 합니다.
범용 임베딩 모델을 넘어, Voyage AI와 같은 기업은 법률 및 금융과 같은 특정 분야에서 품질을 개선하는 특화 모델을 만들고 있으며, Twelve Labs는 비디오 검색 임베딩 모델에 집중하고 있습니다. 쿼리와 소규모 후보 문서 집합 간의 의미적 관련성을 비교하도록 의도적으로 학습된 모델인 리랭커는 초기 벡터 기반 검색 단계의 결과 정확도를 더욱 향상할 수 있습니다. Cohere, Voyage AI, Jina AI와 같은 기업은 검색 정확도를 개선하기 위한 리랭커를 제공합니다.
예시: Voyage AI
Voyage AI는 임베딩 모델과 리랭커를 포함한 검색 모델을 전문으로 하는 Stanford와 MIT 출신 AI 연구자 팀입니다. 이들의 선도 모델인 voyage-2는 텍스트에 대한 대조 학습으로 훈련되었으며, OpenAI의 텍스트 임베딩 모델과 같은 업계 표준에 비해 더 높은 검색 정확도, 확장된 컨텍스트 윈도우, 효율적인 추론을 제공합니다. Voyage AI는 금융, 다국어 컨텍스트, 법률 업무, 코드 검색과 같은 분야에 최적화된 범용 및 도메인 특화 모델을 모두 제공합니다. Voyage AI는 검색 결과를 향상하는 리랭커도 제공합니다.
LLM 추론 및 호스팅
LLM 애플리케이션에 대한 수요가 증가함에 따라, 효율적인 호스팅 및 추론 솔루션이 필수적입니다. vLLM, Lepton AI, Fireworks AI, Octo AI와 같은 프로젝트는 LLM을 배포하고 확장하기 위한 강력한 인프라를 제공합니다. 이들은 서빙 시간 동안 모델이 효율적으로 작동하도록 보장하기 위해 다양한 추론 최적화를 통합합니다.
예시: vLLM
vLLM은 최적화된 LLM 추론 및 서빙을 위한 오픈 소스 라이브러리입니다. PagedAttention 메커니즘을 사용하여 메모리를 효율적으로 관리하고 들어오는 요청의 연속 배치를 지원합니다. 이 라이브러리는 CUDA/HIP 그래프를 통한 빠른 모델 실행을 활용하며 GPTQ, AWQ, SqueezeLLM, FP8 KV Cache와 같은 다양한 양자화 기법을 포함합니다. vLLM은 인기 있는 HuggingFace 모델과 원활하게 통합되어 병렬 샘플링 및 빔 서치와 같은 디코딩 알고리즘으로 높은 처리량의 서빙을 제공합니다. 분산 추론을 위한 텐서 및 파이프라인 병렬 처리, 스트리밍 출력을 지원하며 OpenAI 호환 API 서버를 포함합니다. 또한 접두사 캐싱 및 multi-Lora 지원과 같은 실험적 기능을 제공하고, NVIDIA 및 AMD GPU 모두에 최적화되어 있습니다.
에이전트 및 메모리 관리
GenAI 생태계는 MemGPT, Mem0, Camel, AutoGPT, CrewAI와 같은 솔루션을 통해 메모리 관리 및 에이전트 기반 AI 시스템 분야에서 발전하고 있습니다. 이러한 혁신은 AI 애플리케이션이 대화 기록을 기억하고, 도구를 활용하며, 서로 상호작용할 수 있게 하여 사용자 경험을 크게 향상시키는 더욱 개인화되고 맥락을 인식하는 상호작용을 제공합니다.
예시: MemGPT
MemGPT는 상태 유지형 LLM 에이전트의 개발 및 배포를 단순화하는 것을 목표로 하는 오픈 소스 프로젝트입니다. 전통적인 운영 체제와 유사한 메모리 계층 구조 및 제어 흐름을 활용함으로써, MemGPT는 다양한 스토리지 계층을 자동으로 지능적으로 관리하여 LLM의 제한된 컨텍스트 창 내에서 확장된 컨텍스트를 제공합니다. MemGPT는 RAG를 통해 외부 데이터 소스와의 연결을 촉진하고, 사용자 지정 도구 또는 함수를 정의하고 호출하는 것을 지원하여 고급 상태 유지형 LLM 에이전트의 개발을 용이하게 합니다.
에이전트를 위한 외부 도구 및 API
AI 모델을 다양한 외부 도구 및 API와 통합하는 것은 에이전트의 기능을 확장하는 데 매우 중요합니다. Bing API, Google Search API, Twilio와 같은 서비스와 OpenAPI와 같은 프레임워크는 에이전트와 도구의 상호작용을 촉진하여 애플리케이션이 외부 데이터, 서비스 및 기능에 접근하고 이를 활용할 수 있게 합니다.
예시: Bing API
웹 및 이미지 검색과 같은 서비스를 포함하는 Bing Search API 제품군은 안전하고 광고가 없으며 위치를 인식하는 검색 결과를 제공합니다. 이를 통해 에이전트는 단일 API 호출로 수십억 개의 웹 문서, 이미지, 동영상 및 뉴스 소스에서 정보에 접근할 수 있습니다.
프론트엔드 및 검색/채팅 UI 경험
AI 애플리케이션과 상호작용하기 위한 직관적인 인터페이스를 만드는 것은 사용자 채택에 필수적입니다. Streamlit, Vercel, Gradio와 같은 프레임워크는 사용자 친화적인 UI 경험을 제공하여 AI 애플리케이션 개발을 단순화합니다. 개발자는 이러한 프레임워크를 활용하여 RAG 애플리케이션을 위한 채팅 상자, 시각 검색을 위한 이미지 선택, 자르기 및 탐색과 같은 기능 등 AI 상호작용의 특정 요구 사항을 충족하도록 인터페이스를 맞춤화할 수 있습니다.
예시: Streamlit
Streamlit은 데이터 과학자와 AI/ML 엔지니어가 최소한의 코딩 노력으로 동적이고 인터랙티브한 데이터 앱을 만들 수 있도록 설계된 오픈 소스 Python 프레임워크입니다. 직관적인 구문에 집중하고 CSS, HTML 또는 JavaScript의 필요성을 없앰으로써, Streamlit은 사용자가 세련된 애플리케이션을 빠르게 구축하고 배포할 수 있게 합니다. Pandas 및 NumPy와 같은 인기 있는 데이터 라이브러리와 통합되며 AI 기반 애플리케이션 개발을 위한 백엔드 구성 요소를 지원합니다.
지식 그래프(KG)
지식 그래프는 정보 검색의 정확성과 관련성을 향상시키는 구조화된 데이터를 제공하여 Retrieval-Augmented Generation을 강화하고, 그 결과 더 정확하고 맥락을 인식하는 AI 생성 응답을 만들어냅니다. WhyHow, GraphRAG, and HippoRAG와 같은 선도적인 프로젝트는 검색 결과와 생성된 답변의 품질을 향상시키기 위해 지식 그래프 구조와 RAG 기술을 결합합니다.
예시: WhyHow
WhyHow는 지식 그래프를 사용하여 복잡한 Retrieval-Augmented Generation (RAG) 시스템을 향상시키는 데 중점을 두고, 개발자가 비정형 데이터를 더 효과적으로 구성하고 검색할 수 있도록 돕기 위해 설계된 플랫폼입니다. 유연한 데이터 수집을 위한 도구를 제공하고, 개발자와 비기술 도메인 전문가 간의 협업을 위한 멀티플레이어 그래프 생성을 지원하며, 특정 사용 사례에 맞게 그래프를 조정하기 위한 세분화된 스키마 조작을 허용합니다. 작고 모듈화된 그래프와 벡터 청크를 강조함으로써 WhyHow는 정보 검색 정밀도를 향상시킵니다. 이 플랫폼은 벡터 데이터베이스와 호환되며 다양한 형식을 위한 내보내기 기능을 포함합니다. 또한 WhyHow는 고급 필터링 기법을 통해 더 정확한 검색 워크플로를 만드는 데 도움을 주는 오픈 소스 규칙 기반 검색 패키지를 제공합니다.
즉시 사용 가능한 및 로우 코드 RAG 서비스
또한 RAG를 위한 즉시 사용 가능한 솔루션과 로우코드 솔루션에 대한 수요도 상당합니다. AnythingLLM, PrivateGPT, Dify, Shakudo, Vectara, Epsilla, FlowiseAI와 같은 프로젝트는 기업이 데이터 파이프라인과 검색 인프라에 대한 광범위한 개발 및 도메인 전문 지식 없이도 AI 기능을 빠르게 배포할 수 있도록 사용하기 쉬운 솔루션과 일정 수준의 사용자 지정 기능을 제공합니다.
예시: AnythingLLM
AnythingLLM은 코딩 없이도 대화형 RAG 챗봇과 AI Agents를 제공하는 올인원 AI 애플리케이션입니다. 이는 프라이빗한 무설정 솔루션이나 광범위한 코딩 전문 지식이 필요 없는 사용자 지정 가능한 AI 애플리케이션을 찾는 기업을 위해 설계되었습니다. AnythingLLM은 상용 및 오픈소스 대규모 언어 모델(LLMs)과 벡터 데이터베이스를 모두 지원합니다. 이 애플리케이션은 로컬 및 원격 호스팅을 통해 풀스택 경험을 제공합니다. 주요 기능에는 체계적인 문서 관리를 위한 워크스페이스, 권한 설정이 있는 다중 사용자 지원, 웹 브라우징 및 코드 실행을 위한 에이전트, 사용자 지정 임베드 가능 채팅 위젯, 여러 문서 유형 지원이 포함됩니다. AnythingLLM은 또한 사용자 지정 통합을 위한 개발자 API를 제공합니다.
이미지 및 비디오 생성
GenAI 생태계는 텍스트 기반 애플리케이션에 국한되지 않으며, 이미지 및 비디오 생성 분야의 중요한 발전도 포괄합니다:
창작 생성 및 디지털 트윈
Midjourney, Stability AI, Runway, Pika, HeyGen과 같은 도구는 고품질 이미지와 비디오를 생성하기 위한 AI 기반 솔루션을 제공함으로써 창작 산업을 혁신하고 있습니다. 이러한 플랫폼은 아티스트, 마케터, 개발자가 매력적인 시각 콘텐츠를 만들 수 있도록 지원하며, 창의성과 혁신의 경계를 확장합니다.
예시: Midjourney
Midjourney는 샌프란시스코의 독립 연구소인 Midjourney, Inc.가 개발한 생성형 AI 프로그램 및 서비스입니다. OpenAI의 DALL-E 및 Stability AI의 Stable Diffusion과 유사하게 자연어 설명, 즉 프롬프트로부터 고품질 이미지를 생성합니다. 사용자는 Discord 봇을 통해 Midjourney와 상호작용하며, /imagine 명령어로 프롬프트를 입력해 이미지를 생성할 수 있고, 그 결과 업스케일링 옵션이 있는 네 개의 이미지가 생성됩니다. 이 도구는 GenAI 생태계의 발전을 잘 보여주며, 디지털 콘텐츠 제작의 가능성을 확장함으로써 창작 산업에 영향을 미치고 있습니다.
맺음말
GenAI 생태계는 다양한 구성 요소와 복잡성을 특징으로 하는 역동적이고 빠르게 진화하는 환경입니다. LLM과 벡터 데이터베이스 같은 기반 기술부터 데이터 수집, 오케스트레이션, 이미지 생성 분야의 혁신에 이르기까지, GenAI는 인공지능의 경계를 재정의하고 있습니다. 탐구와 혁신이 계속됨에 따라 산업 전반에 걸친 변혁적 영향의 잠재력은 막대합니다. Milvus 벡터 데이터베이스의 제작자인 Zilliz에서, 우리는 GenAI 환경의 많은 파트너들과 협력해 왔습니다. 우리는 GenAI의 지속적인 진화를 목격하고 이에 기여하기를 기대하며, 그것이 가져올 가능성을 고대하고 있습니다.
계속 읽기

Introducing Functions and Model Inference on Zilliz Cloud: Automatic Embedding and Reranking with Hosted Models
Zilliz Cloud Functions auto-generate embeddings via OpenAI, Voyage AI, Cohere, or Zilliz Hosted Models. Built-in reranking — just insert text and search.

Why I’m Against Claude Code’s Grep-Only Retrieval? It Just Burns Too Many Tokens
Learn how vector-based code retrieval cuts Claude Code token consumption by 40%. Open-source solution with easy MCP integration. Try claude-context today.

AI Integration in Video Surveillance Tools: Transforming the Industry with Vector Databases
Discover how AI and vector databases are revolutionizing video surveillance with real-time analysis, faster threat detection, and intelligent search capabilities for enhanced security.



