Zilliz Cloud Pipelines와 Voyage AI로 코드 중심 텍스트를 위한 우수한 RAG 구축하기
임베딩 모델은 Retrieval Augmented Generation (RAG)의 핵심에 있으며, 주로 검색 성능에 영향을 미치고 전반적인 응답 품질에 매우 중요합니다. 방대한 양의 데이터 코퍼스로 학습된 임베딩 모델은 어떤 텍스트에서든 의미의 수치적 표현을 추출할 수 있어 다양한 정보 검색 작업에 적합합니다. 그러나 어떤 작업에서도 뛰어난 성능을 발휘하는 임베딩 모델을 학습시키는 것은 여전히 매우 어려운 일입니다. 다양한 임베딩 모델이 제공되며, 각 모델은 고유한 강점과 약점, 그리고 서로 다른 특성을 가지고 있습니다.
Zilliz Cloud Pipelines는 검색을 위한 원스톱 솔루션으로 사용 가능한 최고의 임베딩 모델을 통합합니다. 이러한 유연한 선택지는 개발자가 특정 사용 사례에 맞게 최적화된 최고의 모델을 탐색하고 선택할 수 있게 해줍니다.
오늘, Voyage AI의 임베딩 모델을 Zilliz Cloud Pipelines에서 사용할 수 있게 되었음을 발표하게 되어 매우 기쁩니다. 새롭게 출시된 voyage-2 및 voyage-code-2 모델은 소스 코드, 기술 문서, 일반 작업과 관련된 검색 작업에서 뛰어난 품질을 입증했습니다. 예를 들어, voyage-code-2는 코드 집약적인 데이터셋에서 OpenAI 임베딩보다 14.52% 더 우수하고, 일반 목적에서는 3.03% 더 우수한 것으로 보고되었습니다.
또한 우리는 Voyage AI와 협력하여 코드 관련 작업을 위해 다양한 임베딩 모델로 구현된 RAG 시스템의 효과를 평가했습니다. 사용된 언어 모델은 GPT4입니다. 우리는 코딩에 관한 질문이 포함된 APPS 및 Codechef 데이터셋의 하위 집합에서 시스템을 테스트했으며, 각 질문에는 코퍼스에서 정확히 하나의 정답이 있습니다. 검색 품질은 "recall@k"로 측정하는데, 이는 검색된 상위 k개 문서 안에 올바른 결과가 포함될 확률입니다. 또한 RAG 파이프라인을 위한 인기 있는 평가 프레임워크인 Ragas로 엔드투엔드 품질도 평가합니다. Ragas에는 검색된 텍스트의 관련성과 정밀도부터 최종 답변의 정확성과 품질까지 RAG의 다양한 측면을 설명하는 여섯 가지 지표가 있습니다. "Ragas Score"라고 불리는 이 여섯 지표의 조화 평균은 시스템의 전반적인 성능을 측정합니다. 각 지표에 대한 자세한 내용은 Milvus 문서 페이지에서 확인할 수 있습니다.
코드 데이터셋에서 인기 있는 임베딩 모델 간 검색 점수와 전반적인 점수 비교.
상단의 두 그림은 voyages-2 및 voyage-code-2 모델이 다른 모델보다 훨씬 더 뛰어난 검색 성능을 가지고 있음을 보여줍니다. “Recall@k” 점수는 상위 k개 결과를 검색할 때 반환된 k개 결과 안에 정답이 포함될 가능성이 있음을 나타냅니다. 예를 들어, apps_1solution 데이터셋에서 voyage-code-2는 62%의 경우 상위 4개 결과 안에 정답을 포함하는 반면, bge-base-en-v1.5는 2%의 경우에서만 이를 달성합니다. 이러한 테스트는 voyage-code-2가 코드 관련 작업에서 이에 최적화되지 않은 임베딩 모델보다 훨씬 더 뛰어난 성능을 보인다는 것을 보여줍니다.
엔드투엔드 RAG 답변의 경우, 리콜 향상은 가장 성능이 좋은 대안과 비교했을 때 Answer Correctness와 Ragas Score에서 10퍼센트포인트 이상의 증가로 이어집니다. 구체적으로, Context Precision과 Context Recall은 검색 단계의 효과를 측정합니다. Voyage 모델은 특히 Context Precision에서 다른 옵션들을 크게 능가합니다. 생성된 답변의 품질을 측정하는 Faithfulness와 Answer Relevancy에서 Voyage는 다양한 모델보다 5퍼센트포인트 이상 앞섭니다. 결과는 더 나은 검색 품질이 더 나은 RAG 파이프라인 생성을 이끈다는 것을 보여줍니다. Answer Similarity와 Answer Correctness는 생성된 답변과 정답 간의 의미적 유사성을 평가하는 것과 관련이 있습니다. Answer Correctness에서 Voyage 기반 RAG는 다시 한번 뚜렷한 이점을 보이며, 다른 모델들을 5포인트 이상 능가합니다.
RAG는 코딩 문제와 소프트웨어 개발에 관한 질의응답 봇의 주된 접근 방식이 되었습니다. 이러한 애플리케이션은 코드 관련 검색 작업에 뛰어난 고품질 Voyage 모델로부터 훨씬 더 큰 이점을 얻을 수 있습니다. 향상된 검색 품질은 코드나 기술 문서에서 관련 정보를 더 잘 찾아내는 것으로 이어져, 더 정확한 답변과 더 나은 사용자 경험을 제공합니다.
Zilliz Cloud Pipelines에서는 이제 DevOps나 ML 인프라 관리에 대해 걱정하지 않고 코드 관련 작업에서 최고 수준의 검색 품질을 달성하기 위해 임베딩 모델로 voyages-2와 voyage-code-2를 선택할 수 있습니다. 가장 좋은 점은 https://cloud.zilliz.com/signup에서 가입해 무료로 시작하여 쉽고 정밀하게 RAG 애플리케이션을 구축할 수 있다는 것입니다!
계속 읽기

How to Use Anthropic MCP Server with Milvus
MCP + Milvus: Streamline AI agent development with standardized data access, eliminating integration hassles while enhancing context and flexibility.

Similarity Metrics for Vector Search
Exploring five similarity metrics for vector search: L2 or Euclidean distance, cosine distance, inner product, and hamming distance.

What is the K-Nearest Neighbors (KNN) Algorithm in Machine Learning?
KNN is a supervised machine learning technique and algorithm for classification and regression. This post is the ultimate guide to KNN.



