RAG 평가 도구: 검색 증강 생성 애플리케이션을 평가하는 방법
RAG)) 또는 검색 증강 생성(Retrieval Augmented Generation)은 ChatGPT와 같은 대규모 언어 모델(LLMs))) 시대의 대표적인 AI 프레임워크입니다. 이는 외부 지식을 통합하여 이러한 모델의 역량을 향상시키고, 더 정확하고 최신의 응답을 보장합니다. 표준 RAG 시스템에는 LLM, Milvus와 같은 벡터 데이터베이스, 그리고 코드로 된 일부 프롬프트가 포함되며, 이 모든 것은 포괄적인 rag 평가 프레임워크를 사용해 평가할 수 있습니다.
점점 더 많은 개발자와 기업이 GenAI 애플리케이션 구축을 위해 RAG를 채택함에 따라, 그 효과를 평가하는 일이 점점 더 중요해지고 있습니다. 이전 게시물에서는 OpenAI Assistants와 Milvus 벡터 데이터베이스로 구축한 두 가지 서로 다른 RAG 시스템의 성능을 평가하여 RAG 시스템 평가에 대한 몇 가지 통찰을 제공했습니다. 이 게시물에서는 더 깊이 들어가 RAG 애플리케이션을 평가하는 데 사용되는 방법론을 논의합니다. 또한 강력한 평가 도구 몇 가지를 소개하고 표준 지표를 강조하겠습니다.
RAG 애플리케이션 평가는 단순히 몇 가지 예를 비교하는 것 이상입니다. 핵심은 이러한 애플리케이션을 평가하기 위해 설득력 있고, 정량적이며, 재현 가능한 지표를 사용하는 데 있습니다. 이 여정에서 우리는 세 가지 범주의 지표를 소개합니다:
정답 기준에 기반한 지표
정답 기준이 없는 지표
LLM 응답에 기반한 지표
정답 기준은 사용자 쿼리에 해당하는 데이터셋 내의 잘 확립된 답변 또는 지식 문서 청크를 의미합니다. 정답 기준이 답변인 경우, 정답 기준과 RAG 응답을 직접 비교할 수 있어 답변 의미 유사도 및 답변 정확성과 같은 지표를 사용한 엔드투엔드 측정이 가능합니다.
아래는 답변의 정확성을 기준으로 답변을 평가하는 예입니다.
정답 기준: 아인슈타인은 1879년 독일에서 태어났다.
높은 답변 정확성: 1879년, 독일에서 아인슈타인이 태어났다.
낮은 답변 정확성: 스페인에서 아인슈타인은 1879년에 태어났다.
정답 기준이 지식 문서의 청크인 경우, Exact Match (EM), Rouge-L, F1과 같은 전통적인 지표를 사용하여 문서 청크와 검색된 컨텍스트 간의 상관관계를 평가할 수 있습니다. 본질적으로 우리는 RAG 애플리케이션의 검색 효과를 평가하는 것입니다.
이제 RAG 애플리케이션을 평가하기 위해 정답 기준이 있는 데이터셋을 사용하는 것의 중요성을 확인했습니다. 하지만 주석 처리된 정답 기준이 없는 비공개 데이터셋을 사용하여 RAG 애플리케이션을 평가하고 싶다면 어떻게 해야 할까요? 데이터셋에 필요한 정답 기준을 어떻게 생성할 수 있을까요?
가장 간단한 방법은 ChatGPT와 같은 LLM에 독점 데이터셋을 기반으로 샘플 질문과 답변을 생성하도록 요청하는 것입니다. Ragas 및 LlamaIndex와 같은 도구도 지식 문서에 맞춘 테스트 데이터를 생성하는 방법을 제공합니다.
_Ragas 평가 도구가 생성한 샘플 질문과 답변 (출처: https://docs.ragas.io/en/latest/concepts/testset_generation.html)
질문, 컨텍스트, 해당 답변으로 구성된 이러한 생성된 테스트 데이터셋은 관련 없는 외부 기준 데이터셋에 의존하지 않고 정량적 평가를 가능하게 합니다. 이 접근 방식은 사용자가 고유한 데이터를 사용하여 RAG 시스템을 평가할 수 있도록 하여, 더 맞춤화되고 의미 있는 평가 과정을 보장합니다.
정답 기준이 없는 지표
각 쿼리에 대한 정답 기준이 없어도 RAG 애플리케이션을 평가할 수 있습니다. 오픈소스 평가 도구인 TruLens-Eval은 쿼리, 컨텍스트, 응답 삼중항의 요소 간 관련성을 평가하는 데 중점을 둔 RAG Triad 개념을 혁신적으로 제시합니다. 세 가지 해당 지표는 다음과 같습니다:
맥락 관련성: 검색된 맥락이 쿼리를 얼마나 잘 뒷받침하는지 측정합니다.
근거성: LLM의 응답이 검색된 맥락과 어느 정도 일치하는지 평가합니다.
답변 관련성: 최종 응답이 쿼리와 얼마나 관련이 있는지 측정합니다.
아래는 질문과의 관련성을 기준으로 답변을 평가하는 예시입니다.
질문: 프랑스는 어디에 있으며 수도는 무엇인가요?
낮은 관련성의 답변: 프랑스는 서유럽에 있습니다.
높은 관련성의 답변: 프랑스는 서유럽에 있으며 파리가 수도입니다.
RAG Triad, 출처: https://www.trulens.org/getting_started/core_concepts/rag_triad/
또한 이러한 삼원 지표는 더 세분화되어 평가의 세밀도를 높일 수 있습니다. 예를 들어, RAG 시스템의 성능 평가에 특화된 오픈소스 프레임워크인 Ragas는 맥락 관련성을 맥락 정밀도, 맥락 관련성, 맥락 재현율이라는 세 가지 더 상세한 지표로 나누었습니다.
이 범주의 지표는 친절함, 유해성, 간결성 등의 요소를 고려하여 LLM 응답을 평가합니다. 예를 들어, 간결성, 관련성, 정확성, 일관성, 유해성, 악의성, 유용성, 논쟁성, 여성혐오, 범죄성, 무신경함과 같은 지표를 제안합니다.
아래는 간결성을 기준으로 답변을 평가하는 예시입니다.
질문: 2+2는 무엇인가요?
낮은 간결성의 답변: 2+2가 무엇인가요? 그건 기초적인 질문입니다. 당신이 찾는 답은 2 더하기 2는 4라는 것입니다.
높은 간결성의 답변: 4
LLM을 사용하여 지표 채점하기
앞서 언급한 대부분의 지표는 점수를 얻기 위해 텍스트를 입력해야 하며, 이는 작업이 필요합니다. 좋은 소식은 GPT-4와 같은 LLM의 등장으로 이 과정이 더 관리하기 쉬워졌다는 것입니다. 필요한 것은 적절한 프롬프트를 설계하는 것뿐입니다.
논문 "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena"는 GPT-4가 사용자 질문에 대한 AI 어시스턴트의 응답 품질을 판단하도록 하는 프롬프트 설계를 제안합니다. 아래는 간단한 예시입니다:
[System]
Please act as an impartial judge and evaluate the quality of the response provided by an AI assistant to the user question displayed below. Your evaluation should consider factors such as the helpfulness, relevance, accuracy, depth, creativity, and level of detail of the response. Begin your evaluation by providing a short explanation. Be as objective as possible. After providing your explanation, please rate the response on a scale of 1 to 10 by strictly following this format: "[[rating]]", for example: "Rating: [[5]]".
[Question]
{question}
[The Start of Assistant's Answer]
{answer}
[The End of Assistant's Answer]
이 프롬프트는 GPT-4에게 응답 품질을 평가하고 1에서 10까지의 척도로 점수를 매기도록 요청합니다.
GPT-4는 다른 심사자와 마찬가지로 완벽하지 않으며 편향과 잠재적 오류가 있을 수 있다는 점에 유의하는 것이 중요합니다. 따라서 프롬프트 설계가 중요합니다. 멀티샷이나 Chain-of-Thought (CoT)와 같은 고급 프롬프트 엔지니어링 기법이 필요할 수 있습니다. 다행히도 RAG 애플리케이션을 위한 많은 평가 도구가 이미 잘 설계된 프롬프트를 통합하고 있으므로 우리는 이 문제를 걱정할 필요가 없습니다.
이제 RAG 애플리케이션 평가를 다루었으니, RAG 애플리케이션을 평가하기 위한 몇 가지 도구를 살펴보고, 이 도구들이 어떻게 작동하는지와 어떤 사용 사례에 가장 적합한지에 대한 인사이트를 제공하겠습니다.
Ragas: 간소화된 RAG 평가
Ragas는 RAG 애플리케이션을 평가하기 위한 오픈소스 평가 도구입니다. 간단한 인터페이스를 통해 Ragas는 평가 프로세스를 간소화합니다. 필요한 형식으로 데이터셋 인스턴스를 생성하면 사용자는 신속하게 평가를 시작하고 'ragas_score,' 'context_precision,' 'faithfulness,' 및 'answer_relevancy.'와 같은 지표를 얻을 수 있습니다.
from ragas import evaluate
from datasets import Dataset
# prepare your huggingface dataset in the format
# Dataset({
# features: ['question', 'contexts', 'answer', 'ground_truths'],
# num_rows: 25
# })
dataset: Dataset
results = evaluate(dataset)
# {'ragas_score': 0.860, 'context_precision': 0.817,
# 'faithfulness': 0.892, 'answer_relevancy': 0.874}
Ragas는 다양한 지표를 지원하며 특정 프레임워크 요구사항을 부과하지 않아 다양한 RAG 애플리케이션을 평가하는 데 유연성을 제공합니다. Ragas는 LangSmith를 통해 평가의 실시간 모니터링을 가능하게 하며, 각 평가의 이유와 API 키 사용량에 대한 인사이트를 제공합니다.
RAG 시스템 이해하기
검색 증강 생성(Retrieval Augmented Generation, RAG) 시스템은 대규모 언어 모델(LLM)의 강점과 외부 지식 검색을 결합한 인공지능(AI) 기술의 한 유형입니다. RAG 시스템은 세 가지 주요 구성 요소인 Index, Retrieve, Generate로 이루어져 있습니다. Index 구성 요소는 검색하고 가져올 수 있는 지식 데이터베이스를 생성합니다. Retrieve 구성 요소는 인덱싱된 데이터베이스에서 관련 정보를 가져옵니다. Generate 구성 요소는 가져온 정보를 기반으로 새로운 텍스트를 생성합니다.
RAG 시스템은 챗봇과 질의응답 시스템에 일반적으로 사용됩니다. 이들은 AI 대화와 정보 처리에 견고하고 동적인 접근 방식을 제공합니다. 외부 지식을 활용함으로써 RAG 시스템은 더 정확하고, 맥락에 맞으며, 관련성 있고, 최신의 응답을 가능하게 합니다. 이는 정확하고 시의적절한 정보가 중요한 고객 서비스와 내부 지식 챗봇을 포함한 다양한 영역에서 매우 유용하게 만듭니다.
RAG 평가 지표
RAG 시스템의 성능을 평가하는 것은 신뢰성과 성능을 위해 매우 중요합니다. RAG 시스템을 위한 여러 평가 지표가 있으며, 여기에는 다음이 포함됩니다:
컨텍스트 관련성: 검색된 컨텍스트가 사용자의 질의와 얼마나 관련이 있는지를 측정합니다.
컨텍스트 재현율: 시스템이 검색한 관련 컨텍스트의 비율을 측정합니다.
충실성: 검색된 컨텍스트를 기반으로 생성된 텍스트의 정확도를 측정합니다.
답변 관련성: 생성된 텍스트가 사용자의 질의와 얼마나 관련이 있는지를 평가합니다.
답변 정확성: 생성된 텍스트의 정확도를 평가합니다.
이러한 지표는 RAG 시스템의 성능을 평가하기 위한 포괄적인 프레임워크를 제공합니다. 이러한 측면을 분석함으로써 개발자는 개선이 필요한 영역을 식별하고 시스템이 고품질의 관련성 있고 정확한 응답을 제공하도록 보장할 수 있습니다.
LlamaIndex: 쉽게 구축하고 평가하기
LlamaIndex는 RAG 평가 도구를 포함하여 RAG 애플리케이션을 구축하기 위한 강력한 AI 프레임워크입니다. 해당 프레임워크 내에서 구축된 애플리케이션을 평가하는 데 유용합니다.
from llama_index.evaluation import BatchEvalRunner
from llama_index.evaluation import (
FaithfulnessEvaluator,
RelevancyEvaluator,
)
service_context_gpt4 = ...
vector_index = ...
question_list = ...
faithfulness_gpt4 = FaithfulnessEvaluator(service_context=service_context_gpt4)
relevancy_gpt4 = RelevancyEvaluator(service_context=service_context_gpt4)
runner = BatchEvalRunner(
{"faithfulness": faithfulness_gpt4, "relevancy": relevancy_gpt4},
workers=8,
)
eval_results = runner.evaluate_queries(
vector_index.as_query_engine(), queries=question_list
)
TruLens-Eval: 다양한 프레임워크를 위한 통합 평가
TruLens Eval은 LangChain과 LlamaIndex로 구축된 RAG 애플리케이션을 쉽게 평가할 수 있는 방법을 제공합니다. 다음 코드 스니펫은 LangChain 기반 RAG 애플리케이션을 위한 평가를 설정하는 방법을 보여줍니다.
from trulens_eval import TruChain, Feedback, Tru,Select
from trulens_eval.feedback import Groundedness
from trulens_eval.feedback.provider import OpenAI
import numpy as np
tru = Tru()
rag_chain = ...
# Initialize provider class
openai = OpenAI()
grounded = Groundedness(groundedness_provider=OpenAI())
# Define a groundedness feedback function
f_groundedness = (
Feedback(grounded.groundedness_measure_with_cot_reasons)
.on(Select.RecordCalls.first.invoke.rets.context)
.on_output()
.aggregate(grounded.grounded_statements_aggregator)
)
# Question/answer relevance between overall question and answer.
f_qa_relevance = Feedback(openai.relevance).on_input_output()
tru_recorder = TruChain(rag_chain,
app_id='Chain1_ChatApplication',
feedbacks=[f_qa_relevance, f_groundedness])
tru.run_dashboard()
Trulens-Eval은 다른 프레임워크로 구축된 RAG 앱도 평가할 수 있지만, 이를 코드로 구현하는 것은 복잡할 수 있습니다. 자세한 내용은 공식 문서를 참조하세요.
또한 Trulens-Eval은 평가 이유를 분석하고 API 키 사용량을 관찰하기 위한 브라우저 기반 시각적 모니터링도 제공합니다.
Phoenix: 유연하게 LLM 평가하기
Phoenix는 생성된 임베딩의 품질과 LLM의 응답을 포함하여 LLM을 평가하기 위한 완전한 지표 세트를 제공합니다. RAG 애플리케이션도 평가할 수 있지만, 앞서 언급한 다른 평가 도구보다 포함된 지표는 더 적습니다. 다음 코드 스니펫은 LlamaIndex로 구축된 RAG 애플리케이션을 평가하기 위해 Phoenix를 사용하는 방법을 보여줍니다.
import phoenix as px
from llama_index import set_global_handler
from phoenix.experimental.evals import llm_classify, OpenAIModel, RAG_RELEVANCY_PROMPT_TEMPLATE, \
RAG_RELEVANCY_PROMPT_RAILS_MAP
from phoenix.session.evaluation import get_retrieved_documents
px.launch_app()
set_global_handler("arize_phoenix")
print("phoenix URL", px.active_session().url)
query_engine = ...
question_list = ...
for question in question_list:
response_vector = query_engine.query(question)
retrieved_documents = get_retrieved_documents(px.active_session())
retrieved_documents_relevance = llm_classify(
dataframe=retrieved_documents,
model=OpenAIModel(model_name="gpt-4-1106-preview"),
template=RAG_RELEVANCY_PROMPT_TEMPLATE,
rails=list(RAG_RELEVANCY_PROMPT_RAILS_MAP.values()),
provide_explanation=True,
)
위에서 언급한 도구 외에도 DeepEval, LangSmith, OpenAI Evals와 같은 다른 플랫폼도 RAG 애플리케이션 평가 기능을 제공합니다. 이들의 방법론은 유사하지만 프롬프트 설계와 구현 세부 사항은 다양하므로, 자신에게 가장 적합한 도구를 선택해야 합니다.
결론적으로, 우리는 몇 가지 방법론, 지표, 그리고 RAG 애플리케이션 평가 도구를 검토했습니다. 특히 세 가지 범주의 지표를 살펴보았습니다.
정답 데이터에 기반한 지표,
정답 데이터가 없는 지표,
그리고 대규모 언어 모델(LLM)의 응답에 기반한 지표.
정답 데이터 기반 지표는 RAG 응답을 확립된 답변과 비교하는 것을 포함합니다. 반면 RAG Triad와 같이 정답 데이터가 없는 지표는 쿼리, 컨텍스트, 응답 간의 관련성을 평가하는 데 중점을 둡니다. LLM 응답 기반 지표는 친절성, 유해성, 간결성을 고려합니다.
또한 우리는 잘 설계된 프롬프트를 통해 지표를 채점하는 데 LLM을 사용하는 방법을 살펴보았고, 이 작업에 도움이 되는 Ragas, LlamaIndex, TruLens-Eval, Phoenix를 포함한 RAG 평가 도구 세트를 소개했습니다.
빠르게 변화하는 AI 세계에서 RAG 애플리케이션을 정기적으로 평가하고 개선하는 것은 그 신뢰성을 위해 매우 중요합니다. 여기서 논의한 방법론, 지표, 도구를 사용하면 개발자와 기업은 RAG 시스템의 성능과 역량에 대해 정보에 기반한 결정을 내릴 수 있으며, AI 애플리케이션의 발전을 이끌 수 있습니다.
골드 스탠더드 데이터셋 만들기
골드 스탠더드 데이터셋을 만드는 것은 RAG 시스템을 평가하는 데 중요한 단계입니다. 골드 스탠더드 데이터셋은 시스템의 성능을 평가하기 위한 기준으로 사용되는 예시들의 집합입니다. 데이터셋에는 RAG 시스템의 도메인과 관련된 질문, 답변, 컨텍스트의 집합이 포함되어야 합니다.
골드 스탠더드 데이터셋을 만들려면 다음 단계를 따를 수 있습니다:
RAG 시스템의 도메인에 적합한 질문과 답변의 집합을 식별합니다.
질문과 답변에 적합한 컨텍스트의 집합을 만듭니다.
사람 평가자가 컨텍스트와 답변에 주석을 달아 정답 데이터셋을 만들도록 합니다.
정답 데이터셋을 사용하여 RAG 시스템의 성능을 평가합니다.
이 프로세스는 평가가 정확하고 관련성 있는 데이터를 기반으로 이루어지도록 하여, 시스템 성능을 평가하기 위한 신뢰할 수 있는 벤치마크를 제공합니다.
RAG 평가를 위한 모범 사례
RAG 시스템을 평가하려면 여러 요소를 신중하게 고려해야 합니다. 다음은 RAG 평가를 위한 몇 가지 모범 사례입니다:
골드 스탠더드 데이터셋을 사용하여 RAG 시스템의 성능을 평가합니다.
시스템 성능을 종합적으로 이해하기 위해 평가 지표를 조합하여 사용합니다.
다양한 평가 지표 간의 트레이드오프를 고려하고 사용 사례에 가장 적합한 지표를 선택합니다.
평가 지표가 계속 관련성과 효과성을 유지하도록 정기적으로 검토하고 개선합니다.
자동화된 평가 도구를 사용하여 평가 프로세스를 간소화하고 사람 평가자의 부담을 줄입니다.
이러한 모범 사례를 따르면 RAG 시스템을 철저하고 효과적으로 평가할 수 있으며, 지속적인 개선과 최적의 성능으로 이어질 수 있습니다.
결론
RAG 시스템은 챗봇과 질의응답 시스템을 구축하기 위한 강력한 기술입니다. RAG 시스템의 성능을 평가하는 것은 신뢰성과 성능을 위해 매우 중요합니다. RAG 시스템을 이해하고, 평가 지표를 사용하며, 골드 스탠더드 데이터셋을 만들고, RAG 평가를 위한 모범 사례를 따르면, RAG 시스템이 최적으로 작동하고 사용자에게 정확하고 관련성 있는 응답을 제공하도록 보장할 수 있습니다.
빠르게 변화하는 AI 세계에서 RAG 애플리케이션을 정기적으로 평가하고 향상시키는 것은 신뢰성을 위해 매우 중요합니다. 여기에서 논의한 방법론, 지표, 도구를 사용하면 개발자와 기업은 RAG 시스템의 성능과 역량에 대해 정보에 기반한 결정을 내리고, AI 애플리케이션의 발전을 이끌 수 있습니다.
계속 읽기

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

Announcing VDBBench 1.0: Open-Source VectorDB Benchmarking with Your Real-World Production Workloads
Discover VDBBench 1.0, an open-source tool for benchmarking vector databases with real-world production data, streaming ingestion, and concurrent workloads.

The Great AI Agent Protocol Race: Function Calling vs. MCP vs. A2A
Compare Function Calling, MCP, and A2A protocols for AI agents. Learn which standard best fits your development needs and future-proof your applications.



