프로덕션으로 가는 길: LLM 애플리케이션 평가와 관찰 가능성
많은 머신 러닝 팀이 프로덕션 환경에 대규모 언어 모델 (LLMs))을 배포할 준비를 하면서, 환각 문제를 해결하고 책임 있는 배포를 보장하는 것과 같은 중대한 과제에 직면하고 있습니다. 이러한 문제를 다루기 전에, 이를 효과적으로 평가하고 식별하는 것이 중요합니다.
최근 Unstructured Data Meetup에서 Arize AI의 ML Solutions Architect인 Hakan Tekgul은 빠르고 정확한 LLM 평가를 수행하기 위한 통찰력 있는 전략을 공유했습니다. 이러한 접근 방식은 높은 답변 품질과 신뢰성 기준을 유지하고 실질적인 비즈니스 가치를 제공하도록 보장합니다.
이벤트를 놓치셨더라도 걱정하지 마세요! 다음은 Hakan의 발표에 대한 자세한 분석입니다.
GenAI 데모를 프로덕션으로 전환하는 것은 어렵습니다!
GenAI 애플리케이션을 구축하는 것은 처음에는 간단해 보일 수 있습니다. 특히 데모 애플리케이션 생성을 용이하게 해주는 LangChain 및 LlamaIndex와 같은 사용자 친화적인 도구가 있기 때문입니다. 그러나 실질적인 비즈니스 가치를 창출할 수 있는 완전한 제품으로 전환하는 것은 어렵습니다. 핵심은 이러한 애플리케이션이 프로덕션 환경에서 신뢰할 수 있고 고품질의 출력을 일관되게 제공하도록 보장하는 데 있습니다.
Twitter 데모에서 실제 제품으로 전환하는 것은 어떤 모습일까요
전자상거래 챗봇 예시로 이 과제를 설명해 보겠습니다. 사용자는 휴가를 계획하기 위해 이 챗봇과 상호작용합니다.
전자상거래 챗봇의 인터페이스
애플리케이션은 사용자 관점에서는 단순해 보일 수 있지만, 뒤에서 진행되는 워크플로는 복잡합니다. 이 워크플로의 주요 단계는 다음과 같습니다:
채팅 시작: 사용자가 챗봇과 상호작용하여 세션을 시작합니다.
매개변수 추출: LLM이 사용자의 입력에서 구조화된 매개변수를 추출합니다.
순위 지정/추천: 모델이 추출된 매개변수를 기반으로 잠재적인 휴가지 목록을 생성합니다.
임베딩 검색 및 검색: 시스템은 더 관련성 높은 정보를 위해 벡터 검색을 수행하여 목록을 정제합니다.
응답 생성: LLM이 검색된 데이터를 기반으로 개인화된 응답을 생성합니다.
챗봇 워크플로의 주요 단계와 잠재적 문제 해결 전략
이 워크플로의 각 단계에서는 특정 문제가 발생할 수 있습니다. 원활한 사용자 경험과 최적의 성능을 보장하려면 효과적인 문제 해결이 필수적입니다. 예를 들어, 다음이 필요할 수 있습니다:
LangChain 및 LlamaIndex와 같은 도구가 오류 없이 원활하게 작동하도록 보장합니다.
사용자의 입력에서 데이터를 정확하게 추출하도록 프롬프트를 작성하고 개선합니다.
추천 시스템을 지속적으로 평가하고 최적화합니다.
검색된 정보의 정확성과 관련성을 향상합니다.
전체 시스템과 각 구성 요소를 개별적으로 문제 해결합니다.
피드백을 활용하여 시스템을 지속적으로 개선하고 향상합니다.
LLM 관측 가능성이 구원투수로 등장합니다!
앞서 설명한 과제를 해결하려면 원활한 LLM 관측 가능성을 위한 평가 도구를 활용하는 것이 중요합니다. LLM 관측 가능성의 다섯 가지 주요 측면은 애플리케이션의 완전한 가시성을 보장하기 위해 주의를 기울여야 합니다. 이러한 평가를 능숙하게 수행함으로써, 팀은 애플리케이션을 종합적으로 관찰하여 신뢰성과 최적의 성능을 보장할 수 있습니다.
| LLM 관찰 가능성의 다섯 가지 핵심 요소 | ||
| 핵심 요소 | 설명 | 일반적인 문제 |
| 평가 | 별도의 평가 LLM을 사용한 LLM 출력의 체계적인 평가 | 출력 품질 및 정렬 |
| 스팬 및 트레이스 | 워크플로 분해에 대한 상세한 가시성 | 특정 실패 지점 식별 |
| 프롬프트 엔지니어링 | 향상된 결과를 위한 프롬프트 템플릿의 반복적 개선 | 응답 정확도 및 관련성 향상 |
| 검색 및 검색 결과 가져오기 | 검색된 컨텍스트를 찾아 개선 | 검색 정확도 향상 |
| 파인튜닝 | 맞춤형 성능을 위해 특정 데이터로 LLM 재학습 | 비즈니스별 요구 사항에 맞춤 |
다음 섹션에서는 LLM 관찰 가능성을 최적화하는 데 있어 그 중요성을 강조하기 위해 LLM 평가와 LLM 스팬 및 트레이스 범주를 더 자세히 살펴보겠습니다.
LLM 평가
LLM 평가(LLM Evals)는 별도의 LLM을 "심판"으로 사용하여 GenAI 애플리케이션의 출력을 체계적으로 평가하는 것을 의미합니다. 정기적인 평가는 생성된 콘텐츠가 품질 기준을 충족하고 사용자 기대를 충족하도록 보장합니다. 예를 들어, 휴가 추천 서비스는 평가 LLM을 사용하여 추천 사항을 정기적으로 검토합니다. 이 평가 시스템은 추천이 오래되었거나 관련성이 없어지면 학습 데이터를 업데이트하기 위한 검토 프로세스를 트리거합니다.
모델 평가 vs. LLM 평가
자세히 알아보기 전에, 모델 평가와 LLM 평가라는 두 가지 유사한 개념을 비교해 보겠습니다.
모델 평가는 애플리케이션의 기반 모델을 선택하고 일반적인 사용 사례와 일치하는지 확인하는 데 도움이 됩니다.
LLM 평가는 LLM 기반 애플리케이션 내 특정 작업 및 구성 요소의 성능을 측정합니다. LLM 평가는 아래 이미지에 표시된 것처럼 검색, 환각, 사용자 불만, Q&A, 요약 및 코드 생성 평가를 포함합니다.
프로덕션 LLM 평가- 작업 성능 측정 | Arize
LLM 평가 작동 방식
심판 LLM을 사용하여 대규모 언어 모델(LLM)의 성능을 평가하는 것은 복잡해 보일 수 있지만, 적절한 도구와 방법론을 사용하면 훨씬 더 관리하기 쉬워집니다. Phoenix LLM Evals 라이브러리는 빠르고 간단한 LLM 평가를 촉진하도록 설계된 오픈 소스 도구입니다. 이 라이브러리는 심판 LLM, 평가 템플릿 및 모델 매개변수를 응집력 있는 프레임워크로 통합합니다.
이 프로세스는 어떻게 작동할까요? 입력 데이터는 LLM 애플리케이션에서 생성된 출력 데이터와 함께 Phoenix 라이브러리에 공급됩니다. 그런 다음 라이브러리 내의 Judge LLM은 프롬프트 템플릿과 함께 이 입력 및 출력 데이터를 사용하여 특정 작업에 대한 시스템 성능을 평가합니다.
LLM 평가- 일반적인 작동 방식
평가 프로세스를 살펴보겠습니다. Milvus와 같은 벡터 데이터베이스에서 컨텍스트를 검색한 다음 사용자의 질문과 검색된 컨텍스트를 기반으로 응답을 생성하는 Retrieval Augmented Generation(RAG) 애플리케이션을 생각해 보세요.
RAG 검색 작업에서 성능을 측정할 때 입력 데이터(사용자의 질문)와 출력 데이터(참조 텍스트)가 Phoenix Library에 입력됩니다. Judge LLM은 Eval Template을 사용하여 참조 텍스트가 사용자의 질문에 얼마나 잘 답하는지 평가합니다. 예를 들어 사용자의 질문이 "전통적인 프랑스 요리법을 찾아줘"이고 참조 텍스트가 캐러멜라이즈한 양파 빵 수프 레시피를 제공한다면, Eval Template은 이 둘을 비교하여 관련성을 평가합니다.
LLM Evals- RAG 사용 사례에서 작동하는 방식
LLM Eval 결과 벤치마킹하기
LLM 평가 프로세스가 어떻게 작동하는지 논의했지만, 이것이 특정 사용 사례에 효과적일지 어떻게 확신할 수 있을까요? 답은 평가 결과를 벤치마킹하는 데 있습니다.
아래는 결과를 벤치마킹하기 위해 우리가 수행하는 주요 단계입니다.
먼저, 사람이 라벨링한 답변이 포함된 공개 데이터셋을 활용합니다. 이러한 데이터셋은 사용자 질문과 참조 텍스트로 구성되며, 관련성을 나타내는 주석이 포함되어 있습니다. 이러한 잘 정립된 데이터셋을 통해 비교를 위한 견고한 기반을 마련합니다.
다음으로, 이러한 공개 데이터셋에서 사람이 제공한 답변과 비교하여 프롬프트 템플릿의 성능을 평가합니다. 이 단계에서는 인간의 판단을 벤치마크로 사용하여 템플릿이 관련 있는 응답을 얼마나 잘 식별하는지 평가할 수 있습니다.
마지막으로, 프롬프트 템플릿의 성능을 정량화하기 위해 정밀도와 재현율 점수를 계산합니다. 정밀도는 RAG 시스템이 반환한 관련 결과의 정확도를 측정하고, 재현율은 모든 관련 인스턴스를 검색하는 시스템의 능력을 측정합니다.
이러한 정밀도와 재현율 점수는 사람이 라벨링한 다양한 예시 전반에서 프롬프트 템플릿이 얼마나 효과적으로 수행되는지를 나타냅니다. 이 벤치마킹 프로세스는 평가와 프롬프트 템플릿이 신뢰할 수 있으며 LLM 애플리케이션의 성능을 평가하는 데 믿고 사용할 수 있도록 보장합니다.
이러한 측정 후에는 Judge LLM에 사용할 모델을 결정하세요. 작업마다 다른 judge 모델이 필요할 수 있습니다. 예를 들어, GPT-3.5-turbo-instruct는 Q&A 정확성 평가에서는 성능이 좋지 않을 수 있지만 검색 평가에서는 매우 뛰어납니다. 다른 것을 평가한다면 기반 모델을 전환해야 할 수도 있습니다. 이것이 벤치마킹이 중요한 이유입니다.
이러한 측정 후 다음 단계는 Judge LLM에 사용할 모델을 결정하는 것입니다. 작업마다 다른 judge 모델이 필요할 수 있습니다. 예를 들어, GPT-3.5-turbo-instruct는 Q&A 정확성 평가에서는 성능이 좋지 않을 수 있지만 검색 평가에서는 탁월합니다. 다른 측면을 평가하려면 기반 모델을 전환해야 할 수도 있습니다. 이러한 유연성이 바로 벤치마킹이 중요한 이유입니다.
LLM Spans 및 Traces
이제 LLM 애플리케이션 전체를 평가하는 방법을 배웠습니다. 하지만 애플리케이션 상호작용을 구성 요소별로 어떻게 평가할 수 있을까요? LamaIndex나 LangChain과 같은 프레임워크를 기반으로 구축된 전체 검색 시스템 체인을 생각해 보세요. Q&A 평가에서 잘못된 답변이 표시되면 상호작용이 실패했다는 것만 알 수 있을 뿐, 여전히 어디서 문제가 발생했는지 파악해야 합니다. 여기서 LLM Spans와 Traces의 개념이 등장합니다.
다양한 유형의 Span 평가를 통해 실패 지점을 정확히 찾아낼 수 있습니다. 예를 들어 다음을 사용할 수 있습니다.
챗봇 상호작용을 확인하기 위한 사용자 불만 평가
속성 추출 중 분류 평가
검색 구성 요소를 평가하기 위한 검색 평가
분류 프로세스를 위한 분류 평가
LLM Spans에 대한 Evals
검색 평가에 문제가 있으면 Q&A 정확성에 직접적인 영향을 미칩니다. LLM Spans and Traces는 애플리케이션 내에서 이러한 문제를 시각화하고 진단하는 데 도움이 됩니다.
Hakan은 또한 LLM Spans and Traces가 어떻게 작동하는지 보여주는 데모를 공유했습니다. 더 자세한 데모 내용을 보려면 YouTube에서 그의 발표 다시보기를 시청하세요.
결론
Hakan Tekgul의 발표를 되돌아보면, LLM을 프로덕션에 배포하는 것이 결코 쉬운 일이 아님이 분명합니다. 잘 다듬어진 데모에서 신뢰할 수 있고 비즈니스에 바로 사용할 수 있는 애플리케이션으로 나아가는 여정에는 세부 사항에 대한 주의와 견고한 관측 가능성 프레임워크가 필요한 과제들이 가득합니다.
Hakan은 두 가지 주요 LLM 평가 전략인 LLM Evaluation과 LLM Spans and Traces를 공유하고, 자세한 예시와 함께 그것들이 어떻게 작동하는지 설명했습니다. 이러한 전략은 LLM 애플리케이션을 체계적으로 평가하여 실제 사용 사례에서의 신뢰성과 효과성을 보장합니다.
계속 읽기

Build Multimodal Search for 3D Assets with Tripo and Zilliz Cloud
Generate 3D assets with Tripo, then search them by text, image, and metadata with multimodal embeddings and Zilliz Cloud.

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.

AI Agents Are Quietly Transforming E-Commerce — Here’s How
Discover how AI agents transform e-commerce with autonomous decision-making, enhanced product discovery, and vector search capabilities for today's retailers.



