LLM의 지식 주입: 파인튜닝과 RAG
대규모 언어 모델 (LLMs)은 방대한 지식을 저장하고 생성하는 능력에서 인상적입니다. 이들은 사전 학습 중 대규모 데이터셋을 활용하여 다양한 주제에 걸친 전문가가 됩니다. 하지만 한계도 있습니다. 우선, 시간이 지나도 업데이트되지 않기 때문에 지식이 정적입니다. 또한 일반 지식에는 뛰어나지만, 의료, 금융, 법률과 같은 전문 분야에 필요한 깊이 있는 전문성을 제공하는 데에는 종종 부족합니다.
Fine-Tuning 및 Retrieval-Augmented Generation (RAG)와 같은 지식 주입 방법은 이러한 한계를 해결하기 위해 활용됩니다. Fine-tuning은 작업별 데이터로 모델의 가중치를 조정하는 것을 포함하는 반면, RAG는 추론 중 외부 지식을 가져와 필요할 때 모델이 관련 정보를 끌어올 수 있게 합니다. 이 연구에서는 LLM의 사실적 지식을 확장하고 정제하는 데 있어 효과를 평가하기 위해 다양한 지식 집약적 작업 전반에서 이 두 접근 방식을 비교합니다.
RAG는 지식 집약적 작업에서 일관되게 fine-tuning보다 뛰어난 성능을 보였으며, 외부 정보를 통합하는 우수한 능력을 입증했습니다. Fine-tuning은 기본 모델보다 성능을 향상시켰지만, RAG만큼 경쟁력이 있지는 않았습니다. 또한 데이터 증강은 fine-tuning에 유익한 것으로 입증되었는데, 학습 중 모델을 동일한 사실의 여러 변형에 노출시키면 지식 보존이 향상되었기 때문입니다.
Fine-Tuning과 RAG의 방법론 파이프라인
두 가지 방법을 더 자세히 살펴보고, LLM의 지식을 향상시키는 데 있어 서로 어떻게 비교되는지 알아보겠습니다. 이해를 돕기 위해, 공부하지 않은 주제에 대해 시험을 보는 세 명의 학생을 상상해 보세요. 한 명은 시험 중에만 교과서를 가지고 있었고, 다른 한 명은 시험 전에 공부했으며, 세 번째 학생은 시험이 시작된 후 자료에 접근할 수 없었습니다. 누가 가장 좋은 성과를 낼 것이라고 생각하시나요?
알아봅시다!
자세한 이해를 위해 다음 논문을 참조하세요.
LLM은 왜 사실 오류를 생성할까요?
뛰어난 유창성과 다재다능함에도 불구하고, LLM은 도메인 지식 부족, 오래된 학습 데이터, 추론 한계 등 여러 중요한 요인으로 인해 본질적으로 사실 오류에 취약합니다.
- 도메인 지식 부족: LLM은 학습 중 충분히 대표되지 않은 특정 도메인에 대한 깊은 전문성이 부족할 수 있습니다. 예를 들어, 주로 일반 뉴스 출처로 학습된 모델은 도메인별 데이터로 fine-tuning되지 않았다면 의학이나 법률과 같은 고도로 전문화된 분야에서 어려움을 겪을 수 있습니다.
- 오래된 정보: LLM은 학습 데이터셋의 기준 날짜에 의해 제한됩니다. 이 기준 날짜 이후에 발생하는 모든 사건, 과학적 발전 또는 문화적 변화는 반영되지 않아 오래된 응답으로 이어집니다. 이는 특히 의료처럼 역동적인 분야에서 문제가 되는데, COVID-19 팬데믹 이전에 학습된 모델은 팬데믹 관련 보건 프로토콜과 백신 개발에 대한 정보가 부족할 수 있습니다.
- 비암기: 학습 중 모델이 배운 일부 지식은 유지되지 않을 수 있으며, 특히 학습 데이터에서 드문 사실이나 덜 자주 나타나는 패턴과 관련될 때 그렇습니다. 이 문제는 모델이 다양한 작업이나 입력 전반에서 덜 일반적인 정보를 일관되게 회상하는 능력을 저해할 수 있습니다.
- 망각: 파국적 망각은 fine-tuning 중 모델이 이전에 학습한 정보, 특히 원래 학습에서 덜 강조된 사실을 잊어버릴 때 발생합니다. 이는 LLM에서 흔한 문제이며 장기적인 지식 보존에 영향을 미칠 수 있습니다.
- 추론 실패: LLM은 때때로 자신의 지식을 올바르게 적용하지 못하며, 특히 복잡한 다단계 추론 과제에서 그렇습니다. 예를 들어, LLM은 고급 수학 문제나 여러 단계의 논리적 추론을 풀도록 요청받았을 때 부정확하거나 불완전한 답변을 생성할 수 있습니다. 이러한 실패는 종종 더 긴 사고의 연쇄에서 논리적 일관성을 유지하는 데 모델이 어려움을 겪는 것과 관련이 있습니다.
이러한 문제는 주로 모델의 학습 단계에서 비롯되며, 치명적 망각은 미세 조정 중 학습 이후에 발생하는 주목할 만한 예외입니다.
언어 모델에 지식 주입하기
Large Language Models(LLMs)의 사실 오류는 종종 모델의 지식 기반에 있는 공백의 결과입니다. 이를 해결하기 위해, 지식 주입은 모델이 정확한 답변을 제공하는 능력을 개선하고 확장하는 데 도움이 되는 중요한 기법입니다.
지식 주입은 추가 정보를 통해 언어 모델을 수정하거나 보강하는 과정을 의미합니다. 완전히 새로운 사실을 학습하기보다는, 모델의 예측을 특정 지식 영역으로 편향시켜 지식 집약적 과제에서의 성능을 향상시킵니다.
수학적 공식화
이제 지식 주입의 배후에 있는 수학적 공식화와 그것이 어떻게 모델 정확도 향상으로 이어지는지 살펴보겠습니다.
문제
이 연구는 사실 지식에 초점을 맞춥니다. 모델이 어떤 것을 알고 있다면, 관련 질문에 일관되게 올바르게 답하고 참인 진술과 거짓인 진술을 구별할 수 있습니다.
수학적으로 작동 방식은 다음과 같습니다:
Q = {qn}n=1N 를 N개의 사실 질문 집합이라고 하자
각 질문 qn에는 L개의 가능한 답변이 있으며 C = {cn}n=1N 는 이러한 질문에 대한 정답의 집합입니다.
M은 각 질문에 대한 답변을 예측하는 모델을 나타냅니다. 질문 qn에 대한 모델의 예측 답변은 M(qn) ∈ {an1 , . . . , anL } 로 표시되며, 가능한 답변의 집합에 속합니다.
모델이 모든 질문 중에서 제공한 정답의 비율인 지식 점수(정확도)를 계산하여 모델의 지식을 평가할 수 있습니다:
LM,Q := #{qn| M(qn) = cn} N .
이 방정식에서:
LM,Q 는 모델의 지식 점수입니다.
분자는 각 질문 qn에 대해 모델의 답변 M(qn)이 정답 cn과 일치하는 횟수를 셉니다.
분모는 전체 질문 수 N입니다.
지식 주입
일반적인 사전 학습만으로는 많은 지식 집약적 과제에 충분하지 않습니다. 성능을 향상시키려면 지식 주입이 필요합니다.
이는 사전 학습된 모델 M, 질문 집합 Q, 보조 지식 기반 BQ가 주어졌을 때 다음과 같이 수학적으로 표현할 수 있으며, 우리는 다음을 만족하는 지식 주입 함수 F를 찾는 것을 목표로 합니다:
M′ := F(M, BQ) s.t. LM',Q > LM,Q.
간단히 말해, 우리는 지식 기반 BQ를 원래 모델 M에 통합하는 F를 적용하여 새로운 모델 M′를 만들고자 합니다. 목표는 새로운 모델이 더 많은 질문에 올바르게 답함으로써 더 나은 성능을 내도록 하는 것입니다.
정확도 향상
지식 주입(예: 미세 조정 또는 RAG)이 모델을 얼마나 개선했는지 확인하기 위해, 추가 지식을 더하기 전후의 정확도를 비교합니다. 개선 정도는 다음 공식을 사용하여 계산합니다:
(LM`,Q-LM,Q) / LM,Q
여기서:
LM,Q 는 새로운 지식을 추가하기 전 모델의 정확도입니다.
LM`,Q는 새로운 지식을 추가한 후 모델의 정확도입니다.
이 공식은 상대적 정확도 향상을 보여주며, 새로운 정보를 통합한 후 모델이 얼마나 더 좋아졌는지를 나타냅니다.
지식 주입을 위한 프레임워크
지식 주입을 위한 두 가지 일반적인 프레임워크는 미세 조정(FT)과 retrieval-augmented generation(RAG)입니다. 미세 조정은 도메인 특화 데이터로 모델을 학습시켜 모델을 적응시키는 반면, RAG는 추론 중 외부 지식 기반에서 관련 정보를 검색하여 모델을 강화합니다.
미세 조정
파인튜닝은 지식 주입을 위해 널리 사용되는 기법입니다. 이 기법에서는 사전 학습된 LLM을 특정 지식을 내재화하거나 특정 작업에서의 성능을 향상시키기 위해 특화된 데이터셋으로 추가 학습합니다. 이 과정을 통해 모델은 이전에 학습한 지식을 "적응"시켜 새로운 사실, 도메인 특화 용어, 추론 패턴을 통합할 수 있습니다.
파인튜닝의 유형
- 지도 파인튜닝: 지도 파인튜닝(SFT)에는 레이블이 지정된 입력-출력 쌍의 집합이 필요합니다. 일반적인 SFT 방법 중 하나는 명령어 튜닝으로, 입력은 자연어 작업 설명이고 출력은 원하는 동작의 예시입니다. 많은 최첨단 LLM은 사전 학습 단계 이후 명령어 튜닝을 거칩니다. 명령어 튜닝은 모델의 전반적인 품질을 향상시키며, 특히 제로샷 및 추론 능력에 중점을 둡니다. 그러나 명령어 튜닝은 모델에 새로운 지식을 가르치지 않으며, 그 자체만으로는 지식 주입에 충분하지 않습니다.
강화 학습 파인튜닝: 강화 학습(RL) 기반 파인튜닝 기법은 올바른 응답에 보상을 주고 잘못된 응답에 패널티를 부여함으로써 모델을 최적화합니다. 예로는 인간 피드백 기반 강화 학습(RLHF), 직접 선호 최적화(DPO), 근접 정책 최적화(PPO)가 있습니다. 이러한 방법은 응답과 행동의 전반적인 품질을 개선하는 데 유용합니다. 그러나 명령어 튜닝과 마찬가지로 RL 파인튜닝이 지식 주입에 필요한 지식의 폭을 반드시 다루는 것은 아닙니다.
비지도 파인튜닝: 비지도 파인튜닝에는 레이블이 지정된 데이터가 필요하지 않습니다. 일반적인 방법은 지속적 사전 학습 또는 비정형 파인튜닝으로, 이 과정은 사전 학습의 연속으로 간주됩니다. 모델은 다음 토큰을 예측하는 인과적 자기회귀 방식으로 학습됩니다. 치명적 망각을 방지하기 위해 일반적으로 더 낮은 학습률이 사용됩니다. 이 접근 방식은 사전 학습 단계에서 저장된 지식을 기반으로 하므로 모델에 새로운 지식을 주입하는 데 효과적입니다. 본 작업에서는 모델의 새로운 정보 학습 능력을 향상시키기 위해 비지도 파인튜닝을 사용합니다.
검색 증강 생성(RAG)
검색 증강 생성(RAG)은 응답을 생성하기 전에 모델이 외부 소스에서 관련 정보를 검색할 수 있도록 함으로써 LLM에 내장된 정적 지식을 넘어서는 인컨텍스트 학습의 한 형태입니다. 모델의 내부 가중치를 수정하는 기존 파인튜닝과 달리, RAG는 모델의 출력을 실시간 데이터에 기반시키기 위해 외부 지식 베이스에 의존합니다. 이 접근 방식은 최신의 도메인 특화 및 권위 있는 정보에 접근할 수 있다는 장점이 있어, 생성된 텍스트가 정확하고 관련성 있게 유지되도록 보장합니다.
RAG 모델은 두 가지 주요 구성 요소로 이루어집니다:
- 검색 구성 요소: 모델의 이 부분은 사용자 쿼리를 기반으로 관련 정보를 찾기 위해 외부 데이터베이스, 문서 저장소 또는 웹까지 검색하는 역할을 합니다. 검색 전에 문서는 임베딩 모델을 사용하여 벡터 임베딩으로 변환되고 벡터 데이터베이스에 저장됩니다. 검색 중에는 쿼리가 임베딩으로 변환되어 벡터 데이터베이스에 저장된 임베딩과 매칭되어 가장 관련성 높은 정보를 검색합니다. Milvus와 같은 일반적인 벡터 데이터베이스는 대규모 데이터셋 전반에 걸친 효율적인 검색을 가능하게 합니다.
- 생성 구성 요소: 관련 문서나 지식이 검색되면, 생성 구성 요소는 검색된 정보를 일관되고 문맥상 적절한 응답으로 종합합니다. 이를 통해 모델은 실시간 정보를 통합하고, 특히 최신 지식이 필요한 주제에 대해 더 높은 정확도로 질문에 답할 수 있습니다.
실험 설정
이 섹션에서는 모델의 성능을 평가하는 데 사용된 지식 베이스, 모델 선택, 학습 설정 및 평가 방법을 자세히 설명하며 실험 설정을 개괄합니다.
지식 베이스
평가는 MMLU 벤치마크, Current Event Task, Paraphrase Generation 작업이라는 세 가지 핵심 구성 요소를 기반으로 합니다.
MMLU 벤치마크
Massively Multilingual Language Understanding (MMLU) 벤치마크의 네 가지 작업이 지식 집약적 작업에서 LLM의 역량을 평가하기 위해 선택되었습니다. 이러한 작업은 해부학, 천문학, 생물학, 화학, 선사시대와 같은 주제를 포괄합니다. 선택은 추론에 대한 의존을 최소화하면서 사실 지식에 중점을 둔다는 점을 기준으로 이루어졌습니다.
MMLU는 다양한 도메인에 걸친 사실 기반 객관식 질문을 폭넓게 다루며, 모델의 사실 이해도를 다양하고 객관적으로 테스트할 수 있기 때문에 벤치마크로 선택되었습니다. 선사시대 작업은 비현대사에서 나온 사실 정보를 처리하는 모델의 능력을 평가하기 위해 포함되었습니다. 이 접근 방식은 추론 과정과 분리된 상태에서 지식을 이해하고 조작하는 모델의 숙련도를 테스트합니다.
Current Event Task
모델의 학습 데이터 컷오프 이후에 발생한 사건에 대한 객관식 질문에 초점을 맞춰 새로운 데이터셋을 만들었습니다. 구체적으로, 이 작업은 미국의 "current events"를 중심으로 하며, 2023년 8월부터 11월까지를 다루고 관련 Wikipedia 색인에서 추출했습니다.
이 접근 방식은 모델이 학습 중에 이러한 사실에 노출되지 않았음을 보장하여, 모델의 지식 주입 역량과 최신 사실 정보를 처리하는 능력을 직접적으로 테스트할 수 있게 합니다.
Paraphrase Generation
데이터셋을 만든 후 입력 데이터의 의역 버전을 제공하여 증강 데이터를 생성하는 데 GPT-4를 사용했습니다. 모델에는 문장을 다시 표현하면서도 원래 의미를 유지하도록 지시했습니다. 각 의역 반복은 생성된 버전의 다양성을 보장하기 위해 서로 다른 시드를 사용했습니다.
각 MMLU 작업에 대해 240개의 청크를 무작위로 선택했고, 청크당 두 개의 의역을 생성했으며, 이는 하이퍼파라미터 튜닝 중 검증용으로 따로 분리되었습니다. 현재 사건 데이터셋의 파인튜닝 과정에 사용된 각 청크에 대해 열 개의 의역이 생성되었습니다.
모델 선택
Llama2-7B, Mistral-7B, Orca2-7B는 서로 다른 모델링 접근 방식 전반에서 추론 성능을 평가하기 위해 선택되었습니다. 이 구성에는 널리 사용되는 오픈소스 기반 모델과 instruction-tuned 모델이 혼합되어 있어, 비교를 위한 균형 잡힌 기반을 제공합니다.
또한, RAG 구성 요소의 임베딩 모델로 bge-large-en이 선택되었습니다. Hugging Face MTEB 리더보드에 따르면, 이 임베딩 모델은 오픈소스 옵션 중 최첨단이었습니다.
학습 설정
학습 과정에는 다음과 같은 핵심 구성 요소가 포함됩니다:
- 절차: 모든 모델은 비지도 학습 방법을 사용하여 파인튜닝되었습니다. 학습 데이터셋은 청크로 나뉘었으며, 각 청크가 256토큰 크기를 초과하지 않도록 했습니다. 특수 토큰
및 는 각 청크의 시작과 끝을 표시하는 데 사용되었습니다.
- 하드웨어: 모델은 4개의 NVIDIA A-100 GPU에서 학습되어, 대규모 파인튜닝에 필요한 계산 리소스를 사용할 수 있도록 했습니다.
하이퍼파라미터:
학습률은 다음 범위에서 테스트되었습니다: 1 × 10-6에서 5 × 10-5까지.
모델은 하이퍼파라미터 최적화를 기반으로 선택된 배치 크기 64로 최대 5 에포크 동안 학습되었습니다.
평가
평가는 LLM 성능 평가에 널리 사용되는 도구인 LM-Evaluation-Harness 프레임워크를 사용하여 수행되었습니다. 이 프레임워크는 모델 평가에 대한 표준화된 접근 방식을 제공하여 작업 및 방법 전반의 일관성을 보장합니다. 모델은 사실 질문에 대한 정답을 예측하는 능력 측면에서 평가되었습니다.
실험에서 이러한 평가 접근 방식은 다음과 같습니다:
- 기본 모델: 추가적인 지식 주입 없이 모델의 원시 성능.
- 파인튜닝(FT): 사실 지식 기반 질문에 대한 성능을 향상시키기 위해 작업별 데이터로 모델을 파인튜닝합니다.
- 검색 증강 생성(RAG): 이 방법은 외부 지식 베이스를 사용하고 관련 정보를 검색하여 모델의 응답을 보강합니다.
- 파인튜닝 + RAG(FT+RAG): 파인튜닝과 검색 증강 생성을 결합한 하이브리드 접근 방식으로, 지식 적응과 검색을 모두 활용하여 성능 향상을 목표로 합니다.
이 네 가지 접근 방식을 비교하는 것 외에도, 성능은 두 가지 다른 설정에서 평가되었습니다:
- 0-shot: 모델은 사전 예시 없이 테스트되며, 사전 학습 중에 학습한 지식과 지식 주입(파인튜닝 또는 RAG)에만 의존합니다.
- 5-shot: 모델은 각 작업에 대해 다섯 개의 예시를 제공받아 예측을 위한 맥락을 얻습니다. 이 설정은 보다 실용적인 실제 시나리오에서 예시로부터 일반화하는 모델의 능력을 테스트합니다.
이 네 가지 접근 방식 전반에서 모델의 정확도와 성능을 비교한 결과, 지식 주입, 파인튜닝, 검색 증강 생성이 지식 집약적 작업을 처리하는 LLM의 능력에 미치는 영향이 드러났습니다.
실험 결과
이제 MMLU 벤치마크와 최신 사건 데이터 등 다양한 지식 베이스에서의 실험 결과를 살펴보며, 각 접근 방식이 지식 집약적 작업에서 어떻게 수행되었는지 탐구해 보겠습니다
MMLU 결과
모든 작업에서 RAG는 모든 작업과 설정에 대한 로그 가능도 정확도 측면에서 볼 때 기본 모델을 일관되게 능가했습니다.
로그 가능도 정확도 측면에서 본 MMLU 데이터셋 결과 | 출처
생성기로 기본 모델을 사용하는 RAG는 파인튜닝만 사용하는 것보다 우수한 것으로 입증되었습니다. 일부 경우에는 RAG 파이프라인에서 기본 모델을 파인튜닝된 모델로 대체하면 결과가 더욱 향상되었습니다. 그러나 그 효과는 일관되지 않았으며 파인튜닝의 내재적 불안정성을 부각했습니다. 또한 5-shot 프롬프팅은 모든 방법 전반에서 작지만 일관된 향상을 제공했습니다.
MMLU 데이터셋의 모든 실험에서 (열 기준으로) 평균화한 각 지식 주입 방법의 상대적 정확도 향상 | 출처
최신 사건 결과
RAG는 질문과 보조 데이터셋 간의 정밀한 정렬 덕분에 최신 사건 작업에서 탁월한 성능을 보였습니다. 파인튜닝도 유익한 것으로 입증되었지만, RAG의 효과에는 미치지 못했습니다. 그러나 여러 패러프레이즈로 파인튜닝(FT-par)을 보강하자 기준 접근 방식(FT-reg)보다 결과가 크게 향상되었습니다.
최신 사건 결과. 원본 데이터셋으로 파인튜닝된 모델은 FT-reg로 표시되며, 여러 패러프레이즈가 포함된 데이터셋으로 학습된 모델은 FT-par로 표시됩니다 | 출처
파인튜닝 vs. RAG
MMLU와 최신 사건 작업 모두의 결과는 파인튜닝에 대한 RAG의 우수성을 확인해 줍니다. 파인튜닝은 기본 모델 대비 정확도를 향상시켰지만, 검색을 통한 성능 향상에는 미치지 못했습니다.
이러한 경향에는 여러 요인이 기여합니다:
- 맥락적 지식 접근: 파인튜닝과 달리 RAG는 관련 정보를 동적으로 검색하여 응답이 맥락에 기반하도록 보장합니다.
- 치명적 망각: 파인튜닝은 이전에 학습한 지식을 덮어쓸 위험이 있어, 잠재적으로 모델의 일반적 능력을 저하시킬 수 있습니다.
- 정렬 문제: 미세 조정된 모델은 최적의 성능을 달성하기 위해 추가적인 지도 미세 조정 또는 강화 학습(RLHF)이 필요할 수 있습니다
주요 결과
- RAG가 기본 모델을 능가함: RAG(Retrieval Augmented Generation)는 일관되게 기본 모델을 능가했으며, 외부 데이터로 모델을 보강함으로써 특히 지식 집약적 작업에서 정확도를 크게 향상했습니다.
- RAG vs. 미세 조정(FT): RAG는 일관되게 미세 조정(Fine-Tuning, FT)을 능가했습니다. RAG 파이프라인에서 미세 조정된 모델을 생성기로 사용할 때 RAG와 FT의 조합은 어느 정도 개선을 보였습니다. 하지만 결과가 일관되지 않아, RAG에 비해 미세 조정의 본질적인 불안정성을 보여주었습니다.
- 5-shot 향상: 0-shot에서 5-shot으로 전환하면 성능이 작지만 일관되게 향상되었으며, RAG가 추가된 맥락에서 가장 큰 이점을 얻었습니다.
- 데이터 증강이 지식 보존을 향상함: 실험은 패러프레이즈 기반 데이터 증강이 지식 주입 작업에서 모델 정확도의 단조 증가로 이어진다는 것을 보여줍니다. 모델은 정보를 여러 방식으로 재표현함으로써 새로운 지식을 더 잘 이해하고 일반화합니다. 패러프레이즈 수가 증가함에 따라 모델 정확도는 계속해서 꾸준히 향상되었습니다.
패러프레이즈 수에 따른 시사 사건 작업에서의 모델 정확도 | 출처
RAG와 벡터 데이터베이스
RAG(Retrieval Augmented Generation)는 검색된 데이터를 응답에 통합하여 대규모 언어 모델을 향상시키고, 사실 정확성과 맥락적 관련성을 개선합니다.
RAG에서 벡터 데이터베이스의 역할
벡터 데이터베이스는 고차원 임베딩의 효율적인 저장 및 검색을 가능하게 함으로써 Retrieval-Augmented Generation(RAG)에서 중요한 역할을 합니다. RAG 시스템에서 검색 단계는 방대한 지식 기반에서 의미적으로 가장 관련성 높은 정보를 식별하는 데 의존하며, 바로 이 부분에서 벡터 데이터베이스가 탁월합니다.
이러한 데이터베이스는 텍스트 또는 멀티모달 데이터를 밀집 벡터 임베딩으로 인덱싱하여, 근사 최근접 이웃(ANN) 검색과 같은 방법을 사용해 빠르고 정확한 유사도 검색을 가능하게 합니다. 쿼리가 생성되면 벡터 데이터베이스는 코사인 유사도 또는 기타 거리 지표를 기반으로 가장 가까운 일치 임베딩을 검색합니다. 이를 통해 가장 맥락적으로 관련성 높은 정보만 생성 모델에 전달되어 사실 정확성을 향상하고 환각을 줄일 수 있습니다.
벡터 데이터베이스는 질의응답 시스템, 챗봇, 엔터프라이즈 검색, 추천 엔진과 같은 애플리케이션을 위한 실시간 지식 검색에서 특히 가치가 있습니다.
벡터 데이터베이스/클라우드 플랫폼으로서의 Milvus/Zilliz
Milvus는 Zilliz에서 개발한 오픈 소스 벡터 데이터베이스로, Retrieval-Augmented Generation(RAG) 시스템에서 고차원 임베딩을 관리하고 쿼리하기 위한 강력한 솔루션입니다. RAG는 응답을 생성하기 전에 관련 지식을 검색하기 위해 효율적인 유사도 검색에 의존하며, Milvus는 대규모 실시간 검색 작업에 최적화되어 있습니다.
더 정확한 답변을 위해 Zilliz cloud로 LLM 지식 보강하기 | 출처
Milvus는 수백만 개 또는 심지어 수십억 개의 벡터 임베딩을 저장하고 인덱싱할 수 있어, RAG 모델이 방대한 지식 기반 전반에서 빠른 의미 검색을 수행할 수 있도록 합니다. Milvus는 여러 인덱싱 알고리즘을 지원하여 낮은 지연 시간의 검색을 보장합니다. 이는 챗봇, 검색 엔진, 엔터프라이즈 AI 시스템처럼 실시간 정보가 필수적인 애플리케이션에 매우 중요합니다.
Zilliz는 클라우드 기반 솔루션으로 Milvus를 확장하여, 기업이 인프라를 관리하지 않고도 RAG를 위한 벡터 검색을 더 쉽게 배포하고 확장할 수 있게 합니다. 이러한 클라우드 네이티브 접근 방식은 LLM과의 원활한 통합을 보장합니다. 이를 통해 조직은 성능과 확장성을 유지하면서 동적 지식 검색으로 모델을 향상할 수 있습니다.
잠재적인 향후 연구 방향
대규모 언어 모델(LLM)은 방대한 양의 지식을 보유하고 있지만, 새롭거나 특화되었거나 이전에 보지 못한 정보에 적응하는 능력은 여전히 과제로 남아 있습니다. 파인튜닝과 검색 증강 생성(RAG)은 지식 주입을 위한 두 가지 주요 접근 방식입니다. 파인튜닝은 많은 애플리케이션에 유용할 수 있지만, RAG는 외부 지식을 통합하는 데 더 신뢰할 수 있는 선택지임이 입증되었습니다.
LLM에서 지식 주입에 대한 이해를 높이기 위해 추가 조사가 필요한 몇 가지 핵심 영역은 다음과 같습니다:
- 하이브리드 지식 통합: 적응성을 개선하기 위해 파인튜닝, RAG 및 기타 기술의 조합을 연구합니다. 이러한 접근 방식이 어떻게 서로를 보완하는지 이해하면 더 효율적인 지식 주입으로 이어질 수 있습니다.
- 파인튜닝 방법 결합: 향후 연구는 지도문 조정과 강화 학습(RL) 기반 파인튜닝을 비지도 파인튜닝과 통합하는 방안을 탐구해야 합니다. 이는 지식 적응과 보존을 개선할 수 있습니다.
- LLM의 지식 표현 평가: 이론적 관점에서 LLM이 주입된 지식을 내부적으로 저장하고 검색하는 방식을 조사합니다. 더 명확한 이해는 더 해석 가능하고 효율적인 모델로 이어질 수 있습니다.
- LLM의 지식 측정: 지식 보존을 더 잘 평가하기 위해 경험적 접근 방식을 넘어서는 새로운 평가 프레임워크를 개발합니다. 표준화된 벤치마크를 수립하면 서로 다른 모델 간 비교 가능성을 개선할 수 있습니다.
이러한 영역에 대한 추가 연구는 지식 주입 전략을 개선하여 LLM이 새로운 정보에 적응하는 데 있어 효율성과 신뢰성을 높이는 데 도움이 될 것입니다.
추가 자료
계속 읽기

Introducing Zilliz CLI and Agent Skills for Zilliz Cloud
Manage your vector database from your terminal or AI coding agent. Zilliz CLI and Agent Skills work with Claude Code, Cursor, Codex, and Copilot.

Zilliz Cloud BYOC Now Available Across AWS, GCP, and Azure
Zilliz Cloud BYOC is now generally available on all three major clouds. Deploy fully managed vector search in your own AWS, GCP, or Azure account — your data never leaves your VPC.

Zilliz Named "Highest Performer" and "Easiest to Use" in G2's Summer 2025 Grid® Report for Vector Databases
Zilliz shines in G2's Summer 2025 Grid® Report as both "Highest Performer" and "Easiest to Use," solving the performance-usability dilemma.



