GraphRAG 설명: 지식 그래프로 RAG 강화하기
RAG 소개와 그 과제
검색 증강 생성 (RAG)은 외부 데이터 소스를 연결하여 대규모 언어 모델 (LLMs)의 출력을 향상시키는 기법입니다. 이 기법은 LLMs가 비공개 또는 도메인 특화 데이터에 접근하고 환각 문제를 해결하는 데 완벽합니다. 따라서 RAG는 AI 챗봇 및 추천 시스템과 같은 많은 GenAI 애플리케이션을 구동하는 데 널리 사용되어 왔습니다.
기본 RAG는 일반적으로 벡터 데이터베이스와 LLM을 통합하며, 여기서 벡터 데이터베이스는 사용자 쿼리에 대한 맥락 정보를 저장하고 검색하며, LLM은 검색된 맥락을 기반으로 답변을 생성합니다. 이 접근 방식은 많은 경우에 잘 작동하지만, 멀티홉 추론이나 서로 다른 정보 조각들을 연결해야 하는 질문에 답하는 것과 같은 복잡한 작업에는 어려움을 겪습니다.
예를 들어, 다음 질문을 생각해 보세요: “찬탈자 Allectus를 물리친 남자의 아들에게 어떤 이름이 주어졌는가?”
기본 RAG는 일반적으로 이 질문에 답하기 위해 다음 단계를 따릅니다:
그 남자 식별: 누가 Allectus를 물리쳤는지 확인합니다.
그 남자의 아들 조사: 이 인물의 가족, 특히 그의 아들에 대한 정보를 찾아봅니다.
이름 찾기: 아들의 이름을 식별합니다.
문제는 일반적으로 첫 번째 단계에서 발생합니다. 기본 RAG는 의미적 유사성을 기반으로 텍스트를 검색하기 때문에, 특정 세부 정보가 데이터셋에 명시적으로 언급되어 있지 않을 수 있는 복잡한 쿼리에 직접 답하지 못합니다. 이러한 한계로 인해 필요한 정확한 정보를 찾기 어려워지며, 자주 묻는 쿼리에 대해 Q&A 쌍을 수동으로 생성하는 것과 같은 비용이 많이 들고 비현실적인 솔루션이 필요해지는 경우가 많습니다.
이러한 과제를 해결하기 위해 Microsoft Research는 RAG 검색 및 생성을 지식 그래프로 보강하는 완전히 새로운 방법인 GraphRAG를 도입했습니다. 다음 섹션에서는 GraphRAG가 내부적으로 어떻게 작동하는지, 그리고 Milvus 벡터 데이터베이스와 함께 실행하는 방법을 설명하겠습니다.
GraphRAG란 무엇이며 어떻게 작동하나요?
의미적으로 유사한 텍스트를 검색하기 위해 벡터 데이터베이스를 사용하는 기본 RAG와 달리, GraphRAG는 지식 그래프(KGs)를 통합하여 RAG를 향상시킵니다. 지식 그래프는 관련이 있거나 관련이 없는 데이터를 그 관계를 기반으로 저장하고 연결하는 데이터 구조입니다.
GraphRAG 파이프라인은 일반적으로 인덱싱과 쿼리라는 두 가지 기본 프로세스로 구성됩니다.
GraphRAG 파이프라인
GraphRAG 파이프라인 (이미지 출처: GraphRAG 논문)
인덱싱
인덱싱 프로세스에는 네 가지 핵심 단계가 포함됩니다:
텍스트 단위 분할: 전체 입력 코퍼스가 여러 텍스트 단위(텍스트 청크)로 나뉩니다. 이러한 청크는 분석 가능한 가장 작은 단위이며 단락, 문장 또는 기타 논리적 단위가 될 수 있습니다. 긴 문서를 더 작은 청크로 분할함으로써, 이 입력 데이터에 대한 더 자세한 정보를 추출하고 보존할 수 있습니다.
엔터티, 관계 및 주장 추출: GraphRAG는 LLMs를 사용하여 각 텍스트 단위에서 모든 엔터티(사람, 장소, 조직 등의 이름), 이들 간의 관계, 그리고 텍스트에 표현된 주요 주장을 식별하고 추출합니다. 우리는 이렇게 추출된 정보를 사용하여 초기 지식 그래프를 구성할 것입니다.
계층적 클러스터링: GraphRAG는 초기 지식 그래프에 대해 계층적 클러스터링을 수행하기 위해 Leiden 기법을 사용합니다. Leiden은 그래프 내의 커뮤니티 구조를 효과적으로 발견할 수 있는 커뮤니티 탐지 알고리즘입니다. 각 클러스터의 엔터티는 더 심층적인 분석을 위해 서로 다른 커뮤니티에 할당됩니다.
참고: 커뮤니티는 그래프 내에서 서로 조밀하게 연결되어 있지만 네트워크의 다른 조밀한 그룹과는 드물게 연결된 노드 그룹입니다.
- 커뮤니티 요약 생성: GraphRAG는 상향식 접근 방식을 사용하여 각 커뮤니티와 그 구성원에 대한 요약을 생성합니다. 이러한 요약에는 커뮤니티 내의 주요 엔터티, 이들의 관계, 핵심 주장이 포함됩니다. 이 단계는 전체 데이터셋에 대한 개요를 제공하고 이후 쿼리에 유용한 맥락 정보를 제공합니다.
그림 1- GPT-4 Turbo를 사용하여 구축된 LLM 생성 지식 그래프.
그림 1: GPT-4 Turbo를 사용하여 구축된 LLM 생성 지식 그래프.
(이미지 출처: Microsoft Research)
쿼리하기
GraphRAG에는 서로 다른 쿼리에 맞춰 설계된 두 가지 서로 다른 쿼리 워크플로가 있습니다.
커뮤니티 요약을 활용하여 전체 데이터 코퍼스와 관련된 전체적인 질문에 대해 추론하기 위한 Global Search.
이웃 및 관련 개념으로 확장하여 특정 엔터티에 대해 추론하기 위한 Local Search.
이 글로벌 검색 워크플로에는 다음 단계가 포함됩니다.
그림 2- 글로벌 검색 데이터 흐름
그림 2: 글로벌 검색 데이터 흐름 (이미지 출처: Microsoft Research)
사용자 쿼리 및 대화 기록: 시스템은 사용자 쿼리와 대화 기록을 초기 입력으로 받습니다.
커뮤니티 보고서 배치: 시스템은 커뮤니티 계층의 지정된 수준에서 LLM이 생성한 노드 커뮤니티 보고서를 맥락 데이터로 사용합니다. 이러한 커뮤니티 보고서는 섞인 뒤 여러 배치(섞인 커뮤니티 보고서 배치 1, 배치 2... 배치 N)로 나뉩니다.
RIR(평가된 중간 응답): 각 커뮤니티 보고서 배치는 미리 정의된 크기의 텍스트 청크로 추가로 나뉩니다. 각 텍스트 청크는 중간 응답을 생성하는 데 사용됩니다. 응답에는 포인트라고 불리는 정보 조각 목록이 포함됩니다. 각 포인트에는 그 중요도를 나타내는 숫자 점수가 있습니다. 이렇게 생성된 중간 응답이 평가된 중간 응답(평가된 중간 응답 1, 응답 2... 응답 N)입니다.
순위 지정 및 필터링: 시스템은 이러한 중간 응답의 순위를 지정하고 필터링하여 가장 중요한 포인트를 선택합니다. 선택된 중요한 포인트는 집계된 중간 응답을 형성합니다.
최종 응답: 집계된 중간 응답은 최종 답변을 생성하기 위한 맥락으로 사용됩니다.
사용자가 특정 엔터티(예: 사람, 장소, 조직 등의 이름)에 대해 질문할 때는 로컬 검색 워크플로를 사용하는 것을 권장합니다. 이 프로세스에는 다음 단계가 포함됩니다:
그림 3- 로컬 검색 데이터 흐름
그림 3: 로컬 검색 데이터 흐름 (이미지 출처: Microsoft Research)
사용자 쿼리: 먼저, 시스템은 간단한 질문일 수도 있고 더 복잡한 쿼리일 수도 있는 사용자 쿼리를 수신합니다.
유사 엔터티 검색: 시스템은 지식 그래프에서 사용자 입력과 의미적으로 관련된 엔터티 집합을 식별합니다. 이러한 엔터티는 지식 그래프로 들어가는 진입점 역할을 합니다. 이 단계에서는 Milvus와 같은 벡터 데이터베이스를 사용하여 텍스트 유사도 검색을 수행합니다.
엔터티-텍스트 단위 매핑: 추출된 텍스트 단위는 해당 엔터티에 매핑되어 원본 텍스트 정보를 제거합니다.
엔터티-관계 추출: 이 단계에서는 엔터티와 해당 관계에 대한 특정 정보를 추출합니다.
엔터티-공변량 매핑: 이 단계에서는 엔터티를 해당 공변량에 매핑하며, 여기에는 통계 데이터나 기타 관련 속성이 포함될 수 있습니다.
엔터티-커뮤니티 보고서 매핑: 커뮤니티 보고서가 검색 결과에 통합되어 일부 글로벌 정보를 포함합니다.
대화 기록 활용: 제공된 경우, 시스템은 사용자의 의도와 맥락을 더 잘 이해하기 위해 대화 기록을 사용합니다.
응답 생성: 마지막으로, 시스템은 이전 단계에서 생성된 필터링 및 정렬된 데이터를 기반으로 사용자 쿼리에 대한 응답을 구성하고 답변합니다.
출력 품질에서 Baseline RAG와 GraphRAG 비교
GraphRAG의 효과를 보여주기 위해, 제작자들은 발표 블로그에서 Baseline RAG와 GraphRAG의 출력 품질을 비교합니다. 여기서는 설명을 위해 간단한 예를 인용하겠습니다.
사용된 데이터셋
GraphRAG 제작자들은 실험에 뉴스 기사에서 추출한 폭력 사건 정보(VIINA) 데이터셋을 사용했습니다.
참고: 이 데이터셋에는 민감한 주제가 포함되어 있습니다. 복잡성과 서로 다른 의견 및 부분적인 정보의 존재 때문에만 선택되었습니다. 이는 LLM 기본 모델의 학습에 포함되지 않을 만큼 최근의, 정돈되지 않은 실제 테스트 사례입니다.
실험 개요
Baseline RAG와 GraphRAG 모두 답변을 구성하기 위해 데이터셋 전반의 정보를 집계해야 하는 동일한 질문을 받았습니다.
Q: 데이터셋의 상위 5개 주제는 무엇인가요?
답변은 아래 이미지에 표시되어 있습니다. Baseline RAG의 결과는 벡터 검색이 관련 없는 텍스트를 검색했기 때문에 전쟁 주제와 관련이 없었고, 부정확한 평가로 이어졌습니다. 반면 GraphRAG는 주요 주제와 이를 뒷받침하는 세부 정보를 식별하며 명확하고 관련성 높은 답변을 제공했습니다. 결과는 원본 자료에 대한 참조와 함께 데이터셋과 일치했습니다.
그림 4- 복잡한 요약 질문에 답변할 때 BaselineRAG와 GraphRAG 비교
그림 4: 복잡한 요약 질문에 답변할 때 BaselineRAG와 GraphRAG 비교
논문 “From Local to Global: A Graph RAG Approach to Query-Focused Summarization.”의 추가 실험은 GraphRAG가 멀티홉 추론과 복잡한 정보 요약을 크게 향상시킨다는 것을 보여줍니다. 이 연구는 GraphRAG가 포괄성과 다양성 모두에서 Baseline RAG를 능가한다는 것을 나타냅니다:
포괄성: 답변이 질문의 모든 측면을 어느 정도 다루는지.
다양성: 답변이 제공하는 관점과 통찰의 다양성과 풍부함.
이 실험들에 대한 자세한 내용은 원본 GraphRAG 논문을 읽어보시길 권장합니다.
Milvus 벡터 데이터베이스로 GraphRAG를 구현하는 방법
GraphRAG는 지식 그래프로 RAG 애플리케이션을 향상시키며, 관련 엔터티를 검색하기 위해 벡터 데이터베이스에도 의존합니다. 이 섹션에서는 Milvus 벡터 데이터베이스를 사용하여 GraphRAG를 구현하고, GraphRAG 인덱스를 생성하며, 이를 쿼리하는 방법을 보여줍니다.
사전 요구 사항
이 블로그의 코드를 실행하기 전에 다음 종속성을 설치했는지 확인하세요:
pip install --upgrade pymilvus
pip install git+https://github.com/zc277584121/graphrag.git
참고: 작성 시점에 Milvus 스토리지 기능은 아직 공식 병합이 보류 중이므로, 포크된 저장소에서 GraphRAG를 설치했습니다.
인덱싱 워크플로부터 시작해 보겠습니다.
데이터 준비
Project Gutenberg에서 약 천 줄 정도의 작은 텍스트 파일을 다운로드하고 GraphRAG 인덱싱에 사용합니다.
이 데이터셋은 Leonardo Da Vinci의 이야기와 관련되어 있습니다. GraphRAG를 사용해 Da Vinci와 관련된 모든 관계의 그래프 인덱스를 구축하고, Milvus 벡터 데이터베이스를 사용해 질문에 답하는 데 필요한 관련 지식을 검색합니다.
import nest_asyncio
nest_asyncio.apply()
import os
import urllib.request
index_root = os.path.join(os.getcwd(), 'graphrag_index')
os.makedirs(os.path.join(index_root, 'input'), exist_ok=True)
url = "https://www.gutenberg.org/cache/epub/7785/pg7785.txt"
file_path = os.path.join(index_root, 'input', 'davinci.txt')
urllib.request.urlretrieve(url, file_path)
with open(file_path, 'r+', encoding='utf-8') as file:
# We use the first 934 lines of the text file, because the later lines are not relevant for this example.
# If you want to save api key cost, you can truncate the text file to a smaller size.
lines = file.readlines()
file.seek(0)
file.writelines(lines[:934]) # Decrease this number if you want to save api key cost.
file.truncate()
워크스페이스 초기화
이제 GraphRAG를 사용해 텍스트 파일을 인덱싱해 보겠습니다. 워크스페이스를 초기화하려면 먼저 graphrag.index --init 명령을 실행합니다.
python -m graphrag.index --init --root ./graphrag_index
env 파일 및 설정 구성
인덱스의 루트 디렉터리에서 .env 파일을 찾을 수 있습니다. 이를 사용하려면 OpenAI API 키를 .env 파일에 추가하세요.
중요 참고 사항: __
이 예제에서는 OpenAI 모델을 사용합니다. 준비된 API key 가 있는지 확인하세요.
GraphRAG 인덱싱은 전체 텍스트 코퍼스를 LLM으로 처리하므로 비용이 많이 듭니다. 이 데모를 실행하면 몇 달러의 비용이 들 수 있습니다. 비용을 절약하려면 텍스트 파일을 더 작은 크기로 잘라내는 것을 고려하세요.
인덱싱 파이프라인 실행
인덱싱 프로세스에는 다소 시간이 걸립니다. 완료되면 ./graphrag_index/output/<timestamp>/artifacts에 일련의 parquet 파일이 들어 있는 새 폴더가 생성됩니다.
python -m graphrag.index --root ./graphrag_index
Milvus 벡터 데이터베이스로 쿼리하기
쿼리 단계에서는 GraphRAG local search를 위해 Milvus를 사용해 엔터티 설명 임베딩을 저장합니다. 이 방법은 지식 그래프의 구조화된 데이터와 입력 문서의 비정형 데이터를 결합하여, 더 정확한 답변을 위해 관련 엔터티 정보로 LLM 컨텍스트를 강화합니다.
import os
import pandas as pd
import tiktoken
from graphrag.query.context_builder.entity_extraction import EntityVectorStoreKey
from graphrag.query.indexer_adapters import (
# read_indexer_covariates,
read_indexer_entities,
read_indexer_relationships,
read_indexer_reports,
read_indexer_text_units,
)
from graphrag.query.input.loaders.dfs import (
store_entity_semantic_embeddings,
)
from graphrag.query.llm.oai.chat_openai import ChatOpenAI
from graphrag.query.llm.oai.embedding import OpenAIEmbedding
from graphrag.query.llm.oai.typing import OpenaiApiType
from graphrag.query.question_gen.local_gen import LocalQuestionGen
from graphrag.query.structured_search.local_search.mixed_context import (
LocalSearchMixedContext,
)
from graphrag.query.structured_search.local_search.search import LocalSearch
from graphrag.vector_stores import MilvusVectorStore
output_dir = os.path.join(index_root, "output")
subdirs = [os.path.join(output_dir, d) for d in os.listdir(output_dir)]
latest_subdir = max(subdirs, key=os.path.getmtime) # Get latest output directory
INPUT_DIR = os.path.join(latest_subdir, "artifacts")
COMMUNITY_REPORT_TABLE = "create_final_community_reports"
ENTITY_TABLE = "create_final_nodes"
ENTITY_EMBEDDING_TABLE = "create_final_entities"
RELATIONSHIP_TABLE = "create_final_relationships"
COVARIATE_TABLE = "create_final_covariates"
TEXT_UNIT_TABLE = "create_final_text_units"
COMMUNITY_LEVEL = 2
인덱싱 프로세스에서 데이터 로드
인덱싱 프로세스 중에 몇 개의 parquet 파일이 생성됩니다. 이를 메모리에 로드하고 엔터티 설명 정보를 Milvus 벡터 데이터베이스에 저장합니다.
엔터티 읽기:
# read nodes table to get community and degree data
entity_df = pd.read_parquet(f"{INPUT_DIR}/{ENTITY_TABLE}.parquet")
entity_embedding_df = pd.read_parquet(f"{INPUT_DIR}/{ENTITY_EMBEDDING_TABLE}.parquet")
entities = read_indexer_entities(entity_df, entity_embedding_df, COMMUNITY_LEVEL)
description_embedding_store = MilvusVectorStore(
collection_name="entity_description_embeddings",
)
# description_embedding_store.connect(uri="http://localhost:19530") # For Milvus docker service
description_embedding_store.connect(uri="./milvus.db") # For Milvus Lite
entity_description_embeddings = store_entity_semantic_embeddings(
entities=entities, vectorstore=description_embedding_store
)
print(f"Entity count: {len(entity_df)}")
entity_df.head()
엔터티 수: 651
그림 5: 엔터티 스크린샷
그림 5: 엔터티 스크린샷
관계 읽기
relationship_df = pd.read_parquet(f"{INPUT_DIR}/{RELATIONSHIP_TABLE}.parquet")
relationships = read_indexer_relationships(relationship_df)
print(f"Relationship count: {len(relationship_df)}")
relationship_df.head()
관계 수: 290
그림 6- 관계 스크린샷
그림 6: 관계 스크린샷
커뮤니티 보고서 읽기
report_df = pd.read_parquet(f"{INPUT_DIR}/{COMMUNITY_REPORT_TABLE}.parquet")
reports = read_indexer_reports(report_df, entity_df, COMMUNITY_LEVEL)
print(f"Report records: {len(report_df)}")
report_df.head()
보고서 레코드: 45
그림 7- 보고서 레코드 스크린샷
그림 7: 보고서 레코드 스크린샷
텍스트 단위 읽기
text_unit_df = pd.read_parquet(f"{INPUT_DIR}/{TEXT_UNIT_TABLE}.parquet")
text_units = read_indexer_text_units(text_unit_df)
print(f"Text unit records: {len(text_unit_df)}")
text_unit_df.head()
텍스트 단위 레코드: 51
그림 8- 텍스트 단위 레코드 스크린샷
그림 8: 텍스트 단위 레코드 스크린샷
로컬 검색 엔진 만들기
로컬 검색 엔진에 필요한 데이터를 준비했습니다. 이제 이를 LLM 및 임베딩 모델과 함께 사용하여 LocalSearch 인스턴스를 빌드할 수 있습니다.
로컬 검색 엔진에 필요한 데이터를 준비했습니다. 이제 이를 LLM 및 임베딩 모델과 함께 사용하여 LocalSearch 인스턴스를 빌드할 수 있습니다.
api_key = os.environ["OPENAI_API_KEY"] # Your OpenAI API key
llm_model = "gpt-4o" # Or gpt-4-turbo-preview
embedding_model = "text-embedding-3-small"
llm = ChatOpenAI(
api_key=api_key,
model=llm_model,
api_type=OpenaiApiType.OpenAI,
max_retries=20,
)
token_encoder = tiktoken.get_encoding("cl100k_base")
text_embedder = OpenAIEmbedding(
api_key=api_key,
api_base=None,
api_type=OpenaiApiType.OpenAI,
model=embedding_model,
deployment_name=embedding_model,
max_retries=20,
)
context_builder = LocalSearchMixedContext(
community_reports=reports,
text_units=text_units,
entities=entities,
relationships=relationships,
covariates=None, #covariates,#todo
entity_text_embeddings=description_embedding_store,
embedding_vectorstore_key=EntityVectorStoreKey.ID, # if the vectorstore uses entity title as ids, set this to EntityVectorStoreKey.TITLE
text_embedder=text_embedder,
token_encoder=token_encoder,
)
local_context_params = {
"text_unit_prop": 0.5,
"community_prop": 0.1,
"conversation_history_max_turns": 5,
"conversation_history_user_turns_only": True,
"top_k_mapped_entities": 10,
"top_k_relationships": 10,
"include_entity_rank": True,
"include_relationship_weight": True,
"include_community_rank": False,
"return_candidate_context": False,
"embedding_vectorstore_key": EntityVectorStoreKey.ID, # set this to EntityVectorStoreKey.TITLE if the vectorstore uses entity title as ids
"max_tokens": 12_000, # change this based on the token limit you have on your model (if you are using a model with 8k limit, a good setting could be 5000)
}
llm_params = {
"max_tokens": 2_000, # change this based on the token limit you have on your model (if you are using a model with 8k limit, a good setting could be 1000=1500)
"temperature": 0.0,
}
search_engine = LocalSearch(
llm=llm,
context_builder=context_builder,
token_encoder=token_encoder,
llm_params=llm_params,
context_builder_params=local_context_params,
response_type="multiple paragraphs", # free form text describing the response type and format, can be anything, e.g. prioritized list, single paragraph, multiple paragraphs, multiple-page report
)
쿼리 만들기.
result = await search_engine.asearch("Tell me about Leonardo Da Vinci")
print(result.response)
# 레오나르도 다 빈치
1452년 피렌체 근처 빈치 마을에서 태어난 레오나르도 다 빈치는 이탈리아 르네상스의 가장 다재다능한 천재 중 한 명으로 널리 칭송받는다. 그의 전체 이름은 레오나르도 디 세르 피에로 단토니오 디 세르 피에로 디 세르 귀도 다 빈치였으며, 그는 지방 공증인 세르 피에로의 사생아이자 장남이었다 [Data: Entities (0)]. 레오나르도의 공헌은 예술, 과학, 공학, 철학을 포함한 다양한 분야에 걸쳐 있었고, 그에게 기독교 시대의 가장 보편적인 천재라는 칭호를 안겨 주었다 [Data: Entities (8)].
## 어린 시절과 수련
레오나르도의 초기 재능은 그의 아버지에게 인정받았고, 아버지는 그의 그림 몇 점을 저명한 예술가이자 조각가인 안드레아 델 베로키오에게 가져갔다. 레오나르도의 재능에 감명을 받은 베로키오는 1469-1470년경 그를 자신의 공방에 받아들였다. 이곳에서 레오나르도는 보티첼리와 로렌초 디 크레디를 포함한 다른 저명한 예술가들을 만났다 [Data: Sources (6, 7)]. 1472년까지 레오나르도는 피렌체 화가 길드에 가입했으며, 이는 그의 전문 경력의 시작을 알렸다 [Data: Sources (7)].
## 예술적 걸작
레오나르도는 아마도 "모나리자"와 "최후의 만찬" 같은 상징적인 회화로 가장 잘 알려져 있을 것이다. 미묘한 표정과 세밀한 배경으로 유명한 "모나리자"는 루브르에 소장되어 있으며, 여전히 세계에서 가장 유명한 예술 작품 중 하나이다 [Data: Relationships (0, 45)]. 예수가 제자 중 한 명이 자신을 배신할 것이라고 알린 순간을 묘사한 프레스코화인 "최후의 만찬"은 밀라노의 산타 마리아 델레 그라치에 식당에 위치해 있다 [Data: Sources (2)]. 다른 중요한 작품으로는 "암굴의 성모"와 그가 1489-1490년경 시작한 "회화론"이 있다 [Data: Relationships (7, 12)].
## 과학 및 공학 분야의 공헌
레오나르도의 천재성은 예술을 넘어 다양한 과학 및 공학적 시도로 확장되었다. 그는 해부학, 광학, 수리학에서 중요한 관찰을 했으며, 그의 노트에는 많은 현대 발명품을 예견한 스케치와 아이디어가 가득하다. 예를 들어, 그는 코페르니쿠스의 지구 운동 이론과 라마르크의 동물 분류를 예견했다 [Data: Relationships (38, 39)]. 빛과 그림자의 법칙에 관한 그의 작업과 명암법에 대한 숙련은 예술과 과학 양쪽 모두에 깊은 영향을 미쳤다 [Data: Sources (45)].
## 후원과 전문적 관계
레오나르도의 경력은 그의 후원자들에게 큰 영향을 받았다. 밀라노 공작 루도비코 스포르차는 레오나르도를 궁정 화가이자 종합 기술자로 고용하여 다양한 작품을 의뢰했고, 1499년에는 그에게 포도밭을 선물하기도 했다 [Data: Relationships (9, 19, 84)]. 말년에 레오나르도는 프랑수아 1세 왕의 후원 아래 프랑스로 이주했으며, 왕은 그에게 군주에 걸맞은 수입을 제공하고 그를 높이 평가했다 [Data: Relationships (114, 37)]. 레오나르도는 앙부아즈 근처 클루의 저택에서 말년을 보냈으며, 그곳에서 왕의 잦은 방문을 받았고 가까운 친구이자 조수인 프란체스코 멜치의 지원을 받았다 [Data: Relationships (28, 122)].
## 유산과 영향
레오나르도 다 빈치의 영향은 그의 생애를 훨씬 넘어 확장되었다. 그는 밀라노에 회화 학교를 세웠고, 그의 기법과 가르침은 조반니 암브로조 다 프레디스와 프란체스코 멜치 같은 제자와 추종자들에 의해 이어졌다 [Data: Relationships (6, 15, 28)]. 그의 작품들은 계속해서 찬사를 받고 연구되며, 르네상스의 가장 위대한 거장 중 한 명으로서 그의 유산을 확고히 하고 있다. 예술과 과학을 융합하는 레오나르도의 능력은 두 분야 모두에 지울 수 없는 흔적을 남겼고, 수많은 세대의 예술가와 과학자들에게 영감을 주었다 [Data: Entities (148, 86); Relationships (27, 12)].
요약하면, 레오나르도 다 빈치의 예술, 과학, 공학에 대한 비할 데 없는 공헌은 그의 혁신적 사고와 동시대인 및 후대에 대한 깊은 영향과 결합되어, 그를 인간 성취의 역사에서 우뚝 선 인물로 만든다. 그의 유산은 계속해서 감탄과 연구를 불러일으키며, 그의 천재성이 지닌 시대를 초월한 관련성을 강조한다.
GraphRAG의 결과는 구체적이며, 인용된 데이터 소스가 명확하게 표시됩니다.
질문 생성
GraphRAG는 과거 쿼리를 기반으로 질문을 생성할 수도 있으며, 이는 챗봇 대화에서 추천 질문을 만드는 데 유용합니다. 이 방법은 지식 그래프의 구조화된 데이터와 입력 문서의 비정형 데이터를 결합하여 특정 엔터티와 관련된 후보 질문을 생성합니다.
question_generator = LocalQuestionGen(
llm=llm,
context_builder=context_builder,
token_encoder=token_encoder,
llm_params=llm_params,
context_builder_params=local_context_params,
)
question_history = [
"Tell me about Leonardo Da Vinci",
"Leonardo's early works",
]
기록을 기반으로 질문을 생성합니다.
candidate_questions = await question_generator.agenerate(
question_history=question_history, context_data=None, question_count=5
)
candidate_questions.response
["- What were some of Leonardo da Vinci's early works and where are they housed?",
"- How did Leonardo da Vinci's relationship with Andrea del Verrocchio influence his early works?",
'- What notable projects did Leonardo da Vinci undertake during his time in Milan?',
"- How did Leonardo da Vinci's engineering skills contribute to his projects?",
"- What was the significance of Leonardo da Vinci's relationship with Francis I of France?"]
공간을 절약하기 위해 인덱스를 삭제하려면 인덱스 루트를 제거할 수 있습니다.
# import shutil
#
# shutil.rmtree(index_root)
요약
이 블로그에서는 지식 그래프를 통합하여 RAG 기술을 향상시키는 혁신적인 방법인 GraphRAG를 살펴보았습니다. GraphRAG는 다중 홉 추론과 서로 다른 정보 조각을 연결해야 하는 포괄적인 질문에 답하기와 같은 복잡한 작업을 처리하는 데 이상적입니다.
Milvus 벡터 데이터베이스와 결합하면, GraphRAG는 대규모 데이터셋 내의 복잡한 의미적 관계를 탐색하여 더 정확하고 통찰력 있는 결과를 제공할 수 있습니다. 이 강력한 조합은 GraphRAG를 다양한 실용적인 GenAI 애플리케이션에 매우 귀중한 자산으로 만들어, 복잡한 정보를 이해하고 처리하기 위한 견고한 솔루션을 제공합니다.
추가 자료
GraphRAG 논문: From Local to Global: A Graph RAG Approach to Query-Focused Summarization
GraphRAG GitHub: https://github.com/microsoft/graphrag
기타 RAG 향상 기법:
계속 읽기

Zilliz Cloud Now Available in Azure North Europe: Bringing AI-Powered Vector Search Closer to European Customers
The addition of the Azure North Europe (Ireland) region further expands our global footprint to better serve our European customers.

Introducing Zilliz MCP Server: Natural Language Access to Your Vector Database
Developers can easily manage and query vector databases with natural language via Zilliz MCP Server in AI-native environments.

Creating Collections in Zilliz Cloud Just Got Way Easier
We've enhanced the entire collection creation experience to bring advanced capabilities directly into the interface, making it faster and easier to build production-ready schemas without switching tools.



