Zilliz Cloud Pipelines로 데이터 처리 간소화하기: 문서 청킹 심층 분석
Zilliz Cloud Pipelines를 사용하여 데이터 처리를 간소화하려면 문서 청킹을 살펴보는 것이 포함됩니다. 이는 비정형 데이터를 검색 가능한 벡터 컬렉션으로 변환하는 구성 요소입니다. Zilliz Cloud Pipelines의 수집, 삭제 및 검색 파이프라인은 이 프로세스를 더욱 원활하게 합니다. 각각은 데이터 처리 워크플로에서 서로 다른 목적을 수행합니다.
Zilliz Cloud Pipelines는 문서 청킹 프로세스를 단순화하고 검색 가능성을 향상시키는 역할을 합니다. 이 플랫폼은 텍스트 문서에서 의미 검색을 활용한 사용 사례를 가능하게 하며, Retrieval-Augmented Generation (RAG) 애플리케이션을 위한 핵심 빌딩 블록을 제공합니다.
Zilliz Cloud Pipelines에는 쿼리 텍스트를 벡터 임베딩으로 변환하는 SEARCH_DOC_CHUNK와 같은 다양한 기능이 포함되어 있습니다. 그런 다음 상위 K개의 관련 문서 청크를 검색하여 쿼리의 의미를 기반으로 관련 정보를 더 쉽게 찾을 수 있게 합니다.
Zilliz Cloud Pipelines: 데이터 처리의 혁신
Zilliz의 엔지니어들은 바쁜 생성형 AI 개발자를 위해 다양한 소스의 비정형 데이터를 검색 가능한 벡터 컬렉션으로 변환하도록 Zilliz Cloud Pipelines를 설계했습니다. 이 파이프라인은 비정형 데이터를 가져와 분할하고, 임베딩으로 변환하고, 인덱싱한 뒤, 지정된 메타데이터와 함께 Zilliz Cloud에 저장합니다. 이 아키텍처는 성능을 향상시키는 다양한 핵심 기술 구성 요소와 기능을 사용합니다.
기술적 기반
Milvus 벡터 데이터베이스
Milvus 벡터 데이터베이스는 고차원 벡터 데이터를 효율적으로 처리하도록 설계되었습니다. 또한 개발자가 데이터베이스 운영 관리보다 핵심 애플리케이션에 집중할 수 있도록 돕는 클라우드 서비스인 Zilliz Cloud를 포함하여 다양한 사용 사례를 지원합니다.
커넥터
커넥터는 다양한 데이터 소스를 손쉽게 연결하는 내장 도구로, 실시간 데이터 수집 및 인덱싱을 가능하게 하여 모든 검색 요청에 대해 최신 콘텐츠에 즉시 접근할 수 있도록 보장합니다. 확장 가능하고 적응력이 뛰어난 커넥터는 변동하는 트래픽 부하를 원활하게 처리하여 DevOps 부담 없이 매끄러운 확장성을 제공합니다. 또한 문서 추가 및 삭제를 컬렉션에 자동으로 동기화하여 최신 상태로 유지합니다. 더불어 상세한 로깅은 데이터 흐름에 대한 관찰 가능성을 제공하여 투명성을 보장하고 발생할 수 있는 이상 징후를 감지할 수 있게 합니다.
문서 분할기
분할기는 문서 처리 및 텍스트 분석 작업에서 지정된 문자나 패턴을 기준으로 문서 또는 텍스트를 더 작은 청크나 세그먼트로 나누는 데 일반적으로 사용됩니다. 이러한 청크는 이후 개별적으로 처리되거나 분석될 수 있습니다. 예를 들어, 생성형 AI 애플리케이션의 경우 분할기를 사용하여 긴 텍스트를 벡터 임베딩으로 변환하기 전에 개별 문장이나 단락으로 나눌 수 있습니다. 이러한 임베딩은 의미적으로 유사한 청크를 찾는 데 사용됩니다.
머신 러닝 모델
머신 러닝 모델은 벡터 임베딩을 생성하는 데 사용됩니다. 이러한 임베딩은 의미적 관계와 문맥 정보를 포착하여 알고리즘이 언어를 더 효과적으로 이해하고 처리할 수 있도록 합니다. 오픈 소스, 상용 및 비공개 머신 러닝 모델은 벡터 임베딩을 생성하기 위해 온프레미스나 클라우드 환경에 설치하거나 API를 통해 접근할 수 있습니다.
리랭커
정보 검색 시스템에서 리랭커는 쿼리와의 관련성을 높이기 위해 초기 검색 결과를 정제합니다. 검색을 위해 벡터 근사 최근접 이웃(ANN) 검색만 사용하는 것과 달리, 리랭커를 추가하면 문서와 쿼리 간의 의미적 관계를 더 잘 평가하여 검색 품질을 향상시킬 수 있습니다. 검색 증강 생성(RAG) 애플리케이션의 경우, 리랭커는 더 작지만 더 높은 품질의 컨텍스트 문서 집합을 제공함으로써 생성된 답변의 정확도를 높일 수 있습니다. 그러나 리랭커는 계산 비용이 많이 들기 때문에 ANN 검색만 사용할 때보다 비용이 증가하고 쿼리 지연 시간이 길어집니다. 리랭커를 통합할지 여부는 관련성 향상에 대한 필요와 성능 및 비용 제약 간의 균형을 고려해야 합니다.
기능
수집 파이프라인 생성
사용자는 사용하기 쉬운 Zilliz Cloud 콘솔 또는 더 높은 사용자 지정이 가능한 RESTful APIs를 통해 파이프라인을 생성할 수 있습니다. 이러한 이중 접근 방식은 사용자가 단순성을 우선시하든 고급 사용자 지정 옵션이 필요하든, 특정 요구 사항과 선호도에 따라 파이프라인 생성 경험을 맞춤화할 수 있도록 합니다. 파이프라인을 생성할 때, 사용자는 먼저 문서를 분할한 다음 여섯 가지 모델 중 하나(zilliz/bge-base-en-v1.5, voyageai/voyage-2, voyageai/voyage-code-2, openai/text-embedding-3-small, and openai/text-embedding-3-large. For the Chinese language, only zilliz/bge-base-zh-v1.5)를 선택하여 벡터 임베딩을 생성할 수 있습니다. 또한 검색 중에 유용할 관련 메타데이터를 저장할 수도 있습니다.
데이터 소스 연결
Zilliz Cloud의 핵심 도구인 커넥터는 다양한 데이터 소스를 벡터 데이터베이스와 연결하는 과정을 간소화하도록 설계되었습니다. 사용자 인터페이스(UI)에 제공되는 직관적인 안내를 통해 사용자는 다양한 데이터 소스를 자신의 파이프라인에 손쉽게 통합할 수 있습니다. 이는 데이터 처리 역량의 다양성과 확장성을 높일 뿐만 아니라 Zilliz Cloud의 사용자 친화적인 특성을 강조합니다.
예를 들어, 커넥터는 Object Storage, Kafka(곧 제공 예정) 등 다양한 소스에서 Zilliz Cloud로 데이터를 수집하기 위한 메커니즘 역할을 합니다. 객체 스토리지 커넥터를 예로 들면, 사용자가 객체 스토리지 버킷 내의 디렉터리를 모니터링하고 PDF 및 HTML과 같은 파일을 Zilliz Cloud Pipelines에 동기화할 수 있게 합니다. 이후 이러한 파일은 벡터 표현으로 변환되어 검색을 위해 벡터 데이터베이스에 저장될 수 있습니다. 전용 수집 및 삭제 파이프라인을 통해 Zilliz Cloud 내의 파일과 해당 벡터 표현은 동기화된 상태로 유지됩니다. 벡터 데이터베이스 컬렉션은 객체 스토리지에서 파일이 추가되거나 제거되는 사항을 자동으로 반영하여 데이터 일관성과 정확성을 보장합니다.
검색 파이프라인 실행
파이프라인이 생성되면 실행하여 비정형 데이터를 처리할 수 있으며, Zilliz Cloud 생태계 내에서 다양한 기능을 지원합니다. 예를 들어, 수집 파이프라인을 생성한 후 사용자는 이를 실행하여 비정형 데이터를 검색 가능한 벡터 임베딩으로 변환할 수 있습니다. 그런 다음 이러한 임베딩은 Zilliz Cloud 벡터 데이터베이스에 저장되어 데이터 검색의 접근성과 효율성을 향상시킬 수 있습니다.
마찬가지로, 검색 파이프라인을 생성한 후 사용자는 이를 실행하여 시스템이 의미 기반 검색을 수행하도록 할 수 있습니다. 이 기능을 통해 사용자는 의미 분석의 힘을 활용하여 검색 결과를 정제하고, 벡터 데이터베이스에서 관련 정보를 탐색하고 검색할 수 있습니다.
또한, 삭제 파이프라인을 생성한 후 사용자는 벡터 데이터베이스 내 컬렉션에서 지정된 문서와 관련된 모든 청크를 제거함으로써 이를 실행할 수 있습니다. 이 기능은 불필요하거나 오래된 데이터 청크의 제거를 지원하여 데이터베이스의 무결성과 청결성을 보장합니다.
파이프라인 비용 추정
파이프라인 실행과 관련된 비용은 기본 측정 단위로 사용되는 토큰을 기준으로 정량화됩니다. 대규모 언어 모델(LLM)이 토큰을 기본 구성 요소로 활용하는 방식과 유사하게, 파이프라인은 텍스트를 토큰 시퀀스로 구문 분석하고 임베딩하여 문서 처리 및 검색 쿼리 실행을 수행합니다. 사용자는 Estimate Pipeline Usage 도구를 활용하여 파이프라인 실행의 비용 영향을 파악할 수 있습니다. 이 도구는 파일 또는 텍스트 문자열 내의 토큰 수를 계산할 수 있게 하여, 사용자가 파이프라인 실행에 예상되는 리소스 사용량과 관련 비용을 가늠할 수 있도록 합니다. 이 도구를 통해 사용자는 리소스 할당 및 예산 책정과 관련하여 정보에 기반한 결정을 내릴 수 있으며, 파이프라인 운영에서 최적의 효율성과 비용 효율성을 보장할 수 있습니다.
검색 결과 재순위화
Approximate Nearest Neighbor (ANN) 벡터 검색만을 사용한 초기 검색은 매우 효율적이며 종종 만족스러운 결과를 제공합니다. 많은 상황에서 재순위화의 2차 단계는 선택 사항으로 간주될 수 있습니다. 높은 품질 기준을 요구하는 애플리케이션의 경우, reranker를 사용하면 정확도를 향상시킬 수 있지만 계산 요구 사항이 증가하고 검색 시간이 길어질 수 있습니다. 일반적으로 reranker 모델을 통합하면 topK 선택 및 reranker 모델 크기와 같은 요인에 따라 검색 쿼리에 100ms에서 몇 초의 지연 시간이 추가될 수 있습니다. 초기 검색이 부정확하거나 관련 없는 문서를 반환하는 경우, reranker를 사용하면 이를 효과적으로 걸러내어 최종 생성 응답의 품질을 향상시킵니다.
사용 사례에 reranker가 필요하다고 판단되면 UI에서 선택할 수 있습니다.
장점
유연한 파이프라인 생성: 사용자는 사용자 친화적인 Zilliz Cloud 콘솔 또는 더 높은 맞춤화가 가능한 RESTful APIs를 통해 파이프라인을 생성할 수 있습니다. 이 이중 접근 방식은 사용자가 단순성을 우선시하든 고급 맞춤화 옵션을 필요로 하든, 특정 요구 사항과 선호도에 맞게 파이프라인 생성 경험을 조정할 수 있도록 합니다.
원활한 데이터 소스 통합: Zilliz Cloud의 커넥터는 다양한 데이터 소스를 벡터 데이터베이스와 연결하는 과정을 단순화합니다. 사용자 인터페이스(UI)의 직관적인 지침을 통해 사용자는 다양한 데이터 소스를 파이프라인에 손쉽게 통합하여 데이터 처리 기능의 다양성과 확장성을 향상시킬 수 있습니다.
비용 추정 및 최적화: Zilliz Cloud는 사용자가 예상 리소스 사용량과 관련 파이프라인 비용을 가늠하는 데 도움이 되는 Estimate Pipeline Usage 도구를 제공합니다. 사용자는 파일 또는 텍스트 문자열 내의 토큰 수를 계산하여 리소스 할당 및 예산 책정과 관련해 정보에 기반한 결정을 내릴 수 있으며, 파이프라인 운영에서 최적의 효율성과 비용 효율성을 보장할 수 있습니다.
Zilliz Cloud 파이프라인
수집 파이프라인
수집 파이프라인의 주요 목적은 텍스트 조각 및 문서와 같은 비정형 데이터를 검색 가능한 벡터 임베딩으로 처리하도록 설계되었다는 점입니다. 여기에는 입력 텍스트 문서를 여러 청크로 분할하고 각 청크에 대한 벡터 임베딩을 생성하는 INDEX_DOC 함수가 포함되어 있습니다. 입력 필드(doc_url)는 자동으로 생성된 컬렉션의 스칼라 및 벡터 필드로서 네 개의 출력 필드(doc_name, chunk_id, chunk_text, embedding)에 매핑됩니다.
검색 파이프라인
검색 파이프라인의 프로세스는 매우 간단합니다. 쿼리 문자열을 벡터 임베딩으로 변환하고 메타데이터 및 해당 텍스트와 함께 상위 K개 벡터를 검색함으로써 시맨틱 검색을 지원합니다. 이를 위해 SEARCH_DOC_CHUNK라는 함수가 사용됩니다.
삭제 파이프라인
삭제 파이프라인은 컬렉션에서 지정된 문서의 모든 청크를 제거하는 데 사용됩니다. 이를 통해 문서의 모든 데이터를 더 쉽게 삭제할 수 있습니다. 지정된 doc_name을 가진 모든 문서 청크를 삭제하는 PURGE_DOC_INDEX라는 함수가 있습니다.
문서 청킹의 메커니즘
청킹의 목표는 이름에서 알 수 있듯이 정보를 여러 개의 더 작은 조각으로 나누어 더 효율적이고 의미 있게 저장하는 것입니다. 이렇게 하면 검색은 질문과 더 관련 있는 정보 조각을 포착할 수 있고, 생성은 전체 문서 대신 문서의 일부만 LLM 프롬프트에 포함되므로 더 정확하면서도 비용은 더 적게 들 수 있습니다. 마지막으로, 문서 청킹은 정확한 일치가 아니라 의미론적 이해를 기반으로 정보를 검색하므로 검색 가능성을 효율적으로 만듭니다.
Zilliz Cloud Pipelines를 사용하면 문서를 문장, 단락, 줄 또는 사용자 지정 문자열 목록으로 분할할 수 있습니다. 또한 청크 크기를 정의할 수 있습니다. 기본적으로 각 청크는 최대 500개의 토큰을 포함합니다. 다음 표는 적용 가능한 모델과 해당 청크 크기 범위 간의 매핑 관계를 나열합니다.
| 모델 | 청크 크기 범위 |
|---|---|
| zilliz/bge-base-en-v1.5 | 20-500 토큰 |
| zilliz/bge-base-zh-v1.5 | 20-500 토큰 |
| voyageai/voyage-2 | 20-3,000 토큰 |
| voyageai/voyage-code-2 | 20-12,000 토큰 |
| voyageai/voyage-large-2 | 20-12,000 토큰 |
| openai/text-embedding-3-small | 250-8,191 토큰 |
| openai/text-embedding-3-large | 250-8,191 토큰 |
문서 청킹의 실제 응용 분야와 이점
문서 청킹은 다양한 도메인에서 폭넓은 실제 응용 분야를 가지고 있습니다. 텍스트 데이터를 관리 가능한 조각으로 나눔으로써 대량의 비정형 데이터를 처리하는 더 간소화된 접근 방식을 제공합니다. 다음은 문서 청킹의 실제 응용 사례 중 일부입니다.
실제 응용 분야
콘텐츠 관리
콘텐츠 관리에서 문서 청킹 프로세스는 큰 문서를 작은 조각으로 나누어 색인화하고 검색하기 쉽게 만듭니다. 이 접근 방식은 검색을 효율적으로 만들고 사용자가 원하는 정보를 빠르게 찾을 수 있게 합니다.
연구
문서 청킹은 학술 논문, 보고서 및 연구 논문을 색인화하는 연구 도메인에서 유용합니다. 이로 인해 연구자들은 관심 있는 특정 세그먼트를 검색할 수 있습니다.
법률
문서 청킹은 법률 도메인에서도 도움이 됩니다. 청킹은 특정 조항, 계약, 조건 및 법원 판결 검색을 용이하게 합니다. 이는 법률 연구의 정확성과 효율성을 향상시킵니다.
의료
의료 전문가들도 문서 청킹을 사용하여 환자의 의료 기록, 임상 지침 및 연구 논문을 처리하고 색인화할 수 있습니다. 이는 중요한 의료 정보에 지체 없이 접근하는 데 도움이 됩니다.
이점
청킹은 Retrieval Augmented Generation (RAG) 모델의 맥락에서 세 가지 주요 이점을 제공합니다:
- 향상된 정밀도: 텍스트를 더 작고 관리하기 쉬운 청크로 나눔으로써, 청킹은 검색 프로세스가 쿼리와 특별히 관련된 정보를 포착할 수 있게 합니다. 이는 검색 결과의 정밀도를 향상시키고 검색된 정보가 사용자의 요구 사항과 밀접하게 부합하도록 보장합니다.
- 감소된 계산 비용: 청킹은 관련 문서 부분만 언어 모델 프롬프트에 포함함으로써 계산 비용을 최소화합니다. 불필요한 정보를 피함으로써, 청킹은 처리 오버헤드를 최적화하는 데 도움이 되어 더 효율적인 텍스트 검색 및 생성 프로세스로 이어집니다.
- 향상된 일관성과 관련성: Document Specific Chunking과 같은 청킹 전략은 문서의 원래 구성을 존중하여 단락이나 하위 섹션과 같은 논리적 섹션에 맞춰진 청크를 만듭니다. 이 접근 방식은 특히 구조화된 문서에서 텍스트의 일관성과 관련성을 유지하여, 더 의미 있고 문맥상 적절한 검색 결과로 이어집니다.
Zilliz Cloud Pipelines로 문서 청킹 구현하기: 단계별 가이드
Zilliz Cloud Pipelines로 문서 청킹을 구현하려면 여러 단계가 필요합니다. 종합 가이드에는 설정, 구성, 모범 사례 및 최적화 전략이 포함됩니다. 핵심 사항에는 Zilliz Cloud 가입, 파이프라인 생성, 문서 인덱싱, 청킹 전략 사용자 지정이 포함됩니다.
설정 및 구성
가입 또는 로그인
첫 번째 단계는 Zilliz Cloud 계정에 가입하거나 로그인하는 것입니다. 이를 통해 Zilliz Cloud Pipelines Service에 액세스할 수 있습니다.
파이프라인 생성
사용자는 수집, 검색 및 삭제 파이프라인을 생성하기 위해 Zilliz에서 제공하는 지침을 따라야 합니다. 이후 작업을 위해 검색 파이프라인 ID와 API-Key를 반드시 기록해 두세요.
Web UI 방식
- 프로젝트로 이동
- Zilliz Cloud Web UI를 사용하여 프로젝트로 이동합니다.
- 탐색 패널에서 “Pipelines” 옵션을 선택합니다.
- “Overview” 탭으로 이동한 다음 “Pipelines”를 선택합니다.
- 새 파이프라인을 생성하려면 “+Pipeline”을 클릭합니다.
- 파이프라인 유형 선택
- 새 파이프라인을 생성하려면 “+Pipeline” 버튼을 선택합니다.
- 검색 및 삭제 파이프라인보다 먼저 수집 파이프라인을 생성해야 합니다.
- 수집 파이프라인 구성
- 새 컬렉션이 생성될 클러스터를 클릭합니다.
- 새로 생성된 컬렉션의 이름을 입력합니다.
- 형식 제한을 따라 이름을 제공합니다.
- 원한다면 파이프라인을 설명합니다.
- 파이프라인에 함수 추가
- ·INDEX_DOC 함수를 사용합니다. 이 함수는 문서를 더 작은 청크로 나누고, 각 청크를 벡터화하며, 벡터 임베딩을 저장합니다.
- 데이터 수집 중 컬렉션에 스칼라 필드를 추가하려면 PRESERVE 함수를 사용합니다.
- 청킹 전략 사용자 지정
- 문서가 청크로 분할되는 방식을 결정하기 위해 splitter를 사용자 지정합니다. “.”, “\n” 또는 기타 사용자 지정 문자열과 같은 문자를 사용합니다.
- 파이프라인 구성 저장
- 함수를 추가하고 구성한 후에는 이제 파이프라인을 저장할 차례입니다.
- “Create Ingestion Pipeline”을 클릭합니다.
RESTful API 방식
API를 통해 수집 파이프라인을 생성합니다. 수집 파이프라인을 생성하려면 curl 명령을 사용합니다.
--header "Content-Type: application/json" \
--header "Authorization: Bearer ${YOUR_API_KEY}" \
--url "https://controller.api.{cloud-region}.zillizcloud.com/v1/pipelines" \
-d '{
"projectId": "proj-xxxx",
"name": "my_doc_ingestion_pipeline",
"description": "Pipeline description",
"type": "INGESTION",
"functions": [
{
"name": "index_my_doc",
"action": "INDEX_DOC",
"inputField": "doc_url",
"language": "ENGLISH",
"chunkSize": 500,
"embedding": "zilliz/bge-base-en-v1.5",
"splitBy": ["\n\n", "\n", " "]
},
{
"name": "keep_doc_info",
"action": "PRESERVE",
"inputField": "publish_year",
"outputField": "publish_year",
"fieldType": "Int16"
}
],
"clusterId": "${CLUSTER_ID}",
"newCollectionName": "my_new_collection"
}'
- 파이프라인 관리
- 파이프라인 보기 및 관리
- 사용 가능한 파이프라인과 해당 세부 정보 및 토큰 사용량을 보려면 “Pipelines”를 클릭합니다.
- 파이프라인 목록을 보거나 세부 정보를 확인하려면 API를 통해 GET 요청을 사용합니다.
- 파이프라인 실행
- 데이터를 벡터 형식으로 처리하고 저장하려면 수집 파이프라인을 실행합니다.
- 이제 의미론적 검색을 수행하기 위해 검색 파이프라인을 실행합니다.
- 컬렉션에서 원치 않는 문서 청크를 제거하려면 삭제 파이프라인을 사용합니다.
- 파이프라인 사용량 추정
- Zilliz의 Web UI를 사용하여 파이프라인 실행에 대한 토큰 사용량을 확인할 수 있습니다.
- 파이프라인 삭제
- 사용되지 않은 파이프라인은 API(GET 요청) 또는 web UI를 사용하여 삭제할 수 있습니다.
문서 인덱싱
사용자는 파이프라인 플레이그라운드에서 doc_url 필드에 문서의 URL을 입력할 수 있습니다. 문서를 수집하려면 “RUN”을 클릭하면 프로세스가 완료됩니다. 이 단계는 문서를 검색 가능한 벡터 컬렉션으로 변환합니다.
청킹 전략 사용자 지정
Zilliz Cloud Pipelines를 사용하면 청킹 전략을 사용자 지정할 수 있습니다. 사용자는 문서를 청크로 나누는 데 사용되는 splitter를 사용하여 청크 크기를 정의할 수 있습니다. 또한 문장, 줄, 단락에 대한 사용자 지정 구분자도 지정할 수 있습니다.
모델 선택
원하는 청크 크기와 문서의 전체 크기를 기반으로 벡터 임베딩을 생성할 모델을 선택하세요. Zilliz Cloud Pipelines는 다양한 모델을 지원하며, 각 모델은 고유한 청크 크기 범위를 가지고 있습니다.
모범 사례
- 검색 품질과 효율성 간의 최적의 균형을 찾기 위해 다양한 청크 크기를 실험해 보세요.
- splitter 기능을 사용하여 단락, 사용자 지정 구분자 또는 문장과 같은 특정 기준에 따라 문서를 작은 청크로 나누세요.
- 파이프라인 사용량을 계속 확인하고 Zilliz Cloud Limits를 숙지하세요.
문제 해결 팁 및 최적화 전략
- 문서는 INDEX_DOC 함수와 호환되어야 합니다.
- markdown 또는 HTML 파일의 경우, INDEX_DOC 함수는 먼저 헤더를 기준으로 문서를 나눈 다음, 지정된 청크 크기를 기반으로 더 큰 섹션을 나눕니다. 따라서 청크 크기를 그에 맞게 조정해야 합니다.
- 선택한 모델이 최상의 결과를 제공하지 않는다면, 다른 모델도 실험해 볼 수 있습니다.
결론
Zilliz Cloud Pipelines는 비정형 데이터를 검색 가능한 벡터 컬렉션으로 변환합니다. 이는 데이터 처리와 시맨틱 검색에 상당한 영향을 미칩니다. Zilliz Cloud Pipelines는 이미지, 비디오 프레임, 멀티모달 문서를 검색할 수 있습니다. 이러한 유형의 검색을 위한 추가 파이프라인은 향후 추가될 예정입니다.
요약하자면, Zilliz Cloud Pipelines는 문서 청킹 프로세스를 간소화하고 검색 가능성을 향상시킴으로써 데이터 처리와 시맨틱 검색을 완전히 변화시켰습니다. 비정형 데이터를 다룰 때, 수집, 검색, 삭제를 위한 파이프라인을 생성할 수 있는 기능을 포함한 이 기능들은 개발자와 데이터 엔지니어에게 매우 귀중한 도구가 됩니다. 이 플랫폼은 효율성, 확장성, 사용 편의성을 강조함으로써 우리가 정보를 처리하고 검색하는 방식을 더욱 혁신할 것을 약속합니다. 이는 다양한 데이터 워크플로로의 탐색과 통합을 장려합니다.
Zilliz Cloud Pipelines를 직접 사용해 보고 싶다면 Build RAG using Zilliz Cloud Pipelines라는 제목의 이 bootcamp를 시도해 보세요.
계속 읽기

Introducing Loon: A New Storage Engine for Vector Data That Never Stops Changing
Loon is a new storage engine for Milvus 3.0 and Zilliz Vector Lakebase, built to manage evolving vector datasets with ColumnGroups, row ID alignment, and Manifests.

Democratizing AI: Making Vector Search Powerful and Affordable
Zilliz democratizes AI vector search with Milvus 2.6 and Zilliz Cloud for powerful, affordable scalability, cutting costs in infrastructure, operations, and development.

Demystifying the Milvus Sizing Tool
Explore how to use the Sizing Tool to select the optimal configuration for your Milvus deployment.


