마이그레이션 서비스 소개: 플랫폼 간 비정형 데이터를 효율적으로 이동하기
선도적인 벡터 데이터베이스 서비스 제공업체로서, Zilliz는 탁월한 AI 애플리케이션 개발이 데이터 자체에 달려 있음을 잘 알고 있습니다. 그러나 AI 앱을 위해 비정형 데이터를 효율적으로 처리하려면, 다음과 같은 몇 가지 중요한 과제가 있음을 확인했습니다:
데이터 파편화: 사용자 데이터는 S3, HDFS, Kafka, 데이터 웨어하우스, 데이터 레이크와 같은 여러 플랫폼에 흩어져 있습니다.
데이터 형식의 이질성: 비정형 데이터는 JSON, CSV, Parquet, JPEG 등 다양한 형식으로 존재합니다.
완전한 솔루션의 부재: 시스템 간 효율적인 비정형 및 벡터 데이터 전송에 대한 복잡한 요구 사항을 완전히 해결하는 기존 제품은 없습니다.
그중에서도 다양한 소스와 형식의 비정형 데이터를 벡터 데이터베이스로 효율적으로 가져오고 변환하는 것은 고유한 과제를 제시합니다. 이 과정은 기존의 SQL 기반 관계형 데이터를 처리하는 것보다 훨씬 더 복잡하며, 많은 기업이 처음에는 이 사실을 과소평가합니다.
그 결과, 비정형 데이터를 위한 맞춤형 데이터 파이프라인을 구축하는 조직은 성능, 확장성, 유지 관리성 문제로 어려움을 겪는 경우가 많습니다. 이러한 문제는 데이터 품질과 정확성을 저해하여, 얻고자 하는 인사이트를 약화시킬 수 있습니다.
더 나쁜 점은, 많은 기업이 벡터 데이터베이스를 선택할 때 벤더 종속성과 데이터 재해 복구 같은 중요한 요소를 간과한다는 것입니다. 이러한 간과는 인식 부족이나 과소평가에서 비롯되며, 심각한 문제로 이어질 수 있습니다. 특히 벤더 종속성은 특별한 주의가 필요합니다.
벤더 종속성의 영향
벤더 종속성은 조직이 단일 벤더의 독점 기술에 지나치게 의존하게 되어 다른 솔루션으로 전환하기 어렵거나 비용이 많이 드는 상황을 말합니다. 이 문제는 벡터 데이터베이스에서 특히 중요합니다. 벡터 데이터의 특성과 표준화된 형식의 부재로 인해 시스템 간 데이터 마이그레이션이 매우 어려울 수 있기 때문입니다.
벤더 종속성의 영향은 광범위할 수 있습니다. 이는 변화하는 비즈니스 요구에 적응할 수 있는 조직의 유연성을 제한하고, 시간이 지남에 따라 비용을 증가시킬 수 있으며, 회사를 단일 벤더의 생태계에 묶어 혁신을 제약할 수 있습니다. 또한 선택한 솔루션이 조직의 증가하는 요구에 맞춰 잘 확장되지 않는 경우 성능 제한으로 이어질 수 있습니다.
벡터 데이터베이스 솔루션을 선택할 때 조직은 이러한 위험을 완화하기 위해 개방형 표준과 상호 운용성을 우선시해야 합니다. 데이터 이동성에 대한 계획을 포함하는 명확한 데이터 거버넌스 전략을 개발하는 것도 중요합니다. 벤더별 기능에 대한 의존성을 정기적으로 평가하면 유연성을 유지하는 데 도움이 될 수 있습니다.
비정형 데이터 마이그레이션의 과제
그러나 이러한 예방 조치를 마련하더라도, 조직은 벡터 데이터베이스의 고유한 과제에 대비해야 합니다. 저희는 벡터 데이터베이스 간 데이터 마이그레이션이 기존 관계형 데이터베이스보다 훨씬 더 복잡하다는 사실을 확인했습니다. 이러한 복잡성은 올바른 솔루션 선택의 중요성을 강조하며, 벤더 종속성을 피하는 것이 왜 중요한지를 보여줍니다. 벡터 데이터베이스 마이그레이션의 주요 과제는 다음과 같습니다:
벡터 지향 ETL 도구의 부족: Airbyte와 Seatunnel 같은 인기 도구는 관계형 데이터베이스에는 효과적이지만, 벡터 데이터베이스 프로세스에는 어려움을 겪습니다.
벡터 데이터베이스 기능 격차:
많은 벡터 데이터베이스가 완전한 데이터 내보내기 지원을 제공하지 않음
증분 데이터에 대한 실시간 기능 부족
데이터 스키마 불일치
이러한 과제를 해결할 때, 조직은 더 탄력적이고 유연하며 미래에 대비한 AI 애플리케이션을 구축할 수 있으며, 향후 기술 발전에 적응할 민첩성을 유지하면서 비정형 데이터의 힘을 진정으로 활용할 수 있습니다.
마이그레이션 서비스 소개
Zilliz는 위에서 언급한 과제를 해결하기 위해 벡터 데이터를 위한 Apache Seatunnel 기반 서비스인 Migration Services를 개발하고 오픈소스로 공개했습니다. Migration Services를 구축하기로 결정한 데에는 여러 요인이 있었습니다:
증가하는 데이터 마이그레이션 요구 충족: Migration Services는 100개 이상의 조직이 Milvus 클러스터 간에 데이터를 마이그레이션하도록 성공적으로 지원한 Milvus Migration Service에서 발전했습니다. 사용자 요구는 다양한 벡터 데이터베이스, Elasticsearch 및 Solr와 같은 기존 검색 엔진, 관계형 데이터베이스, 데이터 웨어하우스, 문서 데이터베이스, 심지어 S3와 데이터 레이크에서 Milvus로의 마이그레이션까지 포함하도록 확대되었습니다.
실시간 데이터 스트리밍 및 오프라인 가져오기 지원: 벡터 데이터베이스 기능이 확장됨에 따라, 사용자는 실시간 데이터 스트리밍과 오프라인 배치 가져오기 옵션을 모두 필요로 합니다.
비정형 데이터 변환 간소화: 기존 ETL과 달리, 비정형 데이터를 변환하려면 AI와 모델 기능이 필요합니다. Migration Services는 Zilliz Cloud Pipelines와 함께 벡터 임베딩, 태깅 및 복잡한 변환을 가능하게 하여 데이터 정제 비용과 운영 복잡성을 크게 줄입니다.
엔드투엔드 데이터 품질 보장: 데이터 통합 및 동기화 프로세스는 데이터 손실과 불일치가 발생하기 쉽습니다. Migration Services는 강력한 모니터링 및 알림 메커니즘으로 이러한 중요한 데이터 품질 문제를 해결합니다.
Migration Services의 핵심 기능
Apache Seatunnel 위에 구축된 Migration Services는 다음을 제공합니다:
풍부하고 확장 가능한 커넥터
실시간 동기화 및 오프라인 배치 가져오기를 위한 통합 스트림 및 배치 처리
데이터 일관성을 위한 분산 스냅샷 지원
고성능, 낮은 지연 시간 및 확장성
실시간 모니터링 및 시각적 관리
그림- Migration Services는 어떻게 작동하나요?
그림 1: Migration Services는 어떻게 작동하나요?
또한 Migration Services는 다중 데이터 소스 지원, 스키마 매칭, 기본 데이터 검증과 같은 벡터 특화 기능을 도입합니다. 향후 로드맵에는 증분 동기화, 전체 및 증분 모드, 더 고급 데이터 변환 기능이 포함됩니다.
왜 Migration Services를 오픈소스로 공개하나요?
Zilliz에서는 오픈소스가 혁신을 주도하고 개발자에게 최고의 솔루션을 제공하는 힘을 믿습니다. 우리가 Migration Services를 오픈소스로 공개하기로 선택한 이유는 다음과 같습니다:
개방형 벡터 데이터 생태계 조성: 우리는 벤더 종속에서 벗어난 생태계를 구축하여, 필요에 따라 솔루션을 선택하고 전환할 수 있도록 합니다.
기여자 유치: 개발자 커뮤니티의 집단 전문성을 활용하여 도구를 더 다재다능하고 견고하게 만들 수 있습니다. 커넥터, 소스 및 변환 코드를 추가해 주시기를 초대합니다.
오픈소스 커뮤니티에 환원: 오픈소스 벡터 데이터베이스 회사로서, 우리는 전체 분야의 발전을 위해 지식과 리소스를 공유하는 데 전념하고 있습니다.
클라우드 서비스 제공 강화: 여러분의 피드백은 상용 제품의 더 빠른 반복과 개선에 매우 중요합니다. 오픈소스 공개를 통해 우리는 커뮤니티의 소중한 의견을 얻을 수 있습니다.
개방성에 대한 우리의 약속은 단순히 코드를 공유하는 것을 넘어섭니다. 개방형 생태계에서 우리는 개발자에게 선택권이 있다는 것을 이해합니다. 이는 우리가 탁월함을 추구하게 하며, Zilliz를 선택하는 것이 항상 여러분의 요구에 가장 적합한 결정이 되도록 보장합니다. 빠른 반복, 포괄적인 지원, 기능 확장 등 어떤 방식이든, 우리의 목표는 지속적으로 가치를 제공함으로써 매일 여러분의 신뢰와 비즈니스를 얻는 것입니다.
Migration Services 로드맵
앞으로 Migration Services는 계속 발전할 것입니다. 이 도구를 오픈 소스로 공개함으로써, 우리는 벡터 데이터 관리의 현재 과제를 해결하는 데 그치지 않고 AI 애플리케이션 개발의 더 혁신적인 미래를 위한 길을 닦고 있습니다.
그림 2- Migration Services 로드맵
그림 2: Migration Services 로드맵
우리의 비전은 개발자의 요구를 충족하는 도구를 만드는 것이지, 그 반대가 아닙니다. 우리는 데이터와 AI 기술이 더 접근 가능하고, 적응력이 뛰어나며, 실제 개발 과제와 더 잘 부합하는 미래를 향해 나아가고 있습니다. 우리는 커뮤니티가 이 여정에 함께하며, 비정형 데이터 처리를 위한 이 강력한 도구에 기여하고 그 혜택을 누리기를 초대합니다. 함께라면 벡터 데이터베이스의 미래를 형성하고 AI 개발을 위한 더 개방적이고 효율적이며 혁신적인 생태계를 만들 수 있습니다.
계속 읽기

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Announcing the General Availability of Single Sign-On (SSO) on Zilliz Cloud
SSO is GA on Zilliz Cloud, delivering the enterprise-grade identity management capabilities your teams need to deploy vectorDB with confidence.

What is the K-Nearest Neighbors (KNN) Algorithm in Machine Learning?
KNN is a supervised machine learning technique and algorithm for classification and regression. This post is the ultimate guide to KNN.



