Airbyte와 Zilliz를 활용한 성공적인 AI를 위한 데이터 엔지니어링의 중요성
이 글은 원래 2024년 10월 17일 DBTA에 게시되었으며 허가를 받아 재게시되었습니다.
데이터의 수집과 활용을 가능하게 하는 것은 엔터프라이즈 규모에서 AI 프로젝트를 성공적으로 지원하는 데 매우 중요합니다. 데이터 통합부터 데이터 파이프라인, AI 성능, 데이터 거버넌스, 컴플라이언스 등에 이르기까지, AI 기반 미래를 실현하기 위해 데이터 엔지니어링 모범 사례를 준수하는 것은 그 어느 때보다 현명한 일입니다.
DBTA의 최신 웨비나인 Data Engineering Best Practices for AI에서 Airbyte의 엔지니어링 디렉터 Brian Leonard와 Milvus, Zilliz의 수석 개발자 애드버킷 Tim Spann은 효과적인 AI 사용을 배포하고 확장하는 것과 관련된 일반적인 과제를 데이터 엔지니어링이 어떻게 해결할 수 있는지에 대한 전문 지식을 제공했습니다.
오픈 소스 데이터 이동 회사인 Airbyte는 데이터를 어디서든 실행 가능하게 만들어 20,000명 이상의 데이터 및 AI 전문가가 멀티 클라우드 환경 전반에서 다양한 데이터를 관리할 수 있도록 지원한다고 Leonard는 말했습니다. Airbyte의 AI 사용 사례와 관련해, 많은 기업은 Google Drive나 Salesforce와 같은 비정형 소스에서 레코드를 추출하고 해당 데이터를 레이크하우스로 이동함으로써 퍼스트파티 데이터를 AI 앱에 로드하기 위해 Airbyte 플랫폼을 활용하고 있으며, 이를 통해 사용자는 검색 증강 생성(RAG)과 파인튜닝을 수행할 수 있습니다.
이어서 Leonard는 AI 데이터 파이프라인을 더 자세히 살펴보며 추출부터 정규화, 처리, 사용에 이르는 여정을 검토했습니다. 파이프라인의 각 단계에는 다음 프로세스가 포함됩니다:
- 추출: 데이터 암호화, PII 마스킹, 푸시다운 필터, 파일 전송, 권한
- 정규화: 스키마 정규화, 데이터 정제, 중복 제거
- 처리: 강화, 요약, 사용 사례 최적화, 문서 청킹, 임베딩 계산
- 사용: 임베딩을 벡터 데이터베이스인 Milvus와 같은 쿼리 가능한 데이터 저장소에 배치
Spann은 규모 확장을 위해 구축된 고성능 오픈 소스 벡터 데이터베이스인 Zilliz의 Milvus가 가진 장점을 확장해 설명했습니다. Spann은 벡터 검색이 AI의 새로운 패러다임이라고 언급하며, “이제 이미지, 텍스트, 비디오, 문서—모든 것이 데이터이며, 벡터 검색은 이를 검색 가능하게 만든다”고 말했습니다. 실제로 IDC는 2025년에 새로 생성되는 데이터의 90%가 비정형 데이터일 것으로 예측하며, 이는 벡터 검색에 대한 중요한 필요성을 반영합니다.
벡터 데이터베이스는 RAG부터 분자 유사성 검색, 사기 및 이상 탐지, 멀티모달 유사성 검색 등에 이르기까지 다양한 사용 사례 전반에서 검색을 구동하는 역할을 합니다. 본질적으로 비정형 데이터, 그리고 그로부터 지식을 추출하는 능력은 AI 성공을 가능하게 하는 데 핵심적입니다.
2017년부터 Zilliz는 조직이 비정형 데이터를 이해하도록 돕고 있습니다. 고성능, 확장 가능, 고가용성 분산 시스템 개발에 강력한 경력을 가진 최상위 알고리즘 및 데이터베이스 엔지니어 팀이 구축했으며, 벡터 검색에 독특하게 최적화된 Zilliz는 AI와 관련된 다양한 데이터 엔지니어링 과제를 해결하기 위해 처음부터 만들어졌다고 Spann은 설명했습니다.
그 결과 Milvus는 탄력적 확장, 재사용 가능한 코드, 광범위한 통합을 제공하는 설정이 쉬운 기능 풍부한 벡터 데이터베이스이며, 강력하고 지원적인 커뮤니티가 이를 뒷받침합니다. 이어서 Spann은 웨비나 시청자들에게 Milvus가 작동하는 방식을 안내하며 그 구조, 기능 등을 자세히 설명했습니다.
AI 시대를 위한 데이터 엔지니어링을 논의하는 전체 심층 웨비나는 여기에서 아카이브 버전으로 볼 수 있습니다.
계속 읽기

What Is a Vector Lakebase?
A Vector Lakebase is a unified, lake-native data architecture for AI that combines vector-database-grade serving with open lake storage, reusable lake-level indexes, and a shared semantic layer.

Introducing Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud
We're announcing the general availability of Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud.

Optimizing Embedding Model Selection with TDA Clustering: A Strategic Guide for Vector Databases
Discover how Topological Data Analysis (TDA) reveals hidden embedding model weaknesses and helps optimize vector database performance.



