ML 관리의 과제 탐색: 성공을 위한 도구와 인사이트
머신러닝(ML)이 엄청난 속도로 계속 발전함에 따라, 방대한 데이터셋과 모델을 관리하고 버전 관리하는 복잡성도 기하급수적으로 증가했습니다. 개발자들은 소프트웨어 개발에서 버전 관리를 위해 오랫동안 Git 같은 도구에 의존해 왔지만, 머신러닝의 고유한 과제에는 더 전문화된 솔루션이 필요합니다. 코드베이스를 비교적 쉽게 버전 관리하고 관리할 수 있는 소프트웨어와 달리, ML models, datasets, 그리고 아티팩트에는 버전 관리와 관리를 위한 통일된 업계 표준이 없는 경우가 많습니다.
Zilliz가 주최한 최근 Unstructured Data Meetup에서 XetHub(현재 HuggingFace에 인수됨)의 공동 창업자인 Rajat Arya는 그와 그의 팀이 ML 버전 관리와 관리의 이러한 공백을 어떻게 해결했는지 논의했습니다. 그의 팀은 페타바이트 규모의 데이터를 처리할 수 있도록 Git을 확장한 도구인 XetHub를 개발했습니다. 네, 제대로 읽으셨습니다—페타바이트 규모의 데이터입니다. 하지만 왜 이것이 필요했을까요? 어떤 이점을 가져오며, 어떻게 작동할까요? 벡터 데이터베이스와는 어떤 관련이 있을까요? Arya의 인사이트를 살펴보고 핵심 내용을 풀어보겠습니다.
Rajat의 발표 다시 보기
머신러닝 개발의 페인 포인트
머신러닝 개발의 주요 장애물 중 하나는 전체 ML 파이프라인을 포괄하는 종합적인 도구가 없다는 점입니다. 특정 작업을 위한 도구는 많지만, 엔드투엔드 프로세스를 효율적으로 처리하는 솔루션에는 큰 공백이 있습니다. 다음은 몇 가지 핵심 페인 포인트입니다:
확장성
100페타바이트 이상까지 확장될 수 있는 데이터셋을 관리하는 것은 엄청난 과제이며, 특히 기존 도구가 작업할 수 있는 파일 수에 제한을 둘 때 더욱 그렇습니다.
데이터 관리
리포지토리의 불변 스냅샷을 생성하는 것은 데이터 무결성과 쉬운 버전 관리를 보장하는 데 매우 중요합니다. 이 기능이 없으면 변경 사항을 추적하고 일관성을 유지하기가 어려워집니다.
협업
데이터 과학자와 엔지니어 간의 원활한 협업을 촉진하는 것은 필수적입니다. 소프트웨어 개발에서 소스 컨트롤이 가져온 혁신은 ML로 완전히 확장되지 않았으며, ML에서는 표준화된 도구의 부족으로 인해 협업이 종종 장애물에 직면합니다.
관측 가능성
모델과 데이터셋에서 변경이 어떻게, 언제 발생하는지 이해하는 것은 ML 시스템을 디버깅하고 개선하는 데 매우 중요합니다. 이러한 변경 사항에 대한 가시성이 없으면 팀은 효과적으로 반복 개선하는 데 어려움을 겪습니다.
연구에서 실제 ML 애플리케이션으로: 모든 것이 달라집니다
초기에는 ML과 AI가 주로 연구 중심이었으며, 정적이고 종종 structured datasets를 다루는 학술적 목표를 가지고 있었습니다. 목표는 정확도나 오류율 같은 지표를 개선하는 것이었고, 이는 통제된 연구 환경에서는 잘 작동했습니다.
하지만 ML이 학계에서 산업계로 전환되면서 환경은 극적으로 변했습니다:
정적 데이터셋 vs. 동적 데이터셋
학술 ML은 종종 정적 데이터셋을 다루지만, 산업 ML은 끊임없이 변화하는 데이터를 포함하며, 때로는 매시간 업데이트되기도 합니다. 이러한 동적 특성에는 지속적인 업데이트를 원활하게 처리할 수 있는 도구가 필요합니다.
정형 데이터 vs. 비정형 데이터
학술 연구는 구조화된 데이터에 초점을 맞추는 경우가 많지만, 실제 애플리케이션에서는 비정형 데이터를 다루는 일이 빈번합니다. 이러한 변화는 더 정교한 데이터 처리 및 핸들링 기법을 요구합니다. 이러한 비정형 데이터를 관리하기 위해 데이터 저장, 인덱싱, 검색을 위한 Milvus 및 Zilliz Cloud(완전 관리형 Milvus)와 같은 목적 특화 벡터 데이터베이스가 필요합니다.
증가하는 모델 복잡성
ML 모델은 더 많은 매개변수와 더 깊은 아키텍처를 갖추며 점점 더 복잡해지고 있습니다. 이러한 복잡한 모델을 관리하려면 모델과 함께 확장할 수 있는 도구가 필요합니다.
애플리케이션 코드와의 통합
산업 환경에서 ML 모델은 애플리케이션 코드와 원활하게 통합되어야 하며, 이를 위해 마찰 없이 함께 작동하는 패키지와 프레임워크의 응집력 있는 생태계가 필요합니다.
XetHub으로 머신 러닝을 위한 Git 기능 확장
XetHub은 대규모 데이터셋과 모델을 효율적으로 관리하도록 Git의 기능을 확장하여 확장성 문제를 해결합니다. 다음은 XetHub이 차이를 만들어내는 방식입니다:
파일 수 제한 없음: 기존 Git은 많은 수의 파일을 처리하는 데 어려움을 겪지만, XetHub은 이러한 제한을 제거하여 파일 수와 관계없이 원활한 확장을 가능하게 합니다.
불변 스냅샷: XetHub은 불변 스냅샷을 생성하여 데이터 일관성과 재현성을 보장합니다. 이는 견고한 ML 개발에 필수적입니다.
효율적인 데이터 관리: XetHub은 대규모 데이터셋을 전송하는 대신 메타데이터와 포인터를 관리하여 시스템을 더 빠르고 효율적으로 만들고, 시간과 리소스를 모두 절약합니다.
머신 러닝 프로젝트에서 관찰 가능성 달성
관찰 가능성은 ML 모델과 시스템에 매우 중요하며, 모델을 디버그하고 반복 개선하며 향상시키는 데 필요한 가시성을 제공합니다. ML 프로젝트에서 관찰 가능성을 강화하기 위한 몇 가지 제안은 다음과 같습니다:
데이터 요약
데이터에서 시작하세요. 데이터와 특징에 대한 원패스의 개략적인 요약을 생성하세요. 이는 시간이 지남에 따라 데이터셋의 변화를 이해할 수 있게 해주기 때문에 매우 중요합니다. 예를 들어, 데이터셋 A가 서로 다른 시점에서 서로 다른 분포를 가진다면, 요약 정보를 통해 이러한 변화에 기반한 정보에 입각한 결정을 내릴 수 있습니다.
모델 지표와 동작
모델의 지표뿐만 아니라 모델이 어떻게 동작하는지도 저장하세요. 예를 들어, ML 모델의 특징 중요도를 추적하면 어떤 특징이 예측을 주도하는지 확인할 수 있습니다. 특징 중요도의 변화는 학습 데이터의 변화나 아키텍처 수정 사항을 나타낼 수 있습니다. 모델에 대한 이러한 깊은 이해는 모델을 빠르게 디버그하고 개선할 수 있도록 보장합니다.
컴퓨트와 운영
컴퓨트는 ML 관찰 가능성에 필수적입니다. 데이터, 코드, 아티팩트 또는 기타 자산에 대한 모든 작업은 각 커밋이나 변경 사항마다 저장되어야 합니다. 이러한 포괄적인 추적은 완전한 ML 관찰 가능성을 가능하게 하여, 동일한 프로세스의 다양한 실행 전반에서 효율성, 추적 가능성, 재현성을 보장합니다.
현대 머신 러닝에서 벡터 데이터베이스의 역할
Milvus 및 Zilliz Cloud(완전 관리형 Milvus)와 같은 벡터 데이터베이스는 텍스트, 비디오, 오디오, 이미지와 같은 비정형 데이터의 수치 표현(벡터 임베딩이라고도 함)인 고차원 데이터를 저장, 인덱싱, 검색하는 데이터 관리 시스템의 한 유형입니다. 이들은 유사도 검색, 시맨틱 검색, 추천 시스템, 검색 증강 생성(RAG) 및 기타 많은 사용 사례에 널리 사용됩니다.
ML 모델과 데이터셋이 점점 더 복잡해짐에 따라, 방대한 양의 고차원 데이터를 관리하고 검색하는 일은 갈수록 더 어려워지고 있습니다. 벡터 데이터베이스는 이러한 과제를 해결하며, 전통적인 데이터베이스로는 따라올 수 없는 솔루션을 제공합니다.
검색 증강 생성(RAG)
벡터 데이터베이스의 가장 흥미로운 활용 사례 중 하나는 검색 증강 생성(RAG)입니다. 이 기법은 대규모 언어 모델(LLMs)의 강력함과 효율적인 벡터 데이터 검색을 결합합니다. RAG 구성에서는 입력 쿼리가 OpenAI의 텍스트 임베딩 모델과 같은 머신러닝 모델을 사용해 벡터로 변환되고, Milvus.와 같은 벡터 데이터베이스에 저장된 방대한 벡터 컬렉션을 대상으로 검색됩니다. 가장 관련성 높은 결과가 검색되어 LLM에 입력되며, 이를 통해 LLM은 더 정확하고 문맥에 적합한 응답을 생성할 수 있습니다. 이 접근 방식은 LLM의 환각 문제를 완화할 뿐만 아니라, 데이터 보안 문제를 걱정하지 않고도 비공개 또는 독점 데이터셋의 잠재력을 활용할 수 있게 합니다.
연구와 산업 간의 간극 메우기
연구 중심의 ML에서 실제 애플리케이션으로 전환하는 과정에는 종종 비정형적이고 동적인 데이터를 다루는 일이 포함됩니다. 벡터 데이터베이스는 이러한 과제를 처리하는 데 독보적으로 적합하며, ML 모델이 최신 데이터에 지속적으로 적응할 수 있도록 합니다. 이러한 적응성은 기본 데이터가 변화하더라도 모델이 계속 관련성과 효과를 유지하도록 보장합니다.
예를 들어, 제품 설명과 고객 리뷰가 지속적으로 업데이트되는 전자상거래에서는 Milvus와 같은 벡터 데이터베이스가 가장 관련성 높은 정보를 빠르게 검색하여, ML 모델이 최신 추천과 인사이트를 제공할 수 있게 합니다.
XetHub과 같은 도구와의 원활한 통합
XetHub의 페타바이트 규모 데이터 관리 능력은 벡터 데이터베이스의 강점을 보완합니다. 불변 스냅샷을 생성하고 메타데이터를 효율적으로 관리함으로써, XetHub은 대규모 ML 프로젝트가 확장되더라도 데이터 무결성과 버전 관리를 유지하도록 보장합니다. 벡터 데이터베이스는 다양한 머신러닝 모델 및 XetHub과 같은 도구와 통합될 수 있으며, 특히 정보 검색의 정확성과 관련성이 매우 중요한 RAG와 같은 시나리오에서 ML 모델의 개발과 배포를 지원합니다.
결론
Rajat Arya의 논의는 머신러닝에서의 중요한 과제와 모델 및 데이터를 관리하고 버전 관리하기 위한 더 나은 도구의 필요성을 강조했습니다. XetHub은 Git의 기능을 확장하여 대규모 데이터셋을 효율적으로 처리함으로써 이러한 요구를 해결합니다.
머신러닝이 계속 발전함에 따라, 관측 가능성과 데이터 관리를 위한 강력한 도구를 갖추는 것이 중요해집니다. XetHub과 같은 솔루션을 벡터 데이터베이스 및 머신러닝 모델과 결합함으로써, ML 프로젝트의 효과를 높이고 프로젝트가 잘 관리되며 새로운 데이터에 적응할 수 있도록 보장할 수 있습니다. 이러한 조합은 연구에서 실제 애플리케이션으로의 전환을 더욱 원활하게 지원하며, AI 개발을 더 실용적이고 신뢰할 수 있게 만듭니다.
추가 자료
YouTube에서 Rajat Arya의 Meetup 강연 다시 보기.
논문: Git is for Data
계속 읽기

A Few Notes from Databricks Data + AI Summit 2026: Why the Data Layer Matters Again
James Luan shares notes from Databricks Data + AI Summit 2026 on why production AI is pushing the data layer back to the center of infrastructure.

What Is a Vector Lakebase?
A Vector Lakebase is a unified, lake-native data architecture for AI that combines vector-database-grade serving with open lake storage, reusable lake-level indexes, and a shared semantic layer.

Why We Built Vector Lakebase: Rethinking Unstructured Data Architecture for AI
Vector Lakebase: a unified, lake-native data foundation for AI workloads — and an answer to what happens after vector databases succeed.



