벡터 데이터베이스의 다음 단계: 2023년 8가지 예측
2022년은 벡터 데이터베이스에 중요한 해였습니다. 특히 Milvus 커뮤니티는 클라우드 네이티브 벡터 데이터베이스 Milvus 2.0을 출시했습니다. Vald, Weaviate, Qdrant, Vespa, Vearch, AquilaDB, Marqo와 같은 10개 이상의 오픈소스 벡터 데이터베이스 제품이 GitHub에 등장했습니다. Elastic과 Redis 같은 데이터베이스 제조사들도 경쟁에 합류하여 벡터 검색 기능을 도입했습니다. 클라우드 측면에서는 Milvus 커뮤니티를 이끄는 팀인 Zilliz가 완전 관리형 DBaaS 서비스인 Zilliz Cloud를 출시하며 Pinecone 및 Google Vertex AI와 같은 기업들과 경쟁했습니다.
자본 시장 역시 활기를 띠었으며, 여러 벡터 데이터베이스 기업이 상당한 자금을 확보해 추가 성장의 발판을 마련했습니다. 2022년에 벡터 데이터베이스로 유입된 자본과 관심은, 이 신흥 기술의 지속적인 발전과 성숙을 목격할 것으로 기대되는 2023년에 대한 저의 예측으로 이어집니다.
| 기업 | 조달 금액 | 날짜 |
|---|---|---|
| Zilliz | $60M (B+ 라운드) | 2022년 8월 |
| Pinecone | $28M (A 라운드) | 2022년 3월 |
| Weaviate | $16M (A 라운드) | 2022년 2월 |
| Qdrant | €2M (프리 시드 라운드) | 2022년 1월 |
벡터 데이터베이스 기업들의 2022년 자금 조달 현황
2023년 벡터 데이터베이스 예측
예측 #1: 벡터 데이터베이스의 차별화와 전문화
2023년에는 자본 유입과 사용 사례의 빠른 발전으로 인해 벡터 데이터베이스가 뚜렷하게 진화하며, 차별화와 전문화로 이어질 것입니다:
온라인 서빙 대 오프라인 처리: 더 작은 데이터 규모에서 높은 온라인 실시간 요구 사항을 충족하도록 설계된 기존 벡터 데이터베이스는 이제 이미지 처리 및 NLP와 같은 영역의 대규모 데이터셋을 처리하도록 적응해야 하며, 향상된 배치 처리 및 오프라인 기능이 필요해질 것입니다.
논리적 인스턴스 대 물리적 인스턴스: 이 분야는 사용 편의성과 간단한 배포에 초점을 맞춘 논리적 인스턴스와, 유연한 스토리지 및 효율적인 검색 솔루션을 제공하는 Milvus와 같은 물리적 인스턴스로 나뉘게 될 것입니다. 이러한 분화는 단순한 벡터 처리부터 복잡한 벡터 생성에 이르기까지 다양한 요구를 충족합니다.
독립형 대 분산형 클라우드 네이티브 시스템: 독립형 시스템과 분산형 클라우드 네이티브 시스템 사이의 선택은 중요해질 것입니다. 독립형 시스템은 안정성을 제공하는 반면, Milvus 2.0과 같은 분산형 클라우드 네이티브 설계는 확장성과 클라우드 기반 효율성에 적합합니다.
다양한 인덱싱 구현: 인덱싱 방법론은 다양화되고 있습니다. Google의 ScaNN 기술과 같은 새로운 발전으로 벡터 데이터베이스는 성능과 기능 면에서 진화하며, 특정 사용 사례와 효율성 요구 사항에 맞춰지고 있습니다.
이러한 추세는 다양한 애플리케이션과 데이터 규모의 특정 요구에 부합하는, 보다 맞춤화되고 전문화된 벡터 데이터베이스로의 이동을 나타냅니다.
예측 #2: 통합 쿼리 인터페이스를 향한 이동
현재 벡터 데이터베이스에는 통합 쿼리 인터페이스가 부족하며, 주로 맞춤형 Python SDK나 Restful API를 사용합니다. 그러나 Google Next 2022에서 공개된 Big Query의 BigLake와 같은 발전은, 비정형 데이터와 벡터 처리를 위한 주요 언어로 SQL을 발전시키며 중요한 변화를 시사합니다. SQL의 전통적인 사용자 기반이 딥러닝 개발자와 다르고 머신러닝에서의 성공이 엇갈렸음에도 불구하고, 벡터 데이터베이스를 위한 쿼리 언어로서의 잠재력은 주목할 만합니다.
SQL을 넘어, GraphQL 기반 쿼리 언어와 커스텀 DSL에 대한 실험도 이루어지고 있습니다. 어떤 인터페이스가 더 널리 받아들여지든, 2023년에 대한 예측은 벡터 데이터베이스 도메인에서 사실상의 표준 인터페이스가 등장하고, 여러 제품이 구현을 위해 유사한 접근 방식을 채택하게 된다는 것입니다.
예측 #3: 벡터 데이터베이스와 전통적인 데이터베이스의 추가 통합
벡터 데이터베이스는 지난 2년 동안 상당히 발전하여, FAISS를 둘러싼 단순한 래퍼였던 초기 단계를 넘어섰습니다. 이제는 스칼라 필드의 필터링 및 인덱싱 기능과 스트리밍 데이터에 대한 CRUD 작업 관리 기능을 일상적으로 제공하며, 전통적인 데이터베이스의 파서, 옵티마이저, 메모리, 동시성 관리와 같은 요소를 통합하고 있습니다. 많은 OLAP 및 NoSQL 데이터베이스가 벡터 검색 기능을 통합하여 이 분야의 중요한 플레이어가 되고 있습니다.
"모든 것에 맞는 하나의 해법은 없다"는 믿음에도 불구하고, 전통적인 데이터베이스가 인적 및 아키텍처적 한계로 인해 벡터 검색에서 어려움을 겪고 있는 가운데, 2023년에는 더 많은 전통적인 데이터베이스 제조사가 그 잠재력에 이끌려 벡터 검색 영역에 진입할 가능성이 높습니다. 반면 벡터 데이터베이스는 전통적인 데이터베이스 영역에서 점점 더 많은 것을 배우며, 핵심을 AI 인프라에서 보다 데이터베이스 지향적인 기능으로 전환하고 있습니다. 이러한 변화는 더 범용적이고 안정적인 벡터 검색 솔루션에 대한 필요성에 의해 주도됩니다. 따라서 2023년에는 전통적인 데이터베이스 배경(트랜잭션 처리, 애플리케이션 처리, 검색, 캐싱 포함)을 가진 인재들이 벡터 데이터베이스 분야로 유입될 것으로 예상합니다.
예측 #4: 벡터 데이터베이스의 상당한 비용 절감
2023년에는 벡터 데이터베이스가 3-5배의 비용 절감을 경험할 것으로 예측됩니다. 비용과 성능이 벡터 검색이 전통적인 키워드 검색을 뛰어넘는 데 중요한 장벽이 되어 왔기 때문에, 이러한 변화는 매우 중요합니다. 현재 대부분의 벡터 데이터베이스는 메모리에만 의존합니다. 수백억 규모의 벡터 데이터를 저장하려면 수십 테라바이트 수준의 메모리 용량이 필요합니다.
이러한 비용 절감에 기여하는 요인은 여러 가지가 있습니다:
클라우드에서 ARM 아키텍처의 광범위한 사용: ARM의 단순한 연산 성능은 X86보다 2-3배 더 나은 비용 효율성을 제공합니다.
이기종 하드웨어의 성장: 이러한 시스템은 GPU의 메모리/스토리지 및 대역폭 기능을 능가합니다.
양자화 기술의 발전: 특히 벡터 검색에 4비트 양자화를 적용하는 것입니다.
Disk Anns 인덱스 연구에 대한 집중: 주류 연구 방향으로 부상하고 있습니다.
NVMe 디스크 성능: AIO 및 IO_URING과 같은 기술을 활용하여 백만 수준의 IOPs를 달성합니다.
벡터 데이터베이스에 대한 더 깊은 이해: 전통적인 데이터베이스와 유사한 메타데이터 및 프루닝 기술을 활용하여 매번 모든 샤드를 쿼리해야 할 필요성을 줄입니다.
머신 러닝 기반 인덱스 및 모델 파라미터 선택: 이 접근 방식은 처음으로 프로덕션에 구현될 것입니다.
벡터 데이터의 온도 특성: 전통적인 스칼라 데이터와 마찬가지로, 벡터 데이터도 핫/콜드 특성을 보입니다.
이러한 발전은 벡터 데이터베이스에 유망한 한 해를 시사하며, 이를 더 비용 효율적이고 효율적으로 만들 것입니다.
예측 #5: 최초의 서버리스 벡터 데이터베이스 등장
2023년에는 최초의 서버리스 벡터 데이터베이스가 도입될 것으로 예상합니다. 서버리스 아키텍처는 유연성과 온디맨드 과금을 제공하며, 특히 클라우드 호스팅 벡터 데이터베이스 서비스에 매력적입니다. 이 기술은 오프라인 및 온라인 프로세스를 포함하고 멀티테넌트 환경에서 부하 변동을 자주 겪는 벡터 검색의 복잡한 특성에 적합합니다. 서버리스는 사용자를 위한 용량 평가와 비즈니스 격리를 단순화합니다.
서버리스 벡터 데이터베이스는 아직 진화 중이며 성숙 단계에 도달하기까지 갈 길이 남아 있지만, AWS Aurora의 컨테이너 기반 동적 확장 가능 독립형 시스템과 유사한 초기 발전 가능성이 있습니다. 그러나 진정한 분산형 서버리스 벡터 데이터베이스의 완전한 실현은 아직 다소 시간이 걸릴 수 있습니다.
예측 #6: 벡터 데이터베이스를 위한 오픈소스 도구의 부상
2023년에는 벡터 데이터베이스에 맞춤화된 오픈소스 도구의 부상을 볼 수 있을 것으로 예상됩니다. 벡터 데이터의 고유한 특성은 기존 데이터 표현 방식을 넘어서는 혁신적인 도구의 생성을 요구합니다. 이러한 도구는 벡터 데이터의 분포와 쿼리 경로를 포함해 벡터 데이터를 표시하는 더 직관적이고 시각적인 방법을 제공할 것입니다.
데이터 전송 도구의 개발도 핵심 초점이 될 것입니다. 이러한 도구는 데이터 백업, 마이그레이션 및 가져오기 기능을 향상시켜 벡터 데이터베이스의 다양성이 커지는 문제를 해결할 것입니다. Spark, PyTorch, TensorFlow와 같은 플랫폼에서 생성되는 대규모 벡터 데이터의 흐름을 관리하고 서로 다른 데이터 유형을 연결하는 데 중요한 역할을 하며, 다양한 클라우드와 데이터 센터 전반에서 원활한 통합을 촉진할 것입니다.
예측 #7: 벡터 데이터베이스에서 AI for Database (AI4DB)의 초기 도입
2023년에는 벡터 데이터베이스가 AI for Database (AI4DB) 기술의 실용적 구현을 선도할 것입니다. AI4DB는 수년 동안 데이터베이스 분야의 개념으로 존재해 왔지만, 광범위한 도입은 쉽지 않았습니다. 주요 장애물은 관계형 데이터베이스의 높은 정확도와 설명 가능성 요구였으며, 실제 사용 사례에서는 아주 작은 비율의 부정확성도 AI 애플리케이션을 저해할 수 있습니다.
그러나 벡터 데이터베이스는 본질적으로 확률적 최적화에 기반해 작동하며, 절대적인 정확도보다 재현율에 더 중점을 둡니다. 이러한 특성은 매개변수 자동 조정, 쿼리 문 재작성, 학습된 인덱스 사용과 같은 AI4DB의 더 적극적인 적용을 가능하게 합니다. 테스트에 따르면 쿼리 매개변수에 모델 예측을 사용하면 대규모 데이터셋에서 성능을 두 배 이상 향상시킬 수 있습니다. 데이터셋과 소규모 쿼리 집합을 기반으로 인덱스와 쿼리 매개변수를 최적화하면 훨씬 더 큰 개선을 가져올 가능성이 높습니다.
예측 #8: 오픈소스 Milvus에서 등장하는 두 번째 상업 회사
2023년에는 오픈소스 Milvus 벡터 데이터베이스를 활용하는 새로운 상업적 벤처의 출시를 볼 수 있을 것으로 예상됩니다. Milvus는 전 세계적으로 선도적이고 가장 발전된 클라우드 네이티브 벡터 데이터베이스 중 하나입니다. Hadoop, Presto, Clickhouse와 같은 성공적인 오픈소스 프로젝트처럼, Milvus는 상업적 주체들이 그 기반에 기여하고 이를 바탕으로 구축하도록 영감을 줄 것입니다. 벡터 데이터베이스 프로젝트를 처음부터 시작하는 일이 점점 더 어려워지는 한편, Milvus와 같은 벡터 데이터베이스를 기반으로 SaaS (Software as a Service)를 개발할 잠재력은 여전히 큽니다. 이러한 추세는 더 많은 기여자들이 오픈소스 커뮤니티에 참여하고, Milvus 프로젝트에서 협력하며, 상업적 기회를 모색하면서 계속될 가능성이 높습니다.
맺음말
최근 몇 년 동안 GPU와 특수 하드웨어를 포함한 컴퓨팅 성능의 발전에 크게 힘입어 벡터 데이터베이스의 기능과 사용 사례가 크게 확장되었습니다. 2023년을 내다보면, 업계와 오픈소스 커뮤니티에 매우 기대되는 해가 될 것으로 보입니다. 지속적인 혁신, 성장, 협업의 시간이 될 것을 약속합니다.
비록 간략하지만, 이 예측 시리즈는 벡터 데이터베이스의 미래를 엿볼 수 있도록 하며, 앞으로 다가올 흥미로운 발전과 기회를 조명하는 것을 목표로 합니다. 2023년으로 나아가면서 이 분야의 전망은 유망하며, 기술의 역동적이고 진화하는 본질을 보여줍니다. 벡터 데이터베이스에서 내년이 우리에게 무엇을 가져다줄지 기대해 봅시다. 2023년에 만나요!
계속 읽기

What Is a Vector Lakebase?
A Vector Lakebase is a unified, lake-native data architecture for AI that combines vector-database-grade serving with open lake storage, reusable lake-level indexes, and a shared semantic layer.

Why Not All VectorDBs Are Agent-Ready
Explore why choosing the right vector database is critical for scaling AI agents, and why traditional solutions fall short in production.

VidTok: Rethinking Video Processing with Compact Tokenization
VidTok tokenizes videos to reduce redundancy while preserving spatial and temporal details for efficient processing.



