Zilliz, NeurIPS 2021의 10억 규모 ANN 검색 챌린지에서 우승하다
2021년 12월 6일, 세계 최고 AI 학술 컨퍼런스인 NeurIPS는 첫 Approximate Nearest Neighbor (ANN) Search Challenge의 결과를 발표했습니다. Zilliz 연구팀은 Disk Performance Optimization Algorithm을 통해 Disk-based ANN Search 트랙에서 1위를 차지했으며, 수십억 규모 데이터셋에서의 ANN 검색을 한층 더 높은 수준으로 끌어올렸습니다.
이메일 스크린샷.
신경망의 등장은 음성, 이미지, 비디오와 같은 방대한 비정형 데이터를 벡터로 임베딩할 수 있게 했고, ANN 검색은 이러한 비정형 데이터를 이해하는 핵심이 되었습니다. Microsoft Research, Facebook AI Research, Carnegie Mellon University, Yandex 및 기타 영향력 있는 기관의 전문가와 학자들이 주도한 첫 ANN Search Challenge에는 Tsinghua University, Nanjing University, Intel, NVIDIA, Kuaishou Technology 등에서 참가자들이 모였습니다. 총 6개의 수십억 규모 데이터셋이 챌린지의 예시 데이터셋으로 채택되었으며, 그중 4개는 Facebook, Microsoft Turing, Microsoft Bing, Yandex가 이 행사를 위해 특별히 공개했습니다.
Zilliz 연구팀이 개발한 Disk-based ANN Search Solution Block-based ANN (BBAnn)은 이 Challenge의 ANN Search 트랙에서 1위를 차지했습니다. 이 솔루션은 Facebook이 공개한 SimSearchNet++ 데이터셋에서 검색 중 최고 성능을 기록했습니다. 이 데이터셋은 이미지의 미묘한 변화를 정확하게 감지하는 것을 시뮬레이션하며, 대상 벡터 주변의 특정 반경 내 모든 벡터를 검색해야 하는 큰 과제를 제시합니다. 챌린지를 더 어렵게 만들기 위해 반환해야 할 쿼리 결과 수는 불확실하게 유지되었습니다. 테스트 결과에 따르면, Zilliz의 솔루션은 데이터셋 내 모든 관련 결과의 88.573%를 검색해냈으며, 이는 기준선인 16.274%를 훨씬 뛰어넘는 수치로, 수십억 규모 ANN 검색에서의 거대한 돌파구를 의미합니다.
앞으로 Zilliz는 다양한 애플리케이션 시나리오의 사용자 요구를 충족하기 위해 이 연구 성과를 Milvus, 즉 open source vector database에 구현하는 데 전념할 것입니다. Milvus는 LF AI & Data Foundation의 졸업 프로젝트입니다. Milvus는 대량의 비정형 데이터셋을 관리할 수 있으며, 신약 개발, 추천 시스템, 챗봇 등 다양한 분야에 폭넓게 적용됩니다. Zilliz는 오픈 소스 및 클라우드 네이티브 솔루션을 통해 기업을 위한 방대한 비정형 데이터의 숨겨진 가치를 발굴하는 데 계속 투자할 것입니다.
계속 읽기

What Is a Vector Lakebase?
A Vector Lakebase is a unified, lake-native data architecture for AI that combines vector-database-grade serving with open lake storage, reusable lake-level indexes, and a shared semantic layer.

Vector Lakebase: End the AI Data Silo
Learn how Vector Lakebase unifies vector search, data lakes, and AI data operations so teams can serve RAG and agents without copy-and-sync pipelines.

From Vector Database to Vector Lakebase
Zilliz offers a fully managed Vector Lakebase powered by Milvus, unifying real-time vector search, lake-scale discovery, and Al data operations.



