Zilliz a triomphé dans le défi de recherche ANN à l’échelle du milliard de NeurIPS 2021
Le 6 décembre 2021, NeurIPS, la plus grande conférence académique mondiale sur l’IA, a annoncé les résultats de son premier défi de recherche Approximate Nearest Neighbor (ANN). L’équipe de recherche de Zilliz a remporté la première place dans la catégorie Disk-based ANN Search grâce à son algorithme d’optimisation des performances sur disque, portant la recherche ANN sur des jeux de données à l’échelle du milliard à un niveau supérieur.
Capture d’écran d’e-mail.
L’émergence des réseaux neuronaux permet d’intégrer sous forme de vecteurs d’énormes volumes de données non structurées, telles que la parole, les images et les vidéos, faisant de la recherche ANN la clé pour comprendre ces données non structurées. Mené par des experts et des chercheurs de Microsoft Research, Facebook AI Research, Carnegie Mellon University, Yandex et d’autres organisations influentes, le premier ANN Search Challenge a attiré des candidats de Tsinghua University, Nanjing University, Intel, NVIDIA, Kuaishou Technology, et bien d’autres. Au total, six jeux de données à l’échelle du milliard ont été adoptés comme jeux de données d’exemple dans le défi, et quatre d’entre eux ont été publiés par Facebook, Microsoft Turing, Microsoft Bing et Yandex spécifiquement pour cet événement.
La solution de recherche ANN sur disque Block-based ANN (BBAnn), développée par l’équipe de recherche de Zilliz, s’est classée première dans la catégorie ANN Search du défi. Ses performances ont atteint leur sommet lors de la recherche dans le jeu de données SimSearchNet++ publié par Facebook. Ce jeu de données simule une détection précise de changements subtils dans les images, posant un défi majeur consistant à récupérer tous les vecteurs situés dans un certain rayon autour du vecteur cible. Pour rendre le défi plus difficile, le nombre de résultats de requête à retourner restait incertain. Selon le résultat du test, la solution de Zilliz a récupéré 88,573 % de tous les résultats pertinents dans le jeu de données, bien au-delà de la référence de 16,274 %, marquant une avancée majeure dans la recherche ANN à l’échelle du milliard.
À l’avenir, Zilliz se consacrera à la mise en œuvre de cette avancée de recherche dans Milvus, une base de données vectorielle open source, afin de répondre aux besoins des utilisateurs dans différents scénarios d’application. Milvus est un projet diplômé de la LF AI & Data Foundation. Milvus est capable de gérer un grand nombre de jeux de données non structurées et possède un large éventail d’applications dans la découverte de nouveaux médicaments, les systèmes de recommandation, les chatbots, et bien plus encore. Zilliz continuera d’investir pour libérer la valeur cachée des énormes volumes de données non structurées pour les entreprises grâce à des solutions open source et cloud-native.
Continuer à lire

Why We Built Vector Lakebase: Rethinking Unstructured Data Architecture for AI
Vector Lakebase: a unified, lake-native data foundation for AI workloads — and an answer to what happens after vector databases succeed.

Vector Databases vs. Time Series Databases
Use a vector database for similarity search and semantic relationships; use a time series database for tracking value changes over time.

Selecting the Right ETL Tools for Unstructured Data to Prepare for AI
Learn the right ETL tools for unstructured data to power AI. Explore key challenges, tool comparisons, and integrations with Milvus for vector search.



