Qu’est-ce que le benchmark BEIR pour les systèmes de recherche d’information

Qu’est-ce que le benchmark BEIR pour les systèmes de recherche d’information
Analyse du benchmark BEIR pour la recherche d’information
Introduction à la recherche d’information et à BEIR
Les systèmes de RI sont conçus pour trouver des documents en réponse aux requêtes des utilisateurs. À mesure que ces systèmes ont évolué, le besoin de méthodes d’évaluation complètes pour comprendre les systèmes existants a également augmenté.
BEIR (Benchmarking IR) est un outil permettant d’évaluer les performances des systèmes de recherche sur de nombreuses tâches et types d’information. Les chercheurs ont développé BEIR pour répondre aux limites des méthodes d’évaluation existantes. BEIR offre une évaluation plus réaliste de la technologie de recherche, en particulier hors domaine.
Contrairement aux benchmarks traditionnels qui se concentrent sur des tâches ou des domaines spécifiques, BEIR est un cadre d’évaluation hétérogène qui teste de nombreux modèles de systèmes de RI dans de nombreux scénarios. Il comprend 18 jeux de données pour diverses tâches telles que la vérification des faits, la réponse aux questions et la recherche d’information biomédicale. Cette diversité permet à BEIR d’évaluer la polyvalence et la robustesse des systèmes de RI d’une manière plus proche des applications du monde réel.
L’une des principales innovations de BEIR est l’accent mis sur l’évaluation zero-shot, qui teste les performances des modèles sur des tâches pour lesquelles ils n’ont pas été spécifiquement entraînés. Cela a révélé des enseignements importants sur les forces et les faiblesses des différents modèles de RI, en particulier les défis rencontrés par les modèles de recherche dense dans les recherches hors domaine.
Dans ce qui suit, nous allons nous pencher sur les fonctionnalités de BEIR, son importance dans la recherche d’information et l’impact qu’il a sur la technologie de recherche. Nous comparerons BEIR à différentes approches, des moteurs de recherche et approches lexicales traditionnels aux modèles neuronaux modernes, et nous discuterons de ce que cela signifie pour les développeurs qui construisent des systèmes de recherche robustes et adaptables.
Qu’est-ce que BEIR ?
Même si cela ressemble à "beer" et que le logo représente deux chopes de bière, malheureusement ce n’est pas le genre de bière auquel je suis habitué, mais plutôt un type de "Bier!" totalement différent. BEIR signifie Benchmarking IR (Information Retrieval) et est un outil permettant d’évaluer les performances des systèmes de recherche d’information (systèmes de recherche) sur de nombreuses tâches et types d’information. Les chercheurs ont développé BEIR pour répondre aux limites des méthodes d’évaluation existantes. BEIR offre une évaluation plus réaliste de la technologie de recherche.
Vue d’ensemble de la collection diversifiée de jeux de données de Bier
Fonctionnalités de BEIR
Benchmarking Information Retrieval est un benchmark standard pour évaluer les performances des modèles de recherche d’information et fournit une collection diversifiée de jeux de données axés sur diverses tâches de recherche. Il répond au besoin d’une évaluation plus réaliste de la technologie de recherche à travers des tâches et des domaines variés. Voici quelques fonctionnalités clés de BEIR :
BEIR est un benchmark conçu pour évaluer la polyvalence et la robustesse des modèles de recherche d’information. Il comprend 18 jeux de données diversifiés provenant de domaines comme la bioinformatique, la finance et l’actualité, permettant de tester les modèles sur un large éventail de tâches diverses de recherche de texte, telles que la vérification des faits, la réponse aux questions, la recherche de documents et les systèmes de recommandation.
Le benchmark couvre neuf tâches de recherche distinctes, telles que la similarité** retrieval**, la recherche d’arguments et la vérification des faits, ce qui teste les modèles dans divers scénarios du monde réel. Sa capacité de test inter-domaines permet d’évaluer les modèles sur des tâches en dehors de leur domaine d’entraînement, ce qui en fait un outil précieux pour évaluer leurs capacités de généralisation.
BEIR utilise des métriques d’évaluation standardisées comme NDCG et Recall, ce qui simplifie les comparaisons entre modèles et jeux de données. Il inclut également une intégration avec des modèles populaires comme BERT, T5 et GPT, ce qui rationalise le processus de benchmarking. La nature open-source de BEIR favorise la collaboration et l’adaptation au sein de la communauté, ce qui, pour un outil de benchmarking, est important afin de l’aider à maintenir la transparence.
De plus, BEIR met l’accent sur l’évaluation zero-shot, qui mesure la capacité des systèmes de recherche d’information à fonctionner sur des tâches pour lesquelles ils n’ont pas été explicitement entraînés, fournissant ainsi des informations sur leur adaptabilité. Ses jeux de données incluent également des types de textes variés, des courts tweets aux longs articles scientifiques, imitant la diversité des contenus présents sur le Web.
BEIR permet aux chercheurs et aux développeurs d’identifier les forces et les faiblesses des algorithmes d’IR, de comparer les approches de manière équitable et de développer des technologies de recherche de base plus robustes et polyvalentes. Son évaluation complète stimule les progrès de la technologie d’IR, avec le potentiel d’améliorer les expériences de recherche dans diverses applications.
Limites
Accent mis sur la recherche de passages
Le benchmark est axé sur la recherche de passages en raison des limites de longueur des modèles basés sur les transformers. La plupart des documents dans BEIR tiennent dans la limite de 512 tokens des modèles transformer. Il existe quelques exceptions, comme les documents stockés dans le jeu de données robust04, qui contient des articles de presse d’environ 700 mots. Mais BEIR ne contient pas de documents très longs comme des PDF de plusieurs centaines de pages. Il s’agit d’un « angle mort » où de futurs benchmarks peuvent être développés.
Créer des versions plus difficiles du benchmark
À mesure que les modèles de recherche dense se sont améliorés, ils ont obtenu de bien meilleurs résultats sur BEIR. Les résultats récents montrent que la recherche lexicale (comme BM25) n’est meilleure que sur 2 jeux de données sur 14, par rapport aux résultats antérieurs où elle était meilleure sur la plupart des jeux de données. Cela soulève la question de savoir si BEIR reste un benchmark exigeant. Une discussion existe dans la communauté sur la nécessité d’un « BEIR 2 » qui disposerait de jeux de données de recherche plus difficiles afin de repousser les limites des modèles.
Modèles de recherche dense dans la recherche hors domaine
BEIR a montré que les modèles d’embeddings denses qui obtenaient de très bons résultats sur des tâches dans le domaine (jusqu’à 18 points d’amélioration) rencontrent beaucoup de difficultés dans les scénarios hors domaine. Par exemple, certains modèles denses obtenaient de bons résultats uniquement sur le jeu de données Wikipedia sur lequel ils avaient été entraînés, mais étaient moins performants que la recherche lexicale sur les 17 autres jeux de données de BEIR. Cela a conduit à de nombreuses recherches sur les raisons pour lesquelles les modèles denses rencontrent des difficultés avec les domaines inconnus. Les chercheurs ont identifié des problèmes comme un fort chevauchement entre entraînement et test dans certains jeux de données et des mots non vus. Ces observations ont stimulé des améliorations des techniques d’entraînement des modèles, notamment de meilleures façons de gérer les mots hors domaine et des benchmarks plus robustes avec une séparation claire entre les ensembles d’entraînement et de test.
Ces résultats de BEIR ont stimulé les avancées en IR, les innovations dans les modèles, l’entraînement et l’évaluation.
Pourquoi BEIR :
BEIR comble une lacune dans la manière dont la recherche est évaluée. En fournissant un ensemble de tests standard, varié et exigeant, les chercheurs et les développeurs peuvent voir les forces et les faiblesses des algorithmes de recherche actuels, comparer les approches de manière équitable et complète, et construire une technologie de recherche plus polyvalente et meilleure. De plus, BEIR les aide à voir comment les systèmes de recherche fonctionneront dans des applications réelles et diverses.
Pour les utilisateurs de moteurs de recherche Web et de technologies, les résultats de BEIR mèneront à des expériences de recherche plus précises, polyvalentes et efficaces dans toutes les applications et plateformes. Cela signifie de meilleurs résultats de recherche dans les applications quotidiennes, de la recherche Web aux requêtes de bases de données.
BEIR est un projet open source, de sorte que les chercheurs du monde entier peuvent y contribuer et en bénéficier. Cette ouverture accélérera l’amélioration de la technologie de recherche à mesure que les chercheurs s’appuieront sur BEIR et l’affineront. À mesure que BEIR s’améliorera, l’ensemble du domaine de l’IR en bénéficiera et, au final, les utilisateurs finaux auront de meilleures expériences de recherche dans toutes les applications.
Contexte de Beir
BEIR (Benchmarking IR) est le premier benchmark large de recherche d’information en zero-shot. Contrairement aux benchmarks précédents, il évalue la recherche d’information moderne, dans plusieurs domaines et types de tâches en contexte zero-shot. Les travaux précédents comme MultiReQA et KILT étaient limités en portée, à une seule tâche, à un petit corpus ou à un domaine spécifique.
Le benchmark arrive à un moment où les méthodes d’IR évoluent. Traditionnellement, les approches lexicales comme TF-IDF et BM25 étaient les méthodes dominantes de recherche de texte. Récemment, on constate un intérêt croissant pour l’utilisation de réseaux neuronaux comme Splade afin d’améliorer ou de remplacer ces méthodes. Les premières techniques neuronales visaient à améliorer les techniques de recherche d’information lexicale, comme docT5query pour l’expansion de documents et DeepCT pour la pondération des termes.
Des modèles de recherche dense ont ensuite été développés pour capturer les correspondances sémantiques et combler le fossé lexical. Ces modèles projettent les requêtes et les documents dans un espace partagé de vecteurs denses. Des modèles hybrides lexicaux-denses ont ensuite été proposés pour combiner les forces des deux approches.
Une autre ligne de recherche a exploré l’adaptation de domaine non supervisée pour l’entraînement de systèmes de recherche dense. Des modèles comme ColBERT ont également introduit des embeddings contextualisés au niveau des tokens pour la recherche.
Le re-classement utilisant des réseaux neuronaux, en particulier ceux qui utilisent le mécanisme d’attention croisée de BERT, a montré une forte amélioration des performances, mais avec un coût computationnel élevé.
BEIR cherche à déterminer dans quelle mesure ces systèmes et méthodes de recherche existants se généralisent à différents domaines et tâches, en particulier en contexte zero-shot, afin de combler le manque de compréhension de l’adaptabilité des systèmes modernes d’IR.
Logiciel et framework Beir
BEIR est un framework Python convivial qui peut être installé avec pip. Il est conçu pour faciliter l’évaluation des modèles dans les tâches d’IR. Le logiciel est fourni avec des wrappers complets pour reproduire les expériences et évaluer des modèles issus de dépôts bien connus comme Sentence-Transformers, Transformers, Anserini, DPR, Elasticsearch, ColBERT et Universal Sentence Encoder. Cette large compatibilité rend BEIR utile à la fois pour la recherche universitaire et les applications industrielles.
Le framework fournit de nombreuses métriques basées sur l’IR : Precision, Recall, Mean Average Precision (MAP), Mean Reciprocal Rank (MRR), Normalized Discounted Cumulative Gain (nDCG) pour tout top-k. Cela permet d’évaluer les modèles de recherche de manière complète.
BEIR est flexible : les utilisateurs peuvent évaluer des modèles existants sur de nouveaux jeux de données et de nouveaux modèles sur les jeux de données du benchmark. Pour résoudre le problème des jeux de données dans différents formats, BEIR introduit un format standard pour les corpus, les requêtes et les jugements de pertinence (qrels). Cette standardisation facilite le processus d’évaluation sur de nombreux jeux de données pour les chercheurs et les développeurs qui souhaitent tester leurs modèles sur différentes tâches de recherche de données.
Métrique d’évaluation utilisée dans BEIR
BEIR utilise le Normalized Discounted Cumulative Gain (nDCG@10) comme principale métrique d’évaluation. Ce choix a été fait afin d’obtenir des résultats comparables entre différents modèles et jeux de données du benchmark.
Le choix de nDCG@10 était fondé sur :
Les applications du monde réel peuvent être axées soit sur la précision, soit sur le rappel, une métrique équilibrée était donc nécessaire.
Certaines métriques comme la précision et le rappel ne prennent pas en compte le classement des résultats, ce qui est important dans les tâches de recherche d’information.
D’autres métriques tenant compte du classement, comme le rang réciproque moyen (MRR) et la précision moyenne moyenne (MAP), se limitent à des jugements de pertinence binaires, ce qui ne convient pas à toutes les tâches.
nDCG@10 peut gérer à la fois des jugements de pertinence binaires et gradués, ce qui le rend polyvalent pour différents types de tâches de recherche d’information.
L’équipe BEIR indique que nDCG@10 est une bonne métrique pour évaluer largement les différentes tâches de recherche d’information. Elle utilise l’interface Python de l’outil officiel d’évaluation TREC pour calculer cette métrique pour tous les jeux de données du benchmark.
En utilisant une seule métrique pour toutes les tâches, BEIR permet de comparer différents modèles de recherche d’information entre différents jeux de données, qu’ils utilisent des jugements de pertinence binaires ou gradués.
Principales conclusions en comparant les méthodes de recherche neuronale
Lorsque vous consultez l’article Beir (ou regardez la vidéo courte et agréable de l’un des auteurs, Nils Reimers), ils partagent certaines conclusions d’une comparaison de différentes méthodes de recherche neuronale avec BM25 (recherche lexicale).
BEIR évalue de nombreuses architectures de recherche d’information de pointe, en se concentrant sur les approches neuronales basées sur les transformers. Le benchmark utilise des checkpoints pré-entraînés accessibles publiquement et regroupe les modèles en cinq catégories : lexicaux, clairsemés, denses, à interaction tardive et de reclassement. En raison des limitations des réseaux transformer, seuls les 512 premiers morceaux de mots des documents textuels sont utilisés dans les expériences.
Les principales conclusions de l’évaluation de BEIR incluent :
Les chercheurs ont réalisé un benchmarking complet des modèles denses pour la recherche d’information (IR). Traditionnellement, les approches par embeddings étaient utilisées pour l’IR dans le domaine, où un modèle est entraîné avec des données spécifiques au domaine puis appliqué à la recherche au sein de ce même domaine. Mais les chercheurs ont exploré un défi plus intéressant : l’IR hors domaine, où un modèle pré-entraîné est appliqué à de nouveaux domaines sans être réentraîné pour les données spécifiques. Pour évaluer cela, ils ont rassemblé de nombreux jeux de données couvrant différentes tâches de recherche d’information. Par exemple, dans la recherche de tweets, la tâche consistait à associer des articles de presse à des tweets pertinents. Dans les jeux de données ArguAna et Touche-2020, la tâche était la recherche d’arguments, plus précisément trouver des contre-arguments. Le jeu de données Fever a été utilisé pour trouver des articles Wikipédia soutenant des affirmations spécifiques.
Ils ont comparé de nombreux modèles de recherche dense à un modèle de recherche lexicale de référence (BM25). Le modèle de recherche dense de Facebook fonctionnait bien sur Wikipédia, où il avait été entraîné, mais mal sur 17 autres jeux de données par rapport à BM25. Même le meilleur modèle d’embedding dense, TAS-B, ne surpassait BM25 que sur 8 jeux de données sur 18. Les modèles denses rencontrent donc de grands défis dans les tâches hors domaine. Les modèles d’embedding denses ont donc de grandes difficultés lorsqu’ils sont appliqués à des domaines inconnus. Des recherches supplémentaires sont nécessaires pour améliorer leur capacité de généralisation.
Certains modèles comme SPLADE fonctionnaient mieux dans des domaines inconnus. Mais dans de nombreux contextes, la méthode de recherche d’information la plus robuste était BM25 avec cross-encoder et le modèle de requête T5, qui a montré des résultats stables dans de nombreux domaines. À mesure que les modèles denses évoluent, les benchmarks récents montrent que la recherche lexicale surpasse encore les modèles denses dans 2 jeux de données sur 14. Certains modèles pourraient être en surapprentissage sur les jeux de données actuels du Beir Benchmark. Il est peut-être temps de créer Beir Benchmark 2 avec des jeux de données plus difficiles et plus diversifiés.
Les modèles denses fonctionnent en projetant les requêtes et les documents dans un espace vectoriel et récupèrent les documents en trouvant la correspondance vectorielle la plus proche. Cela fonctionne bien dans le domaine, mais a du mal avec les mots inconnus et hors domaine. Les chercheurs ont également constaté que de nombreux jeux de données dans le domaine présentent un chevauchement entre entraînement et test, où les requêtes de test sont vues pendant l’entraînement, d’où des performances artificiellement élevées. Les modèles denses ont du mal lorsqu’ils sont exposés à des domaines ou à des mots non vus pendant l’entraînement. Cela a conduit à davantage de recherches sur l’amélioration de la généralisation des modèles denses au-delà de leurs domaines d’entraînement.
Ensuite, les chercheurs suggèrent de disposer de meilleurs benchmarks qui séparent bien les ensembles d’entraînement et de test et comportent des documents plus longs ou des tâches de recherche plus complexes. Les recherches futures se concentreront sur des modèles capables d’obtenir de bonnes performances dans de nombreux domaines, en particulier dans la recherche hors domaine.
Conclusion
BEIR (Benchmarking IR) est un outil pour la recherche d’information. En tant que premier benchmark large et zero-shot de recherche d’information, il comble le manque en matière d’évaluation des technologies de recherche dans de nombreux domaines et tâches. BEIR, avec 18 jeux de données et 9 tâches, fournit une compréhension sans précédent de nombreuses méthodes et modèles de recherche d’information, en particulier hors domaine.
Le benchmark a montré les défis auxquels sont confrontés les modèles de recherche denses et clairsemés pour se généraliser à des domaines inconnus, ce qui a conduit à davantage de recherche et d’innovation. En montrant les forces de méthodes traditionnelles comme BM25 dans certains cas et des approches hybrides, BEIR a encouragé une vision plus équilibrée des modèles de recherche clairsemée et des capacités des systèmes.
De plus, BEIR est open source et dispose de métriques standardisées, ce qui a encouragé la collaboration dans la communauté de recherche et accéléré les progrès. À mesure que les modèles s’améliorent, la discussion sur la création d’une version plus difficile du benchmark prouve que BEIR reste pertinent et que la recherche d’information est un domaine dynamique.
Ensuite, les enseignements issus de BEIR favoriseront des technologies de recherche plus robustes, flexibles et efficaces. Celles-ci amélioreront l’expérience de recherche dans de nombreuses applications, des bases de données académiques spécialisées à la recherche web quotidienne. À mesure que le domaine progresse, BEIR prouve qu’une évaluation complète dans le monde réel est importante pour repousser les limites des systèmes de recherche d’information.
Références
Reimers, N. (2022). Évaluer la recherche d’information avec BEIR. Cohere. [Vidéo YouTube]. https://www.youtube.com/watch?v=w6_5-hAsjBQ
Thakur, N., Reimers, N., Rücklé, A., Srivastava, A., & Gurevych, I. (2021). BEIR : un benchmark hétérogène pour l’évaluation zero-shot des modèles de recherche d’information. Prépublication arXiv arXiv:2104.08663.
- Introduction à la recherche d’information et à BEIR
- Qu’est-ce que BEIR ?
- Fonctionnalités de BEIR
- Limites
- Pourquoi BEIR :
- Contexte de Beir
- Logiciel et framework Beir
- Métrique d’évaluation utilisée dans BEIR
- Principales conclusions en comparant les méthodes de recherche neuronale
- Conclusion
- Références
Contenu
Commencez gratuitement, évoluez facilement
Essayez la base de données vectorielle entièrement managée conçue pour vos applications GenAI.
Essayer Zilliz Cloud gratuitement

