Qué es el benchmark BEIR para sistemas de recuperación de información

Qué es el benchmark BEIR para sistemas de recuperación de información
Análisis del benchmark BEIR para recuperación de información
Introducción a la recuperación de información y BEIR
Los sistemas de RI están diseñados para encontrar documentos en respuesta a las consultas de los usuarios. A medida que estos sistemas han evolucionado, también lo ha hecho la necesidad de métodos de evaluación integrales para comprender los sistemas existentes.
BEIR (Benchmarking IR) es una herramienta para evaluar qué tan bien funcionan los sistemas de búsqueda en muchas tareas y tipos de información. Los investigadores desarrollaron BEIR para abordar las limitaciones de los métodos de evaluación existentes. BEIR es una evaluación más realista de la tecnología de búsqueda, especialmente fuera del dominio.
A diferencia de los benchmarks tradicionales que se centran en tareas o dominios específicos, BEIR es un marco de evaluación heterogéneo que prueba muchos modelos de sistemas de RI en numerosos escenarios. Cuenta con 18 conjuntos de datos para diversas tareas, como verificación de hechos, respuesta a preguntas y recuperación de información biomédica. Esta diversidad permite a BEIR evaluar la versatilidad y solidez de los sistemas de RI de una manera más parecida a las aplicaciones del mundo real.
Una de las innovaciones clave de BEIR es su enfoque en la evaluación zero-shot, que prueba qué tan bien funcionan los modelos en tareas para las que no fueron entrenados específicamente. Esto ha mostrado conocimientos importantes sobre las fortalezas y debilidades de diferentes modelos de RI, especialmente los desafíos que enfrentan los modelos de recuperación densa en búsquedas fuera del dominio.
A continuación profundizaremos en las características de BEIR, su importancia en la recuperación de información y el impacto que tiene en la tecnología de búsqueda. Compararemos BEIR con diferentes enfoques, desde motores de búsqueda y léxicos tradicionales hasta modelos neuronales modernos, y discutiremos qué significa para los desarrolladores que crean sistemas de búsqueda robustos y adaptables.
¿Qué es BEIR?
Aunque suena como "beer" y el logotipo son dos jarras de cerveza, desafortunadamente no es el tipo de cerveza al que estoy acostumbrado, sino un tipo totalmente diferente de "Bier". BEIR significa Benchmarking IR (Information Retrieval) y es una herramienta para evaluar qué tan bien funcionan los sistemas de recuperación de información (sistemas de búsqueda) en muchas tareas y tipos de información. Los investigadores desarrollaron BEIR para abordar las limitaciones de los métodos de evaluación existentes. BEIR es una evaluación más realista de la tecnología de búsqueda.
Descripción general de la diversa colección de conjuntos de datos de Bier
Características de BEIR
Benchmarking Information Retrieval es un benchmark estándar para evaluar el rendimiento de los modelos de recuperación de información y proporciona una colección diversa de conjuntos de datos que se centran en varias tareas de recuperación. Aborda la necesidad de una evaluación más realista de la tecnología de búsqueda en diversas tareas y dominios. Estas son algunas características clave de BEIR:
BEIR es un benchmark diseñado para evaluar la versatilidad y solidez de los modelos de recuperación de información. Presenta 18 conjuntos de datos diversos de dominios como bioinformática, finanzas y noticias, lo que permite probar los modelos en una amplia variedad de tareas diversas de recuperación de texto, como verificación de hechos, respuesta a preguntas, recuperación de documentos y sistemas de recomendación.
El benchmark cubre nueve tareas de recuperación distintas, como recuperación de similitud, recuperación de argumentos y verificación de hechos, lo que prueba los modelos en varios escenarios del mundo real. Su capacidad de pruebas entre dominios permite evaluar los modelos en tareas fuera de su dominio de entrenamiento, lo que lo convierte en una herramienta valiosa para evaluar sus capacidades de generalización.
BEIR utiliza métricas de evaluación estandarizadas como NDCG y Recall, lo que simplifica las comparaciones entre modelos y conjuntos de datos. También incluye integración con modelos populares como BERT, T5 y GPT, lo que agiliza el proceso de benchmarking. La naturaleza open-source de BEIR fomenta la colaboración y la adaptación de la comunidad, lo cual, para una herramienta de benchmarking, es importante para ayudarla a mantener la transparencia.
Además, BEIR hace hincapié en la evaluación zero-shot, que mide qué tan bien se desempeñan los sistemas de recuperación en tareas para las que no fueron entrenados explícitamente, proporcionando información sobre su adaptabilidad. Sus conjuntos de datos también incluyen tipos de texto variados, desde tweets breves hasta extensos artículos científicos, imitando la variedad de contenido que se encuentra en la web.
BEIR permite a investigadores y desarrolladores identificar fortalezas y debilidades en los algoritmos de IR, comparar enfoques de manera justa y desarrollar tecnologías de búsqueda de referencia más robustas y versátiles. Su evaluación integral impulsa avances en la tecnología de IR, lo que potencialmente mejora las experiencias de búsqueda en diversas aplicaciones.
Limitaciones
Enfoque en la recuperación de pasajes
El benchmark se centra en la recuperación de pasajes debido a las limitaciones de longitud de los modelos basados en transformers. La mayoría de los documentos en BEIR caben dentro del límite de 512 tokens de los modelos transformer. Hay algunas excepciones, como los documentos almacenados en el conjunto de datos robust04, que contiene artículos de noticias de alrededor de 700 palabras. Pero BEIR no tiene documentos muy largos, como PDFs con cientos de páginas. Este es un “punto ciego” donde se pueden desarrollar benchmarks futuros.
Crear versiones más difíciles del benchmark
A medida que los modelos de recuperación densa han mejorado, han tenido un desempeño mucho mejor en BEIR. Resultados recientes muestran que la búsqueda léxica (como BM25) solo es mejor en 2 de 14 conjuntos de datos, en comparación con resultados anteriores en los que era mejor en la mayoría de los conjuntos de datos. Esto plantea la pregunta de si BEIR sigue siendo un benchmark desafiante. Hay una discusión en la comunidad sobre la necesidad de un “BEIR 2” que tenga conjuntos de datos de recuperación más desafiantes para llevar los modelos al límite.
Modelos de recuperación densa en búsquedas fuera del dominio
BEIR mostró que los modelos de embeddings densos que se desempeñaban muy bien en tareas dentro del dominio (hasta 18 puntos de mejora) tienen muchas dificultades en escenarios fuera del dominio. Por ejemplo, algunos modelos densos tuvieron un buen desempeño solo en el conjunto de datos de Wikipedia en el que fueron entrenados, pero fueron peores que la búsqueda léxica en los otros 17 conjuntos de datos de BEIR. Esto condujo a mucha investigación sobre por qué los modelos densos tienen dificultades con dominios desconocidos. Los investigadores encontraron problemas como una alta superposición entre entrenamiento y prueba en algunos conjuntos de datos y palabras no vistas. Estos conocimientos han impulsado mejoras en las técnicas de entrenamiento de modelos, incluyendo una mejor manera de manejar palabras fuera del dominio y benchmarks más robustos con una separación clara entre los conjuntos de entrenamiento y prueba.
Estos resultados de BEIR han impulsado avances en IR, innovaciones en modelos, entrenamiento y evaluación.
Por qué BEIR:
BEIR llena el vacío en la forma en que se evalúa la búsqueda. Al proporcionar un conjunto de pruebas estándar, variado y desafiante, los investigadores y desarrolladores pueden ver las fortalezas y debilidades de los algoritmos de búsqueda actuales, comparar enfoques de manera justa e integral y construir tecnología de búsqueda más versátil y mejor. Además, BEIR les ayuda a ver cómo se desempeñarán los sistemas de búsqueda en aplicaciones diversas del mundo real.
Para los usuarios de motores de búsqueda web y tecnología, los resultados de BEIR conducirán a experiencias de búsqueda más precisas, versátiles y eficientes en todas las aplicaciones y plataformas. Esto significa mejores resultados de búsqueda en aplicaciones cotidianas, desde la búsqueda web hasta las consultas de bases de datos.
BEIR es un proyecto de código abierto, por lo que investigadores de todo el mundo pueden contribuir y beneficiarse de él. Esta apertura acelerará la mejora de la tecnología de búsqueda a medida que los investigadores desarrollen y perfeccionen BEIR. A medida que BEIR mejore, todo el campo de IR se beneficiará y, en última instancia, los usuarios finales tendrán mejores experiencias de búsqueda en todas las aplicaciones.
Antecedentes de Beir
BEIR (Benchmarking IR) es el primer benchmark amplio de recuperación de información zero-shot. A diferencia de benchmarks anteriores, evalúa la recuperación de información moderna, en múltiples dominios y tipos de tareas en un entorno zero-shot. Trabajos anteriores como MultiReQA y KILT tenían un alcance limitado, una sola tarea, un corpus pequeño o un dominio específico.
El benchmark llega en un momento en que los métodos de IR están evolucionando. Tradicionalmente, los enfoques léxicos como TF-IDF y BM25 eran los métodos dominantes de recuperación de texto. Recientemente hay un creciente interés en usar redes neuronales como Splade para mejorar o reemplazar estos métodos. Las primeras técnicas neuronales se utilizaban para mejorar las técnicas léxicas de recuperación de información, como docT5query para la expansión de documentos y DeepCT para la ponderación de términos.
Luego se desarrollaron modelos de recuperación densa para capturar coincidencias semánticas y cerrar la brecha léxica. Estos modelos mapean consultas y documentos en un espacio compartido de vectores densos. Después surgieron modelos híbridos léxico-densos para combinar las fortalezas de ambos.
Otra línea de investigación exploró la adaptación de dominio no supervisada para entrenar recuperadores densos. También modelos como ColBERT introdujeron embeddings contextualizados a nivel de token para la recuperación.
El re-ranking usando redes neuronales, especialmente aquellas que utilizan el mecanismo de atención cruzada de BERT, mostró un gran aumento de rendimiento, pero con un alto costo computacional.
BEIR intenta ver cómo estos sistemas y métodos de recuperación existentes generalizan en diferentes dominios y tareas, especialmente en un entorno zero-shot, para cerrar la brecha en la comprensión de la adaptabilidad de los sistemas modernos de IR.
Software y framework de Beir
BEIR es un framework de Python fácil de usar que se puede instalar con pip. Está diseñado para facilitar la evaluación de modelos en tareas de IR. El software incluye wrappers completos para replicar experimentos y evaluar modelos de repositorios conocidos como Sentence-Transformers, Transformers, Anserini, DPR, Elasticsearch, ColBERT y Universal Sentence Encoder. Esta amplia compatibilidad hace que BEIR sea útil tanto para la investigación académica como para aplicaciones industriales.
El framework proporciona muchas métricas basadas en IR: precisión, recall, precisión media promedio (MAP), rango recíproco medio (MRR), ganancia acumulada descontada normalizada (nDCG) para cualquier top-k. Esto permite evaluar exhaustivamente los modelos de recuperación.
BEIR es flexible, los usuarios pueden evaluar modelos existentes en nuevos datasets y nuevos modelos en los datasets del benchmark. Para abordar el problema de los datasets en diferentes formatos, BEIR introduce un formato estándar para corpus, consultas y juicios de relevancia (qrels). Esta estandarización facilita el proceso de evaluación en muchos datasets para que investigadores y desarrolladores prueben sus modelos en diferentes tareas de recuperación de datos.
Métrica de evaluación utilizada en BEIR
BEIR utiliza la ganancia acumulada descontada normalizada (nDCG@10) como su principal métrica de evaluación. Esto se eligió para obtener resultados comparables entre diferentes modelos y datasets del benchmark.
La elección de nDCG@10 se basó en:
Las aplicaciones del mundo real pueden estar enfocadas en precisión o en recall, por lo que se necesitaba una métrica equilibrada.
Algunas métricas como Precision y Recall no consideran la clasificación de los resultados, lo cual es importante en las tareas de recuperación.
Otras métricas conscientes del ranking como Mean Reciprocal Rank (MRR) y Mean Average Precision (MAP) se limitan a juicios de relevancia binarios, lo cual no es adecuado para todas las tareas.
nDCG@10 puede manejar tanto juicios de relevancia binarios como graduados, por lo que es versátil en diferentes tipos de tareas de recuperación.
El equipo de BEIR dice que nDCG@10 es una buena métrica para evaluar ampliamente las diferentes tareas de recuperación. Usan la interfaz de Python de la herramienta oficial de evaluación TREC para calcular esta métrica para todos los conjuntos de datos del benchmark.
Al usar una sola métrica en todas las tareas, BEIR permite comparar diferentes modelos de recuperación y entre diferentes conjuntos de datos, independientemente de si usan juicios de relevancia binarios o graduados.
Hallazgos clave al comparar métodos de búsqueda neuronal
Cuando miras el artículo de Beir (o ves el video agradable y corto de uno de los autores, Nils Reimers), comparten algunos hallazgos de una comparación de diferentes métodos de búsqueda neuronal frente a BM25 (búsqueda léxica).
BEIR evalúa muchas arquitecturas de recuperación de última generación, centrándose en enfoques neuronales basados en transformers. El benchmark utiliza checkpoints preentrenados disponibles públicamente y agrupa los modelos en cinco categorías: léxicos, dispersos, densos, de interacción tardía y de re-ranking. Debido a las limitaciones de las redes transformer, solo se usan en los experimentos las primeras 512 piezas de palabra de los documentos de texto.
Los hallazgos clave de la evaluación de BEIR incluyen:
Los investigadores hicieron un benchmarking integral de modelos densos para la recuperación de información (IR). Tradicionalmente, los enfoques de embeddings se usaban para IR dentro del dominio, donde un modelo se entrena con datos específicos del dominio y luego se aplica a la búsqueda dentro de ese mismo dominio. Pero los investigadores exploraron un desafío más interesante: IR fuera del dominio, donde un modelo preentrenado se aplica a nuevos dominios sin reentrenarlo para los datos específicos. Para evaluar esto, recopilaron muchos conjuntos de datos en diferentes tareas de recuperación. Por ejemplo, en la recuperación de tweets, la tarea era emparejar artículos de noticias con tweets relevantes. En los conjuntos de datos ArguAna y Touche-2020, la tarea era la recuperación de argumentos, específicamente encontrar contraargumentos. El conjunto de datos Fever se usó para encontrar artículos de Wikipedia que respaldaran afirmaciones específicas.
Compararon muchos modelos de recuperación densa con un modelo base de búsqueda léxica (BM25). El modelo de recuperación densa de Facebook funcionó bien en Wikipedia, donde fue entrenado, pero mal en otros 17 conjuntos de datos en comparación con BM25. Incluso el mejor modelo de embeddings denso, TAS-B, solo superó a BM25 en 8 de 18 conjuntos de datos. Así que los modelos densos tienen grandes desafíos en tareas fuera del dominio. Así que los modelos de embeddings densos tienen grandes dificultades cuando se aplican a dominios desconocidos. Se necesita más investigación para mejorar su capacidad de generalización.
Algunos modelos como SPLADE funcionaron mejor en dominios desconocidos. Pero en muchos entornos, el método de recuperación más robusto fue BM25 con cross-encoder y el modelo de consulta T5, que mostró resultados estables en muchos dominios. A medida que los modelos densos evolucionan, benchmarks recientes muestran que la búsqueda léxica aún supera a los modelos densos en 2 de 14 conjuntos de datos. Algunos modelos podrían estar sobreajustándose a los conjuntos de datos actuales del Beir Benchmark. Quizás sea hora de crear Beir Benchmark 2 con conjuntos de datos más desafiantes y diversos.
Los modelos densos funcionan proyectando consultas y documentos en un espacio vectorial y recuperan documentos encontrando la coincidencia vectorial más cercana. Esto funciona bien dentro del dominio, pero tiene dificultades con palabras no vistas y fuera del dominio. Los investigadores también descubrieron que muchos conjuntos de datos dentro del dominio tienen solapamiento entre entrenamiento y prueba, donde las consultas de prueba se ven durante el entrenamiento y, por lo tanto, producen un rendimiento artificialmente alto. Los modelos densos tienen dificultades cuando se exponen a dominios o palabras no vistos durante el entrenamiento. Esto llevó a más investigación sobre cómo mejorar la generalización de los modelos densos más allá de sus dominios de entrenamiento.
A continuación, los investigadores sugieren tener mejores benchmarks que separen bien los conjuntos de entrenamiento y prueba y tengan documentos más largos o tareas de recuperación más complejas. La investigación futura se centrará en modelos que puedan funcionar bien en muchos dominios, especialmente en la recuperación fuera del dominio.
Conclusión
BEIR (Benchmarking IR) es una herramienta para la recuperación de información. Como el primer benchmark amplio de recuperación de información de zero-shot, llena el vacío de evaluar tecnologías de búsqueda en muchos dominios y tareas. BEIR, con 18 conjuntos de datos y 9 tareas, proporciona una comprensión sin precedentes de muchos métodos y modelos de recuperación de información, especialmente fuera del dominio.
El benchmark mostró los desafíos de los modelos de recuperación densos y dispersos para generalizar a dominios desconocidos, lo que llevó a más investigación e innovación. Al mostrar las fortalezas de métodos tradicionales como BM25 en algunos casos y de los enfoques híbridos, BEIR fomentó una visión más equilibrada de los modelos de recuperación dispersa y las capacidades del sistema.
Además, BEIR es de código abierto y tiene métricas estandarizadas, lo que fomentó la colaboración en la comunidad investigadora y aceleró el progreso. A medida que los modelos mejoran, la discusión sobre crear una versión más desafiante del benchmark demuestra que BEIR sigue siendo relevante y que la recuperación de información es un campo dinámico.
A continuación, los conocimientos de BEIR impulsarán tecnologías de búsqueda más robustas, flexibles y eficientes. Estas mejorarán la experiencia de búsqueda en muchas aplicaciones, desde bases de datos académicas especializadas hasta la búsqueda web cotidiana. A medida que el campo avanza, BEIR es una prueba de que una evaluación integral en el mundo real es importante para ampliar los límites de los sistemas de recuperación de información.
Referencias
Reimers, N. (2022). Evaluating Information Retrieval with BEIR. Cohere. [Video de YouTube]. https://www.youtube.com/watch?v=w6_5-hAsjBQ
Thakur, N., Reimers, N., Rücklé, A., Srivastava, A., & Gurevych, I. (2021). BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models. preprint de arXiv arXiv:2104.08663.
- Introducción a la recuperación de información y BEIR
- ¿Qué es BEIR?
- Características de BEIR
- Limitaciones
- Por qué BEIR:
- Antecedentes de Beir
- Software y framework de Beir
- Métrica de evaluación utilizada en BEIR
- Hallazgos clave al comparar métodos de búsqueda neuronal
- Conclusión
- Referencias
Contenido
Comienza Gratis, Escala Fácilmente
Prueba la base de datos vectorial completamente gestionada construida para tus aplicaciones GenAI.
Prueba Zilliz Cloud Gratis

