Что такое бенчмарк BEIR для системы информационного поиска

Что такое бенчмарк BEIR для системы информационного поиска
Анализ бенчмарка BEIR для информационного поиска
Введение в информационный поиск и BEIR
Системы IR предназначены для поиска документов в ответ на пользовательские запросы. По мере развития этих систем росла и потребность во всесторонних методах оценки, позволяющих понять существующие системы.
BEIR (Benchmarking IR) — это инструмент для оценки того, насколько хорошо поисковые системы работают в различных задачах и с разными типами информации. Исследователи разработали BEIR, чтобы устранить ограничения существующих методов оценки. BEIR представляет собой более реалистичную оценку поисковых технологий, особенно вне домена.
В отличие от традиционных бенчмарков, которые фокусируются на конкретных задачах или доменах, BEIR — это гетерогенная оценочная среда, которая тестирует множество моделей систем IR в различных сценариях. Она содержит 18 наборов данных для различных задач, таких как проверка фактов, ответы на вопросы и поиск биомедицинской информации. Такое разнообразие позволяет BEIR оценивать универсальность и надежность систем IR способом, более похожим на реальные приложения.
Одно из ключевых нововведений BEIR — акцент на оценке zero-shot, то есть проверке того, насколько хорошо модели справляются с задачами, для которых они специально не обучались. Это дало важные представления о сильных и слабых сторонах различных моделей IR, особенно о трудностях, с которыми сталкиваются модели плотного поиска при поиске вне домена.
Далее мы рассмотрим особенности BEIR, его важность в информационном поиске и влияние, которое он оказывает на поисковые технологии. Мы сравним BEIR с различными подходами — от традиционных лексических и поисковых систем до современных нейронных моделей — и обсудим, что это означает для разработчиков, создающих надежные и адаптируемые поисковые системы.
Что такое BEIR?
Хотя это звучит как "beer", а логотип представляет собой две пивные кружки, к сожалению, это не тот вид пива, к которому я привык, а совсем другой вид "Bier!" BEIR означает Benchmarking IR (Information Retrieval) и является инструментом для оценки того, насколько хорошо системы информационного поиска (поисковые системы) работают в различных задачах и с разными типами информации. Исследователи разработали BEIR, чтобы устранить ограничения существующих методов оценки. BEIR — это более реалистичная оценка поисковых технологий.
Обзор разнообразной коллекции наборов данных Bier
Особенности BEIR
Benchmarking Information Retrieval — это стандартный бенчмарк для оценки производительности моделей информационного поиска, который предоставляет разнообразную коллекцию наборов данных, сосредоточенных на различных задачах поиска. Он отвечает на потребность в более реалистичной оценке поисковых технологий в разных задачах и доменах. Вот некоторые ключевые особенности BEIR:
BEIR — это бенчмарк, предназначенный для оценки универсальности и надежности моделей информационного поиска. Он включает 18 разнообразных наборов данных из таких доменов, как биоинформатика, финансы и новости, что позволяет тестировать модели на широком спектре разнообразных задач поиска по тексту, таких как проверка фактов, ответы на вопросы, поиск документов и рекомендательные системы.
Бенчмарк охватывает девять различных задач поиска, таких как similarity** retrieval**, поиск аргументов и проверка фактов, что тестирует модели в различных реальных сценариях. Его возможность кросс-доменного тестирования позволяет оценивать модели на задачах вне их обучающего домена, делая его ценным инструментом для оценки их способностей к обобщению.
BEIR использует стандартизированные метрики оценки, такие как NDCG и Recall, упрощая сравнение между моделями и наборами данных. Он также включает интеграцию с популярными моделями, такими как BERT, T5 и GPT, оптимизируя процесс бенчмаркинга. Открытый исходный код BEIR способствует сотрудничеству и адаптации в сообществе, что для инструмента бенчмаркинга важно, поскольку помогает поддерживать прозрачность.
Кроме того, BEIR делает акцент на zero-shot оценке, которая измеряет, насколько хорошо системы поиска справляются с задачами, для которых они не были явно обучены, давая представление об их адаптивности. Его наборы данных также включают различные типы текстов — от коротких твитов до длинных научных статей, имитируя диапазон контента, встречающегося в интернете.
BEIR позволяет исследователям и разработчикам выявлять сильные и слабые стороны алгоритмов IR, справедливо сравнивать подходы и разрабатывать более надежные базовые универсальные поисковые технологии. Его комплексная оценка способствует развитию технологий IR, потенциально улучшая поисковый опыт в различных приложениях.
Ограничения
Фокус на поиске пассажей
Бенчмарк сосредоточен на поиске пассажей из-за ограничений по длине у моделей на основе трансформеров. Большинство документов в BEIR укладываются в ограничение в 512 токенов transformer models. Есть некоторые исключения, например документы, хранящиеся в наборе данных robust04, который содержит новостные статьи объемом около 700 слов. Но в BEIR нет очень длинных документов, таких как PDF с сотнями страниц. Это «слепая зона», где могут быть разработаны будущие бенчмарки.
Создание более сложных версий бенчмарка
По мере улучшения моделей dense retrieval они стали показывать гораздо лучшие результаты на BEIR. Недавние результаты показывают, что lexical search (например, BM25) лучше только на 2 из 14 наборов данных по сравнению с более ранними результатами, где он был лучше на большинстве наборов данных. Это поднимает вопрос о том, остается ли BEIR все еще сложным бенчмарком. В сообществе идет обсуждение необходимости «BEIR 2», который будет содержать более сложные наборы данных для поиска, чтобы расширять пределы возможностей моделей.
Модели dense retrieval в out-of-domain поиске
BEIR показал, что модели dense embedding, которые очень хорошо работали на in-domain задачах (прирост до 18 пунктов), испытывают серьезные трудности в out-of-domain сценариях. Например, некоторые dense models хорошо работали только на наборе данных Wikipedia, на котором они были обучены, но уступали lexical search на всех остальных 17 наборах данных в BEIR. Это привело к большому количеству исследований о том, почему dense models испытывают трудности с неизвестными доменами. Исследователи обнаружили такие проблемы, как высокое пересечение train-test в некоторых наборах данных и неизвестные слова. Эти выводы стимулировали улучшения в методах обучения моделей, включая более эффективные способы обработки out-of-domain слов и более надежные бенчмарки с четким разделением между обучающими и тестовыми наборами.
Эти результаты BEIR способствовали прогрессу в IR, инновациям в моделях, обучении и оценке.
Почему BEIR:
BEIR закрывает пробел в том, как оценивается поиск. Предоставляя стандартный, разнообразный и сложный набор тестов, исследователи и разработчики могут видеть сильные и слабые стороны текущих поисковых алгоритмов, справедливо и комплексно сравнивать подходы и создавать более универсальные и лучшие поисковые технологии. Также BEIR помогает им понять, как поисковые системы будут работать в реальном мире, в разнообразных приложениях.
Для пользователей веб-поисковиков и технологий результаты BEIR приведут к более точному, универсальному и эффективному поисковому опыту во всех приложениях и платформах. Это означает более качественные результаты поиска в повседневных приложениях — от веб-поиска до запросов к базам данных.
BEIR — это проект с открытым исходным кодом, поэтому исследователи по всему миру могут вносить в него вклад и получать от него пользу. Такая открытость ускорит совершенствование поисковых технологий, поскольку исследователи будут развивать и дорабатывать BEIR. По мере улучшения BEIR вся область IR выиграет, и в конечном итоге конечные пользователи получат более качественный поисковый опыт во всех приложениях.
Предыстория Beir
BEIR (Benchmarking IR) — это первый широкий бенчмарк информационного поиска в режиме zero-shot. В отличие от предыдущих бенчмарков, он оценивает современный информационный поиск в различных доменах и типах задач в zero-shot setting. Предыдущие работы, такие как MultiReQA и KILT, были ограничены по охвату, представляли собой одну задачу, небольшой корпус или конкретный домен.
Бенчмарк появился в то время, когда методы IR развиваются. Традиционно лексические подходы, такие как TF-IDF и BM25, были доминирующими методами текстового поиска. В последнее время растет интерес к использованию нейронных сетей, таких как Splade, для улучшения или замены этих методов. Ранние нейронные техники были направлены на усиление лексических методов информационного поиска, например docT5query для расширения документов и DeepCT для взвешивания терминов.
Затем были разработаны модели плотного поиска, чтобы улавливать семантические совпадения и устранять лексический разрыв. Эти модели отображают запросы и документы в общее пространство плотных векторов. Затем появились гибридные лексико-плотные модели, объединяющие сильные стороны обоих подходов.
Другое направление исследований изучало неконтролируемую доменную адаптацию для обучения плотных ретриверов. Также модели вроде ColBERT ввели контекстуализированные эмбеддинги на уровне токенов для поиска.
Повторное ранжирование с использованием нейронных сетей, особенно тех, которые используют механизм cross-attention BERT, показало значительный прирост производительности, но с высокой вычислительной стоимостью.
BEIR пытается понять, как эти существующие поисковые системы и методы обобщаются на разные домены и задачи, особенно в zero-shot setting, чтобы восполнить пробел в понимании адаптивности современных IR-систем.
Программное обеспечение и фреймворк Beir
BEIR — это удобный Python-фреймворк, который можно установить с помощью pip. Он разработан для упрощения оценки моделей в задачах IR. Программное обеспечение поставляется с комплексными обертками для воспроизведения экспериментов и оценки моделей из известных репозиториев, таких как Sentence-Transformers, Transformers, Anserini, DPR, Elasticsearch, ColBERT и Universal Sentence Encoder. Такой широкий спектр совместимости делает BEIR полезным как для академических исследований, так и для промышленных приложений.
Фреймворк предоставляет множество метрик на основе IR: Precision, Recall, Mean Average Precision (MAP), Mean Reciprocal Rank (MRR), Normalized Discounted Cumulative Gain (nDCG) для любого top-k. Это позволяет всесторонне оценивать поисковые модели.
BEIR гибок: пользователи могут оценивать существующие модели на новых наборах данных и новые модели на наборах данных в бенчмарке. Чтобы решить проблему наборов данных в разных форматах, BEIR вводит стандартный формат для корпуса, запросов и оценок релевантности (qrels). Такая стандартизация упрощает процесс оценки на множестве наборов данных для исследователей и разработчиков, позволяя тестировать их модели на различных задачах поиска данных.
Метрика оценки, используемая в BEIR
BEIR использует Normalized Discounted Cumulative Gain (nDCG@10) в качестве основной метрики оценки. Она была выбрана для получения сопоставимых результатов между различными моделями и наборами данных в бенчмарке.
Выбор nDCG@10 был основан на:
Реальные приложения могут быть ориентированы либо на точность, либо на полноту, поэтому была необходима сбалансированная метрика.
Некоторые метрики, такие как Precision и Recall, не учитывают ранжирование результатов, что важно в задачах поиска.
Другие метрики, учитывающие ранжирование, такие как Mean Reciprocal Rank (MRR) и Mean Average Precision (MAP), ограничены бинарными оценками релевантности, что подходит не для всех задач.
nDCG@10 может работать как с бинарными, так и с градуированными оценками релевантности, поэтому она универсальна для разных типов задач поиска.
Команда BEIR говорит, что nDCG@10 — хорошая метрика для широкой оценки различных задач поиска. Они используют Python-интерфейс официального инструмента оценки TREC для вычисления этой метрики для всех наборов данных в бенчмарке.
Используя единую метрику для всех задач, BEIR позволяет сравнивать разные модели поиска между собой и на разных наборах данных, независимо от того, используют ли они бинарные или градуированные оценки релевантности.
Ключевые выводы при сравнении методов нейронного поиска
Когда вы смотрите статью Beir (или короткое и понятное видео одного из авторов, Nils Reimers), они делятся некоторыми выводами из сравнения различных методов нейронного поиска с BM25 (лексическим поиском).
BEIR оценивает множество современных архитектур поиска, сосредоточившись на нейронных подходах на основе transformer. Бенчмарк использует общедоступные предварительно обученные контрольные точки и группирует модели в пять категорий: лексические, разреженные, плотные, с late-interaction и повторным ранжированием. Из-за ограничений сетей transformer в экспериментах используются только первые 512 word pieces текстовых документов.
Ключевые выводы из оценки BEIR включают:
Исследователи провели комплексный бенчмаркинг плотных моделей для информационного поиска (IR). Традиционно подходы на основе эмбеддингов использовались для внутридоменного IR, где модель обучается на данных конкретного домена, а затем применяется для поиска в том же домене. Но исследователи изучили более интересную задачу: внедоменный IR, где предварительно обученная модель применяется к новым доменам без дообучения на конкретных данных. Чтобы оценить это, они собрали множество наборов данных по разным задачам поиска. Например, в поиске по твитам задача состояла в сопоставлении новостных статей с релевантными твитами. В наборах данных ArguAna и Touche-2020 задачей был поиск аргументов, а именно поиск контраргументов. Набор данных Fever использовался для поиска статей Wikipedia, подтверждающих конкретные утверждения.
Они сравнили множество плотных моделей поиска с базовой моделью лексического поиска (BM25). Плотная модель поиска от Facebook хорошо работала на Wikipedia, где она была обучена, но плохо на 17 других наборах данных по сравнению с BM25. Даже лучшая плотная модель эмбеддингов, TAS-B, превзошла BM25 только на 8 из 18 наборов данных. Поэтому плотные модели сталкиваются с большими трудностями в внедоменных задачах. Поэтому плотные модели эмбеддингов испытывают большие трудности при применении к неизвестным доменам. Требуются дополнительные исследования, чтобы улучшить их способность к обобщению.
Некоторые модели, такие как SPLADE, работали лучше в неизвестных доменах. Но во многих условиях самым устойчивым методом поиска был BM25 с cross-encoder и моделью запросов T5, который показывал стабильные результаты во многих доменах. По мере развития плотных моделей недавние бенчмарки показывают, что лексический поиск всё ещё превосходит плотные модели в 2 из 14 наборов данных. Некоторые модели, возможно, переобучаются на текущих наборах данных Beir Benchmark. Возможно, пришло время создать Beir Benchmark 2 с более сложными и разнообразными наборами данных.
Плотные модели работают, проецируя запросы и документы в векторное пространство и извлекая документы путем поиска ближайшего совпадения векторов. Это хорошо работает внутри домена, но испытывает трудности с невстречавшимися словами и вне домена. Исследователи также обнаружили, что во многих внутридоменных наборах данных есть пересечение между обучающей и тестовой выборками, где тестовые запросы встречаются во время обучения, что приводит к искусственно завышенной производительности. Плотные модели испытывают трудности при работе с доменами или словами, которые не встречались во время обучения. Это привело к дальнейшим исследованиям по улучшению обобщающей способности плотных моделей за пределами их обучающих доменов.
Далее исследователи предлагают иметь более качественные бенчмарки, которые хорошо разделяют обучающие и тестовые наборы и содержат более длинные документы или более сложные задачи извлечения. Будущие исследования будут сосредоточены на моделях, которые могут хорошо работать во многих доменах, особенно при извлечении вне домена.
Заключение
BEIR (Benchmarking IR) — это инструмент для информационного поиска. Как первый широкий zero-shot бенчмарк информационного поиска, он заполняет пробел в оценке поисковых технологий в разных доменах и задачах. BEIR с 18 наборами данных и 9 задачами предоставляет беспрецедентное понимание многих методов и моделей информационного поиска, особенно вне домена.
Бенчмарк показал сложности плотных и разреженных моделей извлечения в обобщении на неизвестные домены, что привело к дальнейшим исследованиям и инновациям. Показав сильные стороны традиционных методов, таких как BM25, в некоторых случаях, а также гибридных подходов, BEIR способствовал более сбалансированному взгляду на модели разреженного извлечения и возможности систем.
Кроме того, BEIR является open source и имеет стандартизированные метрики, что способствовало сотрудничеству в исследовательском сообществе и ускорило прогресс. По мере улучшения моделей обсуждение создания более сложной версии бенчмарка доказывает, что BEIR по-прежнему актуален, а информационный поиск является динамичной областью.
В дальнейшем идеи, полученные из BEIR, будут стимулировать развитие более надежных, гибких и эффективных поисковых технологий. Они улучшат поисковый опыт во многих приложениях — от специализированных академических баз данных до повседневного веб-поиска. По мере развития области BEIR служит доказательством того, что всесторонняя оценка в реальных условиях важна для расширения пределов систем информационного поиска.
Источники
Reimers, N. (2022). Evaluating Information Retrieval with BEIR. Cohere. [YouTube video]. https://www.youtube.com/watch?v=w6_5-hAsjBQ
Thakur, N., Reimers, N., Rücklé, A., Srivastava, A., & Gurevych, I. (2021). BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models. arXiv preprint arXiv:2104.08663.
- Введение в информационный поиск и BEIR
- Что такое BEIR?
- Особенности BEIR
- Ограничения
- Почему BEIR:
- Предыстория Beir
- Программное обеспечение и фреймворк Beir
- Метрика оценки, используемая в BEIR
- Ключевые выводы при сравнении методов нейронного поиска
- Заключение
- Источники
Контент
Начните бесплатно, масштабируйтесь легко
Попробуйте полностью управляемую векторную базу данных, созданную для ваших GenAI приложений.
Попробуйте Zilliz Cloud бесплатно

