정보 검색 시스템을 위한 BEIR 벤치마크란 무엇인가

정보 검색 시스템을 위한 BEIR 벤치마크란 무엇인가
정보 검색을 위한 BEIR 벤치마크 분석
정보 검색과 BEIR 소개
IR 시스템은 사용자 쿼리에 응답하여 문서를 찾도록 설계되었습니다. 이러한 시스템이 발전함에 따라 기존 시스템을 이해하기 위한 포괄적인 평가 방법의 필요성도 커졌습니다.
BEIR(Benchmarking IR)는 검색 시스템이 여러 작업과 정보 유형 전반에서 얼마나 잘 수행되는지 평가하는 도구입니다. 연구자들은 기존 평가 방법의 한계를 해결하기 위해 BEIR를 개발했습니다. BEIR는 특히 도메인 밖에서 검색 기술을 보다 현실적으로 평가합니다.
특정 작업이나 도메인에 초점을 맞추는 기존 벤치마크와 달리, BEIR는 다양한 시나리오 전반에서 많은 IR 시스템 모델을 테스트하는 이기종 평가 프레임워크입니다. 팩트 체크, 질의응답, 생의학 정보 검색과 같은 다양한 작업을 위한 18개의 데이터셋을 갖추고 있습니다. 이러한 다양성 덕분에 BEIR는 실제 애플리케이션에 더 가까운 방식으로 IR 시스템의 범용성과 견고성을 평가할 수 있습니다.
BEIR의 핵심 혁신 중 하나는 zero-shot 평가에 중점을 둔다는 점으로, 모델이 특별히 훈련되지 않은 작업에서 얼마나 잘 수행되는지 테스트합니다. 이는 다양한 IR 모델의 강점과 약점, 특히 도메인 밖 검색에서 dense retrieval 모델이 직면하는 과제에 대한 중요한 통찰을 보여주었습니다.
다음에서는 BEIR의 기능, 정보 검색에서의 중요성, 그리고 검색 기술에 미치는 영향을 살펴보겠습니다. BEIR를 전통적인 lexical 및 검색 엔진부터 최신 neural 모델까지 다양한 접근 방식과 비교하고, 견고하고 적응력 있는 검색 시스템을 구축하는 개발자에게 이것이 무엇을 의미하는지 논의하겠습니다.
BEIR란 무엇인가?
"beer"처럼 들리고 로고도 맥주잔 두 개이지만, 안타깝게도 제가 익숙한 그런 맥주는 아니며, 대신 완전히 다른 종류의 "Bier!"입니다. BEIR는 Benchmarking IR(Information Retrieval)의 약자이며, Information Retrieval Systems(검색 시스템)가 여러 작업과 정보 유형 전반에서 얼마나 잘 수행되는지 평가하는 도구입니다. 연구자들은 기존 평가 방법의 한계를 해결하기 위해 BEIR를 개발했습니다. BEIR는 검색 기술을 보다 현실적으로 평가합니다.
Bier의 다양한 데이터셋 컬렉션 개요
BEIR 기능
Benchmarking Information Retrieval은 정보 검색 모델의 성능을 평가하기 위한 표준 벤치마크이며, 다양한 검색 작업에 초점을 맞춘 다채로운 데이터셋 컬렉션을 제공합니다. 이는 다양한 작업과 도메인 전반에서 검색 기술을 보다 현실적으로 평가해야 할 필요성을 해결합니다. BEIR의 주요 기능은 다음과 같습니다:
BEIR는 정보 검색 모델의 범용성과 견고성을 평가하도록 설계된 벤치마크입니다. 생물정보학, 금융, 뉴스와 같은 도메인의 18개의 다양한 데이터셋을 제공하여, 모델을 팩트 체크, 질의응답, 문서 검색, 추천 시스템과 같은 폭넓고 다양한 텍스트 검색 작업에서 테스트할 수 있게 합니다.
이 벤치마크는 유사도** 검색**, 논증 검색, 팩트 체크와 같은 9개의 distinct 검색 작업을 다루며, 다양한 실제 시나리오 전반에서 모델을 테스트합니다. 크로스 도메인 테스트 기능을 통해 모델을 훈련 도메인 밖의 작업에서 평가할 수 있어, 일반화 능력을 평가하는 데 유용한 도구가 됩니다.
BEIR은 NDCG와 Recall 같은 표준화된 평가 지표를 사용하여 모델과 데이터셋 간 비교를 단순화합니다. 또한 BERT, T5, GPT 같은 인기 모델과의 통합을 포함하여 벤치마킹 프로세스를 간소화합니다. BEIR의 오픈 소스 특성은 커뮤니티 협업과 적응을 촉진하며, 이는 벤치마킹 도구가 투명성을 유지하도록 돕는 데 중요합니다.
또한 BEIR은 제로샷 평가를 강조하는데, 이는 검색 시스템이 명시적으로 학습되지 않은 작업에서 얼마나 잘 수행하는지를 측정하여 그 적응성에 대한 통찰을 제공합니다. BEIR의 데이터셋은 짧은 트윗부터 긴 과학 논문까지 다양한 텍스트 유형도 포함하여, 웹 전반에서 발견되는 콘텐츠의 범위를 모방합니다.
BEIR은 연구자와 개발자가 IR 알고리즘의 강점과 약점을 파악하고, 접근 방식을 공정하게 비교하며, 더 견고한 기준선의 다목적 검색 기술을 개발할 수 있도록 합니다. 포괄적인 평가는 IR 기술의 발전을 이끌어 다양한 애플리케이션 전반의 검색 경험을 잠재적으로 개선합니다.
한계
Passage retrieval 중심
이 벤치마크는 transformer 기반 모델의 길이 제한 때문에 passage retrieval에 초점을 맞춥니다. BEIR의 대부분 문서는 transformer models의 512 토큰 제한 내에 들어갑니다. 약 700단어 분량의 뉴스 기사가 있는 robust04 데이터셋에 저장된 문서 같은 몇 가지 예외가 있습니다. 하지만 BEIR에는 수백 페이지의 PDF처럼 매우 긴 문서는 없습니다. 이는 향후 벤치마크가 개발될 수 있는 “사각지대”입니다.
벤치마크의 더 어려운 버전 만들기
Dense retrieval 모델이 개선되면서, BEIR에서 훨씬 더 좋은 성능을 보여 왔습니다. 최근 결과에 따르면 어휘 기반 검색(BM25 같은)은 대부분의 데이터셋에서 더 좋았던 초기 결과와 비교해 14개 데이터셋 중 2개에서만 더 좋습니다. 이는 BEIR이 여전히 도전적인 벤치마크인지에 대한 질문을 제기합니다. 모델의 한계를 밀어붙이기 위해 더 도전적인 검색 데이터셋을 갖춘 “BEIR 2”의 필요성에 대해 커뮤니티에서 논의가 있습니다.
도메인 외 검색에서의 dense retrieval 모델
BEIR은 도메인 내 작업에서 매우 잘 수행한 dense embedding 모델(최대 18점 향상)이 도메인 외 시나리오에서는 많이 어려움을 겪는다는 것을 보여주었습니다. 예를 들어 일부 dense 모델은 학습된 Wikipedia 데이터셋에서만 좋은 성능을 보였지만 BEIR의 다른 17개 데이터셋 모두에서는 어휘 기반 검색보다 나빴습니다. 이는 dense 모델이 알 수 없는 도메인에서 왜 어려움을 겪는지에 대한 많은 연구로 이어졌습니다. 연구자들은 일부 데이터셋에서 높은 train-test 중복과 미출현 단어 같은 문제를 발견했습니다. 이러한 통찰은 도메인 외 단어를 처리하는 더 나은 방법과 학습 및 테스트 세트 간 명확한 분리를 갖춘 더 견고한 벤치마크를 포함하여 모델 학습 기법의 개선을 이끌었습니다.
BEIR의 이러한 결과는 IR의 발전과 모델, 학습 및 평가의 혁신을 이끌었습니다.
BEIR가 필요한 이유:
BEIR은 검색 평가 방식의 공백을 메웁니다. 표준적이고 다양하며 도전적인 테스트 세트를 제공함으로써, 연구자와 개발자는 현재 검색 알고리즘의 강점과 약점을 확인하고, 접근 방식을 공정하고 포괄적으로 비교하며, 더 다목적이고 더 나은 검색 기술을 구축할 수 있습니다. 또한 BEIR은 검색 시스템이 실제 세계의 다양한 애플리케이션에서 어떻게 수행될지 확인하는 데 도움을 줍니다.
웹 검색 엔진과 기술 사용자에게 BEIR의 결과는 모든 애플리케이션과 플랫폼 전반에서 더 정확하고 다목적이며 효율적인 검색 경험으로 이어질 것입니다. 이는 웹 검색부터 데이터베이스 쿼리에 이르기까지 일상적인 애플리케이션에서 더 나은 검색 결과를 의미합니다.
BEIR는 오픈 소스 프로젝트이므로 전 세계 연구자들이 기여하고 혜택을 얻을 수 있습니다. 이러한 개방성은 연구자들이 BEIR를 기반으로 발전시키고 개선함에 따라 검색 기술의 향상을 가속화할 것입니다. BEIR가 개선되면 전체 IR 분야가 혜택을 얻고, 궁극적으로 최종 사용자는 모든 애플리케이션에서 더 나은 검색 경험을 하게 될 것입니다.
Beir 배경
BEIR(Benchmarking IR)는 최초의 광범위한 제로샷 정보 검색 벤치마크입니다. 이전 벤치마크와 달리, 여러 도메인과 작업 유형에 걸쳐 제로샷 설정에서 현대적인 정보 검색을 평가합니다. MultiReQA와 KILT 같은 이전 연구들은 범위가 제한적이었고, 단일 작업, 작은 코퍼스 또는 특정 도메인에 한정되어 있었습니다.
이 벤치마크는 IR 방법들이 진화하고 있는 시점에 등장했습니다. 전통적으로 TF-IDF와 BM25 같은 어휘 기반 접근법이 지배적인 텍스트 검색 방법이었습니다. 최근에는 이러한 방법을 개선하거나 대체하기 위해 Splade와 같은 신경망을 사용하는 데 대한 관심이 커지고 있습니다. 초기 신경망 기법들은 문서 확장을 위한 docT5query와 용어 가중치를 위한 DeepCT처럼 어휘 기반 정보 검색 기법을 향상시키는 것이었습니다.
그 후 semantic 일치를 포착하고 어휘적 간극을 메우기 위해 밀집 검색 모델이 개발되었습니다. 이러한 모델은 쿼리와 문서를 공유 dense vector 공간으로 매핑합니다. 이후에는 두 방식의 강점을 결합하기 위해 하이브리드 어휘-밀집 모델이 등장했습니다.
또 다른 연구 흐름은 밀집 검색기 학습을 위한 비지도 도메인 적응을 탐구했습니다. 또한 ColBERT와 같은 모델은 검색을 위해 토큰 수준의 문맥화된 embeddings를 도입했습니다.
신경망을 사용한 재순위화, 특히 BERT의 cross-attention 메커니즘을 사용하는 방식은 큰 성능 향상을 보였지만 높은 계산 비용을 수반했습니다.
BEIR는 이러한 기존 검색 시스템과 방법들이 다양한 도메인과 작업, 특히 제로샷 설정에서 어떻게 일반화되는지 확인하여, 현대 IR 시스템의 적응성을 이해하는 데 있는 격차를 메우고자 합니다.
Beir 소프트웨어 및 프레임워크
BEIR는 pip로 설치할 수 있는 사용자 친화적인 Python 프레임워크입니다. IR 작업에서 모델 평가를 쉽게 할 수 있도록 설계되었습니다. 이 소프트웨어는 실험을 재현하고 Sentence-Transformers, Transformers, Anserini, DPR, Elasticsearch, ColBERT 및 Universal Sentence Encoder와 같은 잘 알려진 리포지토리의 모델을 평가하기 위한 포괄적인 래퍼를 제공합니다. 이러한 폭넓은 호환성 덕분에 BEIR는 학술 연구와 산업 응용 모두에 유용합니다.
이 프레임워크는 많은 IR 기반 지표를 제공합니다: Precision, Recall, Mean Average Precision (MAP), Mean Reciprocal Rank (MRR), Normalized Discounted Cumulative Gain (nDCG), 모든 top-k에 대해 제공됩니다. 이를 통해 검색 모델을 종합적으로 평가할 수 있습니다.
BEIR는 유연하여, 사용자는 새로운 데이터셋에서 기존 모델을 평가하고 벤치마크의 데이터셋에서 새로운 모델을 평가할 수 있습니다. 서로 다른 형식의 데이터셋 문제를 해결하기 위해 BEIR는 코퍼스, 쿼리 및 관련성 판단(qrels)을 위한 표준 형식을 도입합니다. 이러한 표준화는 연구자와 개발자가 다양한 데이터 검색 작업에서 자신의 모델을 테스트할 수 있도록 여러 데이터셋 전반의 평가 과정을 더 쉽게 만듭니다.
BEIR에서 사용되는 평가 지표
BEIR는 주요 평가 지표로 Normalized Discounted Cumulative Gain (nDCG@10)을 사용합니다. 이는 벤치마크에서 서로 다른 모델과 데이터셋 간에 비교 가능한 결과를 얻기 위해 선택되었습니다.
nDCG@10의 선택은 다음에 기반했습니다:
실제 애플리케이션은 정밀도 중심이거나 재현율 중심일 수 있으므로, 균형 잡힌 지표가 필요했습니다.
Precision과 Recall 같은 일부 지표는 검색 작업에서 중요한 결과의 순위를 고려하지 않습니다.
Mean Reciprocal Rank (MRR)와 Mean Average Precision (MAP) 같은 다른 순위 인식 지표는 이진 관련성 판단으로 제한되며, 이는 모든 작업에 적합하지 않습니다.
nDCG@10은 이진 및 등급화된 관련성 판단을 모두 처리할 수 있으므로 다양한 유형의 검색 작업 전반에서 다재다능합니다.
BEIR 팀은 nDCG@10이 다양한 검색 작업을 폭넓게 평가하기에 좋은 지표라고 말합니다. 그들은 벤치마크의 모든 데이터셋에 대해 이 지표를 계산하기 위해 공식 TREC 평가 도구의 Python 인터페이스를 사용합니다.
모든 작업에서 단일 지표를 사용함으로써, BEIR은 이진 또는 등급화된 관련성 판단을 사용하는지 여부와 관계없이 서로 다른 검색 모델과 서로 다른 데이터셋을 비교할 수 있게 합니다.
신경망 검색 방법 비교의 주요 결과
Beir 논문을 보거나 저자 중 한 명인 Nils Reimers의 훌륭하고 짧은 영상을 보면, 다양한 신경망 검색 방법과 BM25(어휘 검색)를 비교한 몇 가지 결과를 공유합니다.
BEIR은 transformer 기반 신경망 접근 방식에 초점을 맞춰 많은 최첨단 검색 아키텍처를 평가합니다. 벤치마크는 공개적으로 사용 가능한 사전 학습된 체크포인트를 사용하며 모델을 lexical, sparse, dense, late-interaction 및 re-ranking의 다섯 가지 범주로 그룹화합니다. transformer 네트워크의 제한으로 인해, 텍스트 문서의 처음 512개 word piece만 실험에 사용됩니다.
BEIR 평가의 주요 결과는 다음과 같습니다:
연구자들은 정보 검색(IR)을 위한 dense 모델의 포괄적인 벤치마킹을 수행했습니다. 전통적으로 embedding 접근 방식은 모델을 도메인별 데이터로 학습한 다음 동일한 도메인 내 검색에 적용하는 in-domain IR에 사용되었습니다. 하지만 연구자들은 더 흥미로운 과제인 out-of-domain IR을 탐구했습니다. 이는 사전 학습된 모델을 특정 데이터에 대해 재학습하지 않고 새로운 도메인에 적용하는 것입니다. 이를 평가하기 위해, 그들은 다양한 검색 작업 전반에 걸쳐 많은 데이터셋을 수집했습니다. 예를 들어, tweet retrieval에서는 뉴스 기사를 관련 tweet과 매칭하는 것이 작업이었습니다. ArguAna와 Touche-2020 데이터셋에서는 작업이 argument retrieval, 구체적으로 counter-argument를 찾는 것이었습니다. Fever 데이터셋은 특정 claim을 뒷받침하는 Wikipedia 문서를 찾는 데 사용되었습니다.
그들은 많은 dense retrieval 모델을 baseline lexical search model (BM25)과 비교했습니다. Facebook의 dense retrieval model은 학습된 Wikipedia에서는 잘 작동했지만, BM25와 비교했을 때 다른 17개 데이터셋에서는 성능이 좋지 않았습니다. 최고의 dense embedding model인 TAS-B조차도 18개 데이터셋 중 8개에서만 BM25보다 우수했습니다. 따라서 dense 모델은 out-of-domain 작업에서 큰 어려움을 겪습니다. 따라서 dense embedding model은 알려지지 않은 도메인에 적용될 때 큰 어려움을 겪습니다. 일반화 능력을 향상시키기 위해 더 많은 연구가 필요합니다.
SPLADE와 같은 일부 모델은 알려지지 않은 도메인에서 더 잘 작동했습니다. 그러나 많은 설정 전반에서 가장 견고한 검색 방법은 cross-encoder와 T5 query model을 사용한 BM25였으며, 이는 많은 도메인에서 안정적인 결과를 보였습니다. dense 모델이 발전함에 따라, 최근 벤치마크는 lexical search가 여전히 14개 데이터셋 중 2개에서 dense 모델보다 우수하다는 것을 보여줍니다. 일부 모델은 현재 Beir Benchmark 데이터셋에 과적합되고 있을 수 있습니다. 아마도 더 어렵고 다양한 데이터셋을 갖춘 Beir Benchmark 2를 만들 때가 되었을지도 모릅니다.
Dense 모델은 쿼리와 문서를 벡터 공간에 투영하고 가장 가까운 벡터 매치를 찾아 문서를 검색하는 방식으로 작동합니다. 이는 in-domain에서는 잘 작동하지만, 보지 못한 단어와 out-of-domain에서는 어려움을 겪습니다. 연구자들은 또한 많은 in-domain 데이터셋에서 테스트 쿼리가 학습 중에 보이는 training-test overlap이 있어, 성능이 인위적으로 높게 나타난다는 사실을 발견했습니다. Dense 모델은 학습 중에 보지 못한 도메인이나 단어에 노출되면 어려움을 겪습니다. 이는 dense 모델의 학습 도메인 밖 일반화를 개선하기 위한 더 많은 연구로 이어졌습니다.
다음으로 연구자들은 학습 세트와 테스트 세트를 잘 분리하고, 더 긴 문서나 더 복잡한 검색 과제를 포함하는 더 나은 벤치마크를 갖출 것을 제안합니다. 향후 연구는 특히 out-of-domain 검색에서 여러 도메인에 걸쳐 잘 수행할 수 있는 모델에 초점을 맞출 것입니다.
결론
BEIR (Benchmarking IR)는 정보 검색을 위한 도구입니다. 최초의 광범위한 zero-shot 정보 검색 벤치마크로서, 여러 도메인과 과제에 걸쳐 검색 기술을 평가하는 공백을 메웁니다. 18개의 데이터셋과 9개의 과제를 갖춘 BEIR는 특히 out-of-domain에서 많은 정보 검색 방법과 모델에 대한 전례 없는 이해를 제공합니다.
이 벤치마크는 미지의 도메인으로 일반화하는 데 있어 dense 및 sparse 검색 모델의 과제를 보여주었고, 이는 더 많은 연구와 혁신으로 이어졌습니다. 일부 경우 BM25와 같은 전통적 방법의 강점과 하이브리드 접근법을 보여줌으로써 BEIR는 sparse retrieval 모델과 시스템 역량에 대한 더 균형 잡힌 관점을 장려했습니다.
또한 BEIR는 오픈 소스이며 표준화된 지표를 갖추고 있어 연구 커뮤니티의 협업을 장려하고 발전을 가속화했습니다. 모델이 개선됨에 따라 벤치마크의 더 도전적인 버전을 만드는 것에 대한 논의는 BEIR가 여전히 관련성이 있으며 정보 검색이 역동적인 분야임을 입증합니다.
앞으로 BEIR에서 얻은 통찰은 더 견고하고 유연하며 효율적인 검색 기술을 이끌 것입니다. 이는 전문 학술 데이터베이스부터 일상적인 웹 검색에 이르기까지 다양한 애플리케이션 전반에서 검색 경험을 개선할 것입니다. 이 분야가 발전함에 따라 BEIR는 정보 검색 시스템의 한계를 확장하기 위해 포괄적인 실제 평가가 중요하다는 증거입니다.
참고 문헌
Reimers, N. (2022). BEIR로 정보 검색 평가하기. Cohere. [YouTube 동영상]. https://www.youtube.com/watch?v=w6_5-hAsjBQ
Thakur, N., Reimers, N., Rücklé, A., Srivastava, A., & Gurevych, I. (2021). BEIR: 정보 검색 모델의 Zero-shot 평가를 위한 이질적 벤치마크. arXiv preprint arXiv:2104.08663.


