GPL: генеративная псевдоразметка для неконтролируемой доменной адаптации плотного поиска
Поиск информации важен для многих приложений обработки естественного языка (NLP). Хотя традиционные лексические методы использовались для поиска по текстовому содержимому, они страдают от лексического разрыва. Эти методы не могут распознавать синонимы или различать неоднозначные слова.
Методы плотного поиска, которые отображают запросы и отрывки в общее векторное пространство, стали популярными для решения этих проблем, демонстрируя улучшения по сравнению с традиционными подходами. Однако они требуют больших обучающих наборов данных и чувствительны к сдвигам домена. Например, модели, обученные на MS MARCO, плохо работают с литературой по COVID-19.
Таким образом, существует необходимость создать метод, который сможет эффективно адаптировать модели плотного поиска к новым доменам, не требуя большого объема размеченных данных. Один из предложенных методов — GPL (Generative Pseudo Labeling), методика неконтролируемой доменной адаптации для моделей плотного поиска, которая сочетает генератор запросов с псевдоразметкой. GPL использует модель T5 для генерации запросов для целевого домена. Он извлекает негативные отрывки с помощью существующей модели плотного поиска и использует cross-encoder для оценки пар (запрос, отрывок).
GPL превосходит другие методы доменной адаптации. Он улучшает производительность до 9,3 nDCG@10 (нормализованный Discounted Cumulative Gain на ранге 10) по сравнению с моделями, обученными на MS MARCO, и до 4,5 nDCG@10 по сравнению с QGen (генерация запросов).
Рисунок: GPL для обучения доменно-адаптированного плотного ретривера
Рисунок: GPL для обучения доменно-адаптированного плотного ретривера | Источник
В этой статье будет рассмотрено, как GPL решает проблему доменной адаптации, его базовые механизмы и улучшения, которые он предлагает по сравнению с предыдущими методами доменной адаптации. Для получения дополнительных сведений обратитесь к статье Generative Pseudo Labeling.
Почему плотного поиска не всегда достаточно
Несмотря на их впечатляющие возможности, методы плотного поиска имеют свои недостатки. Наиболее значимые проблемы — это потребность в больших обучающих наборах данных и сложности при адаптации к новым доменам. Вот разбор этих проблем:
Требования к данным: Модели плотного поиска требуют больших объемов обучающих данных для эффективной работы. Это требование к данным создает значительную проблему для применения плотного поиска в специализированных доменах, где большие размеченные наборы данных недоступны.
Чувствительность к сдвигам домена: Модели плотного поиска чрезвычайно чувствительны к сдвигам домена. Их производительность снижается при применении к домену, отличному от того, на котором они обучались.
Лексический разрыв: Традиционные лексические методы, альтернатива плотному поиску, страдают от лексического разрыва. Они не могут распознавать синонимы или различать неоднозначные слова.
Производительность zero-shot: Модели плотного поиска часто плохо работают на заданном корпусе при применении в режиме zero-shot.
Представляем GPL: быстрое и надежное решение для доменной адаптации
GPL — это методика неконтролируемой доменной адаптации, предназначенная для повышения производительности моделей плотного поиска при применении к новым доменам. Метод состоит из нескольких ключевых шагов, включая:
генерацию запросов
поиск негативных примеров
псевдоразметку
обучение плотного ретривера
Генерация запросов с помощью T5
Процесс GPL начинается с генерации запросов, где синтетические запросы создаются для каждого фрагмента в целевом домене. Это выполняется с использованием предварительно обученной модели T5 encoder-decoder.
Модель T5 обучается на больших наборах данных, таких как MS MARCO (Microsoft Machine Reading Comprehension). Она генерирует запросы, релевантные содержимому каждого фрагмента, фактически создавая синтетические пары вопрос-ответ.
Количество запросов, генерируемых для каждого фрагмента, корректируется в зависимости от размера корпуса, чтобы общее количество сгенерированных запросов оставалось согласованным. Создание этих синтетических данных важно, поскольку оно предоставляет данные для последующего обучения плотного ретривера для конкретного целевого домена.
Негативный майнинг с помощью плотного поиска
Метод GPL использует предварительно обученную модель плотного поиска для каждого сгенерированного запроса, чтобы найти наиболее похожие абзацы в целевом корпусе. Затем эти похожие абзацы рассматриваются как негативные фрагменты, что означает, что они нерелевантны запросу.
Этот шаг предназначен для выявления "сложных негативных примеров." Эти сложные примеры помогают модели различать похожие, но нерелевантные фрагменты. Два плотных ретривера, обученных на MS MARCO, ‘msmarco-distilbert-base-v3’ и ‘msmarco-MiniLM-L-6-v3’, используются для обеспечения разнообразного набора негативных примеров.
Наконец, из найденных фрагментов для каждого обучающего примера выбирается один позитивный и один негативный фрагмент.
Псевдоразметка с помощью Cross-Encoder
Следующий шаг включает оценивание пар (запрос, фрагмент) с использованием cross-encoder. В отличие от bi-encoders, которые независимо отображают запросы и фрагменты в общее векторное пространство. Cross-encoder принимает конкатенацию запроса и фрагмента и предсказывает оценку релевантности с использованием cross-attention.
Этот шаг назначает непрерывную, детализированную оценку релевантности каждой паре (запрос, позитивный фрагмент) и каждой паре (запрос, негативный фрагмент). Эти оценки являются псевдометками. Модель cross-encoder, используемая для псевдометок, — ms-marco-MiniLM-L-6-v2. Непрерывные оценки предоставляют более подробную информацию, чем бинарные метки, используемые в других методах.
Обучение плотного ретривера с функцией потерь MarginMSE
Наконец, модель плотного поиска (студенческий плотный ретривер) обучается с использованием сгенерированных кортежей (запрос, позитивный, негативный) и соответствующих оценок cross-encoder с функцией потерь MarginMSE. Цель состоит в том, чтобы научить плотный ретривер имитировать разницу оценок между позитивными и негативными парами запрос-фрагмент cross-encoder. Функция потерь MarginMSE определяется как:
LMarginMSE()= -1Mi=0M-1|i-i|2
Где:
M — размер batch.
i — соответствующая разница оценок студенческого плотного ретривера:
i= f(Qi)T f(Pi)- f(Qi)f(P_)
- где f — плотный ретривер, Qi — запрос, Pi — позитивный фрагмент, а P_ — негативный фрагмент.
- i — разница оценок от cross-encoder:
= CE(Q, P+)-CE(Q, P_)
Эта функция потерь помогает модели изучить векторное пространство. В этом пространстве запросы находятся ближе к релевантным фрагментам и дальше от нерелевантных, как определено псевдометками от cross-encoder. Функция потерь MarginMSE устраняет недостатки предыдущих методов, таких как QGen. QGen использует функцию потерь Multiple Negatives Ranking (MNRL), которая учитывает только грубую связь между запросами и фрагментами.
Экспериментальный дизайн для доменно-адаптированного плотного поиска
Схема оценки GPL предназначена для оценки его эффективности в адаптации моделей плотного поиска к конкретным задачам. Ниже приведен разбор ключевых компонентов этой схемы:
Наборы данных
Используются два набора данных: один для исходного домена и один для целевого домена.
- Данные исходного домена: Набор данных для ранжирования пассажей MS MARCO используется в качестве данных исходного домена. Этот набор данных состоит из 8,8 миллиона пассажей и 532,8 тыс. пар запрос–пассаж, размеченных как релевантные. Модели обучаются на MS MARCO, а затем адаптируются к целевому домену с использованием метода GPL.
- Наборы данных целевого домена: Для оценки возможностей GPL по доменной адаптации используются шесть доменно-специфичных наборов данных для поиска по тексту из бенчмарка BeIR. Число Эти наборы данных представляют ряд специализированных доменов и включают:
FiQA (финансовый домен)
SciFact (научные статьи)
BioASQ (биомедицинские вопросы и ответы)
TREC-COVID (научные статьи о COVID-19)
CQADupStack (12 подфорумов StackExchange)
Robust04 (новостные статьи)
Эти наборы данных различаются по:
Размеры: Различия в размерах корпусов.
Длины запросов и пассажей: Каждый набор данных имеет свои характерные особенности.
Метки релевантности: Число релевантных пассажей на запрос различается.
Некоторые наборы данных были изменены для эффективного обучения и оценки. Например:
- BioASQ: Нерелевантные пассажи были удалены, чтобы уменьшить размер корпуса.
Базовые модели
Для сравнения были включены несколько базовых моделей:
Модели zero-shot: Эти модели обучаются на наборах данных MS MARCO или PAQ и оцениваются на целевых наборах данных без какой-либо доменной адаптации. Лексическая поисковая система BM25 также включена в качестве базовой модели.
Предыдущие методы доменной адаптации: UDALM и MoDIR включены в качестве базовых моделей, представляющих предыдущие подходы к доменной адаптации.
Методы доменной адаптации на основе предобучения: Эти методы включают предобучение плотных ретриверов на целевом корпусе, а затем обучение модели на наборе данных MS MARCO. Использовались различные методы предобучения, такие как CD, SimCSE, CT, MLM, ICT и TSDAE.
Доменная адаптация на основе генерации: Модели QGen обучаются с внутрипакетными негативными примерами и сложными негативными примерами. Кроме того, включено предобучение TSDAE в сочетании с QGen.
Обучение
Модель DistilBERT используется во всех экспериментах с максимальной длиной последовательности 350, mean pooling и сходством на основе скалярного произведения.
Модели QGen обучаются в течение 1 эпохи с размером пакета 75.
Модели GPL обучаются в течение 140 тыс. шагов с размером пакета 32.
Методы предобучения, такие как модели TSDAE и MLM, обучались в течение 100 тыс. шагов обучения с размером пакета 8.
Метрика оценки
Производительность моделей оценивается с использованием nDCG@10 (нормализованного дисконтированного кумулятивного выигрыша на ранге 10). Она оценивает качество ранжирования, учитывая релевантность найденных элементов. Она придает больший вес высокорелевантным документам, появляющимся в верхней части ранжированного списка.
Эффективность и производительность GPL в доменной адаптации
Метод GPL оценивался в сравнении с несколькими базовыми моделями, а его производительность анализировалась в разных условиях. Оценка выполняется с использованием nDCG@10, который измеряет релевантность 10 лучших результатов ранжированного списка.
Общая производительность GPL
GPL значительно превосходит другие методы доменной адаптации почти на всех протестированных наборах данных. В частности, GPL улучшает результат по сравнению с QGen, предыдущим методом уровня state-of-the-art, до 4,5 пункта nDCG@10 на наборе данных BioASQ. Он также показывает среднее улучшение на 2,7 пункта nDCG@10 по всем наборам данных.
Сочетание предобучения TSDAE (Transformer-based Sequential Denoising Auto-Encoder) с GPL (TSDAE + GPL) дает исключительные результаты. Этот подход устанавливает новый уровень state-of-the-art производительности, в среднем достигая 52,9 пункта nDCG@10. Примечательно, что он обеспечивает среднее улучшение на 7,7 пункта по сравнению с базовой готовой моделью MS MARCO.
Рисунок: Результаты оценки с использованием nDCG@10
Рисунок: Результаты оценки с использованием nDCG@10 | Источник
Сравнение с базовыми моделями
Чтобы понять контекст высокой эффективности GPL, сравним его с различными базовыми подходами и альтернативными методами адаптации домена.
Zero-Shot Models
Zero-shot models, обученные на MS MARCO, показывают слабые результаты на доменно-специфичных наборах данных по сравнению с простым лексическим поиском BM25. Например, современная модель dense retrieval достигает MRR@10 (Mean Reciprocal Rank at 10) в 33,2 пункта на наборе данных MS MARCO. Однако она показывает слабые результаты на шести выбранных доменно-специфичных наборах данных для поиска.
Предобучение TSDAE на MS MARCO с последующим supervised learning на MS MARCO показывает результаты немного слабее, чем zero-shot модель MS MARCO.
Previous Domain Adaptation Methods
UDALM значительно ухудшает производительность по сравнению с предобучением MLM (Masked Language Modeling), со средним снижением на 12,2 пункта nDCG@10. Это связано с тем, что прямое обучение MLM конфликтует с supervised training.
MoDIR показывает результаты наравне с zero-shot моделью MS MARCO на некоторых наборах данных, но значительно слабее на других.
Pre-Training Based Domain Adaptation
Предобучение на целевом корпусе с TSDAE, MLM и ICT (Inverse Cloze Task) может улучшить производительность по сравнению с zero-shot моделью MS MARCO. TSDAE является наиболее эффективным методом, превосходя zero-shot baseline в среднем на 4,0 пункта nDCG@10. CD, CT и SimCSE не справляются с адаптацией к доменам и показывают результаты хуже, чем zero-shot модель.
Generation-Based Domain Adaptation
GPL превосходит QGen до 4,5 пункта (на BioASQ) и в среднем на 2,7 пункта. Доменно-адаптивное предобучение на основе TSDAE в сочетании с GPL (TSDAE + GPL) дополнительно улучшает производительность на всех наборах данных. Оно достигает нового результата уровня state-of-the-art — 52,9 пункта nDCG@10.
Переранжирование с помощью Cross-Encoders
Cross-encoders хорошо работают в zero-shot setting и значительно превосходят подходы dense retrieval, но имеют существенные вычислительные затраты на этапе inference. TSDAE и GPL могут сократить, но не полностью устранить разрыв в производительности с cross-encoders. Модель TSDAE + GPL была бы предпочтительнее в production setting благодаря значительно более низким вычислительным затратам на этапе inference.
Влияние количества шагов обучения
Производительность GPL начинает насыщаться примерно после 100K шагов обучения. Предобучение TSDAE стабильно улучшает производительность на протяжении всего этапа обучения.
Рисунок: Влияние количества шагов обучения на производительность
Рисунок: Влияние количества шагов обучения на производительность | Источник
Влияние размера корпуса
GPL может превосходить zero-shot baseline при наличии более 10K фрагментов, а производительность насыщается после 50K фрагментов. Однако QGen отстает от zero-shot baseline при любом размере корпуса.
Рисунок: Влияние размера корпуса на производительность
Рисунок: Влияние размера корпуса на производительность | Источник
Устойчивость к генерации запросов
Меньшие корпуса, такие как SciFact и FiQA, требуют большего количества сгенерированных запросов на фрагмент, чем более крупный корпус Robust04, чтобы достичь оптимальной производительности. Кроме того, GPL более устойчив к низкокачественным запросам, чем QGen. Даже когда сгенерированные запросы почти не связаны с фрагментами, GPL всё равно показывает хорошие результаты.
Рисунок: Влияние количества сгенерированных QPP на производительность
Рисунок: Влияние количества сгенерированных QPP на производительность | Источник
Чувствительность к инициализации
GPL менее чувствителен к выбору начального чекпойнта. Обучение на MS MARCO оказывает относительно небольшое влияние на производительность GPL, со средней разницей в 0,3 пункта. С другой стороны, QGen сильно зависит от выбора начального чекпойнта, демонстрируя разницу в 1,9 пункта.
Рисунок: Влияние начального чекпойнта на производительность
Рисунок: Влияние начального чекпойнта на производительность | Источник
Производительность на полном BeIR
На всех 18 наборах данных BeIR GPL стабильно улучшает производительность по сравнению с zero-shot моделью. Он достигает среднего ранга 5,2. TSDAE + GPL достигает среднего ранга 4,2. При построении поверх сильной zero-shot модели TAS-B GPL обеспечивает значительный прирост производительности — до 21,5 пункта nDCG@10 (на TREC-COVID) и в среднем 4,6 пункта nDCG@10. Эта модель TAS-B + GPL показывает лучший общий результат, достигая среднего ранга, равного 3,2.
Рисунок: Производительность на всех исходных 18 наборах данных BeIR
Рисунок: Производительность на всех исходных 18 наборах данных BeIR | Источник
Значение для генеративной псевдоразметки
Метод GPL имеет несколько важных последствий для информационного поиска. К ним относятся:
Улучшенный доменно-специфический поиск: GPL улучшает результаты поиска в специализированных областях, таких как финансы и наука. Он превосходит предыдущие методы, эффективно адаптируясь к новым доменам.
Меньшая потребность в размеченных данных: GPL адаптирует модели без необходимости в размеченных данных из целевого домена, используя вместо этого неразмеченные фрагменты. Это снижает затраты и время, необходимые для разработки поисковых систем.
Обработка плохих запросов: Метод эффективен для плохо сгенерированных запросов, поскольку cross-encoder присваивает низкие оценки нерелевантным парам (запрос, фрагмент). Это гарантирует, что плотный ретривер не обучается на плохих запросах.
Эффективное использование hard negatives: GPL использует cross-encoder для генерации детализированных оценок релевантности, что делает его эффективным для обучения с hard negatives. Это приводит к более устойчивому обучению.
Эффективность и практичность: GPL можно сочетать с другими техниками, такими как TSDAE, для достижения еще лучших результатов. Он более эффективен, чем вычислительно тяжелые методы, такие как cross-encoders.
Работает на множестве наборов данных: GPL демонстрирует стабильное улучшение на 18 наборах данных, подчеркивая свою общую применимость. Метод также повышает производительность в сочетании с мощной моделью, такой как TAS-B.
GPL для улучшенного семантического поиска в векторных базах данных
Generative Pseudo Labeling (GPL) — это метод, который может напрямую повысить производительность векторных баз данных, таких как Milvus, улучшая эффективность моделей плотного поиска. Эти базы данных полагаются на плотные векторные представления для семантического поиска. GPL помогает адаптировать эти модели к новым доменам без необходимости в размеченных данных, устраняя снижение производительности, вызванное доменными сдвигами.
GPL использует предобученную модель для генерации синтетических запросов для неразмеченных данных, извлекает похожие фрагменты и применяет cross-encoder для оценки пар (запрос, фрагмент). В конечном итоге он обучает модель плотного поиска, которая лучше подходит для целевого домена.
Этот метод особенно ценен, поскольку он предоставляет способ улучшить семантический поиск в векторных базах данных, которые хранят данные в виде плотных векторов. Процесс negative mining в GPL дополнительно уточняет обучение, выявляя похожие, но нерелевантные фрагменты, что приводит к лучшему различению в семантическом поиске.
Milvus поддерживает различные типы поиска, такие как поиск приблизительных ближайших соседей (ANN), поиск с фильтрацией, диапазонный поиск, гибридный поиск и полнотекстовый поиск. Такие техники, как GPL, улучшающие базовые векторные представления, могут повысить его производительность.
Заключение и направление будущих исследований
GPL — это новый метод неконтролируемой доменной адаптации моделей плотного поиска с использованием псевдометок, генерируемых кросс-энкодером. Он значительно превосходит существующие методы доменной адаптации, особенно в сочетании с предварительным обучением TSDAE, при этом демонстрируя устойчивость к вариациям качества запросов.
Детализированные псевдометки от кросс-энкодера являются ключевым преимуществом GPL, позволяя модели обучаться более эффективно, чем при использовании грубых меток в других методах. В сочетании с предварительным обучением TSDAE GPL достигает лучшего баланса между точностью и вычислительной эффективностью, чем вычислительно затратные кросс-энкодеры.
Направление будущих исследований
Существует несколько важных направлений дальнейших исследований, нацеленных на улучшение техник доменной адаптации. Они включают:
Упрощение конвейера обучения: GPL требует относительно сложной схемы обучения. Будущие исследования могли бы сосредоточиться на упрощении этого конвейера, чтобы сделать его более удобным для практических приложений.
Изучение других методов предварительного обучения: Будущие работы могли бы изучить сочетание GPL с другими методами предварительного обучения помимо TSDAE, чтобы проверить, можно ли добиться дальнейшего улучшения производительности.
Домен-специфическая настройка: Изучение способов тонкой настройки моделей GPL для отдельных доменов с целью улучшения производительности в конкретных областях. Например, было обнаружено, что разным наборам данных требуется разное количество сгенерированных запросов на пассаж.
Исследование альтернатив кросс-энкодерам: Кросс-энкодер является важным компонентом GPL, но он требует значительных вычислительных ресурсов. Изучение других способов создания столь же эффективных псевдометок могло бы дополнительно снизить затраты.
Адаптация GPL к языкам с ограниченными ресурсами: Успех GPL в доменной адаптации предполагает, что этот метод может быть полезно применить к языкам с ограниченными ресурсами, где размеченные обучающие данные ограничены.
Сочетание GPL с другими методами адаптации: Было бы интересно исследовать, может ли сочетание GPL с другими методами доменной адаптации дополнительно повысить производительность. Это включает такие методы, как состязательное обучение или многозадачное обучение.
Дополнительные ресурсы
Читать далее

Introducing Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud
We're announcing the general availability of Customer-Managed Encryption Keys (CMEK) on Zilliz Cloud.

DeepSeek-OCR Explained: Optical Compression for Scalable Long-Context and RAG Systems
Discover how DeepSeek-OCR uses visual tokens and Contexts Optical Compression to boost long-context LLM efficiency and reshape RAG performance.

Legal Document Analysis: Harnessing Zilliz Cloud's Semantic Search and RAG for Legal Insights
Enhance legal document analysis with Zilliz Cloud’s Semantic Search and RAG. Improve accuracy, efficiency, and scalability for contracts, case law, and compliance.



