GPL : pseudo-étiquetage génératif pour l’adaptation de domaine non supervisée de la recherche dense
La recherche d’information est importante pour de nombreuses applications de traitement automatique du langage naturel (NLP). Bien que les méthodes lexicales traditionnelles aient été utilisées pour rechercher dans du contenu textuel, elles souffrent d’un fossé lexical. Ces méthodes ne peuvent pas reconnaître les synonymes ni distinguer les mots ambigus.
Les méthodes de recherche dense qui projettent les requêtes et les passages dans un espace vectoriel partagé sont devenues populaires pour résoudre ces problèmes, montrant une amélioration par rapport aux approches traditionnelles. Cependant, elles nécessitent de grands jeux de données d’entraînement et sont sensibles aux changements de domaine. Par exemple, les modèles entraînés sur MS MARCO obtiennent de mauvais résultats dans la littérature sur la COVID-19.
Ainsi, il est nécessaire de créer une méthode capable d’adapter efficacement les modèles de recherche dense à de nouveaux domaines sans nécessiter de grandes quantités de données étiquetées. Une méthode proposée est GPL (Generative Pseudo Labeling), une technique d’adaptation de domaine non supervisée pour les modèles de recherche dense qui combine un générateur de requêtes avec un pseudo-étiquetage. GPL utilise un modèle T5 pour générer des requêtes pour un domaine cible. Elle récupère des passages négatifs à l’aide d’un modèle de recherche dense existant et utilise un cross-encoder pour évaluer les paires (requête, passage).
GPL surpasse les autres méthodes d’adaptation de domaine. Elle améliore les performances jusqu’à 9,3 nDCG@10 (gain cumulé actualisé normalisé au rang 10) par rapport aux modèles entraînés sur MS MARCO et jusqu’à 4,5 nDCG@10 par rapport à QGen (génération de requêtes).
Figure : GPL pour l’entraînement d’un récupérateur dense adapté au domaine
Figure : GPL pour l’entraînement d’un récupérateur dense adapté au domaine | Source
Cet article expliquera comment GPL résout le problème de l’adaptation de domaine, ses mécanismes sous-jacents et les améliorations qu’elle offre par rapport aux méthodes d’adaptation de domaine précédentes. Pour plus de détails, veuillez consulter l’article Generative Pseudo Labeling.
Pourquoi la recherche dense ne suffit pas toujours
Malgré leurs capacités impressionnantes, les méthodes de recherche dense ont leurs inconvénients. Les problèmes les plus importants sont le besoin de grands jeux de données d’entraînement et les difficultés qu’elles rencontrent lors de l’adaptation à de nouveaux domaines. Voici un aperçu de ces défis :
Exigences en matière de données : Les modèles de recherche dense nécessitent de grandes quantités de données d’entraînement pour fonctionner efficacement. Cette exigence en matière de données représente un défi important pour l’application de la recherche dense dans des domaines spécialisés où de grands jeux de données étiquetées ne sont pas disponibles.
Sensibilité aux changements de domaine : Les modèles de recherche dense sont extrêmement sensibles aux changements de domaine. Leurs performances diminuent lorsqu’ils sont appliqués à un domaine différent de celui sur lequel ils ont été entraînés.
Fossé lexical : Les méthodes lexicales traditionnelles, une alternative à la recherche dense, souffrent d’un fossé lexical. Elles ne peuvent pas reconnaître les synonymes ni différencier les mots ambigus.
Performance en zero-shot : Les modèles de recherche dense obtiennent souvent de mauvais résultats sur un corpus donné lorsqu’ils sont appliqués dans un contexte zero-shot.
Présentation de GPL : une solution rapide et robuste pour l’adaptation de domaine
GPL est une technique d’adaptation de domaine non supervisée conçue pour améliorer les performances des modèles de recherche dense lorsqu’ils sont appliqués à de nouveaux domaines. La méthode comprend plusieurs étapes clés, notamment :
Génération de requêtes
Extraction de négatifs
Pseudo-étiquetage
Entraînement du récupérateur dense
Génération de requêtes via T5
Le processus GPL commence par la génération de requêtes, où des requêtes synthétiques sont créées pour chaque passage au sein du domaine cible. Cela est réalisé à l’aide d’un modèle encodeur-décodeur T5 pré-entraîné.
Le modèle T5 est entraîné sur de grands jeux de données comme MS MARCO (Microsoft Machine Reading Comprehension). Il génère des requêtes pertinentes par rapport au contenu de chaque passage, créant essentiellement des paires question-réponse synthétiques.
Le nombre de requêtes générées par passage est ajusté en fonction de la taille du corpus afin de maintenir cohérent le nombre total de requêtes générées. Cette création de données synthétiques est importante, car elle fournit des données pour l’entraînement ultérieur du récupérateur dense pour le domaine cible spécifique.
Extraction de négatifs via récupération dense
La méthode GPL utilise un modèle de récupération dense pré-entraîné pour chaque requête générée afin de trouver les paragraphes les plus similaires dans le corpus cible. Ces paragraphes similaires sont ensuite traités comme des passages négatifs, ce qui signifie qu’ils ne sont pas pertinents pour la requête.
Cette étape est conçue pour identifier des « négatifs difficiles ». Ces exemples complexes aident le modèle à différencier les passages similaires mais non pertinents. Deux récupérateurs denses entraînés sur MS MARCO, ‘msmarco-distilbert-base-v3’ et ‘msmarco-MiniLM-L-6-v3’, sont utilisés afin de garantir un ensemble diversifié d’exemples négatifs.
Enfin, un passage positif et un passage négatif sont sélectionnés parmi les passages récupérés pour chaque exemple d’entraînement.
Pseudo-étiquetage via cross-encoder
L’étape suivante consiste à noter les paires (requête, passage) à l’aide d’un cross-encoder. Contrairement aux bi-encoders, qui projettent indépendamment les requêtes et les passages dans un espace vectoriel partagé. Un cross-encoder prend la concaténation de la requête et du passage et prédit un score de pertinence à l’aide de l’attention croisée.
Cette étape attribue un score de pertinence continu et finement détaillé à chaque paire (requête, passage positif) et à chaque paire (requête, passage négatif). Ces scores sont les pseudo-étiquettes. Le modèle cross-encoder utilisé pour les pseudo-étiquettes est ms-marco-MiniLM-L-6-v2. Les scores continus fournissent des informations plus détaillées que les étiquettes binaires utilisées dans d’autres méthodes.
Entraînement du récupérateur dense avec la perte MarginMSE
Enfin, le modèle de récupération dense (récupérateur dense étudiant) est entraîné à l’aide des triplets générés (requête, positif, négatif) et des scores correspondants du cross-encoder avec la perte MarginMSE. L’objectif est d’apprendre au récupérateur dense à imiter la marge de score entre les paires requête-passage positives et négatives du cross-encoder. La fonction de perte MarginMSE est définie comme suit :
LMarginMSE()= -1Mi=0M-1|i-i|2
Où :
M est la taille du batch.
i est la marge de score correspondante du récupérateur dense étudiant :
i= f(Qi)T f(Pi)- f(Qi)f(P_)
- où f est le récupérateur dense, Qi est la requête, Pi est le passage positif et P_ est le passage négatif.
- i est la marge de score du cross-encoder :
= CE(Q, P+)-CE(Q, P_)
Cette fonction de perte aide le modèle à apprendre un espace vectoriel. Dans cet espace, les requêtes sont plus proches des passages pertinents et plus éloignées des passages non pertinents, comme défini par les pseudo-étiquettes du cross-encoder. La perte MarginMSE corrige les limites des méthodes précédentes comme QGen. QGen utilise la perte Multiple Negatives Ranking (MNRL), qui ne prend en compte que la relation grossière entre les requêtes et les passages.
Conception expérimentale pour la récupération dense adaptée au domaine
La configuration d’évaluation de GPL vise à mesurer son efficacité dans l’adaptation des modèles de récupération dense à des tâches spécifiques. Voici une présentation des principaux composants de la configuration :
Jeux de données
Deux jeux de données sont utilisés : l’un pour le domaine source et l’autre pour le domaine cible.
- Données du domaine source : Le jeu de données de classement de passages MS MARCO est utilisé comme données du domaine source. Ce jeu de données se compose de 8,8 millions de passages et de 532,8 K paires requête-passage étiquetées comme pertinentes. Les modèles sont entraînés sur MS MARCO puis adaptés à un domaine cible à l’aide de la méthode GPL.
- Jeux de données du domaine cible : Six jeux de données de recherche textuelle spécifiques à un domaine issus du benchmark BeIR sont utilisés pour évaluer les capacités d’adaptation de domaine de GPL. Le nombre Ces jeux de données représentent un éventail de domaines spécialisés et comprennent :
FiQA (domaine financier)
SciFact (articles scientifiques)
BioASQ (questions-réponses biomédicales)
TREC-COVID (articles scientifiques sur la COVID-19)
CQADupStack (12 sous-forums StackExchange)
Robust04 (articles de presse)
Ces jeux de données diffèrent par :
Tailles : Variation des tailles des corpus.
Longueurs des requêtes et des passages : Chaque jeu de données présente des caractéristiques distinctes.
Étiquettes de pertinence : Le nombre de passages pertinents par requête varie.
Certains jeux de données ont été modifiés pour un entraînement et une évaluation efficaces. Par exemple :
- BioASQ : Les passages non pertinents ont été supprimés afin de réduire la taille du corpus.
Références
Plusieurs modèles de référence ont été inclus à des fins de comparaison :
Modèles zero-shot : Ces modèles sont entraînés sur les jeux de données MS MARCO ou PAQ et évalués sur les jeux de données cibles sans aucune adaptation de domaine. Un système de recherche lexicale BM25 est également inclus comme référence.
Méthodes précédentes d’adaptation de domaine : UDALM et MoDIR sont inclus comme références représentant des approches antérieures de l’adaptation de domaine.
Méthodes d’adaptation de domaine fondées sur le pré-entraînement : Ces méthodes incluent le pré-entraînement des récupérateurs denses sur le corpus cible, puis l’entraînement du modèle sur le jeu de données MS MARCO. Différentes méthodes de pré-entraînement, telles que CD, SimCSE, CT, MLM, ICT et TSDAE, ont été utilisées.
Adaptation de domaine fondée sur la génération : Les modèles QGen sont entraînés avec des négatifs intra-lot et des négatifs difficiles. De plus, le pré-entraînement TSDAE combiné à QGen est inclus.
Entraînement
Le modèle DistilBERT est utilisé pour toutes les expériences avec une longueur de séquence maximale de 350, avec mean pooling et similarité par produit scalaire.
Les modèles QGen sont entraînés pendant 1 époque, avec une taille de lot de 75.
Les modèles GPL sont entraînés pendant 140 k étapes, avec une taille de lot de 32.
Les méthodes de pré-entraînement telles que TSDAE et les modèles MLM ont été entraînées pendant 100 K étapes d’entraînement avec une taille de lot de 8.
Métrique d’évaluation
Les performances des modèles sont évaluées à l’aide de nDCG@10 (normalized Discounted Cumulative Gain au rang 10). Elle évalue la qualité d’un classement en tenant compte de la pertinence des éléments récupérés. Elle accorde davantage de poids aux documents très pertinents apparaissant en haut de la liste classée.
Efficacité et performances de GPL dans l’adaptation de domaine
La méthode GPL a été évaluée par rapport à plusieurs références, et ses performances ont été analysées dans différentes conditions. L’évaluation est effectuée à l’aide de nDCG@10, qui mesure la pertinence des 10 premiers résultats d’une liste classée.
Performance globale de GPL
GPL surpasse nettement les autres méthodes d’adaptation de domaine sur presque tous les jeux de données testés. Plus précisément, GPL améliore QGen, une méthode précédente à l’état de l’art, jusqu’à 4,5 points nDCG@10 sur le jeu de données BioASQ. Elle montre également une amélioration moyenne de 2,7 points nDCG@10 sur l’ensemble des jeux de données.
La combinaison du pré-entraînement TSDAE (Transformer-based Sequential Denoising Auto-Encoder) avec GPL (TSDAE + GPL) donne des résultats exceptionnels. Cette approche établit une nouvelle performance à l’état de l’art, avec une moyenne de 52,9 points nDCG@10. Il est à noter qu’elle offre une amélioration moyenne de 7,7 points par rapport au modèle MS MARCO prêt à l’emploi de référence.
Figure : Résultats d’évaluation avec nDCG@10
Figure : Résultats d’évaluation avec nDCG@10 | Source
Comparaison avec les références
Pour comprendre le contexte des fortes performances de GPL, comparons-le à diverses approches de référence et méthodes alternatives d’adaptation de domaine.
Modèles Zero-Shot
Les modèles zero-shot entraînés sur MS MARCO obtiennent de faibles performances sur les jeux de données spécifiques à un domaine par rapport à de simples recherches lexicales BM25. Par exemple, un modèle de recherche dense à l’état de l’art atteint un MRR@10 (Mean Reciprocal Rank at 10) de 33,2 points sur le jeu de données MS MARCO. Cependant, ses performances sont faibles sur les six jeux de données de recherche spécifiques à un domaine sélectionnés.
Le pré-entraînement TSDAE sur MS MARCO, suivi d’un apprentissage supervisé sur MS MARCO, obtient des performances légèrement inférieures à celles du modèle MS MARCO zero-shot.
Méthodes précédentes d’adaptation de domaine
UDALM nuit fortement aux performances par rapport au pré-entraînement MLM (Masked Language Modeling), avec une baisse moyenne de 12,2 points nDCG@10. Cela s’explique par le fait que l’entraînement MLM direct entre en conflit avec l’entraînement supervisé.
MoDIR obtient des performances comparables à celles du modèle MS MARCO zero-shot sur certains jeux de données, mais des performances beaucoup plus faibles sur d’autres.
Adaptation de domaine basée sur le pré-entraînement
Le pré-entraînement sur le corpus cible avec TSDAE, MLM et ICT (Inverse Cloze Task) peut améliorer les performances par rapport au modèle MS MARCO zero-shot. TSDAE est la méthode la plus efficace, dépassant la référence zero-shot de 4,0 points nDCG@10 en moyenne. CD, CT et SimCSE ne parviennent pas à s’adapter aux domaines et obtiennent de moins bonnes performances que le modèle zero-shot.
Adaptation de domaine basée sur la génération
GPL surpasse QGen jusqu’à 4,5 points (sur BioASQ) et de 2,7 points en moyenne. Le pré-entraînement adaptatif au domaine basé sur TSDAE combiné à GPL (TSDAE + GPL) améliore encore les performances sur tous les jeux de données. Il atteint un nouveau résultat à l’état de l’art de 52,9 points nDCG@10.
Re-classement avec des Cross-Encoders
Les cross-encoders obtiennent de bonnes performances dans un contexte zero-shot et surpassent nettement les approches de recherche dense, mais ils entraînent un coût de calcul important à l’inférence. TSDAE et GPL peuvent réduire, sans toutefois combler entièrement, l’écart de performance avec les cross-encoders. Le modèle TSDAE + GPL serait préférable dans un contexte de production en raison de coûts de calcul beaucoup plus faibles à l’inférence.
Influence du nombre d’étapes d’entraînement
Les performances de GPL commencent à saturer après environ 100K étapes d’entraînement. Le pré-entraînement TSDAE améliore constamment les performances tout au long de la phase d’entraînement.
Figure : Influence du nombre d’étapes d’entraînement sur les performances
Figure : Influence du nombre d’étapes d’entraînement sur les performances | Source
Influence de la taille du corpus
GPL peut surpasser la référence zero-shot avec plus de 10K passages, et les performances saturent après 50K passages. Cependant, QGen reste derrière la référence zero-shot pour chaque taille de corpus.
Figure : Influence de la taille du corpus sur les performances
Figure : Influence de la taille du corpus sur les performances | Source
Robustesse face à la génération de requêtes
Les corpus plus petits, tels que SciFact et FiQA, nécessitent un nombre plus élevé de requêtes générées par passage que le corpus Robust04, plus grand, pour atteindre des performances optimales. De plus, GPL est plus robuste que QGen face aux requêtes de faible qualité. Même lorsque les requêtes générées n’ont presque aucun lien avec les passages, GPL obtient tout de même de bonnes performances.
Figure : Influence du nombre de QPP générés sur les performances
Figure : Influence du nombre de QPP générés sur les performances | Source
Sensibilité à l’initialisation
GPL est moins sensible au choix du point de contrôle d’initialisation. L’entraînement MS MARCO a un effet relativement faible sur les performances de GPL, avec une différence moyenne de 0,3 point. En revanche, QGen dépend fortement du choix du point de contrôle d’initialisation, affichant une différence de 1,9 point.
Figure : Influence du point de contrôle d’initialisation sur les performances
Figure : Influence du point de contrôle d’initialisation sur les performances | Source
Performances sur l’ensemble complet de BeIR
Sur les 18 jeux de données BeIR complets, GPL améliore systématiquement les performances par rapport au modèle zero-shot. Il atteint un rang moyen de 5,2. TSDAE + GPL atteint un rang moyen de 4,2. Lorsqu’il s’appuie sur le puissant modèle zero-shot TAS-B, GPL génère des gains de performance significatifs allant jusqu’à 21,5 points nDCG@10 (sur TREC-COVID) et 4,6 points nDCG@10 en moyenne. Ce modèle TAS-B + GPL obtient les meilleures performances globales, atteignant un rang moyen égal à 3,2.
Figure : Performances sur l’ensemble des 18 jeux de données BeIR originaux
Figure : Performances sur l’ensemble des 18 jeux de données BeIR originaux | Source
Implications du Generative Pseudo Labeling
La méthode GPL a plusieurs implications importantes pour la recherche d’information. Celles-ci incluent :
Meilleure recherche spécifique à un domaine : GPL améliore les résultats de recherche dans des domaines spécialisés comme la finance et la science. Il surpasse les méthodes précédentes en s’adaptant efficacement à de nouveaux domaines.
Moins besoin de données étiquetées : GPL adapte les modèles sans nécessiter de données étiquetées provenant du domaine cible, en utilisant plutôt des passages non étiquetés. Cela réduit le coût et le temps nécessaires au développement de systèmes de recherche.
Gestion des requêtes de mauvaise qualité : La méthode est efficace pour les requêtes mal générées, car un cross-encoder attribue de faibles scores aux paires (requête, passage) non pertinentes. Cela garantit que le récupérateur dense n’apprend pas à partir de mauvaises requêtes.
Utilise efficacement les négatifs difficiles : GPL utilise un cross-encoder pour générer des scores de pertinence à granularité fine, ce qui le rend efficace pour l’entraînement avec des négatifs difficiles. Cela conduit à un entraînement plus robuste.
Efficace et pratique : GPL peut être combiné avec d’autres techniques comme TSDAE pour obtenir des résultats encore meilleurs. Il est plus efficace que les méthodes lourdes en calcul comme les cross-encoders.
Fonctionne sur de nombreux jeux de données : GPL montre une amélioration constante sur 18 jeux de données, soulignant son applicabilité générale. La méthode améliore également les performances lorsqu’elle est combinée à un modèle puissant comme TAS-B.
GPL pour une recherche sémantique améliorée dans les bases de données vectorielles
Generative Pseudo Labeling (GPL) est une méthode qui peut améliorer directement les performances des bases de données vectorielles telles que Milvus en améliorant l’efficacité des modèles de récupération dense. Ces bases de données s’appuient sur des représentations vectorielles denses pour la recherche sémantique. GPL aide à adapter ces modèles à de nouveaux domaines sans nécessiter de données étiquetées, en remédiant à la dégradation des performances causée par les changements de domaine.
GPL utilise un modèle préentraîné pour générer des requêtes synthétiques à partir de données non étiquetées, récupère des passages similaires, et emploie un cross-encoder pour noter les paires (requête, passage). Au final, il entraîne un modèle de récupération dense plus adapté au domaine cible.
Cette méthode est particulièrement précieuse, car elle fournit un moyen d’améliorer la recherche sémantique dans les bases de données vectorielles, qui stockent les données sous forme de vecteurs denses. Le processus d’extraction de négatifs dans GPL affine davantage l’entraînement en identifiant des passages similaires mais non pertinents, ce qui conduit à de meilleures distinctions en recherche sémantique.
Milvus prend en charge différents types de recherches, comme la recherche Approximate Nearest Neighbor (ANN), la recherche avec filtrage, la recherche par plage, la recherche hybride et la recherche en texte intégral. Des techniques comme GPL, qui améliorent les représentations vectorielles sous-jacentes, peuvent renforcer ses performances.
Conclusion et orientation des recherches futures
GPL est une méthode novatrice d’adaptation de domaine non supervisée pour les modèles de recherche dense, utilisant des pseudo-étiquettes générées par un encodeur croisé. Elle surpasse nettement les méthodes d’adaptation de domaine existantes, en particulier lorsqu’elle est combinée à un pré-entraînement TSDAE, tout en faisant preuve de robustesse face aux variations de qualité des requêtes.
Les pseudo-étiquettes fines issues de l’encodeur croisé constituent un avantage clé de GPL, permettant au modèle d’apprendre plus efficacement qu’avec les étiquettes grossières utilisées dans d’autres méthodes. Lorsqu’elle est combinée au pré-entraînement TSDAE, GPL atteint un meilleur équilibre entre précision et efficacité computationnelle que les encodeurs croisés intensifs en calcul.
Orientation des recherches futures
Il existe plusieurs pistes importantes pour de futures recherches visant à améliorer les techniques d’adaptation de domaine. Celles-ci incluent :
Simplification du pipeline d’entraînement : GPL nécessite une configuration d’entraînement relativement complexe. Les recherches futures pourraient se concentrer sur la simplification de ce pipeline afin de le rendre plus facile à utiliser pour des applications pratiques.
Exploration d’autres méthodes de pré-entraînement : Les travaux futurs pourraient explorer la combinaison de GPL avec d’autres méthodes de pré-entraînement au-delà de TSDAE afin de déterminer si de nouvelles améliorations de performance peuvent être obtenues.
Ajustement spécifique au domaine : Explorer des façons d’affiner les modèles GPL pour des domaines individuels afin d’améliorer les performances dans des domaines spécifiques. Par exemple, il a été constaté que différents jeux de données nécessitent différentes quantités de requêtes générées par passage.
Étude d’alternatives aux encodeurs croisés : L’encodeur croisé est un composant important de GPL, mais il est intensif en calcul. Explorer d’autres façons de créer des pseudo-étiquettes tout aussi efficaces pourrait réduire davantage les coûts.
Adaptation de GPL aux langues à faibles ressources : Le succès de GPL dans l’adaptation de domaine suggère qu’il pourrait être bénéfique d’appliquer cette méthode aux langues à faibles ressources où les données d’entraînement étiquetées sont limitées.
Combinaison de GPL avec d’autres méthodes d’adaptation : Il pourrait être intéressant d’examiner si la combinaison de GPL avec d’autres méthodes d’adaptation de domaine peut améliorer davantage les performances. Cela inclut des méthodes telles que l’entraînement adversarial ou l’apprentissage multitâche.
Ressources complémentaires
Article GPL : https://arxiv.org/pdf/2112.07577
Soyez comme un poisson rouge, ne mémorisez pas ! Atténuer la mémorisation dans les LLMs génératifs
Libérer la puissance de l’apprentissage en contexte avec de nombreux exemples dans les LLMs
LLM-Eval : une approche rationalisée pour évaluer les conversations des LLM
Qu’est-ce qu’une base de données vectorielle et comment fonctionne-t-elle ?
Vecteurs denses en IA : maximiser le potentiel des données en apprentissage automatique
Continuer à lire

Zilliz Cloud Just Landed in Claude Code
The Zilliz Cloud Plugin brings the full power of Zilliz Cloud directly into your Claude Code terminal as natural-language conversations.

A Developer's Guide to Exploring Milvus 2.6 Features on Zilliz Cloud
Milvus 2.6 marks a shift from “vector search + glue code” to a more advanced retrieval engine, and it is now Generally Available (GA) on Zilliz Cloud (a managed Milvus service).

Introducing Zilliz MCP Server: Natural Language Access to Your Vector Database
Developers can easily manage and query vector databases with natural language via Zilliz MCP Server in AI-native environments.



