SBERT augmenté : une méthode d’augmentation des données pour améliorer les bi-encodeurs pour la notation de phrases par paires
Introduction
La notation de phrases par paires est fondamentale pour diverses tâches de traitement du langage naturel (NLP), notamment la similarité sémantique, la détection de paraphrases et la recherche d'information. Ces tâches alimentent des applications critiques comme les moteurs de recherche, les systèmes de recommandation et les chatbots, qui utilisent des comparaisons précises de phrases pour comprendre les requêtes des utilisateurs et y répondre. Cependant, les méthodes existantes, comme les encodeurs croisés et les bi-encodeurs, sont confrontées à des défis importants.
Les encodeurs croisés comme BERT (Bidirectional Encoder Representations from Transformers) comparent directement les phrases pour obtenir des résultats optimaux, mais ils sont lents et coûteux pour une utilisation à grande échelle. En revanche, les bi-encodeurs comme SBERT (Sentence-BERT) sont plus rapides et plus évolutifs grâce au traitement indépendant des phrases, bien qu’ils aient des difficultés avec des représentations de données limitées.
Comparaison de la corrélation de rang de Spearman (ρ) entre les encodeurs croisés et les bi-encodeurs sur le jeu de données STSb (anglais), montrant les performances selon différentes tailles d’entraînement (en milliers)
Figure : Comparaison de la corrélation de rang de Spearman (ρ) entre les encodeurs croisés et les bi-encodeurs sur le jeu de données STSb (anglais), montrant les performances selon différentes tailles d’entraînement (en milliers) | Source
Augmented SBERT (AugSBERT) est une extension de SBERT qui répond aux limitations des bi-encodeurs grâce à l’augmentation de données et génère des données d’entraînement supplémentaires. Cette approche maintient des performances élevées dans les scénarios où les données sont rares. AugSBERT utilise l’optimisation des graines, en entraînant plusieurs modèles avec des graines variées afin d’identifier le meilleur. La sélection des paires de phrases est essentielle ; il utilise l’échantillonnage BM25 pour sélectionner efficacement les paires pertinentes, améliorant ainsi les performances.
AugSBERT atteint une amélioration de 1 à 6 % de la précision dans le domaine et des gains pouvant aller jusqu’à 37 points dans les scénarios d’adaptation de domaine. Il offre une solution pratique pour des tâches de notation de phrases précises et évolutives.
Ce blog abordera les défis auxquels les méthodes traditionnelles comme les encodeurs croisés et les bi-encodeurs sont confrontées, ainsi que la manière dont augmented SBERT résout ces problèmes. Nous verrons également comment fonctionne AugSBERT, son utilisation innovante de l’augmentation de données et sa capacité à améliorer les performances des bi-encodeurs. Pour une compréhension détaillée, veuillez vous référer à l’article suivant.
Figure : Un encodeur croisé (à droite) prend les deux phrases comme une seule entrée en une étape d’inférence BERT et produit un score de similarité. De l’autre côté, les bi-encodeurs (à gauche) traitent chaque phrase indépendamment, produisant des vecteurs de phrases | Source
Pourquoi l’augmentation de données est-elle essentielle pour AugSBERT ?
L’augmentation de données est au cœur d’Augmented SBERT (AugSBERT). Elle aide à générer de nouvelles paires de phrases en échantillonnant les paires de phrases existantes. L’augmentation de données peut résoudre les défis de SBERT liés aux petits jeux de données et aux paires de phrases limitées. Voici pourquoi elle est essentielle :
Générer des paires de phrases diversifiées : AugSBERT utilise l’augmentation de données pour générer des paires de phrases diversifiées. Il réutilise des phrases individuelles issues des paires de phrases étiquetées existantes (jeu d’entraînement de référence) et les recombine pour créer de nouvelles paires de phrases.
Stimule l’apprentissage à faibles ressources : L’augmentation génère des paires de phrases synthétiques pour accroître les données d’entraînement destinées au fine-tuning de SBERT. Elle permet à AugSBERT d’être affiné en un transformeur de phrases très performant, même avec de petits jeux de données, ce qui constituait auparavant une limitation.
Le problème avec les méthodes traditionnelles de notation des phrases
Les méthodes traditionnelles de notation des phrases ont posé les bases des techniques modernes. Cependant, elles présentent des limites notables. Ces inconvénients soulignent la nécessité de meilleures approches, comme Augmented SBERT. Voici les principaux problèmes des méthodes traditionnelles :
Pas de représentations indépendantes des phrases : Les cross-encoders comme BERT fonctionnent bien sur les tâches de notation de phrases en encodant les deux phrases ensemble. Cependant, cela ne crée pas d’embeddings indépendants pour chaque phrase. Il faut une étape d’inférence complète pour obtenir une seule similarité par paire, ce qui le rend inutilisable pour la plupart des cas d’utilisation.
Inefficacité dans la recherche à grande échelle : Les cross-encoders sont précis mais ne peuvent pas générer d’embeddings de phrases de taille fixe. Cela les rend difficiles à utiliser dans les tâches de recherche à grande échelle. Les poly-encoders rencontrent également des difficultés d’indexation, ce qui les rend moins adaptés.
Exigences importantes en données : Les bi-encoders nécessitent une grande quantité de données avec des paires de phrases pour l’entraînement. La collecte de ces données étiquetées peut être chronophage et gourmande en ressources. Sans données suffisantes, leurs performances peuvent en pâtir.
Notation asymétrique : Les poly-encoders résolvent certains problèmes des bi-encoders et des cross-encoders. Cependant, la fonction de score est asymétrique, ce qui limite son utilisation dans les tâches nécessitant une similarité symétrique.
Augmented SBERT résout ces problèmes. Il utilise l’augmentation des données et l’échantillonnage pour créer des embeddings de phrases de haute qualité. Il est efficace et fonctionne bien sur différentes tâches.
Augmented SBERT
Augmented SBERT est une méthode de pointe pour améliorer les performances des bi-encoders dans les tâches de paires de phrases. Elle répond aux limites critiques des modèles existants en utilisant l’augmentation des données et l’apprentissage semi-supervisé, ce qui en fait une solution robuste pour les scénarios intra-domaine et d’adaptation de domaine. Cette méthode se concentre sur les tâches de paires de phrases, telles que la similarité textuelle sémantique, l’appariement question-réponse et la recherche d’informations. Des techniques d’augmentation adaptées à ces tâches sont utilisées pour améliorer les performances.
En quoi Augmented SBERT est-il différent ?
Augmented SBERT (AugSBERT) améliore SBERT grâce à des changements clés dans la gestion des données, l’entraînement et les performances. Voici en quoi ils diffèrent :
Exigences réduites en données : SBERT nécessite de grandes quantités de données étiquetées de haute qualité. AugSBERT réduit ce besoin en utilisant des données automatiquement étiquetées et des techniques plus intelligentes.
Augmentation des données : SBERT utilise un ensemble fixe de paires de phrases étiquetées, ce qui peut limiter ses performances, surtout avec de petits jeux de données. AugSBERT applique l’augmentation des données pour générer de nouvelles paires de phrases, élargissant ainsi les données d’entraînement.
Cross-encoder pour l’étiquetage des paires de phrases : AugSBERT utilise des cross-encoders pour étiqueter de nouvelles paires de phrases, ajoutant davantage de données pour le fine-tuning. Il combine des jeux de données gold (haute qualité) et silver (générés automatiquement) afin d’améliorer les performances du modèle.
Échantillonnage des paires de phrases : AugSBERT emploie des techniques d’échantillonnage intelligentes pour sélectionner des paires de phrases qui améliorent la qualité de l’entraînement.
Performances dans différents domaines : AugSBERT s’adapte mieux aux scénarios intra-domaine et hors domaine. Son jeu de données diversifié et augmenté aide le modèle à généraliser plus efficacement à de nouvelles tâches et à de nouveaux domaines.
Comment fonctionne Augmented SBERT ?
Augmented SBERT génère de nouvelles paires de phrases grâce à l’augmentation des données. Ensuite, il étiquette ces paires à l’aide d’un cross-encoder pour créer un jeu de données silver. Le jeu de données silver est combiné au jeu de données gold pour affiner le bi-encoder (SBERT).
Figure : Approche intra-domaine d’Augmented SBERT
Figure : Approche intra-domaine d’Augmented SBERT | Source
Maintenant, décomposons les étapes spécifiques impliquées dans le processus :
Étape 0 : Ajustement fin du cross-encoder
Un cross-encoder (BERT) est d’abord ajusté finement sur le jeu de données gold, une collection de paires de phrases de haute qualité annotées par des humains. Ce cross-encoder ajusté finement est ensuite utilisé pour générer des étiquettes faibles pour de nouvelles paires de phrases non étiquetées. Les étiquettes faibles issues du cross-encoder soutiennent l’ajustement fin du bi-encoder plus tard dans le processus.
Étape 1 : Création du jeu de données silver
Étiquetage (Étape 1.1) : Les paires de phrases non étiquetées sont passées dans le cross-encoder ajusté finement. Le modèle attribue des étiquettes et crée le jeu de données silver. Ce jeu de données est appelé "silver" parce que les étiquettes sont générées par une machine, et non annotées par des humains.
Échantillonnage (Étape 1.2) : Étiqueter chaque paire de phrases possible serait trop coûteux et inefficace. Pour résoudre ce problème, AugSBERT utilise des stratégies d’échantillonnage afin de sélectionner les paires les plus pertinentes à étiqueter. L’échantillonnage améliore l’efficacité et garantit que l’étiquetage est effectué de manière plus efficace. Cela aide le modèle à mieux fonctionner sans gaspiller de ressources sur des combinaisons inutiles. Certaines méthodes d’échantillonnage incluent Random Sampling, Kernel Density Estimation (KDE), BM25, et Semantic Search. Vous pouvez en apprendre davantage sur chacune de ces méthodes dans la section suivante.
Étape 2 : Entraînement et prédiction
Ajustement fin du bi-encoder (Étape 2.1) : Le jeu de données silver est combiné au jeu de données gold pour ajuster finement le bi-encoder (SBERT). Le bi-encoder est entraîné à projeter chaque phrase indépendamment dans un espace vectoriel dense pendant ce processus.
Prédiction (Étape 2.2) : Le bi-encoder ajusté finement génère des embeddings de phrases qui peuvent être comparés pour des tâches telles que la notation de similarité.
Ce pipeline combine l’étiquetage précis du cross-encoder avec l’efficacité du bi-encoder, améliorant les performances sur les tâches de paires de phrases. Le diagramme d’architecture illustre ce processus, de l’étiquetage aux prédictions finales.
Configuration expérimentale : données, échantillonnage, référence et évaluation
Voici la configuration de l’expérience, y compris le jeu de données utilisé, les approches d’échantillonnage et d’autres composants clés tels que les références et les méthodes d’évaluation.
Jeu de données
L’étude utilise à la fois des jeux de données à domaine unique (par exemple, Quora, AskUbuntu) et multidomaines (par exemple, Quora, Sprint, SuperUser). Ces jeux de données sont conçus pour des tâches de paires de phrases, les tâches multidomaines se concentrant sur l’adaptation de domaine à travers des communautés spécialisées.
Figure : Résumé de tous les jeux de données utilisés pour diverses tâches de paires de phrases intra-domaine
Figure : Résumé de tous les jeux de données utilisés pour diverses tâches de paires de phrases intra-domaine | Source
Échantillonnage
L’échantillonnage de paires est essentiel dans Augmented SBERT. Choisir les bonnes paires de phrases n’est pas simple et constitue un facteur clé du succès d’AugSBERT. Étiqueter toutes les paires de phrases possibles serait trop coûteux et inefficace. Pour résoudre ce problème, AugSBERT utilise des stratégies d’échantillonnage pour se concentrer sur les paires les plus pertinentes à étiqueter.
Un mauvais échantillonnage peut introduire des paires non pertinentes, ce qui peut nuire aux performances du modèle et ne conduire probablement à aucune amélioration.
Une variable clé dans l’échantillonnage est le top k. L’impact de k est minimal dans AugSBERT, les meilleurs résultats étant généralement obtenus avec k = 3 ou k = 5.
Voici quelques stratégies d’échantillonnage courantes utilisées dans AugSBERT :
Random Sampling (RS) : Cette méthode sélectionne aléatoirement des paires de phrases à étiqueter. Elle produit souvent des paires dissemblables (négatives) et peu de paires positives. Cela provoque un déséquilibre dans le jeu de données silver, le rendant moins utile.
Estimation de densité par noyau (KDE) : KDE vise à équilibrer la distribution des étiquettes du jeu de données silver avec celle du jeu de données gold. Elle étiquette faiblement un grand ensemble de paires de phrases, puis sélectionne des paires pour correspondre à la distribution des étiquettes positives et négatives. L’objectif est de minimiser les différences entre les distributions. Cependant, KDE est coûteuse en calcul, car elle nécessite d’étiqueter de nombreux échantillons aléatoires rejetés.
BM25 : BM25 est une méthode de récupération basée sur le chevauchement lexical qui identifie rapidement les k phrases les plus similaires. Elle crée une forte distribution de similarité et fonctionne bien pour le jeu de données silver.
Recherche sémantique (SS) : Cette méthode recherche des phrases sémantiquement similaires, même si elles ne partagent pas beaucoup de mots communs. Elle utilise un bi-encodeur pré-entraîné (SBERT) pour trouver les k phrases les plus similaires selon la similarité cosinus.
BM25 + Recherche sémantique : Cette méthode combine à la fois BM25 et la recherche sémantique. Elle capture les similarités lexicales et sémantiques. Cependant, elle peut introduire trop de paires négatives, ce qui nuit aux performances.
Performances dans les expériences
Les expériences montrent que BM25 et KDE offrent les meilleures performances. KDE fait légèrement mieux dans certains cas, mais BM25 est plus rapide et plus efficace. L’échantillonnage aléatoire ne fonctionne pas bien, car il produit trop de paires dissemblables. BM25 + SS obtient de moins bons résultats que BM25 seul sur certains jeux de données. Dans l’ensemble, BM25 est le meilleur choix à la fois pour les performances et l’efficacité.
Optimisation de la graine pour de meilleurs résultats : Les modèles Transformer comme BERT peuvent produire des résultats différents selon la graine aléatoire utilisée pendant l’entraînement. Cette variabilité est plus prononcée pour les petits jeux de données d’entraînement. Pour y remédier, AugSBERT applique une optimisation de la graine en entraînant plusieurs modèles avec différentes graines et en sélectionnant celui qui obtient les meilleures performances sur l’ensemble de développement.
Pour gagner du temps, seule une petite partie (20 %) des étapes d’entraînement est d’abord effectuée pour toutes les graines. Le modèle le plus prometteur est ensuite entièrement entraîné. Cette approche garantit une meilleure généralisation et de meilleures performances finales.
Référence
AugSBERT a été évalué par rapport à plusieurs références. La similarité de Jaccard a mesuré le chevauchement des mots des deux phrases d’entrée pour les tâches de régression. La référence de l’étiquette majoritaire a été utilisée pour les tâches de classification. L’Universal Sentence Encoder (USE), un modèle pré-entraîné de pointe, a également été testé. AugSBERT a en outre été comparé aux méthodes d’augmentation de données de NLPAug. Parmi celles-ci, le remplacement par synonymes avec un modèle BERT a obtenu les meilleurs résultats.
Évaluation
Les expériences ont été menées pour évaluer les performances d’AugSBERT dans diverses tâches et configurations. Vous trouverez ci-dessous un résumé des modèles, des hyperparamètres et des métriques d’évaluation utilisés.
- Modèles : Les expériences ont été mises en œuvre à l’aide de PyTorch, des Transformers de Huggingface et du framework Sentence-Transformers.
Jeux de données anglais : Le modèle bert-base-uncased a été utilisé.
Jeux de données espagnols : Le modèle bert-base-multilingual-cased a été utilisé.
Tous les modèles AugSBERT ont présenté des vitesses de calcul comparables à celles de SBERT.
- Hyperparamètres : Différents hyperparamètres ont été testés pour l’affinage du cross-encoder, l’affinage du bi-encodeur et l’échantillonnage. Voici les hyperparamètres optimaux qui ont été utilisés pendant les expériences.
- Affinage du cross-encoder : Les paramètres d’affinage suivants ont été optimisés pour le cross-encoder (BERT) :
Taux d’apprentissage : 1 × 10⁻⁵
Tailles des couches cachées : {200, 400}
Taille de lot : 16
Une couche linéaire avec une activation sigmoïde a été ajoutée au-dessus du jeton [CLS] pour produire des scores de similarité entre 0 et 1.
- Affinage du bi-encodeur : Le bi-encodeur SBERT a été affiné avec ces hyperparamètres :
Taille de lot : 16
Taux d’apprentissage : 2 × 10⁻⁵
Optimiseur : AdamW
- Stratégie d’échantillonnage : Pour l’échantillonnage BM25 et Semantic Search, diverses valeurs top k ont été évaluées dans l’intervalle {3, 18}. Il a été constaté que le choix de k avait un impact minimal sur les performances, les meilleurs résultats étant obtenus avec k = 3 ou k = 5.
- Métriques d’évaluation : Différentes métriques d’évaluation ont été utilisées pour différentes tâches. Vous pouvez trouver les détails sur les métriques d’évaluation ci-dessous :
Tâches de régression intra-domaine (par exemple, STS, BWS) :
- Pour évaluer les performances, la corrélation de rang de Spearman (ρ × 100) entre les scores de similarité prédits et de référence a été utilisée.
Tâches de classification intra-domaine (par exemple, Quora-QP, MRPC) :
- Le score F1 de l’étiquette positive a été rapporté. Le seuil optimal a été sélectionné sur la base de l’ensemble de développement et appliqué à l’ensemble de test.
Tâches d’adaptation de domaine :
- AUC(0.05) a été utilisée comme métrique d’évaluation. Elle mesure l’aire sous la courbe du taux de vrais positifs (TPR) en fonction du taux de faux positifs (FPR), de FPR = 0 à FPR = 0.05. Cette métrique est plus robuste face aux faux négatifs.
- Optimisation des graines : Les expériences intra-domaine ont été répétées avec 10 graines aléatoires afin d’assurer la fiabilité. Les scores moyens et les écarts-types ont été rapportés pour chaque configuration. De plus, l’optimisation des graines a été utilisée pour tenir compte de la variabilité entre les exécutions.
Résultats intra-domaine et d’adaptation de domaine
Les performances d’AugSBERT sur les tâches intra-domaine et d’adaptation de domaine démontrent son efficacité pour améliorer les capacités des bi-encodeurs. AugSBERT offre une solution pratique pour diverses tâches de NLP en combinant les points forts des encodeurs croisés et des bi-encodeurs. Évaluons les résultats détaillés des expériences intra-domaine et d’adaptation de domaine.
Figure : Scores AUC(0.05) pour les expériences intra-domaine et inter-domaines
Figure : Scores AUC(0.05) pour les expériences intra-domaine et inter-domaines | Source
Résultats intra-domaine
Performance du bi-encodeur (SBERT sans SeedOpt.) : Le bi-encodeur simple (SBERT sans SeedOpt.) obtient systématiquement de moins bonnes performances que l’encodeur croisé sur toutes les tâches intra-domaine, avec des écarts de performance allant de 4,5 à 9,1 points.
Performance d’AugSBERT : AugSBERT améliore les performances pour toutes les tâches de 1 à 6 points, surpassant nettement le bi-encodeur SBERT et réduisant l’écart de performance avec l’encodeur croisé BERT.
Comparaison avec le remplacement par synonymes (NLPAug) : AugSBERT surpasse les techniques d’augmentation de données par remplacement de synonymes (NLPAug) dans toutes les tâches.
Comparaison avec Universal Sentence Encoder (USE) : AugSBERT surpasse nettement le modèle USE prêt à l’emploi dans la plupart des tâches. L’exception est Spanish-STS, où USE obtient de bons résultats en raison d’une exposition préalable à l’ensemble de test pendant l’entraînement
Comparaison avec l’encodeur croisé : Pour les sujets connus (in-topic), AugSBERT obtient de bons résultats, surpassant même l’encodeur croisé. L’amélioration des performances est probablement due à la meilleure capacité de généralisation du bi-encodeur SBERT par rapport à l’encodeur croisé BERT.
Stratégie d’échantillonnage par paires :
L’échantillonnage aléatoire entraîne de mauvaises performances en raison d’un nombre élevé de paires dissemblables, ce qui biaise la distribution des étiquettes.
Les méthodes d’échantillonnage BM25 et Kernel Density Estimation (KDE) améliorent les performances en générant davantage de paires similaires.
KDE améliore les performances en créant une meilleure distribution de paires positives et négatives, mais elle est inefficace sur le plan computationnel.
BM25 offre le meilleur équilibre entre efficacité computationnelle et performance, en générant davantage de paires similaires.
Résultats d’adaptation de domaine
AugSBERT dans l’adaptation de domaine : AugSBERT surpasse systématiquement SBERT entraîné sur des données hors domaine (inter-domaines) pour la plupart des combinaisons de domaines source-cible. Par exemple, sur le jeu de données Sprint (cible), AugSBERT atteint jusqu’à 87,5 % d’AUC (source : Quora), ce qui représente une amélioration significative de 37 points par rapport à SBERT (50,5 % d’AUC).
Domaine source et domaine cible : AugSBERT est particulièrement performant lorsque le domaine source est générique (p. ex., Quora) et que le domaine cible est spécifique (p. ex., Sprint). Cela est probablement dû au fait que Quora couvre des sujets variés, ce qui permet à un cross-encoder de s’adapter efficacement au domaine cible plus spécifique. Lors du passage d’un domaine spécifique (p. ex., Sprint) à une cible plus générique (p. ex., Quora), AugSBERT montre peu ou pas d’amélioration. Par exemple, avec Sprint comme source et Quora comme cible, AugSBERT atteint une AUC de 49,5 %, identique à celle de SBERT. Cela montre que l’adaptation de domaines spécifiques vers des domaines génériques est difficile.
Comparaison avec Bi-LSTM : AugSBERT surpasse le modèle bi-encodeur Bi-LSTM à l’état de l’art dans de nombreux cas, sauf pour le jeu de données Sprint (cible). Par exemple, sur le jeu de données Sprint (cible) avec AskUbuntu comme source, Bi-LSTM (adversarial) atteint une AUC de 92,2 %, dépassant l’AUC de 85,2 % d’AugSBERT. Malgré cela, AugSBERT est plus performant dans la plupart des autres paires de domaines, en particulier lors de l’adaptation de domaines génériques vers des domaines spécifiques.
Principales conclusions
Amélioration d’AugSBERT : AugSBERT augmente les performances de 1 à 6 points sur toutes les tâches. Il réduit l’écart avec le cross-encoder et surpasse SBERT.
Adaptation de domaine : AugSBERT surpasse SBERT entraîné sur des données hors domaine jusqu’à 37 points, en particulier lors du transfert d’un domaine générique vers un domaine spécifique.
Échantillonnage par paires : BM25 offre le meilleur équilibre entre performance et efficacité. KDE améliore les performances mais est inefficace sur le plan computationnel.
Comparaison avec USE : AugSBERT surpasse Universal Sentence Encoder (USE) dans la plupart des tâches, sauf Spanish-STS, où USE est plus performant grâce à une exposition préalable.
Bi-encodeur et bases de données vectorielles
Les modèles bi-encodeurs, tels qu’AugSBERT, créent des représentations vectorielles denses des phrases, capturant leur signification sémantique dans un embedding de longueur fixe. Ces modèles encodent chaque entrée indépendamment, générant un vecteur unique représentant son contenu. En transformant les données textuelles en embeddings de haute dimension, les bi-encodeurs permettent une comparaison efficace de la similarité sémantique. Cette capacité alimente des applications comme la recherche sémantique, le classement de documents et la recherche d’informations, où la compréhension du sens du texte est cruciale.
Les bases de données vectorielles fournissent une infrastructure spécialisée pour gérer ces embeddings à grande échelle. Elles stockent, indexent et récupèrent ces embeddings de haute dimension pour des tâches comme les recherches de similarité à l’aide de métriques telles que la similarité cosinus ou la distance euclidienne. Lorsqu’un vecteur de requête est soumis, la base de données récupère les vecteurs les plus similaires sur le plan sémantique, permettant des cas d’utilisation comme les systèmes de questions-réponses, les moteurs de recommandation et la récupération inter-domaines. La combinaison des bi-encodeurs pour générer des représentations significatives et des bases de données vectorielles pour une récupération efficace constitue l’épine dorsale des systèmes modernes de recherche et de recommandation pilotés par l’IA, offrant à la fois évolutivité et rapidité.
L’une des principales plateformes de gestion et d’interrogation des données vectorielles est Milvus, une base de données vectorielle open-source développée par Zilliz. Milvus prend en charge les recherches de similarité à grande échelle et a été optimisé à la fois pour les données de haute dimension et pour une indexation et une interrogation rapides.
Avec Milvus, vous pouvez stocker des milliards de vecteurs générés par des modèles comme AugSBERT et effectuer des recherches en temps réel pour trouver les données les plus pertinentes en fonction de la similarité. Il prend en charge divers algorithmes d’indexation capables de s’adapter à de grands ensembles de données tout en garantissant des recherches à faible latence.
Zilliz propose également Zilliz Cloud, une solution cloud basée sur Milvus pour les clients d’entreprise. Elle est sans tracas et 10 fois plus rapide que Milvus. Cette offre facilite l’intégration de la recherche et de la gestion vectorielles dans des architectures cloud-native. Elle permet aux utilisateurs de déployer des bases de données vectorielles pour des applications d’IA à grande échelle sans se soucier de la gestion de l’infrastructure.
Conclusion et pistes potentielles de recherche future
L’approche AugSBERT améliore puissamment les bi-encodeurs pour les tâches de notation de paires de phrases. AugSBERT comble l’écart de performance entre les bi-encodeurs et les cross-encodeurs grâce à l’augmentation de données avec des étiquettes souples générées par des cross-encodeurs. Sa conception indépendante du modèle permet une adaptation fluide à diverses applications de notation de phrases. Cela en fait un outil polyvalent pour améliorer les représentations sémantiques.
AugSBERT offre des améliorations de performance significatives, avec des gains allant jusqu’à 6 points dans les tâches intra-domaine et 37 points dans les scénarios d’adaptation de domaine. Malgré son efficacité, AugSBERT s’appuie sur des stratégies d’échantillonnage intensives en calcul, telles que KDE, ce qui peut limiter l’évolutivité dans les implémentations à grande échelle. De plus, bien qu’il identifie des paires de phrases pertinentes, il rencontre des difficultés dans les contextes multilingues et adversariaux.
Pistes de recherche future pour AugSBERT
Il existe plusieurs pistes de recherche future pour améliorer la méthode Binoculars et remédier à ses limites :
L’efficacité des stratégies d’échantillonnage : Bien qu’AugSBERT bénéficie de stratégies comme BM25 et KDE, il est essentiel d’explorer davantage des méthodes d’échantillonnage plus efficaces sur le plan computationnel. Ces méthodes devraient équilibrer les améliorations de performance et l’évolutivité, en particulier pour les grands ensembles de données.
Contextes multilingues et à faibles ressources : Les performances d’AugSBERT dans les tâches multilingues peuvent être améliorées grâce à des modèles multilingues plus robustes. Les travaux futurs pourraient se concentrer sur l’amélioration de son efficacité dans les langues à faibles ressources, où les données d’entraînement et les modèles préentraînés sont limités.
Ressources associées
Article Augmented SBERT : https://arxiv.org/pdf/2010.08240
Plateforme Zilliz Cloud : https://www.zilliz.com
Documentation Milvus : https://milvus.io/docs
Comprendre l’architecture et les concepts fondamentaux des modèles Transformer
Les modèles d’IA les plus performants pour vos applications GenAI | Zilliz
10 frameworks LLM open source que les développeurs ne peuvent pas ignorer en 2025
Continuer à lire
Stop Building AI Data Infra for the Wrong Stage
Learn how AI data infrastructure should evolve from prototype to enterprise scale, and when Vector Lakebase becomes the right architecture for AI apps.

How to Build an Enterprise-Ready RAG Pipeline on AWS with Bedrock, Zilliz Cloud, and LangChain
Build production-ready enterprise RAG with AWS Bedrock, Nova models, Zilliz Cloud, and LangChain. Complete tutorial with deployable code.

VidTok: Rethinking Video Processing with Compact Tokenization
VidTok tokenizes videos to reduce redundancy while preserving spatial and temporal details for efficient processing.



