SBERT Aumentado: Um Método de Aumento de Dados para Aprimorar Bi-Encoders para Pontuação de Sentenças em Pares
Introdução
A pontuação pareada de sentenças é fundamental para várias tarefas de processamento de linguagem natural (NLP), incluindo similaridade semântica, detecção de paráfrases e recuperação de informações. Essas tarefas impulsionam aplicações críticas como mecanismos de busca, sistemas de recomendação e chatbots, que usam comparações precisas de sentenças para entender e responder às consultas dos usuários. No entanto, os métodos existentes, como cross-encoders e bi-encoders, enfrentam desafios significativos.
Cross-encoders como BERT (Bidirectional Encoder Representations from Transformers) comparam sentenças diretamente para obter resultados ideais, mas são lentos e caros para uso em larga escala. Em contraste, Bi-encoders como SBERT (Sentence-BERT) são mais rápidos e mais escaláveis devido ao processamento independente das sentenças, embora tenham dificuldade com representações de dados limitadas.
Comparação da correlação de postos de Spearman (ρ) entre Cross-Encoders e Bi-Encoders no conjunto de dados STSb (inglês), destacando o desempenho em diferentes tamanhos de treinamento (em milhares)
Figura: Comparação da correlação de postos de Spearman (ρ) entre Cross-Encoders e Bi-Encoders no conjunto de dados STSb (inglês), destacando o desempenho em diferentes tamanhos de treinamento (em milhares) | Fonte
Augmented SBERT (AugSBERT) é uma extensão do SBERT que aborda as limitações dos bi-encoders por meio de aumento de dados e gera dados extras de treinamento. Essa abordagem mantém alto desempenho em cenários com escassez de dados. O AugSBERT emprega otimização de seed, treinando múltiplos modelos com seeds variadas para identificar o melhor. A seleção de pares de sentenças é vital; ele usa amostragem BM25 para selecionar pares relevantes de forma eficiente, aprimorando o desempenho.
O AugSBERT alcança uma melhoria de 1-6% na precisão dentro do domínio e ganhos de até 37 pontos em cenários de adaptação de domínio. Ele oferece uma solução prática para tarefas de pontuação de sentenças precisas e escaláveis.
Este blog discutirá os desafios que métodos tradicionais como cross-encoders e bi-encoders enfrentam e como o augmented SBERT aborda esses problemas. Também veremos como o AugSBERT funciona, seu uso inovador de aumento de dados e sua capacidade de melhorar o desempenho dos bi-encoders. Para uma compreensão detalhada, consulte o seguinte artigo.
Figura: Um cross-encoder (à direita) recebe ambas as sentenças como uma única entrada em uma etapa de inferência do BERT e gera uma pontuação de similaridade. Por outro lado, bi-encoders (à esquerda) processam cada sentença independentemente, gerando vetores de sentenças | Fonte
Por que o aumento de dados é crítico para o AugSBERT?
O aumento de dados está no centro do Augmented SBERT (AugSBERT). Ele ajuda a gerar novos pares de sentenças por meio da amostragem dos pares de sentenças existentes. O aumento de dados pode resolver os desafios do SBERT com pequenos conjuntos de dados e pares de sentenças limitados. Veja por que ele é essencial:
Geração de pares de sentenças diversos: O AugSBERT usa aumento de dados para gerar pares de sentenças diversos. Ele reutiliza sentenças individuais dos pares de sentenças rotulados existentes (conjunto de treinamento gold) e as recombina para criar novos pares de sentenças.
Impulsiona o Aprendizado com Poucos Recursos: A aumentação gera pares de frases sintéticos para aumentar os dados de treinamento para o ajuste fino do SBERT. Ela permite que o AugSBERT seja ajustado para se tornar um transformador de frases de alto desempenho mesmo com conjuntos de dados pequenos, o que antes era uma limitação.
O Problema com os Métodos Tradicionais de Pontuação de Frases
Os métodos tradicionais de pontuação de frases estabeleceram a base para técnicas modernas. No entanto, eles têm limitações notáveis. Essas desvantagens destacam a necessidade de abordagens melhores, como o SBERT Aumentado. Abaixo estão os principais problemas dos métodos tradicionais:
Sem Representações de Frases Independentes: Cross-encoders como o BERT funcionam bem em tarefas de pontuação de frases ao codificar ambas as frases juntas. No entanto, isso não cria embeddings independentes para cada frase. É necessária uma etapa completa de inferência para obter uma única similaridade par a par, tornando-o inutilizável para a maioria dos casos de uso.
Ineficiência na Recuperação em Grande Escala: Cross-encoders são precisos, mas não conseguem gerar embeddings de frases de tamanho fixo. Isso os torna difíceis de usar em tarefas de recuperação em grande escala. Poly-encoders também enfrentam desafios na indexação, tornando-os menos adequados.
Grandes Requisitos de Dados: Bi-encoders exigem uma grande quantidade de dados com pares de frases para treinamento. Coletar esses dados rotulados pode ser demorado e exigir muitos recursos. Sem dados suficientes, seu desempenho pode ser prejudicado.
Pontuação Assimétrica: Poly-encoders resolvem alguns problemas dos bi-encoders e cross-encoders. No entanto, a função de pontuação é assimétrica, limitando seu uso em tarefas que exigem similaridade simétrica.
O SBERT Aumentado resolve esses problemas. Ele usa aumentação de dados e amostragem para criar embeddings de frases de alta qualidade. É eficiente e funciona bem em diferentes tarefas.
SBERT Aumentado
O SBERT Aumentado é um método de ponta para melhorar o desempenho de bi-encoders em tarefas de pares de frases. Ele aborda limitações críticas nos modelos existentes usando aumentação de dados e aprendizado semissupervisionado, tornando-se uma solução robusta para cenários em domínio e de adaptação de domínio. Este método se concentra em tarefas de pares de frases, como similaridade textual semântica, correspondência pergunta-resposta e recuperação de informações. Técnicas aumentadas adaptadas a essas tarefas são usadas para melhorar o desempenho.
Como o SBERT Aumentado é Diferente?
O SBERT Aumentado (AugSBERT) aprimora o SBERT com mudanças importantes no tratamento de dados, treinamento e desempenho. Veja como eles diferem:
Requisitos de Dados Reduzidos: O SBERT exige grandes quantidades de dados rotulados de alta qualidade. O AugSBERT reduz essa necessidade usando dados rotulados automaticamente e técnicas mais inteligentes.
Aumentação de Dados: O SBERT usa um conjunto fixo de pares de frases rotulados, o que pode limitar seu desempenho, especialmente com conjuntos de dados pequenos. O AugSBERT aplica aumentação de dados para gerar novos pares de frases, expandindo os dados de treinamento.
Cross-Encoder para Rotulagem de Pares de Frases: O AugSBERT usa cross-encoders para rotular novos pares de frases, adicionando mais dados para o ajuste fino. Ele combina conjuntos de dados gold (alta qualidade) e silver (gerados automaticamente) para melhorar o desempenho do modelo.
Amostragem de Pares de Frases: O AugSBERT emprega técnicas inteligentes de amostragem para selecionar pares de frases que melhoram a qualidade do treinamento.
Desempenho em Diferentes Domínios: O AugSBERT se adapta melhor a cenários dentro e fora do domínio. Seu conjunto de dados diverso e aumentado ajuda o modelo a generalizar de forma mais eficaz para novas tarefas e domínios.
Como o SBERT Aumentado Funciona?
O SBERT Aumentado gera novos pares de frases por meio de aumentação de dados. Em seguida, ele rotula esses pares usando um cross-encoder para criar um conjunto de dados silver. O conjunto de dados silver é combinado com o conjunto de dados gold para ajustar finamente o bi-encoder (SBERT).
Figura: Abordagem em domínio do SBERT Aumentado
Figura: Abordagem em domínio do SBERT Aumentado | Fonte
Agora, vamos detalhar as etapas específicas envolvidas no processo:
Etapa 0: Ajuste Fino do Cross-Encoder
Um cross-encoder (BERT) é primeiro ajustado finamente no conjunto de dados gold, uma coleção de pares de frases de alta qualidade, anotados por humanos. Esse cross-encoder ajustado finamente é usado posteriormente para gerar rótulos fracos para novos pares de frases não rotulados. Os rótulos fracos do cross-encoder apoiam o ajuste fino do bi-encoder mais adiante no processo.
Etapa 1: Criação do Conjunto de Dados Silver
Rotulagem (Etapa 1.1): Pares de frases não rotulados são passados pelo cross-encoder ajustado finamente. O modelo atribui rótulos e cria o conjunto de dados silver. Esse conjunto de dados é chamado de "silver" porque os rótulos são gerados por máquina, não anotados por humanos.
Amostragem (Etapa 1.2): Rotular todos os pares de frases possíveis seria muito caro e ineficiente. Para resolver isso, o AugSBERT usa estratégias de amostragem para selecionar os pares mais relevantes para rotulagem. A amostragem melhora a eficiência e garante que a rotulagem seja feita de forma mais eficaz. Isso ajuda o modelo a ter melhor desempenho sem desperdiçar recursos em combinações desnecessárias. Alguns métodos de amostragem incluem Random Sampling, Kernel Density Estimation (KDE), BM25 e Semantic Search. Você pode saber mais sobre cada um desses métodos na próxima seção.
Etapa 2: Treinamento e Predição
Ajuste Fino do Bi-Encoder (Etapa 2.1): O conjunto de dados silver é combinado com o conjunto de dados gold para ajustar finamente o bi-encoder (SBERT). O bi-encoder é treinado para mapear cada frase independentemente para um espaço vetorial denso durante esse processo.
Predição (Etapa 2.2): O bi-encoder ajustado finamente gera embeddings de frases que podem ser comparados para tarefas como pontuação de similaridade.
Esse pipeline combina a rotulagem precisa do cross-encoder com a eficiência do bi-encoder, melhorando o desempenho em tarefas de pares de frases. O diagrama da arquitetura captura esse processo desde a rotulagem até as predições finais.
Configuração Experimental: Dados, Amostragem, Baseline e Avaliação
Aqui está a configuração do experimento, incluindo o conjunto de dados usado, as abordagens de amostragem e outros componentes-chave, como baselines e métodos de avaliação.
Conjunto de Dados
O estudo usa conjuntos de dados de domínio único (por exemplo, Quora, AskUbuntu) e de múltiplos domínios (por exemplo, Quora, Sprint, SuperUser). Esses conjuntos de dados são projetados para tarefas de pares de frases, com tarefas de múltiplos domínios focadas na adaptação de domínio entre comunidades especializadas.
Figura: Resumo de todos os conjuntos de dados usados para diversas tarefas de pares de frases no domínio
Figura: Resumo de todos os conjuntos de dados usados para diversas tarefas de pares de frases no domínio | Fonte
Amostragem
A amostragem de pares é essencial no Augmented SBERT. Escolher os pares de frases corretos não é simples e é fundamental para o sucesso do AugSBERT. Rotular todos os pares de frases possíveis seria muito caro e ineficiente. Para resolver esse problema, o AugSBERT usa estratégias de amostragem para se concentrar nos pares mais relevantes para rotulagem.
Uma amostragem ruim pode introduzir pares irrelevantes, o que pode prejudicar o desempenho do modelo e provavelmente não levar a nenhuma melhoria.
Uma variável-chave na amostragem é o top k. O impacto de k é mínimo no AugSBERT, com os melhores resultados normalmente alcançados usando k = 3 ou k = 5.
Aqui estão algumas estratégias de amostragem comuns usadas no AugSBERT:
Random Sampling (RS): Este método seleciona aleatoriamente pares de frases para rotulagem. Ele frequentemente resulta em pares dissimilares (negativos) e poucos pares positivos. Isso causa um desequilíbrio no conjunto de dados silver, tornando-o menos útil.
Estimativa de Densidade por Kernel (KDE): A KDE visa equilibrar a distribuição de rótulos do conjunto de dados silver com o conjunto de dados gold. Ela rotula fracamente um grande conjunto de pares de frases e, em seguida, seleciona pares para corresponder à distribuição de rótulos positivos e negativos. O objetivo é minimizar as diferenças entre as distribuições. No entanto, a KDE é computacionalmente cara porque exige rotular muitas amostras aleatórias descartadas.
BM25: O BM25 é um método de recuperação baseado em sobreposição lexical que identifica rapidamente as top k frases mais semelhantes. Ele cria uma forte distribuição de similaridade e funciona bem para o conjunto de dados silver.
Busca Semântica (SS): Este método procura frases semanticamente semelhantes, mesmo que elas não compartilhem muitas palavras em comum. Ele usa um bi-encoder pré-treinado (SBERT) para encontrar as top k frases mais semelhantes com base na similaridade de cosseno.
BM25 + Busca Semântica: Isto combina tanto o BM25 quanto a Busca Semântica. Captura semelhanças lexicais e semânticas. No entanto, pode introduzir pares negativos demais, prejudicando o desempenho.
Desempenho em Experimentos
Os experimentos mostram que BM25 e KDE apresentam o melhor desempenho. A KDE se sai ligeiramente melhor em alguns casos, mas o BM25 é mais rápido e mais eficiente. A Amostragem Aleatória não funciona bem porque produz muitos pares dissimilares. BM25 + SS tem desempenho pior do que BM25 sozinho em alguns conjuntos de dados. No geral, o BM25 é a melhor escolha tanto para desempenho quanto para eficiência.
Otimização de Seed para Resultados Melhorados: Modelos Transformer como o BERT podem produzir resultados diferentes dependendo da seed aleatória usada durante o treinamento. Essa variabilidade é mais pronunciada para pequenos conjuntos de dados de treinamento. Para lidar com isso, o AugSBERT aplica otimização de seed treinando múltiplos modelos com diferentes seeds e selecionando aquele que apresenta o melhor desempenho no conjunto de desenvolvimento.
Para economizar tempo, apenas uma pequena parte (20%) das etapas de treinamento é concluída inicialmente para todas as seeds. O modelo mais promissor é então treinado completamente. Essa abordagem garante melhor generalização e desempenho final aprimorado.
Baseline
O AugSBERT foi avaliado em relação a vários baselines. A similaridade de Jaccard mediu a sobreposição de palavras das duas frases de entrada para tarefas de regressão. O baseline de rótulo majoritário foi usado para tarefas de classificação. O Universal Sentence Encoder (USE), um modelo pré-treinado de ponta, também foi testado. O AugSBERT foi ainda comparado aos métodos de aumento de dados do NLPAug. Entre estes, a substituição de sinônimos com um modelo BERT teve o melhor desempenho.
Avaliação
Os experimentos foram realizados para avaliar o desempenho do AugSBERT em várias tarefas e configurações. Abaixo está um resumo dos modelos, hiperparâmetros e métricas de avaliação usados.
- Modelos: Os experimentos foram implementados usando PyTorch, Transformers da Huggingface e o framework Sentence-Transformers.
Conjuntos de dados em inglês: O modelo bert-base-uncased foi usado.
Conjuntos de dados em espanhol: O modelo bert-base-multilingual-cased foi usado.
Todos os modelos AugSBERT exibiram velocidades computacionais comparáveis ao SBERT.
- Hiperparâmetros: Diferentes hiperparâmetros foram testados para ajuste fino do cross-encoder, ajuste fino do bi-encoder e amostragem. Aqui estão os hiperparâmetros ideais que foram usados durante os experimentos.
- Ajuste Fino do Cross-Encoder: Os seguintes parâmetros de ajuste fino foram otimizados para o cross-encoder (BERT):
Taxa de aprendizado: 1 × 10⁻⁵
Tamanhos das camadas ocultas: {200, 400}
Tamanho do batch: 16
Uma camada linear com uma ativação sigmoid foi adicionada sobre o token [CLS] para gerar pontuações de similaridade entre 0 e 1.
- Ajuste Fino do Bi-Encoder: O bi-encoder SBERT foi ajustado finamente com estes hiperparâmetros:
Tamanho do batch: 16
Taxa de aprendizado: 2 × 10⁻⁵
Otimizador: AdamW
- Estratégia de Amostragem: Para a amostragem BM25 e Semantic Search, vários valores top k foram avaliados no intervalo {3, 18}. Verificou-se que a escolha de k teve impacto mínimo no desempenho, com os melhores resultados alcançados usando k = 3 ou k = 5.
- Métricas de Avaliação: Diferentes métricas de avaliação foram usadas para diferentes tarefas. Você pode encontrar os detalhes sobre as métricas de avaliação abaixo:
Tarefas de regressão no domínio (por exemplo, STS, BWS):
- Para avaliar o desempenho, foi usada a correlação de postos de Spearman (ρ × 100) entre as pontuações de similaridade previstas e as de referência.
Tarefas de classificação no domínio (por exemplo, Quora-QP, MRPC):
- A pontuação F1 do rótulo positivo foi relatada. O limiar ideal foi selecionado com base no conjunto de desenvolvimento e aplicado ao conjunto de teste.
Tarefas de adaptação de domínio:
- AUC(0.05) foi usada como métrica de avaliação. Ela mede a área sob a curva da taxa de verdadeiros positivos (TPR) em função da taxa de falsos positivos (FPR), de FPR = 0 a FPR = 0.05. Essa métrica é mais robusta contra falsos negativos.
- Otimização de Semente: Os experimentos no domínio foram repetidos com 10 sementes aleatórias para garantir confiabilidade. As pontuações médias e os desvios padrão foram relatados para cada configuração. Além disso, a otimização de semente foi usada para considerar a variabilidade entre execuções.
Resultados no Domínio e de Adaptação de Domínio
O desempenho do AugSBERT em tarefas tanto no domínio quanto de adaptação de domínio demonstra sua eficácia em melhorar as capacidades de bi-encoders. O AugSBERT oferece uma solução prática para várias tarefas de NLP ao combinar os pontos fortes de cross-encoders e bi-encoders. Vamos avaliar os resultados detalhados dos experimentos no domínio e de adaptação de domínio.
Figura: Pontuações AUC(0.05) para experimentos no Domínio e Cross-Domain
Figura: Pontuações AUC(0.05) para experimentos no Domínio e Cross-Domain | Fonte
Resultados no Domínio
Desempenho do Bi-Encoder (SBERT sem SeedOpt.): O bi-encoder simples (SBERT sem SeedOpt.) apresenta desempenho consistentemente inferior ao cross-encoder em todas as tarefas no domínio, com lacunas de desempenho variando de 4,5 a 9,1 pontos.
Desempenho do AugSBERT: O AugSBERT melhora o desempenho em todas as tarefas de 1 a 6 pontos, superando significativamente o bi-encoder SBERT e reduzindo a lacuna de desempenho em relação ao cross-encoder BERT.
Comparação com Substituição por Sinônimos (NLPAug): O AugSBERT supera as técnicas de aumento de dados por substituição de sinônimos (NLPAug) em todas as tarefas.
Comparação com Universal Sentence Encoder (USE): O AugSBERT supera significativamente o modelo USE pronto para uso na maioria das tarefas. A exceção é Spanish-STS, em que o USE apresenta bom desempenho devido à exposição prévia ao conjunto de teste durante o treinamento
Comparação com Cross-Encoder: Para tópicos conhecidos (in-topic), o AugSBERT apresenta bom desempenho, até superando o cross-encoder. O desempenho aprimorado provavelmente se deve à melhor capacidade de generalização do bi-encoder SBERT em comparação com o cross-encoder BERT.
Estratégia de Amostragem Pareada:
A amostragem aleatória leva a um desempenho ruim devido a um alto número de pares dissimilares, o que distorce a distribuição dos rótulos.
Os métodos de amostragem BM25 e Kernel Density Estimation (KDE) melhoram o desempenho ao gerar pares mais similares.
O KDE melhora o desempenho criando uma melhor distribuição de pares positivos e negativos, mas é computacionalmente ineficiente.
O BM25 oferece o melhor equilíbrio entre eficiência computacional e desempenho, gerando pares mais similares.
Resultados de Adaptação de Domínio
AugSBERT em Adaptação de Domínio: AugSBERT supera consistentemente o SBERT treinado em dados fora do domínio (cross-domain) na maioria das combinações de domínios fonte-alvo. Por exemplo, no conjunto de dados Sprint (alvo), o AugSBERT atinge até 87,5% de AUC (fonte: Quora), representando uma melhoria significativa de 37 pontos em relação ao SBERT (50,5% de AUC).
Domínio Fonte e Alvo: O AugSBERT tem um desempenho particularmente bom quando o domínio fonte é genérico (por exemplo, Quora) e o domínio alvo é específico (por exemplo, Sprint). Isso provavelmente ocorre porque o Quora cobre tópicos diversos, permitindo que um cross-encoder se adapte efetivamente ao domínio alvo mais específico. Ao passar de um domínio específico (por exemplo, Sprint) para um alvo mais genérico (por exemplo, Quora), o AugSBERT mostra pouca ou nenhuma melhoria. Por exemplo, com Sprint como fonte e Quora como alvo, o AugSBERT atinge uma AUC de 49,5%, a mesma do SBERT. Isso mostra que a adaptação de domínios específicos para genéricos é desafiadora.
Comparação com Bi-LSTM: O AugSBERT supera o modelo bi-encoder Bi-LSTM de estado da arte em muitos casos, exceto no conjunto de dados Sprint (alvo). Por exemplo, no conjunto de dados Sprint (alvo) com AskUbuntu como fonte, o Bi-LSTM (adversarial) atinge uma AUC de 92,2%, superando os 85,2% de AUC do AugSBERT. Apesar disso, o AugSBERT tem melhor desempenho na maioria dos outros pares de domínios, especialmente ao se adaptar de domínios genéricos para específicos.
Principais Descobertas
Melhoria do AugSBERT: O AugSBERT aumenta o desempenho de 1 a 6 pontos em todas as tarefas. Ele reduz a lacuna em relação ao cross-encoder e supera o SBERT.
Adaptação de Domínio: O AugSBERT supera o SBERT treinado em dados fora do domínio em até 37 pontos, especialmente ao transferir de um domínio genérico para um específico.
Amostragem Pareada: BM25 atinge o melhor equilíbrio entre desempenho e eficiência. KDE melhora o desempenho, mas é computacionalmente ineficiente.
Comparação com USE: O AugSBERT supera o Universal Sentence Encoder (USE) na maioria das tarefas, exceto Spanish-STS, onde o USE tem melhor desempenho devido à exposição prévia.
Bi-Encoder e Bancos de Dados Vetoriais
Modelos bi-encoder, como o AugSBERT, criam representações vetoriais densas de frases, capturando seu significado semântico em um embedding de comprimento fixo. Esses modelos codificam cada entrada de forma independente, gerando um vetor único que representa seu conteúdo. Ao transformar dados textuais em embeddings de alta dimensionalidade, os bi-encoders permitem uma comparação eficiente de similaridade semântica. Essa capacidade impulsiona aplicações como busca semântica, ranqueamento de documentos e recuperação de informações, onde compreender o significado por trás do texto é crucial.
Bancos de dados vetoriais fornecem uma infraestrutura especializada para lidar com esses embeddings em escala. Eles armazenam, indexam e recuperam esses embeddings de alta dimensionalidade para tarefas como buscas por similaridade usando métricas como similaridade de cosseno ou distância euclidiana. Quando um vetor de consulta é enviado, o banco de dados recupera os vetores mais semanticamente semelhantes, possibilitando casos de uso como sistemas de perguntas e respostas, mecanismos de recomendação e recuperação entre domínios. A combinação de bi-encoders para gerar representações significativas e bancos de dados vetoriais para recuperação eficiente forma a espinha dorsal dos modernos sistemas de busca e recomendação impulsionados por IA, oferecendo escalabilidade e velocidade.
Uma das principais plataformas para gerenciar e consultar dados vetoriais é Milvus, um banco de dados vetorial de código aberto desenvolvido pela Zilliz. O Milvus oferece suporte a buscas por similaridade em larga escala e foi otimizado tanto para dados de alta dimensionalidade quanto para indexação e consultas rápidas.
Com o Milvus, você pode armazenar bilhões de vetores gerados por modelos como o AugSBERT e realizar buscas em tempo real para encontrar os dados mais relevantes com base na similaridade. Ele oferece suporte a vários algoritmos de indexação que podem escalar para grandes conjuntos de dados, garantindo buscas de baixa latência.
A Zilliz também oferece o Zilliz Cloud, uma solução baseada em nuvem baseada no Milvus para clientes corporativos. Ela é descomplicada e 10x mais rápida que o Milvus. Essa oferta facilita a integração de busca e gerenciamento vetorial em arquiteturas nativas da nuvem. Ela permite que os usuários implantem bancos de dados vetoriais para aplicações de IA em larga escala sem se preocupar com o gerenciamento de infraestrutura.
Conclusão e Possíveis Direções Futuras de Pesquisa
A abordagem AugSBERT aprimora poderosamente os bi-encoders para tarefas de pontuação de pares de sentenças. O AugSBERT reduz a lacuna de desempenho entre bi-encoders e cross-encoders usando aumento de dados com rótulos suaves gerados por cross-encoders. Seu design agnóstico ao modelo permite adaptação contínua em várias aplicações de pontuação de sentenças. Isso o torna uma ferramenta versátil para melhorar representações semânticas.
O AugSBERT oferece melhorias significativas de desempenho, com ganhos de até 6 pontos em tarefas no domínio e 37 pontos em cenários de adaptação de domínio. Apesar de sua eficácia, o AugSBERT depende de estratégias de amostragem computacionalmente intensivas, como KDE, o que pode limitar a escalabilidade em implementações de larga escala. Além disso, embora identifique pares de sentenças significativos, ele enfrenta desafios em contextos multilíngues e adversariais.
Direções Futuras de Pesquisa para o AugSBERT
Há várias direções futuras de pesquisa para melhorar o método Binoculars e abordar suas limitações:
A eficiência das Estratégias de Amostragem: Embora o AugSBERT se beneficie de estratégias como BM25 e KDE, é essencial explorar mais métodos de amostragem computacionalmente eficientes. Esses métodos devem equilibrar melhorias de desempenho com escalabilidade, particularmente para grandes conjuntos de dados.
Contextos Multilíngues e de Baixos Recursos: O desempenho do AugSBERT em tarefas multilíngues pode ser melhorado usando modelos multilíngues mais fortes. Trabalhos futuros poderiam se concentrar em melhorar sua eficácia em idiomas de baixos recursos, nos quais os dados de treinamento e os modelos pré-treinados são limitados.
Recursos Relacionados
Artigo do Augmented SBERT: https://arxiv.org/pdf/2010.08240
Plataforma Zilliz Cloud: https://www.zilliz.com
Documentação do Milvus: https://milvus.io/docs
Entendendo a Arquitetura e os Conceitos Centrais dos Modelos Transformer
Modelos de IA de Melhor Desempenho para Seus Apps GenAI | Zilliz
10 Frameworks LLM de Código Aberto que Desenvolvedores Não Podem Ignorar em 2025
Continue lendo

Zilliz Cloud BYOC Now Available Across AWS, GCP, and Azure
Zilliz Cloud BYOC is now generally available on all three major clouds. Deploy fully managed vector search in your own AWS, GCP, or Azure account — your data never leaves your VPC.

Introducing Zilliz Cloud Global Cluster: Region-Level Resilience for Mission-Critical AI
Zilliz Cloud Global Cluster delivers multi-region resilience, automatic failover, and fast global AI search with built-in security and compliance.

Zilliz Cloud Launches in AWS Australia, Expanding Global Reach to Australia and Neighboring Markets
We're thrilled to announce that Zilliz Cloud is now available in the AWS Sydney, Australia region (ap-southeast-2).



