GPL: Etiquetado pseudo generativo para la adaptación de dominio no supervisada de la recuperación densa
La recuperación de información es importante para muchas aplicaciones de procesamiento del lenguaje natural (NLP). Aunque los métodos léxicos tradicionales se han utilizado para buscar en contenido textual, sufren una brecha léxica. Estos métodos no pueden reconocer sinónimos ni distinguir entre palabras ambiguas.
Los métodos de recuperación densa que mapean consultas y pasajes en un espacio vectorial compartido se han vuelto populares para abordar estos problemas, mostrando mejoras respecto a los enfoques tradicionales. Sin embargo, requieren grandes conjuntos de datos de entrenamiento y son sensibles a los cambios de dominio. Por ejemplo, los modelos entrenados en MS MARCO tienen un rendimiento deficiente en la literatura sobre COVID-19.
Por lo tanto, existe la necesidad de crear un método que pueda adaptar eficazmente los modelos de recuperación densa a nuevos dominios sin requerir grandes cantidades de datos etiquetados. Un método propuesto es GPL (Generative Pseudo Labeling), una técnica de adaptación de dominio no supervisada para modelos de recuperación densa que combina un generador de consultas con pseudoetiquetado. GPL utiliza un modelo T5 para generar consultas para un dominio objetivo. Recupera pasajes negativos utilizando un modelo de recuperación densa existente y usa un codificador cruzado para puntuar pares (consulta, pasaje).
GPL supera a otros métodos de adaptación de dominio. Mejora el rendimiento hasta en 9.3 nDCG@10 (ganancia acumulada descontada normalizada en el rango 10) frente a modelos entrenados en MS MARCO y hasta en 4.5 nDCG@10 frente a QGen (generación de consultas).
Figura: GPL para entrenar un recuperador denso adaptado al dominio
Figura: GPL para entrenar un recuperador denso adaptado al dominio | Fuente
Este artículo analizará cómo GPL aborda el problema de la adaptación de dominio, sus mecanismos subyacentes y las mejoras que ofrece respecto a métodos anteriores de adaptación de dominio. Para más detalles, consulte el artículo Generative Pseudo Labeling.
Por qué la recuperación densa no siempre es suficiente
A pesar de sus impresionantes capacidades, los métodos de recuperación densa tienen sus inconvenientes. Los problemas más significativos son la necesidad de grandes conjuntos de datos de entrenamiento y sus dificultades al adaptarse a nuevos dominios. A continuación se presenta un desglose de estos desafíos:
Requisitos de datos: Los modelos de recuperación densa requieren grandes cantidades de datos de entrenamiento para funcionar eficazmente. Este requisito de datos plantea un desafío significativo para aplicar la recuperación densa en dominios especializados donde no hay disponibles conjuntos de datos grandes y etiquetados.
Sensibilidad a los cambios de dominio: Los modelos de recuperación densa son extremadamente sensibles a los cambios de dominio. Su rendimiento disminuye cuando se aplican a un dominio diferente de aquel en el que fueron entrenados.
Brecha léxica: Los métodos léxicos tradicionales, una alternativa a la recuperación densa, sufren una brecha léxica. No pueden reconocer sinónimos ni diferenciar entre palabras ambiguas.
Rendimiento de zero-shot: Los modelos de recuperación densa a menudo tienen un rendimiento deficiente en un corpus determinado cuando se aplican en un entorno zero-shot.
Presentación de GPL: una solución rápida y robusta para la adaptación de dominio
GPL es una técnica de adaptación de dominio no supervisada diseñada para mejorar el rendimiento de los modelos de recuperación densa cuando se aplican a nuevos dominios. El método consta de varios pasos clave, entre ellos:
Generación de consultas
Minería negativa
Pseudoetiquetado
Entrenamiento del recuperador denso
Generación de consultas mediante T5
El proceso GPL comienza con la generación de consultas, donde se crean consultas sintéticas para cada pasaje dentro del dominio objetivo. Esto se realiza usando un modelo preentrenado T5 de codificador-decodificador.
El modelo T5 se entrena con grandes conjuntos de datos como MS MARCO (Microsoft Machine Reading Comprehension). Genera consultas relevantes para el contenido de cada pasaje, creando esencialmente pares sintéticos de pregunta-respuesta.
El número de consultas generadas por pasaje se ajusta según el tamaño del corpus para mantener constante el número total de consultas generadas. Esta creación de datos sintéticos es importante porque proporciona datos para el entrenamiento posterior del recuperador denso para el dominio objetivo específico.
Minería de negativos mediante recuperación densa
El método GPL utiliza un modelo de recuperación densa preentrenado para cada consulta generada con el fin de encontrar los párrafos más similares dentro del corpus objetivo. Estos párrafos similares se tratan luego como pasajes negativos, lo que significa que son irrelevantes para la consulta.
Este paso está diseñado para identificar "negativos difíciles." Estos ejemplos desafiantes ayudan al modelo a diferenciar entre pasajes similares pero irrelevantes. Se utilizan dos recuperadores densos entrenados con MS MARCO, ‘msmarco-distilbert-base-v3’ y ‘msmarco-MiniLM-L-6-v3’, para garantizar un conjunto diverso de ejemplos negativos.
Finalmente, se selecciona un pasaje positivo y uno negativo de los pasajes recuperados para cada ejemplo de entrenamiento.
Pseudoetiquetado mediante Cross-Encoder
El siguiente paso incluye puntuar los pares (consulta, pasaje) usando un cross-encoder. A diferencia de los bi-encoders, que asignan consultas y pasajes de forma independiente a un espacio vectorial compartido. Un cross-encoder toma la concatenación de la consulta y el pasaje y predice una puntuación de relevancia mediante atención cruzada.
Este paso asigna una puntuación de relevancia continua y detallada a cada par (consulta, pasaje positivo) y a cada par (consulta, pasaje negativo). Estas puntuaciones son las pseudoetiquetas. El modelo cross-encoder utilizado para las pseudoetiquetas es ms-marco-MiniLM-L-6-v2. Las puntuaciones continuas proporcionan información más detallada que las etiquetas binarias utilizadas en otros métodos.
Entrenamiento del recuperador denso con pérdida MarginMSE
Finalmente, el modelo de recuperación densa (recuperador denso estudiante) se entrena utilizando las tuplas generadas (consulta, positivo, negativo) y las puntuaciones correspondientes del cross-encoder con pérdida MarginMSE. El objetivo es enseñar al recuperador denso a imitar el margen de puntuación entre los pares consulta-pasaje positivos y negativos del cross-encoder. La función de pérdida MarginMSE se define como:
LMarginMSE()= -1Mi=0M-1|i-i|2
Donde:
M es el tamaño del lote.
i es el margen de puntuación correspondiente del recuperador denso estudiante:
i= f(Qi)T f(Pi)- f(Qi)f(P_)
- donde f es el recuperador denso, Qi es la consulta, Pi es el pasaje positivo y P_ es el pasaje negativo.
- i es el margen de puntuación del cross-encoder:
= CE(Q, P+)-CE(Q, P_)
Esta función de pérdida ayuda al modelo a aprender un espacio vectorial. En este espacio, las consultas están más cerca de los pasajes relevantes y más lejos de los irrelevantes, según lo definido por las pseudoetiquetas del cross-encoder. La pérdida MarginMSE aborda las deficiencias de métodos anteriores como QGen. QGen utiliza la pérdida Multiple Negatives Ranking (MNRL), que solo considera la relación aproximada entre consultas y pasajes.
Diseño experimental para la recuperación densa adaptada al dominio
La configuración para evaluar GPL está destinada a valorar su eficacia al adaptar modelos de recuperación densa a tareas específicas. Aquí hay un desglose de los componentes clave de la configuración:
Conjuntos de datos
Se utilizan dos conjuntos de datos: uno para el dominio de origen y otro para el dominio objetivo.
- Datos del dominio fuente: El conjunto de datos de clasificación de pasajes MS MARCO se utiliza como datos del dominio fuente. Este conjunto de datos consta de 8,8 millones de pasajes y 532,8K pares consulta-pasaje etiquetados como relevantes. Los modelos se entrenan en MS MARCO y luego se adaptan a un dominio objetivo utilizando el método GPL.
- Conjuntos de datos del dominio objetivo: Se utilizan seis conjuntos de datos de recuperación de texto específicos de dominio del benchmark BeIR para evaluar las capacidades de adaptación de dominio de GPL. El número Estos conjuntos de datos representan una variedad de dominios especializados e incluyen:
FiQA (dominio financiero)
SciFact (artículos científicos)
BioASQ (preguntas y respuestas biomédicas)
TREC-COVID (artículos científicos sobre COVID-19)
CQADupStack (12 subforos de StackExchange)
Robust04 (artículos de noticias)
Estos conjuntos de datos difieren en:
Tamaños: Variación en los tamaños de corpus.
Longitudes de consultas y pasajes: Cada conjunto de datos tiene características distintas.
Etiquetas de relevancia: El número de pasajes relevantes por consulta varía.
Algunos conjuntos de datos se modificaron para un entrenamiento y una evaluación eficientes. Por ejemplo:
- BioASQ: Se eliminaron pasajes irrelevantes para reducir el tamaño del corpus.
Líneas base
Se incluyeron varios modelos de referencia para la comparación:
Modelos zero-shot: Estos modelos se entrenan en los conjuntos de datos MS MARCO o PAQ y se evalúan en conjuntos de datos objetivo sin ninguna adaptación de dominio. También se incluye un sistema de búsqueda léxica BM25 como línea base.
Métodos previos de adaptación de dominio: UDALM y MoDIR se incluyen como líneas base que representan enfoques anteriores de adaptación de dominio.
Métodos de adaptación de dominio basados en preentrenamiento: Estos métodos incluyen preentrenar los recuperadores densos en el corpus objetivo y luego entrenar el modelo en el conjunto de datos MS MARCO. Se utilizaron diferentes métodos de preentrenamiento, como CD, SimCSE, CT, MLM, ICT y TSDAE.
Adaptación de dominio basada en generación: Los modelos QGen se entrenan con negativos dentro del lote y negativos difíciles. Además, se incluye el preentrenamiento TSDAE combinado con QGen.
Entrenamiento
El modelo DistilBERT se utiliza para todos los experimentos con una longitud máxima de secuencia de 350, con agrupación media y similitud de producto punto.
Los modelos QGen se entrenan durante 1 época, con un tamaño de lote de 75.
Los modelos GPL se entrenan durante 140k pasos, con un tamaño de lote de 32.
Los métodos de preentrenamiento como TSDAE y los modelos MLM se entrenaron durante 100K pasos de entrenamiento con un tamaño de lote de 8.
Métrica de evaluación
El rendimiento de los modelos se evalúa utilizando nDCG@10 (ganancia acumulada descontada normalizada en el rango 10). Evalúa la calidad de una clasificación considerando la relevancia de los elementos recuperados. Da más peso a los documentos altamente relevantes que aparecen en la parte superior de la lista clasificada.
Efectividad y rendimiento de GPL en la adaptación de dominio
El método GPL se evaluó frente a varias líneas base, y su rendimiento se analizó bajo diferentes condiciones. La evaluación se realiza utilizando nDCG@10, que mide la relevancia de los 10 primeros resultados de una lista clasificada.
Rendimiento general de GPL
GPL supera significativamente a otros métodos de adaptación de dominio en casi todos los conjuntos de datos probados. Específicamente, GPL mejora sobre QGen, un método anterior de última generación, hasta en 4,5 puntos nDCG@10 en el conjunto de datos BioASQ. También muestra una mejora promedio de 2,7 puntos nDCG@10 en todos los conjuntos de datos.
Combinar el preentrenamiento TSDAE (autoencoder secuencial de eliminación de ruido basado en Transformer) con GPL (TSDAE + GPL) ofrece resultados excepcionales. Este enfoque establece un nuevo rendimiento de última generación, con un promedio de 52,9 puntos nDCG@10. En particular, ofrece una mejora promedio de 7,7 puntos sobre el modelo base MS MARCO listo para usar.
Figura: Resultados de evaluación usando nDCG@10
Figura: Resultados de evaluación usando nDCG@10 | Fuente
Comparación con líneas base
Para comprender el contexto del sólido rendimiento de GPL, comparémoslo con varios enfoques de referencia y métodos alternativos de adaptación de dominio.
Modelos Zero-Shot
Los modelos zero-shot entrenados en MS MARCO tienen un rendimiento deficiente en conjuntos de datos específicos de dominio en comparación con búsquedas léxicas simples con BM25. Por ejemplo, un modelo de recuperación densa de última generación alcanza un MRR@10 (Mean Reciprocal Rank at 10) de 33,2 puntos en el conjunto de datos MS MARCO. Sin embargo, tiene un rendimiento deficiente en los seis conjuntos de datos de recuperación específicos de dominio seleccionados.
El preentrenamiento de TSDAE en MS MARCO, seguido de aprendizaje supervisado en MS MARCO, tiene un rendimiento ligeramente inferior al del modelo zero-shot MS MARCO.
Métodos Previos de Adaptación de Dominio
UDALM perjudica enormemente el rendimiento en comparación con el preentrenamiento MLM (Masked Language Modeling), con una disminución media de 12,2 puntos nDCG@10. Esto se debe a que el entrenamiento MLM directo entra en conflicto con el entrenamiento supervisado.
MoDIR ofrece un rendimiento similar al del modelo zero-shot MS MARCO en algunos conjuntos de datos, pero es mucho más débil en otros.
Adaptación de Dominio Basada en Preentrenamiento
El preentrenamiento en el corpus objetivo con TSDAE, MLM e ICT (Inverse Cloze Task) puede mejorar el rendimiento en comparación con el modelo zero-shot MS MARCO. TSDAE es el método más eficaz, superando la referencia zero-shot en una media de 4,0 puntos nDCG@10. CD, CT y SimCSE no logran adaptarse a los dominios y tienen un rendimiento peor que el modelo zero-shot.
Adaptación de Dominio Basada en Generación
GPL supera a QGen hasta en 4,5 puntos (en BioASQ) y en 2,7 puntos de media. El preentrenamiento adaptativo de dominio basado en TSDAE combinado con GPL (TSDAE + GPL) mejora aún más el rendimiento en todos los conjuntos de datos. Alcanza un nuevo resultado de vanguardia de 52,9 puntos nDCG@10.
Reordenamiento con Cross-Encoders
Los cross-encoders funcionan bien en un entorno zero-shot y superan significativamente a los enfoques de recuperación densa, pero tienen un coste computacional significativo en la inferencia. TSDAE y GPL pueden reducir, pero no cerrar por completo, la brecha de rendimiento con los cross-encoders. El modelo TSDAE + GPL sería preferible en un entorno de producción debido a los costes computacionales mucho menores en la inferencia.
Influencia de los Pasos de Entrenamiento
El rendimiento de GPL comienza a saturarse después de alrededor de 100K pasos de entrenamiento. El preentrenamiento de TSDAE mejora de forma constante el rendimiento durante toda la etapa de entrenamiento.
Figura: Influencia del número de pasos de entrenamiento en el rendimiento
Figura: Influencia del número de pasos de entrenamiento en el rendimiento | Fuente
Influencia del Tamaño del Corpus
GPL puede superar la referencia zero-shot con más de 10K pasajes, y el rendimiento se satura después de 50K pasajes. Sin embargo, QGen queda por detrás de la referencia zero-shot para cada tamaño de corpus.
Figura: Influencia del tamaño del corpus en el rendimiento
Figura: Influencia del tamaño del corpus en el rendimiento | Fuente
Robustez Frente a la Generación de Consultas
Los corpus más pequeños, como SciFact y FiQA, requieren un mayor número de consultas generadas por pasaje que el corpus Robust04, más grande, para lograr un rendimiento óptimo. Además, GPL es más robusto ante consultas de baja calidad que QGen. Incluso cuando las consultas generadas casi no tienen relación con los pasajes, GPL sigue funcionando bien.
Figura: Influencia del número de QPP generados en el rendimiento
Figura: Influencia del número de QPP generados en el rendimiento | Fuente
Sensibilidad a la inicialización
GPL es menos sensible a la elección del checkpoint de inicialización. El entrenamiento con MS MARCO tiene un efecto relativamente pequeño en el rendimiento de GPL, con una diferencia promedio de 0,3 puntos. Por otro lado, QGen depende en gran medida de la elección del checkpoint de inicialización, mostrando una diferencia de 1,9 puntos.
Figura: Influencia del checkpoint de inicialización en el rendimiento
Figura: Influencia del checkpoint de inicialización en el rendimiento | Fuente
Rendimiento en BeIR completo
En los 18 conjuntos de datos completos de BeIR, GPL mejora consistentemente el rendimiento con respecto al modelo zero-shot. Logra un rango promedio de 5,2. TSDAE + GPL logra un rango promedio de 4,2. Al construirse sobre el sólido modelo zero-shot TAS-B, GPL produce ganancias de rendimiento significativas de hasta 21,5 puntos nDCG@10 (en TREC-COVID) y 4,6 puntos nDCG@10 en promedio. Este modelo TAS-B + GPL tiene el mejor rendimiento general, logrando un rango promedio igual a 3,2.
Figura: Rendimiento en todos los 18 conjuntos de datos originales de BeIR
Figura: Rendimiento en todos los 18 conjuntos de datos originales de BeIR | Fuente
Implicaciones para el Generative Pseudo Labeling
El método GPL tiene varias implicaciones importantes para la recuperación de información. Estas incluyen:
Mejor búsqueda específica de dominio: GPL mejora los resultados de búsqueda en áreas especializadas como finanzas y ciencia. Supera a los métodos anteriores al adaptarse eficazmente a nuevos dominios.
Menor necesidad de datos etiquetados: GPL adapta modelos sin requerir datos etiquetados del dominio objetivo, usando en su lugar pasajes sin etiquetar. Esto reduce el costo y el tiempo necesarios para desarrollar sistemas de recuperación.
Maneja consultas deficientes: El método es eficaz para consultas generadas de forma deficiente porque un cross-encoder asigna puntuaciones bajas a pares (consulta, pasaje) irrelevantes. Esto garantiza que el recuperador denso no aprenda de consultas malas.
Utiliza bien los negativos difíciles: GPL utiliza un cross-encoder para generar puntuaciones de relevancia de grano fino, lo que lo hace eficaz para el entrenamiento con negativos difíciles. Esto conduce a un entrenamiento más robusto.
Eficiente y práctico: GPL puede combinarse con otras técnicas como TSDAE para lograr resultados aún mejores. Es más eficiente que métodos computacionalmente pesados como los cross-encoders.
Funciona en muchos conjuntos de datos: GPL muestra una mejora consistente en 18 conjuntos de datos, lo que destaca su aplicabilidad general. El método también mejora el rendimiento cuando se combina con un modelo potente como TAS-B.
GPL para una búsqueda semántica mejorada en bases de datos vectoriales
Generative Pseudo Labeling (GPL) es un método que puede mejorar directamente el rendimiento de bases de datos vectoriales como Milvus al mejorar la eficacia de los modelos de recuperación densa. Estas bases de datos dependen de representaciones vectoriales densas para la búsqueda semántica. GPL ayuda a adaptar estos modelos a nuevos dominios sin requerir datos etiquetados, abordando la degradación del rendimiento causada por cambios de dominio.
GPL utiliza un modelo preentrenado para generar consultas sintéticas para datos sin etiquetar, recupera pasajes similares y emplea un cross-encoder para puntuar pares (consulta, pasaje). En última instancia, entrena un modelo de recuperación densa que es más adecuado para el dominio objetivo.
Este método es particularmente valioso porque proporciona una forma de mejorar la búsqueda semántica en bases de datos vectoriales, que almacenan datos como vectores densos. El proceso de minería de negativos en GPL refina aún más el entrenamiento al identificar pasajes similares pero irrelevantes, lo que conduce a mejores distinciones en la búsqueda semántica.
Milvus admite varios tipos de búsquedas, como la búsqueda de vecinos más cercanos aproximados (ANN), la búsqueda con filtrado, la búsqueda por rango, la búsqueda híbrida y la búsqueda de texto completo. Técnicas como GPL, que mejoran las representaciones vectoriales subyacentes, pueden mejorar su rendimiento.
Conclusión y dirección de investigación futura
GPL es un método novedoso para la adaptación de dominio no supervisada de modelos de recuperación densa utilizando pseudoetiquetas generadas por un codificador cruzado. Supera significativamente a los métodos de adaptación de dominio existentes, especialmente cuando se combina con el preentrenamiento TSDAE, al tiempo que demuestra robustez frente a variaciones en la calidad de las consultas.
Las pseudoetiquetas de grano fino del codificador cruzado son una ventaja clave de GPL, ya que permiten que el modelo aprenda de manera más eficaz que con las etiquetas de grano grueso utilizadas en otros métodos. Cuando se combina con el preentrenamiento TSDAE, GPL logra un mejor equilibrio entre precisión y eficiencia computacional que los codificadores cruzados computacionalmente intensivos.
Dirección de investigación futura
Existen varias vías importantes para futuras investigaciones orientadas a mejorar las técnicas de adaptación de dominio. Estas incluyen:
Simplificación del proceso de entrenamiento: GPL requiere una configuración de entrenamiento relativamente compleja. La investigación futura podría centrarse en simplificar este proceso para facilitar su uso en aplicaciones prácticas.
Exploración de otros métodos de preentrenamiento: El trabajo futuro podría explorar la combinación de GPL con otros métodos de preentrenamiento más allá de TSDAE para ver si se pueden lograr mejoras adicionales en el rendimiento.
Ajuste específico del dominio: Explorar formas de ajustar finamente los modelos GPL para dominios individuales con el fin de mejorar el rendimiento en áreas específicas. Por ejemplo, se encontró que diferentes conjuntos de datos necesitan diferentes cantidades de consultas generadas por pasaje.
Investigación de alternativas a los codificadores cruzados: El codificador cruzado es un componente importante de GPL, pero es computacionalmente intensivo. Explorar otras formas de crear pseudoetiquetas igualmente eficaces podría reducir aún más los costos.
Adaptación de GPL a idiomas de bajos recursos: El éxito de GPL en la adaptación de dominio sugiere que podría ser beneficioso aplicar este método a idiomas de bajos recursos donde los datos de entrenamiento etiquetados son limitados.
Combinación de GPL con otros métodos de adaptación: Podría ser interesante investigar si la combinación de GPL con otros métodos de adaptación de dominio puede mejorar aún más el rendimiento. Esto incluye métodos como el entrenamiento adversarial o el aprendizaje multitarea.
Recursos adicionales
Artículo de GPL: https://arxiv.org/pdf/2112.07577
Sé como un pez dorado, ¡no memorices! Mitigación de la memorización en LLM generativos
Desbloqueando el poder del aprendizaje en contexto de muchos ejemplos en LLM
LLM-Eval: Un enfoque simplificado para evaluar conversaciones de LLM
Vectores densos en IA: Maximizar el potencial de los datos en el aprendizaje automático
Sigue leyendo

How to Build an Enterprise-Ready RAG Pipeline on AWS with Bedrock, Zilliz Cloud, and LangChain
Build production-ready enterprise RAG with AWS Bedrock, Nova models, Zilliz Cloud, and LangChain. Complete tutorial with deployable code.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.

Why Deepseek is Waking up AI Giants Like OpenAI And Why You Should Care
Discover how DeepSeek R1's open-source AI model with superior reasoning capabilities and lower costs is disrupting the AI landscape and challenging tech giants like OpenAI.



