Inyección de conocimiento en LLMs: ajuste fino y RAG
Los modelos de lenguaje grandes (LLMs) son impresionantes por su capacidad para almacenar y generar una gran cantidad de conocimiento. Se basan en conjuntos de datos masivos durante el preentrenamiento, lo que los convierte en expertos en diversos temas. Pero tienen sus límites. Por un lado, su conocimiento es estático, ya que no se actualiza con el paso del tiempo. Además, aunque destacan en conocimiento general, a menudo se quedan cortos al proporcionar la experiencia profunda requerida para campos especializados como la atención médica, las finanzas o el derecho.
Los métodos de inyección de conocimiento como el Fine-Tuning y la Retrieval-Augmented Generation (RAG) se utilizan para abordar estas limitaciones. El fine-tuning implica ajustar los pesos de un modelo con datos específicos de una tarea, mientras que RAG incorpora conocimiento externo durante la inferencia, lo que permite que el modelo extraiga información relevante cuando sea necesario. En este estudio, estos dos enfoques se comparan en diversas tareas intensivas en conocimiento para evaluar su eficacia a la hora de ampliar y refinar el conocimiento factual de los LLMs.
RAG superó de manera constante al fine-tuning en tareas intensivas en conocimiento, demostrando su capacidad superior para integrar información externa. Aunque el fine-tuning mejoró el rendimiento con respecto al modelo base, no fue tan competitivo como RAG. Además, el aumento de datos demostró ser beneficioso para el fine-tuning, ya que exponer los modelos a múltiples variaciones del mismo hecho durante el entrenamiento mejoró la retención de conocimiento.
Pipeline metodológico de Fine-Tuning y RAG
Veamos más de cerca los dos métodos y exploremos cómo se comparan entre sí cuando se trata de mejorar el conocimiento de un LLM. Para poner las cosas en perspectiva, imagina a tres estudiantes haciendo un examen sobre un tema que no han estudiado. Uno tenía el libro de texto solo durante el examen, otro estudió antes del examen y el tercero no tuvo acceso a materiales una vez que comenzó el examen. ¿Quién crees que tendría el mejor desempeño?
¡Averigüémoslo!
Consulta el siguiente artículo para una comprensión detallada.
¿Por qué los LLMs generan errores factuales?
A pesar de su notable fluidez y versatilidad, los LLMs son inherentemente propensos a errores factuales debido a varios factores críticos, incluidos déficits de conocimiento del dominio, datos de entrenamiento obsoletos y limitaciones de razonamiento.
- Déficit de conocimiento del dominio: Los LLMs pueden carecer de experiencia profunda en dominios específicos que estuvieron subrepresentados durante el entrenamiento. Por ejemplo, un modelo entrenado predominantemente con fuentes de noticias generales puede tener dificultades con campos altamente especializados como la medicina o el derecho si no ha sido ajustado con datos específicos del dominio.
- Información obsoleta: Los LLMs están restringidos por la fecha de corte de sus conjuntos de datos de entrenamiento. Cualquier evento, avance científico o cambio cultural que ocurra después de esta fecha de corte no se incorporará, lo que dará lugar a respuestas obsoletas. Esto es especialmente problemático en campos dinámicos como la atención médica, donde un modelo entrenado antes de la pandemia de COVID-19 carecería de información sobre protocolos de salud relacionados con la pandemia y desarrollos de vacunas.
- Inmemorización: Parte del conocimiento aprendido por el modelo durante el entrenamiento puede no retenerse, particularmente cuando implica hechos raros o patrones vistos con menor frecuencia en los datos de entrenamiento. Este problema puede obstaculizar la capacidad del modelo para recordar de manera constante información menos común en diferentes tareas o entradas.
- Olvido: El olvido catastrófico ocurre durante el fine-tuning cuando un modelo olvida información aprendida previamente, especialmente hechos menos enfatizados del entrenamiento original. Este es un problema común con los LLMs y puede afectar la retención de conocimiento a largo plazo.
- Fallos de razonamiento: Los LLM a veces no logran aplicar correctamente su conocimiento, particularmente en tareas de razonamiento complejas y de múltiples pasos. Por ejemplo, los LLM pueden producir respuestas incorrectas o incompletas cuando se les pide resolver problemas matemáticos avanzados o deducciones lógicas de varias etapas. Estos fallos a menudo están vinculados a la dificultad del modelo para mantener la coherencia lógica a lo largo de secuencias de pensamiento más largas.
Estos problemas provienen principalmente de la fase de entrenamiento del modelo, siendo el olvido catastrófico la excepción notable que surge después del entrenamiento durante el fine-tuning.
Inyectar conocimiento en modelos de lenguaje
Los errores factuales en los modelos de lenguaje grandes (LLM) a menudo son el resultado de lagunas en la base de conocimiento del modelo. Para abordar esto, la inyección de conocimiento es una técnica importante que ayuda a refinar y expandir la capacidad del modelo para proporcionar respuestas precisas.
La inyección de conocimiento se refiere al proceso de modificar o aumentar un modelo de lenguaje con información adicional. En lugar de aprender hechos completamente nuevos, sesga las predicciones del modelo hacia un dominio de conocimiento específico, mejorando su rendimiento en tareas intensivas en conocimiento.
Formulación matemática
Exploremos ahora la formulación matemática detrás de la inyección de conocimiento y cómo conduce a una mejora en la precisión del modelo.
Problema
La investigación se centra en el conocimiento factual. Si un modelo sabe algo, puede responder de manera consistente correctamente a preguntas relacionadas y distinguir afirmaciones verdaderas de falsas.
Así es como funciona matemáticamente:
Q = {qn}n=1N sea un conjunto de N preguntas factuales
Cada pregunta qn tiene L respuestas posibles y C = {cn}n=1N es el conjunto de respuestas correctas para estas preguntas.
M representa el modelo, que predice una respuesta para cada pregunta. La respuesta predicha del modelo para una pregunta qn se denota como M(qn) ∈ {an1 , . . . , anL } , y pertenece a un conjunto de respuestas posibles.
Podemos evaluar el conocimiento del modelo calculando su puntuación de conocimiento (precisión), que es el porcentaje de respuestas correctas que el modelo da de todas las preguntas:
LM,Q := #{qn| M(qn) = cn} N .
En esta ecuación:
LM,Q es la puntuación de conocimiento del modelo.
El numerador cuenta cuántas veces la respuesta del modelo M(qn) coincide con la respuesta correcta cn para cada pregunta qn.
El denominador es el número total de preguntas N.
Inyección de conocimiento
El preentrenamiento general por sí solo no es suficiente para muchas tareas intensivas en conocimiento. Para mejorar el rendimiento, necesitamos inyección de conocimiento.
Esto puede representarse matemáticamente de la siguiente manera dado un modelo preentrenado M, un conjunto de preguntas Q y una base de conocimiento auxiliar BQ, nuestro objetivo es encontrar una función para la inyección de conocimiento F tal que:
M′ := F(M, BQ) s.t. LM',Q > LM,Q.
En términos simples, buscamos crear un nuevo modelo M′ aplicando F, que incorpora la base de conocimiento BQ en el modelo original M. El objetivo es que el nuevo modelo tenga un mejor rendimiento al responder correctamente más preguntas.
Ganancia de precisión
Para ver cuánto mejoró el modelo la inyección de conocimiento (como el fine-tuning o RAG), comparamos la precisión antes y después de añadir el conocimiento adicional. La mejora se calcula usando esta fórmula:
(LM`,Q-LM,Q) / LM,Q
Donde:
LM,Q es la precisión del modelo antes de añadir nuevo conocimiento.
LM`,Qis es la precisión del modelo después de añadir nuevo conocimiento.
Esta fórmula muestra la ganancia relativa de precisión, y cuánto ha mejorado el modelo después de incorporar nueva información.
Marcos para la inyección de conocimiento
Dos marcos comunes para la inyección de conocimiento son el fine-tuning (FT) y la generación aumentada por recuperación (RAG). El fine-tuning adapta el modelo entrenándolo con datos específicos del dominio, mientras que RAG mejora el modelo recuperando información relevante de una base de conocimiento externa durante la inferencia.
Fine-Tuning
El ajuste fino es una técnica ampliamente utilizada para la inyección de conocimiento. En esta técnica, un LLM preentrenado se entrena adicionalmente con un conjunto de datos especializado para internalizar conocimientos específicos o mejorar su rendimiento en tareas concretas. Este proceso permite que el modelo "adapte" su conocimiento previamente aprendido para incorporar nuevos hechos, términos específicos del dominio y patrones de razonamiento.
Tipos de ajuste fino
- Ajuste fino supervisado: El ajuste fino supervisado (SFT) requiere conjuntos de pares entrada-salida etiquetados. Un método común de SFT es el ajuste por instrucciones, donde la entrada es una descripción de tarea en lenguaje natural y la salida es un ejemplo del comportamiento deseado. Muchos LLMs de vanguardia pasan por un ajuste por instrucciones después de su fase de preentrenamiento. El ajuste por instrucciones mejora la calidad general del modelo, con un enfoque particular en las capacidades zero-shot y de razonamiento. Sin embargo, el ajuste por instrucciones no enseña nuevos conocimientos al modelo y no es suficiente por sí solo para la inyección de conocimiento.
Ajuste fino mediante aprendizaje por refuerzo: Las técnicas de ajuste fino basadas en aprendizaje por refuerzo (RL) optimizan los modelos recompensando las respuestas correctas y penalizando las incorrectas. Algunos ejemplos incluyen aprendizaje por refuerzo a partir de retroalimentación humana (RLHF), optimización directa de preferencias (DPO) y optimización de políticas proximales (PPO). Estos métodos son útiles para mejorar la calidad general de las respuestas y el comportamiento. Sin embargo, al igual que el ajuste por instrucciones, el ajuste fino mediante RL no aborda necesariamente la amplitud de conocimiento necesaria para la inyección de conocimiento.
Ajuste fino no supervisado: El ajuste fino no supervisado no requiere datos etiquetados. Un método común es el preentrenamiento continuo o ajuste fino no estructurado, donde el proceso se considera una continuación del preentrenamiento. El modelo se entrena de manera autoregresiva causal, prediciendo el siguiente token. Normalmente se utiliza una tasa de aprendizaje más baja para evitar el olvido catastrófico. Este enfoque es eficaz para inyectar nuevo conocimiento en el modelo, ya que se basa en el conocimiento almacenado durante la fase de preentrenamiento. Este trabajo utiliza ajuste fino no supervisado para mejorar la capacidad del modelo de aprender nueva información.
Generación aumentada por recuperación (RAG)
La generación aumentada por recuperación (RAG) es una forma de aprendizaje en contexto que va más allá del conocimiento estático incrustado dentro de los LLMs al permitir que los modelos recuperen información relevante de fuentes externas antes de generar una respuesta. A diferencia del ajuste fino tradicional, que modifica los pesos internos del modelo, RAG se basa en bases de conocimiento externas para fundamentar las salidas del modelo en datos en tiempo real. Este enfoque tiene la ventaja de proporcionar acceso a información actualizada, específica del dominio y autorizada, garantizando que el texto generado siga siendo preciso y relevante.
Los modelos RAG constan de dos componentes principales:
- Componente de recuperación: Esta parte del modelo es responsable de buscar en bases de datos externas, repositorios de documentos o incluso la web información relevante basada en una consulta del usuario. Antes de la recuperación, los documentos se convierten en incrustaciones vectoriales utilizando modelos de incrustación y se almacenan en una base de datos vectorial. Durante la recuperación, la consulta se convierte en una incrustación y se compara con las incrustaciones almacenadas en la base de datos vectorial para recuperar la información más relevante. Las bases de datos vectoriales comunes como Milvus permiten una búsqueda eficiente en grandes conjuntos de datos.
- Componente de generación: Una vez recuperados los documentos o el conocimiento relevantes, el componente de generación sintetiza la información recuperada en una respuesta coherente y contextualmente adecuada. Esto permite que el modelo integre información en tiempo real y responda preguntas con mayor precisión, especialmente sobre temas que requieren el conocimiento más reciente.
Configuración experimental
Esta sección describe la configuración del experimento, detallando la base de conocimiento, la selección de modelos, la configuración de entrenamiento y los métodos de evaluación utilizados para evaluar el rendimiento de los modelos.
Base de conocimiento
La evaluación se basa en tres componentes clave: el benchmark MMLU, la tarea de eventos actuales y las tareas de generación de paráfrasis.
Benchmark MMLU
Se seleccionaron cuatro tareas del benchmark Massively Multilingual Language Understanding (MMLU) para evaluar las capacidades de los LLM en tareas intensivas en conocimiento. Estas tareas abarcan materias como anatomía, astronomía, biología, química y prehistoria. La selección se basó en su énfasis en el conocimiento factual, con una dependencia mínima del razonamiento.
MMLU fue elegido como benchmark debido a su amplia cobertura de preguntas factuales de opción múltiple en diversos dominios, proporcionando una prueba diversa y objetiva de la comprensión factual de un modelo. Se incluyeron tareas de prehistoria para evaluar la capacidad del modelo para procesar información factual de la historia no moderna. Este enfoque prueba la competencia del modelo para comprender y manipular conocimiento de forma aislada de los procesos de razonamiento.
Tarea de eventos actuales
Se creó un nuevo conjunto de datos centrado en preguntas de opción múltiple sobre eventos que ocurrieron después de la fecha límite de los datos de entrenamiento de los modelos. Específicamente, la tarea se centró en "eventos actuales" de los EE. UU., cubriendo de agosto a noviembre de 2023 y extraídos de los índices relevantes de Wikipedia.
Este enfoque garantiza que los modelos no hayan estado expuestos a estos hechos durante su entrenamiento, lo que permite una prueba directa de sus capacidades de inyección de conocimiento y su habilidad para manejar información factual actualizada.
Generación de paráfrasis
Se utilizó GPT-4 para generar aumentaciones proporcionando versiones parafraseadas de los datos de entrada después de crear el conjunto de datos. Se instruyó al modelo para que conservara el significado original mientras reformulaba las oraciones. Cada iteración de paráfrasis utilizó una semilla diferente para garantizar la diversidad en las versiones generadas.
Para cada tarea de MMLU, se seleccionaron aleatoriamente 240 fragmentos, y se crearon dos paráfrasis por fragmento, que se reservó para la validación durante el ajuste de hiperparámetros. Se generaron diez paráfrasis para cada fragmento utilizado en el proceso de fine-tuning para el conjunto de datos de eventos actuales.
Selección de modelos
Llama2-7B, Mistral-7B y Orca2-7B fueron elegidos para evaluar el rendimiento de inferencia en diferentes enfoques de modelado. Esta alineación incluye una combinación de modelos base de código abierto ampliamente utilizados y un modelo ajustado con instrucciones, ofreciendo una base equilibrada para la comparación.
Además, bge-large-en fue seleccionado como el modelo de embeddings para el componente RAG. Este modelo de embeddings era de vanguardia entre las opciones de código abierto, según la clasificación MTEB de Hugging Face.
Configuración de entrenamiento
El proceso de entrenamiento incluye los siguientes componentes clave:
- Procedimiento: Todos los modelos fueron sometidos a fine-tuning utilizando un método de entrenamiento no supervisado. El conjunto de datos de entrenamiento se dividió en fragmentos, asegurando que cada fragmento no excediera un tamaño de 256 tokens. Se utilizaron tokens especiales
y para marcar el comienzo y el final de cada fragmento.
- Hardware: Los modelos fueron entrenados en 4 GPU NVIDIA A-100, garantizando que estuvieran disponibles los recursos computacionales necesarios para el fine-tuning a gran escala.
Hiperparámetros:
Las tasas de aprendizaje se probaron en el siguiente rango: 1 × 10-6 a 5 × 10-5.
Los modelos se entrenaron durante un máximo de 5 épocas con un tamaño de lote de 64, seleccionado en función de la optimización de hiperparámetros.
Evaluación
La evaluación se llevó a cabo utilizando el framework LM-Evaluation-Harness, una herramienta popular para evaluar el rendimiento de los LLM. Este framework proporciona un enfoque estandarizado para la evaluación de modelos, garantizando la consistencia entre tareas y métodos. Los modelos se evaluaron en términos de su capacidad para predecir las respuestas correctas a preguntas factuales.
Para el experimento, estos enfoques de evaluación son:
- Modelo base: El rendimiento bruto del modelo sin ninguna inyección adicional de conocimiento.
- Fine-Tuning (FT): El modelo se ajusta finamente con datos específicos de la tarea para mejorar su rendimiento en preguntas basadas en conocimiento factual.
- Generación aumentada por recuperación (RAG): Este método utiliza una base de conocimiento externa y recupera información relevante para aumentar las respuestas del modelo.
- Fine-Tuning + RAG (FT+RAG): Un enfoque híbrido que combina el fine-tuning con la generación aumentada por recuperación, con el objetivo de mejorar el rendimiento aprovechando tanto la adaptación del conocimiento como la recuperación.
Además de comparar estos cuatro enfoques, el rendimiento se evaluó en dos configuraciones diferentes:
- 0-shot: El modelo se prueba sin ejemplos previos, basándose únicamente en el conocimiento que ha aprendido durante el preentrenamiento y en cualquier inyección de conocimiento (fine-tuning o RAG).
- 5-shot: El modelo recibe cinco ejemplos para cada tarea, proporcionando un contexto para realizar predicciones. Esta configuración evalúa la capacidad del modelo para generalizar a partir de ejemplos en un escenario más práctico y realista.
La comparación de la precisión y el rendimiento de los modelos en estos cuatro enfoques reveló el impacto de la inyección de conocimiento, el fine-tuning y la generación aumentada por recuperación en la capacidad de los LLMs para manejar tareas intensivas en conocimiento.
Resultados del experimento
Ahora, profundicemos en los resultados experimentales en diferentes bases de conocimiento, es decir, el benchmark MMLU y los datos de eventos actuales, explorando cómo se desempeñó cada enfoque en tareas intensivas en conocimiento
Resultados de MMLU
En todas las tareas, RAG superó consistentemente a los modelos base, como se observa en términos de la precisión de log-verosimilitud para todas las tareas y configuraciones.
Resultados para los conjuntos de datos MMLU en términos de precisión de log-verosimilitud | Fuente
Usar RAG con el modelo base como generador demostró ser superior al fine-tuning por sí solo. En algunos casos, sustituir el modelo base por un modelo ajustado finamente en la pipeline de RAG mejoró aún más los resultados. Sin embargo, el efecto fue inconsistente y destacó la inestabilidad inherente del fine-tuning. Además, el prompting five-shot proporcionó una pequeña pero consistente mejora en todos los métodos.
La ganancia relativa de precisión para cada método de inyección de conocimiento, promediada (por columnas) en todos los experimentos del conjunto de datos MMLU | Fuente
Resultados de eventos actuales
RAG ofreció un rendimiento excepcional en la tarea de eventos actuales gracias a su alineación precisa entre las preguntas y el conjunto de datos auxiliar. Si bien el fine-tuning resultó beneficioso, quedó por debajo de la efectividad de RAG. Sin embargo, aumentar el fine-tuning (FT-par) con múltiples paráfrasis mejoró significativamente los resultados frente al enfoque de referencia (FT-reg).
Resultados de eventos actuales. Los modelos que fueron ajustados finamente con el conjunto de datos original se etiquetan como FT-reg, mientras que aquellos entrenados con el conjunto de datos con múltiples paráfrasis se etiquetan como FT-par | Fuente
Fine-Tuning vs. RAG
Los resultados de las tareas MMLU y de eventos actuales confirman la superioridad de RAG sobre el fine-tuning. Si bien el fine-tuning mejoró la precisión en comparación con el modelo base, no pudo igualar las ganancias de rendimiento derivadas de la recuperación.
Varios factores contribuyen a esta tendencia:
- Acceso a conocimiento contextual: A diferencia del fine-tuning, RAG recupera dinámicamente información relevante, asegurando que las respuestas estén fundamentadas contextualmente.
- Olvido catastrófico: El fine-tuning corre el riesgo de sobrescribir conocimiento aprendido previamente, lo que podría disminuir las capacidades generales del modelo.
- Problemas de alineación: Los modelos ajustados pueden requerir ajuste fino supervisado adicional o aprendizaje por refuerzo (RLHF) para lograr un rendimiento óptimo
Hallazgos clave
- RAG supera a los modelos base: RAG (Generación Aumentada por Recuperación) superó constantemente a los modelos base, mejorando significativamente la precisión, especialmente en tareas intensivas en conocimiento, al aumentar el modelo con datos externos.
- RAG vs. ajuste fino (FT): RAG superó constantemente al ajuste fino (FT). La combinación de RAG y FT mostró cierta mejora al usar un modelo ajustado como generador en la canalización de RAG. Aun así, los resultados fueron inconsistentes, lo que indica la inestabilidad inherente del ajuste fino en comparación con RAG.
- Impulso de 5-shot: La transición de 0-shot a 5-shot produjo una mejora pequeña pero constante en el rendimiento, y RAG fue el que más se benefició del contexto añadido.
- La aumentación de datos mejora la retención de conocimiento: Los experimentos muestran que la aumentación de datos basada en paráfrasis conduce a un aumento monotónico en la precisión del modelo en tareas de inyección de conocimiento. Los modelos comprenden y generalizan mejor el nuevo conocimiento al reformular la información de múltiples maneras. A medida que aumentó el número de paráfrasis, la precisión del modelo siguió mejorando de forma constante.
Precisión del modelo en la tarea de eventos actuales en función del número de paráfrasis | Fuente
RAG y bases de datos vectoriales
RAG (Generación Aumentada por Recuperación) mejora los modelos de lenguaje grandes al integrar datos recuperados en las respuestas, mejorando la precisión factual y la relevancia contextual.
El papel de las bases de datos vectoriales en RAG
Las bases de datos vectoriales desempeñan un papel crucial en la generación aumentada por recuperación (RAG) al permitir el almacenamiento y la recuperación eficientes de embeddings de alta dimensionalidad. En un sistema RAG, la fase de recuperación depende de identificar la información más semánticamente relevante de una vasta base de conocimiento, que es donde destacan las bases de datos vectoriales.
Estas bases de datos indexan datos textuales o multimodales como embeddings vectoriales densos, lo que permite búsquedas de similitud rápidas y precisas mediante métodos como la búsqueda aproximada del vecino más cercano (ANN). Cuando se genera una consulta, la base de datos vectorial recupera los embeddings coincidentes más cercanos en función de la similitud coseno u otras métricas de distancia. Esto garantiza que solo la información más relevante contextualmente se pase al modelo de generación, mejorando la precisión factual y reduciendo las alucinaciones.
Las bases de datos vectoriales son especialmente valiosas en la recuperación de conocimiento en tiempo real para aplicaciones como sistemas de preguntas y respuestas, chatbots, búsqueda empresarial y motores de recomendación.
Milvus/Zilliz como base de datos vectorial/plataforma en la nube
Milvus, una base de datos vectorial de código abierto desarrollada por Zilliz, es una solución potente para gestionar y consultar embeddings de alta dimensionalidad en sistemas de generación aumentada por recuperación (RAG). RAG se basa en una búsqueda de similitud eficiente para recuperar conocimiento relevante antes de generar respuestas, y Milvus está optimizado para tareas de recuperación en tiempo real a gran escala.
Enriquecimiento del conocimiento de los LLM con Zilliz cloud para obtener respuestas más precisas | Fuente
Milvus permite el almacenamiento y la indexación de millones o incluso miles de millones de embeddings vectoriales, lo que permite a los modelos RAG realizar búsquedas semánticas rápidas en vastas bases de conocimiento. Milvus garantiza una recuperación de baja latencia al admitir múltiples algoritmos de indexación. Esto es fundamental para aplicaciones en las que la información en tiempo real es esencial, como chatbots, motores de búsqueda y sistemas de IA empresarial.
Zilliz amplía Milvus con soluciones basadas en la nube, lo que facilita a las empresas implementar y escalar la búsqueda vectorial para RAG sin gestionar infraestructura. Este enfoque nativo de la nube garantiza una integración fluida con los LLMs. Permite a las organizaciones mejorar sus modelos con recuperación dinámica de conocimiento, manteniendo al mismo tiempo el rendimiento y la escalabilidad.
Posibles direcciones futuras de investigación
Los modelos de lenguaje grandes (LLMs) poseen enormes cantidades de conocimiento, pero su capacidad para adaptarse a información nueva, especializada o no vista sigue siendo un desafío. El ajuste fino y la generación aumentada por recuperación (RAG) son dos enfoques destacados para la inyección de conocimiento. Si bien el ajuste fino puede ser útil para muchas aplicaciones, RAG ha demostrado ser una opción más fiable para integrar conocimiento externo.
Varias áreas clave justifican una mayor investigación para mejorar nuestra comprensión de la inyección de conocimiento en los LLMs:
- Integración híbrida de conocimiento: Investigar combinaciones de ajuste fino, RAG y otras técnicas para mejorar la adaptabilidad. Comprender cómo estos enfoques se complementan entre sí puede conducir a una inyección de conocimiento más eficiente.
- Combinación de métodos de ajuste fino: Las investigaciones futuras deberían explorar la integración del ajuste por instrucciones y el ajuste fino basado en aprendizaje por refuerzo (RL) con el ajuste fino no supervisado. Esto podría mejorar la adaptación y retención del conocimiento.
- Evaluación de la representación del conocimiento en los LLMs: Investigar cómo los LLMs almacenan y recuperan internamente el conocimiento inyectado desde una perspectiva teórica. Una comprensión más clara podría conducir a modelos más interpretables y eficientes.
- Medición del conocimiento en los LLMs: Desarrollar nuevos marcos de evaluación más allá de los enfoques empíricos para evaluar mejor la retención del conocimiento. Establecer referencias estandarizadas podría mejorar la comparabilidad de diferentes modelos.
La investigación adicional en estas áreas ayudará a perfeccionar las estrategias de inyección de conocimiento, mejorando la eficiencia y la fiabilidad de los LLMs al adaptarse a nueva información.
Recursos adicionales
Sigue leyendo

Creating Collections in Zilliz Cloud Just Got Way Easier
We've enhanced the entire collection creation experience to bring advanced capabilities directly into the interface, making it faster and easier to build production-ready schemas without switching tools.

1 Table = 1000 Words? Foundation Models for Tabular Data
TableGPT2 automates tabular data insights, overcoming schema variability, while Milvus accelerates vector search for efficient, scalable decision-making.

Building RAG Pipelines for Real-Time Data with Cloudera and Milvus
explore how Cloudera can be integrated with Milvus to effectively implement some of the key functionalities of RAG pipelines.



