Combinar imágenes y texto: cómo la recuperación multimodal transforma la búsqueda
El auge de los modelos multimodales
Al mirar atrás al rápido progreso de los grandes modelos de lenguaje (LLMs) en 2024, está claro que la IA continúa avanzando gracias a una mayor innovación e inversión. Si bien hay abundantes datos textuales disponibles, los investigadores han reconocido que los humanos entienden el mundo a través de múltiples sentidos, lo que ha impulsado un cambio hacia el aprovechamiento de otros tipos de datos como imágenes, audio y videos. Este cambio ha impulsado el auge de los modelos de IA multimodal, que pueden procesar y comprender datos de múltiples fuentes, lo que permite interpretaciones de la información más ricas y complejas.
En la primera mitad de 2024, vimos lanzamientos significativos de modelos multimodales, como GPT-4o de OpenAI, Claude 3 de Anthropic, Gemini 1.5 Pro de Google y Ferret-UI de Apple. Estos modelos amplían las capacidades de la IA más allá del texto, abriendo nuevas aplicaciones en industrias creativas, herramientas de productividad y sistemas más interactivos. Lo que antes era un concepto académico de nicho ahora se ha vuelto generalizado, con desarrolladores que utilizan estas APIs para crear aplicaciones que integran la IA con medios diversos, desbloqueando nuevas posibilidades de innovación.
Científicos de OpenAI mostrando las capacidades multimodales de su recién lanzado GPT-40.png
Figura: Científicos de OpenAI mostrando las capacidades multimodales de su recién lanzado GPT-40
Recuperación multimodal y recuperación de imágenes compuestas (CIR)
A medida que se desarrollan los modelos multimodales, la recuperación multimodal —que combina entradas de múltiples modalidades, normalmente texto e imágenes— se está volviendo cada vez más popular. Este enfoque permite una forma más matizada y precisa de captar las intenciones de búsqueda de los usuarios, aprovechando las fortalezas de ambas modalidades.
Una de las tareas más comunes dentro de la recuperación multimodal es la recuperación de imágenes compuestas (CIR), donde los usuarios proporcionan una consulta que incluye una imagen de referencia junto con un pie de foto descriptivo. Este enfoque de doble entrada permite la recuperación de imágenes específicas al combinar contenido visual con instrucciones textuales, creando una consulta más detallada y precisa.
Las búsquedas de imágenes tradicionales se basan principalmente en métricas de similitud visual, que son eficaces para muchas consultas de propósito general. Sin embargo, en casos en los que una sola imagen de referencia no expresa completamente la intención del usuario, la entrada de texto se convierte en un complemento esencial. El texto añade contexto y precisión que una imagen por sí sola puede no tener, permitiendo a los usuarios afinar sus consultas de búsqueda. Esta fusión de modalidades permite a los desarrolladores crear sistemas de búsqueda más robustos y flexibles, permitiendo a los usuarios expresar consultas complejas de forma natural y con mayor precisión.
En las siguientes secciones, exploraremos los modelos y técnicas líderes en la recuperación de imágenes compuestas, sus metodologías y su rendimiento en diversos dominios, evaluados utilizando conjuntos de datos populares como FashionIQ, CIRR y CIRCO. Estas evaluaciones destacarán las fortalezas y limitaciones de diferentes enfoques de CIR en aplicaciones del mundo real.
Una visión general de los métodos populares de recuperación de imágenes compuestas
En los últimos años, las técnicas de recuperación multimodal han avanzado hacia la universalidad zero-shot, especialmente con modelos como CLIP, que permite una potente recuperación de texto a imagen utilizando un espacio de incrustación compartido para ambas modalidades. Estas técnicas aprovechan ya sea incrustaciones preentrenadas o conjuntos de datos anotados y ajustados finamente, dependiendo de los recursos disponibles, lo que conduce a mejoras significativas en el rendimiento de búsqueda y la calidad de los datos.
La siguiente tabla ofrece una visión general de técnicas populares de recuperación de imágenes compuestas (CIR), sus metodologías principales y los tipos de embeddings que generan y usan para la búsqueda:
| Técnica | Descripción | Embedding generado | Embedding de búsqueda |
| Pic2Word | Convierte una imagen en un token incrustado dentro del texto, lo que permite búsquedas flexibles de imagen a texto. | Embedding de texto CLIP | Embedding visual CLIP |
| CompoDiff | Aplica ruido a un embedding visual CLIP y luego usa texto durante el proceso de eliminación de ruido para reconstruir un embedding visual CLIP condicional. | Embedding visual CLIP | Embedding visual CLIP |
| CIReVL | Transforma una imagen en texto descriptivo, modifica la descripción para que coincida con el objetivo y genera una nueva representación. | Embedding de texto CLIP | Embedding visual CLIP |
| MagicLens | Usa un modelo Transformer que procesa simultáneamente datos de imagen y texto, generando un embedding vectorial unificado. | Embedding MagicLens | Embedding MagicLens |
Pic2Word: Mapeo de imágenes a palabras para la recuperación de imágenes compuestas zero-shot
Pic2Word es un método para la recuperación de imágenes compuestas zero-shot (ZS-CIR), orientado a recuperar imágenes usando imagen y texto como consultas de entrada sin requerir grandes conjuntos de datos etiquetados. Usando el modelo CLIP preentrenado, Pic2Word mapea embeddings visuales de imágenes a tokens de pseudopalabras que representan la imagen en el espacio textual. Esto permite que el modelo combine las características de la imagen con descripciones de texto para recuperar imágenes objetivo basadas en modificaciones especificadas en el texto (p. ej., cambiar atributos de una imagen, como el color de un objeto).
Left-the process of training the Pic2word mapping network; Right-the process of composed image retrieval..png
Figura: Izquierda: el proceso de entrenamiento de la red de mapeo Pic2word; Derecha: el proceso de recuperación de imágenes compuestas.
Cómo funciona Pic2Word
La imagen anterior muestra el entrenamiento de la red de mapeo Pic2Word y el proceso de recuperación de imágenes compuestas. Durante el proceso de entrenamiento, una imagen (p. ej., una imagen de un gato) pasa por un Codificador visual congelado, que genera un embedding visual . Simultáneamente, un prompt de texto tokenizado como "A photo of" pasa por un Codificador de texto que produce un embedding de texto correspondiente . El objetivo de la red de mapeo es mapear el embedding de imagen a un pseudotoken que pueda incorporarse al prompt de texto, formando la frase "A photo of [s]."
Este token mapeado, cuando pasa por el Codificador de texto congelado, debe generar un embedding textual que se alinee estrechamente con el embedding de imagen original . La red se entrena usando una función de pérdida contrastiva, que minimiza la distancia entre el embedding visual y el embedding de texto , asegurando que la imagen se represente con precisión como un token similar a una palabra.
Una vez entrenada la red de mapeo, puede utilizarse para tareas de recuperación de imágenes compuestas. En esta etapa, el usuario introduce una imagen (p. ej., un perro) y una consulta de texto (p. ej., "en una piscina"). La imagen se procesa a través del Codificador Visual, mientras que el texto se procesa a través del Codificador de Texto. El pseudo-token aprendido mejora la consulta, lo que permite que el sistema comprenda la composición de imagen y texto.
La característica de consulta, que combina representaciones de imagen y texto, se compara con una base de datos de imágenes candidatas. Luego, el sistema recupera la imagen que mejor coincide (p. ej., un perro nadando en una piscina), modificando efectivamente la imagen de entrada según la descripción de texto proporcionada.
CompoDiff: Recuperación Versátil de Imágenes Compuestas Con Difusión Latente
CompoDiff es un modelo basado en difusión diseñado para la recuperación de imágenes compuestas zero-shot (ZS-CIR). Emplea modelos de difusión, una técnica en la generación de texto a imagen, para mejorar significativamente la flexibilidad y la precisión de la edición y recuperación de imágenes. Estos modelos van más allá de simplemente hacer referencia al texto; garantizan que las imágenes generadas se alineen con los patrones observados durante el entrenamiento. Al usar modelos de difusión, CompoDiff crea embeddings que fusionan texto de entrada, imágenes de referencia y máscaras, generando vectores que se alinean con la distribución de embeddings visuales de CLIP.
Entonces, ¿cómo entendemos la mecánica de los modelos de difusión? Considera una fotografía que se vuelve cada vez más ruidosa con el tiempo. Imagina que empiezas con una imagen clara y nítida y luego le agregas gradualmente ruido aleatorio, similar a la estática de un televisor antiguo. La imagen se vuelve cada vez más oscurecida hasta que es casi irreconocible, convirtiéndose en algo que parece ruido puro. Este es el proceso de difusión directa.
Sin embargo, la parte más fascinante es el proceso inverso. En los modelos de difusión, el objetivo es empezar con esa imagen ruidosa y "eliminar el ruido" lentamente paso a paso. A medida que el modelo elimina ruido, reconstruye la imagen original (o crea nuevas imágenes basadas en prompts de texto). Este proceso permite que el modelo genere imágenes de alta calidad que se ajustan a ciertas condiciones, como una descripción de texto específica o una imagen de referencia.
Funciona de la misma manera al incrustar texto. CompoDiff elimina gradualmente el ruido de un embedding de ruido gaussiano, mejorando su relación señal-ruido hasta que coincide con la de un embedding visual de CLIP. El texto y las imágenes controlan esta transformación, y las máscaras proporcionan orientación adicional sobre qué áreas de la imagen modificar.
Cómo Funciona CompoDiff.png
Figura: Cómo Funciona CompoDiff
Proceso de Inferencia de CompoDiff
En la fase de inferencia de CompoDiff, como se ilustra en el diagrama, el proceso comienza con una imagen de entrada (p. ej., la Torre Eiffel) que se codifica en un espacio latente a través del Codificador de Imágenes CLIP, produciendo el embedding visual inicial . Este embedding pasa por un proceso de difusión directa, añadiéndole ruido y transformándolo en una versión más ruidosa , que representa una versión degradada de la imagen original.
A continuación, se aplica el Transformer de Eliminación de Ruido, que elimina progresivamente el ruido en múltiples pasos (repetidos veces) para recuperar un embedding de imagen más limpio. El proceso de eliminación de ruido está guiado por condiciones que influyen en cómo debe reconstruirse la imagen. Estas condiciones incluyen:
Condición de Texto : En este caso, el prompt de texto "Globo" se codifica a través de un Codificador de Texto (CLIP u otros modelos de texto como T5), produciendo un embedding de texto . Este embedding añade una guía contextual al proceso de eliminación de ruido, asegurando que la imagen final se alinee con la descripción de un "Globo."
Condición de máscara : Si se proporciona una máscara, se procesa mediante un perceptrón multicapa (MLP) para generar una incrustación de máscara , que guía el denoising para centrarse en áreas específicas de la imagen, como modificar o añadir elementos como un globo en ciertas regiones.
Las condiciones de texto y máscara se concatenan con la incrustación visual ruidosa y se pasan por el transformador de denoising, que utiliza Classifier-Free Guidance (CFG) para ajustar la intensidad de estas condiciones. Si no se proporciona ninguna máscara o condición, se utilizan vectores cero predeterminados para garantizar un funcionamiento fluido.
Cabe destacar que también se introducen condiciones de texto negativas durante este proceso para refinar la salida. Por ejemplo, podría aplicarse una condición negativa como "múltiples globos" para evitar generar más de un globo, asegurando que la imagen final refleje un solo globo cerca de la Torre Eiffel.
Tras varias iteraciones de denoising, la incrustación de imagen resultante se alinea con las características visuales de CLIP y luego se compara con una base de datos de recuperación para encontrar o generar la imagen que mejor coincida, que en este caso sería la Torre Eiffel con un globo en el cielo.
Proceso de entrenamiento de CompoDiff
El entrenamiento se desarrolla en dos fases:
Proceso de entrenamiento de CompoDiff.png
Figura: Proceso de entrenamiento de CompoDiff
****
Etapa 1: Entrenamiento con LAION-2B
En la primera etapa, el modelo se entrena con el conjunto de datos LAION-2B, que contiene una gran colección de pares imagen-texto. El objetivo principal de esta etapa es aprender a generar incrustaciones visuales de CLIP a partir de entradas ruidosas utilizando descripciones textuales como guía.
El proceso comienza codificando una imagen (por ejemplo, un pájaro) en una incrustación visual de CLIP . Esta incrustación pasa por un proceso de difusión, donde se añade ruido progresivamente durante varios pasos, lo que da como resultado una versión altamente ruidosa que contiene poca o ninguna información identificable. Simultáneamente, la descripción de texto correspondiente, como "Un carbonero sentado sobre una superficie de madera junto a flores", se codifica en una incrustación de texto de CLIP . La incrustación visual ruidosa y la incrustación de texto se introducen entonces en un transformador de denoising, que elimina el ruido por etapas, guiado por el texto. El transformador tiene como objetivo reconstruir gradualmente la incrustación visual limpia de la imagen. El objetivo en esta etapa es minimizar la diferencia entre la incrustación visual ruidosa y la incrustación reconstruida utilizando el texto como referencia guía. Esto enseña al modelo a alinear la información visual y textual, garantizando que las características de la imagen generada coincidan con la descripción textual.
Etapa 2: Ajuste fino en el conjunto de datos SynthTriplets18M
En la Etapa 2, el modelo se ajusta finamente tanto en LAION-2B como en los conjuntos de datos sintéticos SynthTriplet18M, mejorando su capacidad para manejar escenarios más complejos.
En esta fase, el modelo aprende a generar imágenes específicas no solo a partir de descripciones de texto, sino también incorporando imágenes de referencia y condiciones de máscara que indican áreas a modificar. El entrenamiento comienza codificando una imagen de entrada, igual que en la Etapa 1, pero ahora también se proporciona una imagen de referencia y se codifica en su propia incrustación visual. La imagen de referencia guía al modelo en la modificación de la imagen de entrada. También se introduce una condición de máscara, que resalta regiones específicas de la imagen que requieren modificación. La máscara se procesa en una incrustación utilizando un MLP (perceptrón multicapa), y funciona conjuntamente con la incrustación de texto (por ejemplo, "Cambiar el carbonero por un gallo") para guiar el proceso de denoising.
El modelo alterna entre dos objetivos: uno en el que aprende a oscurecer áreas específicas de la imagen objetivo según las condiciones de texto y máscara, y otro en el que perfecciona su capacidad para transformar la imagen de entrada en la imagen objetivo según la referencia, la máscara y el texto proporcionados. A través de este proceso de entrenamiento alterno, el modelo aprende a combinar información visual y textual para modificar imágenes de forma precisa y flexible. Al final de estas dos etapas, CompoDiff está equipado para manejar tareas complejas de recuperación de imágenes compuestas, ofreciendo un control preciso sobre cómo se generan y modifican las imágenes en función de múltiples condiciones. Esto permite que el modelo genere imágenes que se alineen con instrucciones de texto detalladas, incorporen características de imágenes de referencia y modifiquen selectivamente regiones específicas.
CIReVL: Visión mediante lenguaje para la recuperación composicional de imágenes sin entrenamiento
La mayoría de los modelos de recuperación composicional de imágenes (CIR) dependen de conjuntos de datos anotados y de entrenamiento de modelos específicos para la tarea, que son costosos y propensos al sobreajuste. Esto significa que los modelos tienden a rendir mal cuando se les presentan imágenes que difieren de su distribución de entrenamiento. Este problema se vuelve especialmente problemático en aplicaciones del mundo real donde la variedad de entradas puede ser enorme e impredecible. Con el desarrollo de modelos a gran escala como los grandes modelos de lenguaje (LLMs) y los modelos de visión-lenguaje (VLMs), el paradigma de aprendizaje zero-shot—en el que los modelos realizan tareas para las que no han sido entrenados explícitamente—ha recibido una atención significativa. CIReVL es un ejemplo destacado de un modelo CIR zero-shot que no requiere entrenamiento adicional, pero aun así logra un rendimiento robusto.
Cómo funciona CIReVL.png
Figura: Cómo funciona CIReVL
Más específicamente, CIReVL (recuperación composicional de imágenes mediante visión por lenguaje) es un enfoque sin entrenamiento para la recuperación composicional de imágenes que aprovecha modelos existentes y preentrenados, como VLMs y LLMs. Su objetivo es recuperar imágenes objetivo de una base de datos combinando una imagen de consulta y un modificador textual (por ejemplo, "Torre Eiffel sin gente y de noche"). Lo que hace que CIReVL destaque es su capacidad para evitar por completo la necesidad de entrenamiento supervisado, ofreciendo una solución más flexible y eficiente para tareas de CIR.
El método se basa en tres componentes clave, cada uno con sólidas capacidades de generalización. Primero, un modelo de visión-lenguaje (como BLIP2) genera una leyenda descriptiva para la imagen de entrada. Segundo, un gran modelo de lenguaje (como GPT-3.5 o GPT-4) modifica la leyenda según las instrucciones de texto proporcionadas (p. ej., "eliminar personas, cambiar la hora a la noche"). Por último, la leyenda modificada se transforma en un embedding de texto utilizando un codificador texto-imagen como CLIP, que luego realiza la recuperación real de imágenes desde la base de datos. Este proceso es altamente modular y opera puramente en el dominio del lenguaje, lo que permite un control más intuitivo y la intervención del usuario. Esta pipeline sencilla también hace que CIReVL sea escalable y adaptable.
MagicLens: Recuperación de imágenes autosupervisada con instrucciones abiertas
Al revisar métodos anteriores, podemos encontrar que uno de los mayores desafíos en la recuperación de imágenes compuestas (CIR) es recopilar y anotar datos reales de alta calidad para entrenar modelos que generalicen bien en diversos contextos. Los modelos necesitan comprender relaciones complejas entre imágenes, pero los datos necesarios para este tipo de entrenamiento suelen ser costosos y difíciles de obtener. Para abordar este problema, investigadores de DeepMind y la Universidad Estatal de Ohio presentaron MagicLens, un modelo de recuperación de imágenes autosupervisado con instrucciones abiertas. Su innovación principal radica en su capacidad para ir más allá de la similitud visual tradicional y recuperar imágenes en función de relaciones semánticas más matizadas.
MagicLens se basa en modelos de visión-lenguaje (VLM) preentrenados como CLIP o CoCa, junto con grandes modelos de lenguaje (LLM) como PaLM2. Esta combinación permite a MagicLens gestionar consultas de búsqueda complejas, lo que permite a los usuarios introducir una imagen y un prompt de texto flexible (p. ej., "desde un ángulo diferente" o "la vista interior") para recuperar imágenes que se alineen tanto con el contenido visual como con las relaciones semánticas.
El modelo aprovecha la idea de que las imágenes de las mismas páginas web suelen compartir relaciones implícitas, como diferentes vistas de un objeto o interacciones entre objetos. MagicLens extrae estos pares de imágenes de páginas web y los utiliza para generar un vasto conjunto de datos de tripletas de entrenamiento, cada una compuesta por una imagen de consulta, una instrucción textual y una imagen objetivo. Estas tripletas proporcionan la base para el proceso de aprendizaje autosupervisado de MagicLens, en el que el modelo aprende a vincular imágenes en función de las instrucciones proporcionadas.
Cómo funciona Magiclends.png
Figura: Cómo funciona Magiclends
Para recopilar y depurar estas tripletas, MagicLens emplea una sofisticada canalización de datos:
Páginas web: Las imágenes se recopilan de la misma URL, con la suposición de que probablemente estén relacionadas. Esto permite al modelo reunir una enorme cantidad de datos de Common Crawl.
Agrupación y limpieza: Las imágenes recopiladas se agrupan por URL y luego se filtran para eliminar imágenes de baja resolución, duplicadas o irrelevantes (p. ej., anuncios).
Expansión de metadatos: Para mejorar la comprensión, se generan metadatos para cada imagen. Estos metadatos incluyen:
Etiquetas ICA (generadas mediante Google Vision API) para la identificación básica de objetos.
Texto alternativo (descripciones de texto alternativo de páginas web).
Subtítulos generados mediante el modelo PaLI de Google.
Puntuación y filtrado: Utilizando la puntuación de imagen a imagen y de texto a texto de CLIP, MagicLens filtra aún más los pares de imágenes débilmente relacionados, garantizando que solo permanezcan pares de alta calidad.
Generación de instrucciones: Basándose en los metadatos de las imágenes emparejadas, PaLM2 de Google genera instrucciones textuales abiertas que explican la relación entre las imágenes de consulta y objetivo.
canalización de datos.png
Figura: canalización de datos
A través de esta canalización, MagicLens genera un conjunto de datos de 36,7 millones de tripletas (imagen de referencia, instrucción de texto e imagen objetivo), que proporciona la base para el entrenamiento del modelo. Este enorme conjunto de datos permite a MagicLens entrenarse eficazmente sin necesidad de anotaciones manuales, lo que da lugar a un modelo robusto en diversas tareas de recuperación.
Evaluación de modelos de recuperación de imágenes compuestas (CIR)
Se utilizan habitualmente varios conjuntos de datos de referencia para evaluar el rendimiento de los modelos de recuperación de imágenes compuestas (CIR), incluidos FashionIQ, CIRR y CIRCO. Estos conjuntos de datos cubren una variedad de tareas de recuperación, desde la búsqueda de imágenes de moda hasta la recuperación de imágenes naturales, lo que los hace ideales para evaluar diferentes modelos en diversos dominios.
FashionIQ se centra en la recuperación de imágenes de moda de grano fino, con tareas que implican prendas específicas (p. ej., vestidos, camisas, etc.). Incluye 2005 consultas y 5179 imágenes de índice.
CIRR hace hincapié en imágenes del mundo real y cubre una amplia gama de relaciones entre imágenes (p. ej., cambios espaciales o composicionales). Tiene 4148 consultas y 2316 imágenes de índice.
CIRCO es un conjunto de datos a gran escala con más de 120.000 imágenes naturales, donde cada consulta puede tener múltiples imágenes objetivo correctas.
Rendimiento del modelo en benchmarks CIR
La siguiente tabla destaca el rendimiento de varios modelos CIR líderes en estos conjuntos de datos. Los modelos se evalúan utilizando diferentes métricas, como Recall@10 (R@10) para FashionIQ y CIRR, y Mean Average Precision at 5 (mAP@5) para CIRCO. Estas métricas evalúan qué tan bien los modelos pueden recuperar imágenes relevantes basándose en una combinación de entrada visual e instrucciones textuales.
| Publicación | Params | Fashion IQ R@10 | CIRR R@1 | CIRCO mAP@5 | |
| Pic2Word | CVPR 2023 | 429M | 24.7 | 23.9 | 8.7 |
| CompoDiff | CVPRW 2024 | 568M | 36.0 | 18.2 | 12.6 |
| CIReVL | ICLR 2024 | 12.5B | 28.6 | 24.6 | 18.6 |
| MagicLens-L | ICML 2024 | 613M | 38.0 | 33.3 | 34.1 |
Conclusiones clave:
Rendimiento en FashionIQ: MagicLens-L supera a otros modelos con un Recall@10 de 38.0, mostrando su eficacia en tareas de recuperación de moda. CompoDiff le sigue de cerca con 36.0, demostrando su fortaleza en CIR relacionado con la moda.
Rendimiento en CIRR: MagicLens-L también lidera en CIRR, logrando un Recall@1 de 33.3, significativamente superior al de otros modelos. CIReVL ofrece un rendimiento sólido con 24.6, demostrando su capacidad en la recuperación de imágenes del mundo real.
Rendimiento en CIRCO: MagicLens-L también destaca en tareas de recuperación de imágenes naturales a gran escala, con una Mean Average Precision at 5 (mAP@5) de 34.1, muy por delante de otros modelos. Esto demuestra su fortaleza para manejar conjuntos de datos complejos y grandes con múltiples objetivos correctos.
En general, MagicLens-L muestra el mejor rendimiento general en todos los conjuntos de datos, destacando especialmente tanto en tareas de recuperación de moda como de imágenes naturales a gran escala, a pesar de tener menos parámetros en comparación con CIReVL.
Resumen
En este artículo, exploramos la creciente adopción de métodos de recuperación multimodal, que combinan la recuperación de texto, imágenes y muchos otros tipos de datos para proporcionar formas más flexibles y precisas de captar la intención de búsqueda. Una tarea común en este dominio es la recuperación de imágenes compuesta (CIR), donde los usuarios refinan las búsquedas de imágenes utilizando descripciones de texto en combinación con imágenes de referencia.
Cubrimos los modelos y técnicas clave que impulsan CIR, incluidos Pic2Word, CompoDiff, CIReVL y MagicLens. Cada uno de estos se basa en las capacidades fundamentales de CLIP, al tiempo que adopta diferentes enfoques para mejorar la recuperación:
Pic2Word transforma imágenes en tokens de texto incrustados en una búsqueda basada en texto, aprovechando los embeddings de texto de CLIP para una recuperación de imágenes muy versátil e impulsada por texto.
CompoDiff emplea eliminación de ruido guiada por texto, refinando embeddings visuales ruidosos con entrada de texto para reconstruir condicionalmente embeddings de imágenes, mejorando la precisión de búsqueda.
CIReVL modifica las descripciones de texto para que coincidan mejor con la imagen objetivo y regenera nuevos embeddings visuales, proporcionando resultados de búsqueda más precisos al alinear las modificaciones textuales con la imagen de referencia.
MagicLens utiliza modelos Transformer para procesar texto e imágenes en paralelo, generando un embedding unificado que captura ambas modalidades y mejora el rendimiento de recuperación.
¡Explora nuestra demo de búsqueda multimodal!
Hemos desarrollado una demo online para búsqueda multimodal impulsada por la base de datos vectorial Milvus. En esta demo, puedes subir una imagen e introducir instrucciones de texto, que son procesadas por un modelo de recuperación de imágenes compuesta para encontrar imágenes coincidentes basándose tanto en la entrada visual como textual.
En el centro de esta demo se encuentra el modelo de embeddings MagicLens, que funciona junto con un sistema de reordenación basado en GPT-4o para refinar los resultados de búsqueda según la intención del usuario. Esta combinación destaca cómo los modelos multimodales pueden transformar los sistemas de recuperación modernos, ofreciendo experiencias de búsqueda más precisas e intuitivas.
¡Te invitamos a explorar y experimentar de primera mano el futuro de la búsqueda multimodal!
Searching results from the multimodal search model.png
Figura: Resultados de búsqueda del modelo de búsqueda multimodal
Prueba la demo: Búsqueda de imágenes multimodal
Consulta el código fuente: RAG multimodal con Milvus | Documentación de Milvus
Recursos adicionales
Página de GitHub de MagicLens: https://open-vision-language.github.io/MagicLens/
Página de GitHub de CIReVL: https://github.com/ExplainableML/Vision_by_Language
Página de GitHub de CompoDiff: https://github.com/navervision/CompoDiff
Demo de Milvus: https://milvus.io/milvus-demos
Sigue leyendo

Vector Databases vs. Graph Databases
Use a vector database for AI-powered similarity search; use a graph database for complex relationship-based queries and network analysis.

Proactive Monitoring for Vector Database: Zilliz Cloud Integrates with Datadog
we're excited to announce Zilliz Cloud's integration with Datadog, enabling comprehensive monitoring and observability for your vectorDB deployments.

DeepRAG: Thinking to Retrieval Step by Step for Large Language Models
Discover DeepRAG, an advanced retrieval-augmented generation (RAG) model that improves LLM accuracy by retrieving only essential data through step-by-step reasoning.



