Uso de la búsqueda vectorial para comprender mejor los datos de visión por computadora
¿Qué tan malos pueden ser los datos malos para tu IA? Compruébalo tú mismo:
Problemas de calidad de datos
Los datos malos pueden sabotear tu aplicación y tus flujos de trabajo impulsados por IA, con un impacto serio que va más allá de un usuario frustrado, pero esto no es ninguna sorpresa.
Muchos de nosotros hemos imaginado aprovechar la comodidad y versatilidad de los large language models (LLMs) multimodales para acceder a la rica información presente en imágenes y videos. Hacer maravillas, llevarlo al siguiente nivel, como dice el cliché. La visión por computadora ofrece ese tipo de oportunidad ilimitada para servicios nuevos y más satisfactorios. Pero hay desafíos en el camino.
Uno crítico es cómo seleccionar mejores datos para el modelo adecuado con el fin de obtener mejores resultados. Hay mucho ajuste fino, ensayo y error por fuerza bruta en la oscuridad debido a la complejidad de los modelos y la alta dimensionalidad de los datos, lo que desvía recursos de la innovación.
¿Qué pasaría si pudiéramos aportar transparencia y claridad a los flujos de trabajo de IA visual, haciéndolos rápidos e incluso divertidos? ¡Voxel51 lo asumió como una misión y lo logró!
Como lo demostró Jacob Marks, ingeniero de aprendizaje automático y evangelista de desarrolladores en Voxel51 en SF Unstructured Data Meetup.
Hacer realidad la IA visual
La explosión de nuevas aplicaciones y servicios impulsados por IA generativa y aprendizaje automático ha revelado la importancia de aprovechar los datos no estructurados y el papel de las bases de datos vectoriales como un punto de inflexión. Jacob Marks mostró en su presentación cómo la integración de bases de datos vectoriales con herramientas como Voxel51 y su proyecto de código abierto FiftyOne, está revolucionando la exploración, visualización y curación de datos visuales para crear aplicaciones impulsadas por IA de manera más eficiente y confiable. Te permite probar y evaluar modelos alimentándolos con los conjuntos de datos exactos que necesitan para garantizar resultados sólidos y precisos.
Todo comienza con la calidad de los datos
¿Por qué? Porque mejores datos conducen a mejores modelos, acelerando el camino hacia el éxito.
“Nada obstaculiza más el éxito de los sistemas de aprendizaje automático que los datos de mala calidad", dice Jacob. Preparar datos y encontrar el modelo adecuado puede llevar mucho tiempo y ser ineficiente sin las herramientas adecuadas. Incluso los ingenieros de ML capacitados necesitan buenas herramientas para crear conjuntos de datos y modelos de alta calidad.
FiftyOne simplifica el manejo de datos visuales, lo que facilita y acelera la comprensión de operaciones, ajustes y resultados.
Puedes visualizar etiquetas complejas, evaluar modelos, explorar escenarios de interés, identificar modos de fallo y encontrar errores de anotación, entre otras tareas. Esto se logra mediante cadenas de LLM que se ejecutan en segundo plano, generan embeddings y consultan una base de datos vectorial.
Ahora, ¡vayamos al grano!
De RAG a la riqueza: el poder de la búsqueda vectorial
RAG es una de las razones que hizo populares a las bases de datos vectoriales.
La Retrieval-Augmented Generation (RAG) ha popularizado la búsqueda vectorial al mejorar la precisión de los modelos de lenguaje grandes. Combina modelos basados en recuperación y generativos para mejorar la calidad y relevancia del texto generado.
Esta técnica utiliza LLM para convertir el prompt del usuario en embeddings y compararlos con los embeddings vectoriales, lo que permite la búsqueda de similitud semántica para obtener respuestas más precisas y ricas en contexto.
RAG
Puedes comparar múltiples vectores por similitud con las entradas de datos. Así que, si tomas dos entradas de texto, las vectorizas y las conviertes en embeddings, puedes observar su cercanía, independientemente de las métricas utilizadas: distancia euclidiana, similitud coseno o el producto punto.
Similitud vectorial
También puedes tener embeddings multimodales para manejar diferentes tipos de datos juntos, como textos, imágenes y videos en el tipo de espacio.
Embeddings vectoriales
Búsqueda vectorial para visión por computadora
Voxel51 integró Milvus usando Zilliz Cloud para liberar capacidades de búsqueda vectorial en conjuntos de datos visuales. Estos son algunos casos de uso potentes:
Similitud de imágenes: La búsqueda por similitud es un caso de uso común y se vuelve aún más fácil con Voxel51.
Solo necesitas seleccionar la imagen que te interesa de tu conjunto de datos y usarla para buscar otras similares. Todos los pasos de embedding y consulta se realizan en segundo plano. Manteniendo la experiencia visual muy intuitiva y clicable. Por ejemplo, puedes definir los atributos como la métrica y el valor k seleccionándolos en la GUI.
Búsqueda por similitud de imágenes
Con la misma facilidad, también puedes hacer una búsqueda inversa usando una imagen externa.
Digamos que quieres encontrar si tienes un perro cane corso en tu conjunto de datos visual. Solo necesitas proporcionar el URI de la imagen; se vectorizará automáticamente y se consultará por similitud contra el conjunto de datos visual en el espacio vectorial.
Búsqueda inversa de imágenes
Búsqueda de objetos: Más allá de las imágenes completas, las bases de datos vectoriales pueden manejar parches de detección de objetos, lo que permite búsquedas más precisas dentro de subimágenes. Esto es útil para tareas como el reconocimiento facial o la identificación de objetos dentro de grandes conjuntos de datos.
Búsqueda por similitud de objetos
Como el foco de búsqueda del objeto muy probablemente no sea la imagen completa, calcular embeddings para toda la imagen podría ser menos efectivo porque no siempre será similar a los embeddings del objeto.
Búsqueda OCR: Otro caso de uso es el documento interactivo de Reconocimiento Óptico de Caracteres (OCR). Puedes interactuar visualmente con los embeddings de texto. Puedes ver de dónde provienen estos resultados en cada una de las páginas de tus documentos.
Búsqueda robusta de documentos OCR
Recuperación multimodal: Herramientas como CLIP de OpenAI e ImageBind de Meta permiten la combinación de embeddings de texto e imagen. Esto habilita la recuperación multimodal, donde los usuarios pueden buscar imágenes usando embeddings de descripciones de texto, embeddings de audio, etc., o viceversa. En su ejemplo, se incrustó un clip de audio de un tren y luego se comparó con todas las imágenes para encontrar trenes en el conjunto de datos.
Recuperación multimodal
Similitud perceptual: La similitud perceptual nos permite entender cómo diferentes modelos perciben el mundo comparando representaciones de modelos en el espacio vectorial. Algunos modelos son muy semánticos, capturan detalles y conceptos de alto nivel, pero no la paleta de la imagen a nivel de píxel, como en la imagen de abajo:
Explorando la similitud perceptual
La visión por computadora más tradicional implementada con redes neuronales computacionales obtiene todos los píxeles y parches, pero no captará correctamente nada del significado, como puedes ver en la imagen de abajo.
Explorando la similitud perceptual-2
Puedes comparar representaciones de modelos en el espacio vectorial viendo la distribución de resultados en el espacio vectorial. Algunos modelos tienen los resultados agrupados, mientras que otros podrían no tenerlos. Ven el mundo de manera diferente y entender cuándo aplicar estas diferentes perspectivas es fundamental para la calidad de tu IA.
Viene más innovación en la búsqueda vectorial visual
Interpolación de conceptos: La interpolación de conceptos toma dos conceptos de texto e interpola hallazgos entre ellos. En el ejemplo, se dieron los embeddings iniciales para un husky y un chihuahua para buscar cualquier cosa que pudiera encajar entre ellos, ¡incluido un gato!
interpolación de conceptos
Recorrido del espacio conceptual: Con el recorrido del espacio conceptual, los usuarios pueden combinar y manipular embeddings para regular atributos en el espacio de posibles embeddings, como en el ejemplo, donde los atributos de salubridad y colorido se regulan en la búsqueda.
Recorrido del espacio conceptual
Mucho está ocurriendo en segundo plano para hacer que la búsqueda combine embeddings para texto, imágenes y otras modalidades con los atributos correctos en el nivel deseado para proporcionar una exploración más dinámica del espacio de búsqueda, y todo lo que te queda por hacer es hacer clic o deslizar hasta tu selección. ¡Así de fácil!
Conclusión
Las bases de datos vectoriales son indispensables en la visión por computadora, ya que ofrecen un motor potente a las herramientas de conjuntos de datos visuales para la exploración de datos, la evaluación de modelos y la búsqueda innovadora mediante embeddings multimodales, interpolación de conceptos y recorrido. A medida que la IA continúa evolucionando, la integración de bases de datos vectoriales desempeñará un papel crucial en la configuración del futuro de las tecnologías impulsadas por datos no estructurados.
El cielo es el límite, como dice Jacob. Ponte manos a la obra y diviértete con la IA visual impulsada por una base de datos vectorial con este práctico tutorial.
Si deseas obtener más información o comenzar tu proyecto de visión por computadora , por ejemplo, te invitamos a unirte a nuestro canal de Discord. Ofrecemos una gran cantidad de recursos y una comunidad de apoyo para ayudarte a comenzar.
Sigue leyendo

How to Choose the Best Embedding Model for RAG in 2026: 10 Models Benchmarked
We benchmarked 10 embedding models on cross-modal, cross-lingual, long-document, and dimension compression tasks. See which one fits your RAG pipeline.

AI Agents Are Quietly Transforming E-Commerce — Here’s How
Discover how AI agents transform e-commerce with autonomous decision-making, enhanced product discovery, and vector search capabilities for today's retailers.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.



