Búsqueda avanzada de video: aprovechando Twelve Labs y Milvus para la recuperación semántica
En agosto de 2024, en el Unstructured Data Meetup en San Francisco, James Le, Head of Developer Experience en Twelve Labs, ofreció una charla reveladora sobre búsqueda avanzada de video para recuperación semántica. Si aún no has oído hablar de Twelve Labs, te espera algo especial. Twelve Labs desarrolla modelos multimodales de vanguardia que ayudan a las máquinas a comprender videos de manera tan intuitiva como lo hacen los humanos. Han creado modelos fundacionales de última generación para generar embeddings de video junto con APIs que pueden buscar, generar y clasificar contenido de video con una precisión similar a la humana.
En la charla, James explica los conceptos clave de la comprensión de video y el flujo de trabajo general de su modelo fundacional y APIs. James también habla sobre la integración de modelos de comprensión de video con bases de datos vectoriales eficientes como Milvus de Zilliz para crear aplicaciones interesantes para la recuperación semántica. Si te intriga cómo la IA puede revolucionar el contenido de video, este meetup fue memorable.
Con eso, profundicemos en la charla de James sobre ‘Búsqueda avanzada de video: cómo aprovechar Twelve Labs y Milvus para la recuperación semántica’: Mira la charla en YouTube.
James Le hablando en el August South Bay Unstructured Data Meetup
¿Qué es la comprensión de video?
Los videos son una poderosa fuente de información sobre el mundo real. A diferencia de las imágenes, que capturan solo escenas estáticas, los videos capturan información temporal como acciones, comportamientos o eventos cambiantes. Al igual que los humanos, se puede enseñar a las máquinas a analizar, interpretar y extraer información significativa de los videos usando técnicas de visión por computadora y aprendizaje profundo.
Evolución de la comprensión de video
Los videos se inventaron por primera vez a finales del siglo XIX, y en ese momento no había tecnología para su interpretación. Más tarde, en 1996, se comercializó la primera tecnología de voz a texto, que creó transcripciones. Sin embargo, esas transcripciones eran terribles de leer y estaban desconectadas de la información visual. Además, en 1997, se lanzó el primer modelo de reconocimiento de imágenes basado en CNN: LeNet - 5, que creó etiquetas para comprender objetos en los fotogramas de video como ‘persona,’ ‘perro,’ ‘ropa,’ y así sucesivamente. Estas etiquetas no ayudaban a comprender el contexto del video y generaban discrepancias. Más tarde, a partir de 2012, la comprensión de video se revolucionó con las redes neuronales convolucionales (CNNs), que permitieron a los modelos realizar tareas avanzadas como el reconocimiento de acciones.
Pasado, presente y futuro de la comprensión de video
En el pasado, la comprensión de video consistía en resolver tareas de percepción de video de bajo nivel, como extraer características de bajo nivel como color, textura y movimiento usando características diseñadas manualmente o técnicas simples de visión por computadora como Histogram of Gradients (HOG). Algunas de las primeras tareas de percepción de video incluyeron Video Object Detection, Video Object Tracking, Video Instance Segmentation y Action Recognition.
Las tareas mencionadas anteriormente a menudo tenían un alcance limitado e implicaban ineficiencias como objetos mal etiquetados o etiquetas omitidas. En el presente, la comprensión de video ha evolucionado para manejar tareas más amplias como Video Classification, Video Retrieval, Video Question Answering y Video Captioning. Técnicas como las CNNs, las Recurrent Neural Networks (RNNs) y, más recientemente, los Transformers han permitido que los modelos procesen patrones espaciales y temporales de manera eficiente. El reconocimiento de acciones evolucionó hacia la clasificación de video, donde los modelos clasifican una secuencia completa en lugar de reconocer solo una acción individual. De manera similar, los sistemas de recuperación de video ahora pueden indexar y recuperar videos relevantes en función de consultas. Al mismo tiempo, los modelos de respuesta a preguntas pueden responder preguntas relacionadas con videos, y el subtitulado de video puede generar descripciones textuales de escenas.
Los modelos actuales están enfocados en una tarea específica, entrenados con datos específicos o basados en una sola modalidad. En el futuro, el enfoque estará en modelos fundacionales de video multimodales que ofrezcan comprensión de propósito general. Estos modelos integrarán información de múltiples fuentes - video, audio y texto para desarrollar una comprensión holística del contenido de video. La idea principal detrás de estos modelos es que atienden diversos casos de uso e industrias, abordan tareas dinámicas y proporcionan una comprensión unificada de todas las modalidades, permitiendo aplicaciones complejas que funcionan en tiempo real.
Modelos Fundacionales de Video de Twelve Labs
Los Modelos Fundacionales de video son modelos grandes, preentrenados, diseñados para comprender videos de manera integral. Al igual que los modelos de lenguaje (por ejemplo, GPT) sirven como base para diversas aplicaciones basadas en texto, los modelos fundacionales de video entrenados con enormes cantidades de datos multimodales (video, audio, texto) están equipados para generar embeddings multimodales que pueden utilizarse posteriormente para manejar una amplia variedad de tareas posteriores y crear aplicaciones centradas en video en distintas industrias.
En la charla, James Lee describe con mucha claridad el papel de los modelos fundacionales de video en la creación de aplicaciones del mundo real y cómo esto es beneficioso para los usuarios finales.
Generación de embeddings: Primero, el modelo fundacional generará embeddings multimodales para los datos de entrada. Estos embeddings son representaciones numéricas que almacenan toda la información semántica conversacional y visual de un video.
Tareas posteriores: Los embeddings generados pueden utilizarse posteriormente para crear APIs para tareas posteriores como Buscar y Clasificar, Generar e Incrustar.
Aplicaciones centradas en video: Las APIs de puerta de enlace basadas en embeddings pueden utilizarse posteriormente para generar aplicaciones centradas en video en diversas industrias como las fuerzas del orden, el aprendizaje electrónico, los deportes y la economía de creadores.
Usuarios finales: Los pasos anteriores crearán una canalización de comprensión inteligente de video que será beneficiosa para la demanda de usuarios individuales y empresas.
Habiendo comprendido la pila general, profundicemos en los matices técnicos de los modelos fundacionales de video.
¿Qué son los embeddings de video?
Los embeddings de video son esencialmente representaciones de un video en un espacio vectorial de menor dimensión en forma de vector numérico. Estos embeddings capturan las características visuales y la semántica del video, lo que permite a los modelos fundacionales comprender el contenido de los videos. Tradicionalmente, los embeddings vectoriales solo pertenecían a una única modalidad, como imagen, texto o audio, que se procesaría de forma independiente. Sin embargo, con el auge del contenido multimedia y la popularidad de la arquitectura transformer, ha habido un cambio hacia el desarrollo de embeddings que pueden capturar información visual, textual y audible en un espacio latente compartido.
La magia de los embeddings de video
Modelo Fundacional de Video de última generación - Marengo 2.6
James Lee presenta el modelo fundacional de video de última generación desarrollado en Twelve Labs llamado Marengo 2.6. Este modelo es capaz de realizar tareas de búsqueda ‘any-to-any’, lo que significa que puede consultar datos de video utilizando varios formatos de entrada como Text-To-Video, Text-To-Image, Text-To-Audio, Audio-To-Video, Image-To-Video y más. Este modelo es transformador en el dominio de la comprensión de video, ya que mejora significativamente la eficiencia de la búsqueda de video y permite interacciones robustas entre diferentes modalidades.
Como se menciona en el blog ‘Introducing Marengo 2.6’, el concepto básico de la arquitectura trata sobre ‘Expertos de modalidad con compuerta’, lo que permite el procesamiento de entradas multimodales mediante codificadores especializados antes de combinarlas en una representación multimodal integral. Hay tres módulos principales en la arquitectura
Experto visual - Procesa información visual para capturar la apariencia, el movimiento y los cambios temporales dentro del video.
Experto de audio - Procesa información auditiva para capturar señales de audio tanto verbales como no verbales relacionadas con el video.
Módulo de fusión con compuerta - Evalúa la contribución de cada experto para los videos y los fusiona en una representación multimodal unificada para la recuperación de cualquiera a cualquiera.
Además, Marengo 2.6 destaca en el ajuste fino, lo que permite a los usuarios personalizar el modelo para adaptarlo a necesidades de contenido o dominios específicos. La infraestructura del modelo admite el manejo de vastos conjuntos de datos de video, lo que lo hace adaptable para organizaciones con grandes bibliotecas de video. Este modelo puede utilizarse además para tareas posteriores, como la mejora de la búsqueda, la clasificación y la gestión de contenido con la ayuda de integraciones de API fluidas.
Tareas posteriores con las API de Twelve Labs
API de búsqueda de video
Imagina poder encontrar las escenas exactas en un video de un torneo de tenis de Grand Slam cuando Roger Federer gana un punto al rematar contra el oponente, simplemente describiendo estas imágenes en lenguaje natural. Suena demasiado bueno para ser verdad, ¿verdad? Esto se llama búsqueda de video.
Como se muestra en la figura a continuación, la búsqueda de video funciona creando primero embeddings de los videos mediante un modelo fundacional de video. A continuación, la API de búsqueda toma la entrada de una consulta en lenguaje natural, que también se convierte en embeddings. Finalmente, los embeddings de la consulta se buscan con respecto a los embeddings de video para entregar las escenas de video con tiempos.
API de búsqueda de Twelve Labs
La búsqueda de video tradicional, por otro lado, tenía limitaciones severas en su enfoque y ejecución, ya que dependía principalmente de la coincidencia de palabras clave para indexar y recuperar videos. Sin embargo, con la comprensión de video mediante IA multimodal, es posible capturar las relaciones complejas entre todas las modalidades simultáneamente y proporcionar una interpretación del video más similar a la humana.
API de clasificación de video
La comprensión de video impulsada por IA permite la categorización automática del video en clases predefinidas. Usando un enfoque zero-shot, también es posible obtener las clases sobre la marcha sin predefinirlas. Con la API Classify de Twelve Labs, puedes organizar videos en deportes, noticias, entretenimiento o documentales, analizando características semánticas, objetos, acciones y otros elementos del contenido.
API Classify de Twelve Labs
API Embed de video
API Embed de Twelve Labs
Twelve Labs también ha lanzado una API Embed en beta privada para desarrolladores. Las API Search y Classify eran de extremo a extremo, pero esta API es para alguien que quiere experimentar en la capa de embeddings, ya sea agregando sus metadatos o haciendo algunas operaciones matemáticas adicionales.
Esta API crea embeddings multimodales a nivel de video y a nivel de clip que pueden utilizarse para diversas tareas downstream personalizadas, incluyendo, entre otras, la detección de anomalías, la ordenación por diversidad, el análisis de sentimiento, las recomendaciones y la construcción de sistemas de Generación Aumentada por Recuperación (RAG).
Twelve Labs se une a Milvus
Twelve Labs se une a Milvus
En agosto de 2024, Twelve Labs y Milvus (base de datos vectorial de Zilliz) unieron fuerzas para crear potentes aplicaciones de búsqueda de video. Milvus es una base de datos vectorial escalable y eficiente para gestionar, consultar y recuperar embeddings vectoriales. Está diseñada específicamente para crear aplicaciones de IA de alto rendimiento. Al aprovechar el poder de los embeddings multimodales avanzados de Twelve Labs e integrarlos con Milvus, los desarrolladores pueden desbloquear nuevas posibilidades en el análisis de contenido de video creando aplicaciones como motores de búsqueda, sistemas de recomendación y recuperación de video basada en contenido.
Recuperación semántica usando Twelve Labs y Milvus
Para realizar la recuperación semántica, el primer paso es elegir y configurar los SDK y bibliotecas necesarios de la base de datos vectorial y la API para generar embeddings. A continuación, con la ayuda de la Embed API de Twelve Labs, se generan embeddings multimodales de los videos, ya sea a nivel de clip o a nivel de video. Para el nivel de clip, se pueden definir las longitudes de los clips en los que debe dividirse el video. Por ejemplo, si el video completo dura 18 segundos y se elige una longitud de clip de 6 segundos, entonces obtenemos 3 embeddings a nivel de clip. Luego, los embeddings se insertan en la base de datos vectorial y finalmente se puede realizar una búsqueda por similitud. Cuando un usuario envía una consulta (video o texto), también se convierte en un vector usando el mismo modelo de embeddings. Luego, el sistema compara este vector de consulta con los vectores almacenados en la base de datos para recuperar los resultados más similares semánticamente.
Recursos para desarrolladores
Implementación completa del código de Recuperación semántica aprovechando Twelve Labs y Milvus
¿Qué son las bases de datos vectoriales y cómo funcionan? - blog de Zilliz
Sigue leyendo

Introducing Functions and Model Inference on Zilliz Cloud: Automatic Embedding and Reranking with Hosted Models
Zilliz Cloud Functions auto-generate embeddings via OpenAI, Voyage AI, Cohere, or Zilliz Hosted Models. Built-in reranking — just insert text and search.

How to Build RAG with Milvus, QwQ-32B and Ollama
Hands-on tutorial on how to create a streamlined, powerful RAG pipeline that balances efficiency, accuracy, and scalability using the QwQ-32B and Milvus.

Why Deepseek is Waking up AI Giants Like OpenAI And Why You Should Care
Discover how DeepSeek R1's open-source AI model with superior reasoning capabilities and lower costs is disrupting the AI landscape and challenging tech giants like OpenAI.


