DeepSeek-VL2: Modelos de lenguaje y visión de mezcla de expertos para una comprensión multimodal avanzada
El monopolio de la IA está cambiando. DeepSeek-VL2 ofrece inteligencia visión-lenguaje al nivel de GPT-4o a una fracción del costo, lo que demuestra que los modelos abiertos no solo se están poniendo al día. Están liderando el camino. ¿Podría esto marcar el fin de la IA cerrada y costosa?
Los modelos grandes de visión-lenguaje (VLMs) han surgido como una fuerza transformadora en la Inteligencia Artificial. Extienden las notables capacidades de los modelos grandes de lenguaje (LLMs) para procesar información visual y textual de forma fluida. Abordan tareas como responder preguntas visuales y el análisis de documentos. Sin embargo, los VLMs enfrentan el desafío de los altos costos computacionales. También tienen dificultades con imágenes de alta resolución y relaciones de aspecto variadas, en gran medida debido al escalado computacional cuadrático típicamente asociado con el aumento de las resoluciones de imagen.
DeepSeek-VL2, una serie avanzada de grandes modelos de visión-lenguaje Mixture-of-Experts (MoE), aborda estos problemas. Introduce una estrategia dinámica de codificación visual de alta resolución y una arquitectura optimizada de modelo de lenguaje que mejora la comprensión visual y aumenta significativamente la eficiencia de entrenamiento e inferencia. Otro avance clave es el flujo refinado de construcción de datos de visión-lenguaje que impulsa el rendimiento general y amplía la capacidad del modelo en nuevas áreas, como el anclaje visual preciso.
DeepSeek-VL2 demuestra capacidades superiores en diversas tareas, incluidas, entre otras, respuesta a preguntas visuales, reconocimiento óptico de caracteres, comprensión de documentos/tablas/gráficos y anclaje visual. Evaluado en benchmarks multimodales de uso común,
DeepSeek-VL2 logra un rendimiento similar o mejor que el modelo de vanguardia, con menos parámetros activados. En particular, en OCRBench, obtiene 834, superando a GPT-4o 736. También alcanza 93.3% en DocVQA para tareas de respuesta a preguntas visuales. La evaluación cualitativa destaca su capacidad para razonar a través de múltiples imágenes y generar narrativas visuales coherentes.
Rendimiento promedio vs. parámetros activados entre diferentes modelos de código abierto | Fuente
Este blog analiza los avances técnicos de DeepSeek-VL2 en visión y lenguaje. Analizamos en detalle sus resultados de benchmark y mejoras de eficiencia, y repasamos su papel en la democratización de la IA multimodal de alto rendimiento.
DeepSeek-VL2: Arquitectura central del modelo
En el núcleo de DeepSeek-VL2 hay una arquitectura bien estructurada creada para mejorar la comprensión multimodal. Al combinar un marco Mixture-of-Experts (MoE) con un pipeline avanzado de procesamiento de visión-lenguaje (VL), DeepSeek-VL2 integra eficientemente información visual y textual.
Vista general de la arquitectura de DeepSeek-VL2 | Fuente
A continuación se explica los módulos principales de DeepSeek-VL2:
Codificador de visión
El codificador de visión está diseñado para extraer eficientemente características visuales de alta resolución. El codificador de visión en DeepSeek-VL2 utiliza una estrategia de mosaico dinámico diseñada para el procesamiento de imágenes de alta resolución. El enfoque consiste en dividir una alta resolución en mosaicos para permitir el procesamiento eficiente de diferentes imágenes de alta resolución con relaciones de aspecto variables.
DeepSeek-VL2 utiliza el codificador de visión SigLIP-SO400M-384. El codificador de visión opera a una resolución base de 384x384. Para acomodar imágenes de alta resolución con diversas relaciones de aspecto, la imagen primero se redimensiona y se divide en mosaicos de 384x384 píxeles. Definimos un conjunto de resoluciones candidatas CR:
CR = {(m .384, n .384) | mN, n N, 1m,n,mn9}
donde m:n representa la relación de aspecto.
El padding necesario para redimensionar cada imagen de entrada a cada candidato se calcula, y se selecciona el candidato con el padding mínimo. Minimizar el padding reduce la sobrecarga computacional y garantiza que se retenga más contenido de la imagen, mejorando la eficiencia del procesamiento. La imagen redimensionada se divide en mini mosaicos locales de 384 × 384 y un mosaico de miniatura global. El codificador de visión SigLIP-SO400M-384 procesa todos los mosaicos ( 1+mini ), produciendo 729 embeddings visuales de 1152 dimensiones por mosaico.
Adaptador Visión-Lenguaje (VL)
Después de la extracción de características visuales, el adaptador visión-lenguaje reestructura y comprime los tokens para cerrar la brecha entre las representaciones visuales y textuales. Este paso permite una integración fluida de datos visuales y textuales mediante la introducción de tokens especiales para codificar relaciones espaciales.
Primero, una operación de pixel shuffle 2×2 reduce las dimensiones espaciales de los tokens de cada mosaico de 27×27 a 14×14=196 tokens. Luego, el adaptador inserta tokens especiales para codificar relaciones espaciales entre mosaicos.
Miniatura global: Para el mosaico de miniatura global, se añaden 14
<tile_newline>tokens al final de cada fila, lo que da como resultado un número total de 14 filas × 15 tokens = 210 tokens.Mosaicos locales: Para los mn mosaicos locales dispuestos en una cuadrícula (mi .14, ni .14), el sistema añade mi .14
<tile_newline>tokens para marcar el final de cada fila de todos los mosaicos locales.Separador: Se añade un token
<view_separator>entre los mosaicos globales y locales.
Esta salida estructurada garantiza que el modelo comprenda la disposición espacial de la imagen en mosaicos. La secuencia final de tokens visuales 210+1+ mi⋅14 × (ni⋅14 +1) se proyecta en el espacio de embeddings del LLM mediante un MLP de dos capas.
Ilustración de la estrategia de mosaico dinámico en DeepSeek-VL2 | Fuente
Modelo de lenguaje grande DeepSeekMoE
La columna vertebral lingüística de DeepSeek-VL2 se basa en un modelo Mixture-of-Experts (MoE) aumentado con Multi-head Latent Attention (MLA). MLA aumenta la eficiencia de inferencia al comprimir la caché Key-Value en un vector latente, reduciendo la sobrecarga de memoria y aumentando la capacidad de rendimiento. Esto permite a DeepSeek-VL2 manejar secuencias de contexto largo de manera más efectiva mientras mantiene la eficiencia computacional.
La arquitectura MoE permite una inferencia eficiente mediante computación dispersa, donde solo se seleccionan los seis expertos principales durante la inferencia. Esto reduce significativamente los costos computacionales mientras preserva el rendimiento. Durante el entrenamiento, se introduce un término de sesgo global para cada experto con el fin de mejorar el equilibrio de carga y optimizar la eficiencia del aprendizaje.
DeepSeek-VL2 viene en tres variantes de modelo, cada una con un número diferente de parámetros activados y expertos:
DeepSeek-VL2-Tiny: 1.0B parámetros, 64 expertos
DeepSeek-VL2-Small: 2.8B parámetros, 64 expertos
DeepSeek-VL2: 4.5B parámetros, 72 expertos
Metodología de entrenamiento
DeepSeek-VL2 utiliza una canalización de entrenamiento de tres etapas que equilibra la comprensión multimodal con la eficiencia computacional. El proceso general se divide en tres fases:
Alineación Visión-Lenguaje
Preentrenamiento Visión-Lenguaje
Ajuste fino supervisado
Fases de alto nivel en la canalización de entrenamiento
Antes de analizar la canalización de entrenamiento, aprenderemos sobre la construcción de datos y los conjuntos de datos utilizados en las diferentes fases de entrenamiento.
Construcción de datos
Se creó un conjunto de datos Visión-Lenguaje integral a partir de diversas fuentes para DeepSeek-VL2. En esta sección, describiremos los datos utilizados en diferentes etapas de la canalización de entrenamiento.
Datos de alineación Visión-Lenguaje
En la etapa de Alineación VL, el enfoque está en conectar las características visuales con los embeddings textuales. El conjunto de datos ShareGPT4V se utiliza para esta fase inicial. Este conjunto de datos comprende aproximadamente 1,2 millones de muestras de subtítulos y conversaciones.
Datos de preentrenamiento visión-lenguaje
Los datos de preentrenamiento combinan datos de visión-lenguaje (VL) y datos solo de texto para equilibrar las capacidades VL y el rendimiento solo de texto. En esta etapa, alrededor del 70% de los datos proviene de fuentes de visión-lenguaje, y el 30% restante son datos solo de texto provenientes del corpus de preentrenamiento del LLM.
Las categorías de datos VL utilizadas se describen aquí:
Datos intercalados de imagen-texto: Conjuntos de datos de código abierto como WIT, WikiHow y muestras de OBELICS proporcionan pares variados de imagen-texto para conocimiento general del mundo real.
Datos de subtitulado de imágenes: Los experimentos iniciales con conjuntos de datos de código abierto mostraron una calidad inconsistente (p. ej., texto no coincidente, alucinaciones). Se utilizó una canalización integral de subtitulado de imágenes que considera pistas de OCR, metadatos y subtítulos originales como prompts para volver a subtitular las imágenes con un modelo interno. Estos datos recapturados y curados se utilizaron en el entrenamiento.
Datos de reconocimiento óptico de caracteres (OCR): Conjuntos de datos públicos como LaTeX OCR y 12M RenderedText se combinaron con amplios datos internos de OCR que cubren diversos tipos de documentos.
Datos de respuesta a preguntas visuales (QA): Los datos de QA visual consisten en cuatro categorías: VQA general (de DeepSeek-VL), comprensión de documentos (PubTabNet, FinTabNet, Docmatix), generación web-a-código/gráfico-a-Python (Websight y cuadernos Jupyter, refinados con DeepSeek V2.5), y QA con prompts visuales (superponiendo indicadores como flechas/cuadros en imágenes para crear pares de QA enfocados).
- Datos de anclaje visual: Se construyó un conjunto de datos para el anclaje visual. Para las anotaciones de detección de objetos de cada imagen, los datos se estructuraron de la siguiente manera usando tokens especiales <|ref|>, <|/ref|>, <|det|>, <|/det|>:
Prompt: Localiza <|ref|>
<|/ref|> en la imagen dada. Respuesta: <|ref|>
<|/ref|><|det|>[[x1, y1, x2, y2],...]<|/det|>
- Datos de conversación anclada: Conjunto de datos conversacional donde los prompts y las respuestas incluyen tokens especiales de anclaje para asociar el diálogo con regiones específicas de la imagen.
Datos de ajuste fino supervisado
La etapa de ajuste fino supervisado refina el seguimiento de instrucciones y el rendimiento conversacional del modelo. Los aspectos cubiertos incluyen:
Respuesta general a preguntas visuales: Los conjuntos de datos públicos de QA visual a menudo sufren de respuestas cortas, OCR deficiente y alucinaciones. Se generó un nuevo conjunto de datos regenerando respuestas usando preguntas originales, imágenes y datos de OCR.
OCR y comprensión de documentos: Se utilizaron conjuntos de datos OCR existentes depurados eliminando muestras con mala calidad de OCR.
Comprensión de tablas y gráficos: Se mejoraron los datos de QA basados en tablas regenerando respuestas basadas en preguntas originales para crear datos de alta calidad.
Razonamiento, lógica y matemáticas: Para mejorar la claridad, los conjuntos de datos públicos de razonamiento se enriquecen con procesos detallados y formatos de respuesta estandarizados.
Preguntas de libros de texto y académicas: Colecciones internas de libros de texto de nivel universitario centradas en contenido académico de múltiples disciplinas.
Generación web-a-código y gráfico-a-Python: Los conjuntos de datos internos se ampliaron con conjuntos de datos de código abierto tras la generación de respuestas para mejorar la calidad.
Anclaje visual: Los datos con anotaciones de detección de objetos guían al modelo para localizar y describir objetos con precisión.
Conversación anclada: Los conjuntos de datos conversacionales incorporan tokens de anclaje para vincular el diálogo con regiones de la imagen y mejorar la interacción.
Conjuntos de datos solo de texto: También se utilizan conjuntos de datos de ajuste de instrucciones solo de texto para mantener las capacidades lingüísticas del modelo.
Canalizaciones de entrenamiento
Antes de comenzar el entrenamiento, el proceso se divide en etapas definidas. Esta estructura garantiza transiciones fluidas entre la alineación, el preentrenamiento y el ajuste fino. Inicialmente, se entrenan el codificador de visión y el MLP adaptador de visión-lenguaje mientras el modelo de lenguaje permanece fijo. Más adelante, todos los parámetros del modelo se descongelan para un preentrenamiento extensivo y, finalmente, el modelo se ajusta finamente utilizando datos supervisados. La pérdida se calcula únicamente sobre los tokens de texto en cada etapa para priorizar el aprendizaje del contexto visual.
- Alineación Visión-Lenguaje: La fase de Alineación VL conecta las características visuales con las incrustaciones textuales. El entrenamiento utiliza el conjunto de datos ShareGPT4V, que consta de aproximadamente 1,2 millones de pares imagen-texto. Durante esta fase, el modelo de lenguaje permanece congelado. Solo se entrenan el codificador de visión y el adaptador, utilizando un conector MLP ligero para fusionar características visuales y de texto. Esta fase ajusta codificadores de resolución fija para manejar entradas dinámicas de alta resolución.
- Preentrenamiento Visión-Lenguaje: En la fase de Preentrenamiento VL, todos los parámetros se descongelan para la optimización. La mezcla de datos comprende un 70% de datos de visión-lenguaje y un 30% de datos solo de texto. Los datos VL incluyen pares imagen-texto intercalados que cubren tareas como OCR y análisis de documentos. Los datos solo de texto provienen del corpus de preentrenamiento del LLM. El entrenamiento utiliza alrededor de 800 mil millones de tokens imagen-texto para construir representaciones conjuntas de entradas visuales y textuales.
- Ajuste Fino Supervisado: Durante el Ajuste Fino Supervisado, se refinan las capacidades conversacionales y de seguimiento de instrucciones del modelo. Esta fase utiliza pares pregunta-respuesta curados de conjuntos de datos públicos y datos internos. Los datos de diálogo multimodal se combinan con diálogos solo de texto de DeepSeek-V2, y los prompts de sistema/usuario se enmascaran para que la supervisión se aplique únicamente a las respuestas y los tokens especiales.
Hiperparámetros e Infraestructura
La configuración de hiperparámetros para DeepSeek-VL2 se detalla en la tabla proporcionada. Durante el entrenamiento, las diferentes etapas utilizan configuraciones adaptadas. Por ejemplo, en la Etapa 1 para DeepSeek-VL2-Tiny, la tasa de aprendizaje se establece en 5,4×10⁻⁴, mientras que en la Etapa 3 disminuye a 3,0×10⁻⁵. El Programador Step LR divide la tasa de aprendizaje por √10 al 50% y al 75% del total de pasos de entrenamiento. Se aplica un multiplicador fijo de 0,1 a la tasa de aprendizaje del codificador de visión. En las primeras etapas se utilizan programadores de tasa de aprendizaje coseno, con un programa constante en la etapa final. Los ajustes adicionales incluyen una decaída de peso de 0,1, recorte de gradiente en 1,0 y el optimizador AdamW configurado con β₁ = 0,9 y β₂ = 0,95.
Hiperparámetros para entrenar DeepSeek-VL2 | Fuente
El entrenamiento se lleva a cabo en la plataforma HAI-LLM, un sistema ligero diseñado para modelos grandes. La canalización emplea una división de capas de grano fino para el codificador de visión con el fin de garantizar el equilibrio de carga entre GPUs, lo que ayuda a prevenir burbujas en la canalización. También se realiza equilibrio de carga de mosaicos de imagen entre rangos de paralelismo de datos para manejar la variabilidad introducida por la estrategia de resolución dinámica.
Además, se incorporan técnicas de paralelismo tensorial y paralelismo de expertos para maximizar la eficiencia. Combinadas con un ajuste meticuloso de hiperparámetros, estas elecciones de infraestructura permiten a DeepSeek-VL2 procesar eficientemente miles de millones de tokens de entrenamiento mientras mantiene un rendimiento multimodal robusto.
DeepSeek-VL2 fue entrenado en 7/10/14 días utilizando un clúster de 16/33/42 nodos, cada uno equipado con 8 GPUs NVIDIA A100.
Evaluación
Ahora examinamos el rendimiento de DeepSeek-VL2 utilizando benchmarks estándar y pruebas cualitativas. Las siguientes secciones describen los resultados de evaluación y comparan DeepSeek-VL2 con los modelos de vanguardia.
Benchmarks
DeepSeek-VL2 se evalúa en una variedad de benchmarks de uso común. Estos incluyen DocVQA, ChartQA, InfoVQA, TextVQA, RealWorldQA, OCRBench, AI2D, MMMU, MMStar, MathVista, MME, MMBench (y MMBench-V1.1), y MMT-Bench. Además, la capacidad de grounding del modelo se prueba en los benchmarks RefCOCO, RefCOCO+ y RefCOCOg. Estas pruebas abarcan tareas que van desde la comprensión de documentos y la interpretación de gráficos hasta la resolución de problemas del mundo real, proporcionando una medida integral del rendimiento del modelo.
Comparación con el estado del arte
DeepSeek-VL2 se comparó con varios modelos de visión-lenguaje de última generación, como LLaVA-OV, InternVL2, DeepSeek-VL, Qwen2-VL, Phi-3.5-Vision, Molmo, Pixtral, MM1.5 y Aria-MoE, en los benchmarks de comprensión multimodal. En tareas de grounding, el modelo DeepSeek-VL2 supera a otros como Grounding DINO, UNINEXT, ONE-PEACE, mPLUG-2, Florence-2, InternVL2, Shikra, TextHawk2, Ferret-v2 y MM1.5.
Comparación con modelos de última generación en benchmarks multimodales de QA general y relacionados con matemáticas | Fuente
DeepSeek-VL2 logra un rendimiento similar o mejor con menos parámetros activados. Demuestra un rendimiento competitivo en diversos benchmarks multimodales, igualando o superando a modelos más grandes como Qwen2-VL-7B (8.3B) e InternVL2-8B (8.0B) en tareas como MMBench (83.1 vs. 85.0) y MME (2,253 vs. 2,327).
A pesar de su menor cantidad de parámetros activados, se acerca al rendimiento de GPT-4o en MMStar (61.3 vs. 63.9) y supera a la mayoría de los modelos de código abierto en tareas con alta carga de OCR como AIDD (81.4). La eficiencia del modelo, habilitada por su arquitectura MoE, equilibra eficazmente la capacidad y el costo computacional.
Comparación con modelos de última generación en benchmarks multimodales relacionados con OCR | Fuente
DeepSeek-VL2 logra un rendimiento competitivo en tareas de OCR, igualando o superando a modelos más grandes como Qwen2-VL-7B en TextVQA (84.2 vs. 84.3) y superando a GPT-4o en DocVQA (93.3 vs. 92.8). Sus puntuaciones en ChartQA (86.0) e InfoVQA (78.1) superan a la mayoría de sus pares de código abierto, mientras que su eficiencia reduce la brecha con modelos cerrados como Claude 3.5 Sonnet (OCRBench: 811 vs. 788). Esto demuestra capacidades de OCR robustas a pesar de su arquitectura compacta.
Estudio cualitativo
El estudio cualitativo demuestra las capacidades de DeepSeek-VL2 en varias tareas. Las áreas clave incluyen:
- Respuesta visual a preguntas generales: El modelo proporciona respuestas detalladas, describe con precisión contenido de imágenes densas y reconoce puntos de referencia tanto en inglés como en chino. Tiene capacidades multifacéticas, incluyendo el reconocimiento de puntos de referencia, la composición de poesía basada en imágenes, la respuesta a preguntas sobre conocimiento general, la comprensión de gráficos, el reconocimiento de texto y más.
La capacidad de respuesta a preguntas generales de DeepSeek-VL2 | Fuente
- Conversación con múltiples imágenes: Analiza eficazmente las asociaciones y diferencias entre múltiples imágenes, al tiempo que permite un razonamiento simple mediante la integración del contenido de varias imágenes. Por ejemplo, puede considerar cómo preparar un plato basándose en imágenes de ciertos ingredientes.
Capacidad de conversación con múltiples imágenes de DeepSeek-VL2 | Fuente
- Narración visual: DeepSeek-VL2 puede generar narrativas creativas basadas en una serie de imágenes mientras mantiene el contexto y la coherencia. Su narración refleja una comprensión de la progresión temporal y las transiciones de escena, añadiendo profundidad a las narrativas generadas.
Capacidad de narración visual de DeepSeek-VL2 | Fuente
- Anclaje visual: El modelo identifica y localiza correctamente objetos en imágenes, generalizándolos desde escenas naturales hasta escenarios variados como memes y anime. Demuestra un rendimiento robusto incluso cuando los objetos están parcialmente ocultos o se presentan en condiciones difíciles.
Capacidad de anclaje visual de DeepSeek-VL2 | Fuente
- Conversación anclada: Con el uso de tokens especiales de anclaje <|grounding|>, el modelo se refiere a objetos clave con detalles de ubicación precisos, lo que mejora sus capacidades interactivas. Sus respuestas ancladas facilitan aplicaciones prácticas en sistemas interactivos del mundo real.
Conversación anclada con DeepSeek-VL2 | Fuente
Hallazgos clave
- Eficiencia y escalabilidad: DeepSeek-VL2 logra resultados competitivos con menos parámetros activados gracias a su diseño MoE eficiente y su enfoque de mosaico dinámico. Este equilibrio entre rendimiento y uso de recursos permite su implementación en entornos con capacidad computacional limitada.
- Comprensión multimodal robusta: El modelo destaca en tareas que abarcan OCR, análisis de documentos y anclaje visual. Su capacidad para integrar información visual y textual da como resultado una alta precisión en diversas aplicaciones.
- Seguimiento de instrucciones y habilidades conversacionales mejorados: El modelo muestra mejoras notables en la generación de respuestas coherentes y conscientes del contexto mediante ajuste fino supervisado. Este perfeccionamiento refuerza su rendimiento en entornos interactivos y conversacionales.
- Aplicabilidad en el mundo real: El sólido rendimiento observado tanto en evaluaciones cuantitativas como en estudios cualitativos indica que DeepSeek-VL2 es muy adecuado para aplicaciones prácticas, como el procesamiento automatizado de documentos, asistentes virtuales y sistemas interactivos en IA incorporada.
Posibles direcciones futuras de investigación
DeepSeek-VL2 es una versión mejorada de modelos de visión-lenguaje basados en MoE disponible en tres tamaños: 3B, 16B y 27B de parámetros totales, con 1.0B, 2.8B y 4.5B activados. Este diseño inteligente hace que tanto el entrenamiento como la inferencia sean más eficientes. Permite que el modelo más pequeño se ejecute en una sola GPU con solo 10 GB de memoria, mientras que las variantes más grandes requieren 40 GB y 80 GB.
Una de las características más destacadas es su estrategia de mosaico dinámico, que procesa hábilmente imágenes de alta resolución en diversas relaciones de aspecto. Al publicar el código y los modelos preentrenados, DeepSeek-VL2 inspirará más investigación y aplicaciones innovadoras en la emocionante intersección entre visión y lenguaje.
Hay varias áreas en las que DeepSeek-VL2 podría mejorarse.
- Ventana de contexto: Actualmente, el modelo admite solo unas pocas imágenes por sesión de chat. Las actualizaciones futuras podrían ampliar la ventana de contexto para permitir interacciones más ricas con múltiples imágenes.
- Robustez ante la calidad de imagen: El modelo a veces enfrenta desafíos con imágenes borrosas u objetos no vistos. Abordar estos problemas podría mejorar su fiabilidad en diversos escenarios.
- Capacidades de razonamiento: Si bien el modelo tiene un buen desempeño en percepción y reconocimiento visual, sus capacidades de razonamiento pueden mejorarse. Fortalecer este aspecto puede ampliar su potencial de aplicación en el mundo real.
Recursos adicionales
- Artículo de investigación: DeepSeek-VL2: Mixture-of-Experts Vision-Language Models
Sigue leyendo

Zilliz Cloud Now Available in AWS Asia Pacific (Seoul)
Zilliz Cloud is now available in AWS Seoul — low-latency vector search, in-country data residency, and one-step migration for Korean AI teams. 31 regions across 5 clouds.

Build for the Boom: Why AI Agent Startups Should Build Scalable Infrastructure Early
Explore strategies for developing AI agents that can handle rapid growth. Don't let inadequate systems undermine your success during critical breakthrough moments.

Demystifying the Milvus Sizing Tool
Explore how to use the Sizing Tool to select the optimal configuration for your Milvus deployment.



