DeepSeek-VL2: Modelos de Linguagem e Visão com Mistura de Especialistas para Compreensão Multimodal Avançada
O monopólio da IA está mudando. O DeepSeek-VL2 oferece inteligência visão-linguagem no nível do GPT-4o por uma fração do custo, mostrando que os modelos abertos não estão apenas alcançando os demais. Eles estão liderando o caminho. Isso poderia marcar o fim da IA cara e fechada?
Grandes Modelos Visão-Linguagem (VLMs) surgiram como uma força transformadora na Inteligência Artificial. Eles estendem as capacidades notáveis dos grandes modelos de linguagem (LLMs) para processar informações visuais e textuais de forma integrada. Eles lidam com tarefas como responder a perguntas visuais e análise de documentos. No entanto, os VLMs enfrentam o desafio dos altos custos computacionais. Eles também têm dificuldade com imagens de alta resolução e proporções variadas, em grande parte devido ao escalonamento computacional quadrático normalmente associado ao aumento das resoluções de imagem.
O DeepSeek-VL2, uma série avançada de grandes Modelos Visão-Linguagem Mixture-of-Experts (MoE), aborda esses problemas. Ele introduz uma estratégia dinâmica de codificação de visão de alta resolução e uma arquitetura otimizada de modelo de linguagem que aprimora a compreensão visual e melhora significativamente a eficiência de treinamento e inferência. Outro avanço importante é o pipeline refinado de construção de dados visão-linguagem, que impulsiona o desempenho geral e amplia a capacidade do modelo em novas áreas, como ancoragem visual precisa.
O DeepSeek-VL2 demonstra capacidades superiores em várias tarefas, incluindo, entre outras, resposta a perguntas visuais, reconhecimento óptico de caracteres, compreensão de documentos/tabelas/gráficos e ancoragem visual. Avaliado em benchmarks multimodais comumente usados,
O DeepSeek-VL2 alcança desempenho semelhante ou melhor que o modelo de ponta, com menos parâmetros ativados. Notavelmente, no OCRBench, ele pontua 834, superando os 736 do GPT-4o. Ele também alcança 93,3% no DocVQA para tarefas de resposta a perguntas visuais. A avaliação qualitativa destaca sua capacidade de raciocinar em várias imagens e gerar narrativas visuais coerentes.
Desempenho médio vs. parâmetros ativados entre diferentes modelos de código aberto | Fonte
Este blog discute os avanços técnicos do DeepSeek-VL2 em visão e linguagem. Analisamos em detalhes seus resultados de benchmark e melhorias de eficiência e abordamos seu papel na democratização da IA multimodal de alto desempenho.
DeepSeek-VL2: Arquitetura central do modelo
No centro do DeepSeek-VL2 está uma arquitetura bem estruturada, criada para aprimorar a compreensão multimodal. Ao combinar uma estrutura Mixture-of-Experts (MoE) com um pipeline avançado de processamento Visão-Linguagem (VL), o DeepSeek-VL2 integra informações visuais e textuais de forma eficiente.
Visão geral da arquitetura do DeepSeek-VL2 | Fonte
Abaixo está a explicação dos módulos centrais do DeepSeek-VL2:
Codificador de visão
O codificador de visão é projetado para extrair recursos visuais de alta resolução com eficiência. O codificador de visão no DeepSeek-VL2 usa uma estratégia dinâmica de divisão em blocos projetada para processamento de imagens de alta resolução. A abordagem consiste em dividir uma imagem de alta resolução em blocos para permitir o processamento eficiente de diferentes imagens de alta resolução com proporções variadas.
O DeepSeek-VL2 usa o codificador de visão SigLIP-SO400M-384. O codificador de visão opera em uma resolução base de 384x384. Para acomodar imagens de alta resolução de várias proporções, a imagem é primeiro redimensionada e dividida em blocos de 384x384 pixels. Definimos um conjunto de resoluções candidatas CR:
CR = {(m .384, n .384) | mN, n N, 1m,n,mn9}
em que m:n representa a proporção.
O preenchimento necessário para redimensionar cada imagem de entrada para cada candidata é calculado, e a candidata com o preenchimento mínimo é selecionada. Minimizar o preenchimento reduz a sobrecarga computacional e garante que mais conteúdo da imagem seja retido, melhorando a eficiência do processamento. A imagem redimensionada é dividida em mini blocos locais medindo 384 × 384 e um bloco de miniatura global. O codificador de visão SigLIP-SO400M-384 processa todos os blocos ( 1+mini ), produzindo 729 embeddings visuais de 1152 dimensões por bloco.
Adaptador Visão-Linguagem (VL)
Após a extração de características visuais, o adaptador visão-linguagem reestrutura e comprime tokens para preencher a lacuna entre representações visuais e textuais. Esta etapa permite a integração perfeita de dados visuais e textuais ao introduzir tokens especiais para codificar relações espaciais.
Primeiro, uma operação pixel shuffle 2×2 reduz as dimensões espaciais dos tokens de cada bloco de 27×27 para 14×14=196 tokens. Em seguida, o adaptador insere tokens especiais para codificar relações espaciais entre blocos.
Miniatura Global: Para o bloco de miniatura global, 14 tokens
<tile_newline>são adicionados ao final de cada linha, resultando em um número total de 14 linhas × 15 tokens = 210 tokens.Blocos Locais: Para os mn blocos locais organizados em uma grade (mi .14, ni .14), o sistema acrescenta mi .14 tokens
<tile_newline>para marcar o final de cada linha de todos os blocos locais.Separador: Um token
<view_separator>é adicionado entre os blocos globais e locais.
Essa saída estruturada garante que o modelo compreenda o layout espacial da imagem em blocos. A sequência final de tokens visuais 210+1+ mi⋅14 × (ni⋅14 +1) é projetada no espaço de embeddings do LLM por meio de um MLP de duas camadas.
Ilustração da estratégia de divisão dinâmica em blocos no DeepSeek-VL2 | Fonte
Modelo de Linguagem Grande DeepSeekMoE
A base linguística do DeepSeek-VL2 é construída sobre um modelo Mixture-of-Experts (MoE) ampliado com Multi-head Latent Attention (MLA). A MLA aumenta a eficiência da inferência ao comprimir o cache Key-Value em um vetor latente, reduzindo a sobrecarga de memória e aumentando a capacidade de throughput. Isso permite que o DeepSeek-VL2 lide com sequências de contexto longo de forma mais eficaz, mantendo a eficiência computacional.
A arquitetura MoE permite inferência eficiente por meio de computação esparsa, na qual apenas os seis principais especialistas são selecionados durante a inferência. Isso reduz significativamente os custos computacionais, preservando o desempenho. Durante o treinamento, um termo de viés global é introduzido para cada especialista a fim de melhorar o balanceamento de carga e otimizar a eficiência de aprendizado.
O DeepSeek-VL2 vem em três variantes de modelo, cada uma com um número diferente de parâmetros ativados e especialistas:
DeepSeek-VL2-Tiny: 1,0B parâmetros, 64 especialistas
DeepSeek-VL2-Small: 2,8B parâmetros, 64 especialistas
DeepSeek-VL2: 4,5B parâmetros, 72 especialistas
Metodologia de Treinamento
O DeepSeek-VL2 usa um pipeline de treinamento em três estágios que equilibra a compreensão multimodal com a eficiência computacional. O processo geral é dividido em três fases:
Alinhamento Visão-Linguagem
Pré-treinamento Visão-Linguagem
Ajuste Fino Supervisionado
Fases de alto nível no pipeline de treinamento
Antes de discutir o pipeline de treinamento, aprenderemos sobre a construção de dados e os conjuntos de dados usados em diferentes fases de treinamento.
Construção de Dados
Um conjunto de dados Visão-Linguagem abrangente de diversas fontes foi criado para o DeepSeek-VL2. Nesta seção, descreveremos os dados usados em diferentes estágios do pipeline de treinamento.
Dados de Alinhamento Visão-Linguagem
No estágio de Alinhamento VL, o foco é conectar características visuais com embeddings textuais. O conjunto de dados ShareGPT4V é usado para esta fase inicial. Este conjunto de dados compreende aproximadamente 1,2 milhão de amostras de legendas e conversas.
Dados de Pré-treinamento Visão-Linguagem
Os dados de pré-treinamento combinam dados de visão-linguagem (VL) e dados somente de texto para equilibrar as capacidades de VL e o desempenho apenas em teste. Nesta etapa, cerca de 70% dos dados vêm de fontes de visão-linguagem, e os 30% restantes são dados somente de texto provenientes do corpus de pré-treinamento do LLM.
As categorias de dados de VL usadas são descritas aqui:
Dados Intercalados de Imagem-Texto: Conjuntos de dados de código aberto como WIT, WikiHow e amostras do OBELICS fornecem pares variados de imagem-texto para conhecimento geral do mundo real.
Dados de Legendagem de Imagens: Experimentos iniciais com conjuntos de dados de código aberto mostraram qualidade inconsistente (por exemplo, texto incompatível, alucinações). Foi usado um pipeline abrangente de legendagem de imagens que considera pistas de OCR, metadados e legendas originais como prompts para relegendar as imagens com um modelo interno. Esses dados relegendados curados foram usados no treinamento.
Dados de Reconhecimento Óptico de Caracteres (OCR): Conjuntos de dados públicos, como LaTeX OCR e 12M RenderedText, foram combinados com extensos dados internos de OCR cobrindo diversos tipos de documentos.
Dados de Perguntas e Respostas Visuais (QA): Os dados de QA visual consistem em quatro categorias: VQA geral (do DeepSeek-VL), compreensão de documentos (PubTabNet, FinTabNet, Docmatix), geração de web-para-código/plot-para-Python (Websight e notebooks Jupyter, refinados com DeepSeek V2.5) e QA com prompts visuais (sobrepondo indicadores como setas/caixas em imagens para criar pares de QA focados).
- Dados de Fundamentação Visual: Um conjunto de dados foi construído para fundamentação visual. Para as anotações de detecção de objetos de cada imagem, os dados foram estruturados da seguinte forma usando tokens especiais <|ref|>, <|/ref|>, <|det|>, <|/det|>:
Prompt: Localize <|ref|>
<|/ref|> na imagem fornecida. Resposta: <|ref|>
<|/ref|><|det|>[[x1, y1, x2, y2],...]<|/det|>
- Dados de Conversa Fundamentada: Conjunto de dados conversacional em que prompts e respostas incluem tokens especiais de fundamentação para associar o diálogo a regiões específicas da imagem.
Dados de Ajuste Fino Supervisionado
A etapa de Ajuste Fino Supervisionado refina o desempenho do modelo em seguir instruções e em conversação. Os aspectos cobertos incluem:
Perguntas e Respostas Visuais Gerais: Conjuntos de dados públicos de QA visual frequentemente sofrem com respostas curtas, OCR ruim e alucinações. Um novo conjunto de dados foi gerado regenerando respostas usando perguntas originais, imagens e dados de OCR.
OCR e Compreensão de Documentos: Foram usados conjuntos de dados de OCR existentes limpos, removendo amostras com baixa qualidade de OCR.
Compreensão de Tabelas e Gráficos: Dados de QA baseados em tabelas foram aprimorados regenerando respostas com base nas perguntas originais para criar dados de alta qualidade.
Raciocínio, Lógica e Matemática: Para melhorar a clareza, conjuntos de dados públicos de raciocínio são aprimorados com processos detalhados e formatos de resposta padronizados.
Perguntas de Livros Didáticos e Acadêmicas: Coleções internas de livros didáticos de nível universitário focadas em conteúdo acadêmico em várias disciplinas.
Geração de Web-para-código e Plot-para-Python: Conjuntos de dados internos foram expandidos com conjuntos de dados de código aberto após a geração de respostas para melhorar a qualidade.
Fundamentação Visual: Dados com anotações de detecção de objetos orientam o modelo a localizar e descrever objetos com precisão.
Conversa Fundamentada: Conjuntos de dados conversacionais incorporam tokens de fundamentação para vincular o diálogo a regiões da imagem para melhorar a interação.
Conjuntos de Dados Somente de Texto: Conjuntos de dados de ajuste de instruções somente de texto também são usados para manter as capacidades linguísticas do modelo.
Pipelines de Treinamento
Antes de iniciar o treinamento, o processo é dividido em etapas definidas. Essa estrutura garante transições suaves entre alinhamento, pré-treinamento e ajuste fino. Inicialmente, o codificador de visão e o MLP adaptador visão-linguagem são treinados enquanto o modelo de linguagem permanece fixo. Posteriormente, todos os parâmetros do modelo são descongelados para um pré-treinamento extensivo e, por fim, o modelo é ajustado usando dados supervisionados. A perda é calculada exclusivamente sobre tokens de texto em cada etapa para priorizar o aprendizado do contexto visual.
- Alinhamento Visão-Linguagem: A fase de Alinhamento VL conecta recursos visuais com embeddings textuais. O treinamento usa o conjunto de dados ShareGPT4V, que consiste em aproximadamente 1,2 milhão de pares imagem-texto. Durante essa fase, o modelo de linguagem permanece congelado. Apenas o codificador de visão e o adaptador são treinados, usando um conector MLP leve para mesclar recursos visuais e textuais. Essa fase ajusta codificadores de resolução fixa para lidar com entradas dinâmicas de alta resolução.
- Pré-treinamento Visão-Linguagem: Na fase de Pré-treinamento VL, todos os parâmetros são descongelados para otimização. A combinação de dados compreende 70% de dados visão-linguagem e 30% de dados somente de texto. Os dados VL incluem pares imagem-texto intercalados que abrangem tarefas como OCR e análise de documentos. Os dados somente de texto vêm do corpus de pré-treinamento do LLM. O treinamento usa cerca de 800 bilhões de tokens imagem-texto para construir representações conjuntas para entradas visuais e textuais.
- Ajuste Fino Supervisionado: Durante o Ajuste Fino Supervisionado, as capacidades de seguir instruções e de conversação do modelo são refinadas. Essa fase usa pares pergunta-resposta selecionados de conjuntos de dados públicos e dados internos. Dados de diálogo multimodal são combinados com diálogos somente de texto do DeepSeek-V2, e prompts de sistema/usuário são mascarados para que a supervisão se aplique apenas às respostas e aos tokens especiais.
Hiperparâmetros e Infraestrutura
A configuração de hiperparâmetros do DeepSeek-VL2 é detalhada na tabela fornecida. Durante o treinamento, diferentes etapas usam configurações personalizadas. Por exemplo, na Etapa 1 para o DeepSeek-VL2-Tiny, a taxa de aprendizado é definida como 5,4×10⁻⁴, enquanto na Etapa 3 ela cai para 3,0×10⁻⁵. O Step LR Scheduler divide a taxa de aprendizado por √10 em 50% e 75% do total de etapas de treinamento. Um multiplicador fixo de 0,1 é aplicado à taxa de aprendizado do codificador de visão. Agendadores de taxa de aprendizado cosseno são usados nas etapas iniciais, com um cronograma constante na etapa final. Configurações adicionais incluem um decaimento de peso de 0,1, clipping de gradiente em 1,0 e o otimizador AdamW configurado com β₁ = 0,9 e β₂ = 0,95.
Hiperparâmetros para treinar o DeepSeek-VL2 | Fonte
O treinamento é realizado na plataforma HAI-LLM, um sistema leve projetado para grandes modelos. O pipeline emprega divisão de camadas de granularidade fina para o codificador de visão a fim de garantir balanceamento de carga entre GPUs, o que ajuda a evitar bolhas no pipeline. O balanceamento de carga de blocos de imagem também é realizado entre ranks paralelos de dados para lidar com a variabilidade introduzida pela estratégia de resolução dinâmica.
Além disso, técnicas de paralelismo de tensores e paralelismo de especialistas são incorporadas para maximizar a eficiência. Combinadas com um ajuste meticuloso de hiperparâmetros, essas escolhas de infraestrutura permitem que o DeepSeek-VL2 processe bilhões de tokens de treinamento de forma eficiente, mantendo um desempenho multimodal robusto.
O DeepSeek-VL2 foi treinado em 7/10/14 dias usando um cluster de 16/33/42 nós, cada um equipado com 8 GPUs NVIDIA A100.
Avaliação
Agora examinamos o desempenho do DeepSeek-VL2 usando benchmarks padrão e testes qualitativos. As seções a seguir descrevem os resultados da avaliação e comparam o DeepSeek-VL2 com os modelos de ponta.
Benchmarks
DeepSeek-VL2 é avaliado em uma série de benchmarks comumente usados. Estes incluem DocVQA, ChartQA, InfoVQA, TextVQA, RealWorldQA, OCRBench, AI2D, MMMU, MMStar, MathVista, MME, MMBench (e MMBench-V1.1) e MMT-Bench. Além disso, a capacidade de grounding do modelo é testada nos benchmarks RefCOCO, RefCOCO+ e RefCOCOg. Esses testes abrangem tarefas que vão desde compreensão de documentos e interpretação de gráficos até resolução de problemas do mundo real, fornecendo uma medida abrangente do desempenho do modelo.
Comparação com o Estado da Arte
DeepSeek-VL2 foi comparado com vários modelos de visão-linguagem de estado da arte, como LLaVA-OV, InternVL2, DeepSeek-VL, Qwen2-VL, Phi-3.5-Vision, Molmo, Pixtral, MM1.5 e Aria-MoE nos benchmarks de compreensão multimodal. Em tarefas de grounding, o modelo DeepSeek-VL2 supera outros como Grounding DINO, UNINEXT, ONE-PEACE, mPLUG-2, Florence-2, InternVL2, Shikra, TextHawk2, Ferret-v2 e MM1.5.
Comparação com modelos de estado da arte em benchmarks multimodais gerais de QA e relacionados à matemática | Fonte
DeepSeek-VL2 alcança desempenho semelhante ou melhor com menos parâmetros ativados. Ele demonstra desempenho competitivo em diversos benchmarks multimodais, igualando ou superando modelos maiores como Qwen2-VL-7B (8.3B) e InternVL2-8B (8.0B) em tarefas como MMBench (83.1 vs. 85.0) e MME (2,253 vs. 2,327).
Apesar de sua contagem menor de parâmetros ativados, ele se aproxima do desempenho do GPT-4o no MMStar (61.3 vs. 63.9) e supera a maioria dos modelos open-source em tarefas intensivas de OCR como AIDD (81.4). A eficiência do modelo, possibilitada por sua arquitetura MoE, equilibra capacidade e custo computacional de forma eficaz.
Comparação com modelos de estado da arte em benchmarks multimodais relacionados a OCR | Fonte
DeepSeek-VL2 alcança desempenho competitivo em tarefas de OCR, igualando ou superando modelos maiores como Qwen2-VL-7B em TextVQA (84.2 vs. 84.3) e superando GPT-4o em DocVQA (93.3 vs. 92.8). Suas pontuações em ChartQA (86.0) e InfoVQA (78.1) excedem as da maioria dos pares open-source, enquanto sua eficiência reduz a lacuna em relação a modelos fechados como Claude 3.5 Sonnet (OCRBench: 811 vs. 788). Isso demonstra capacidades robustas de OCR apesar de sua arquitetura compacta.
Estudo Qualitativo
O estudo qualitativo demonstra as capacidades do DeepSeek-VL2 em várias tarefas. As principais áreas incluem:
- Perguntas e Respostas Visuais Gerais: O modelo fornece respostas detalhadas, descreve com precisão conteúdo denso de imagens e reconhece pontos de referência tanto em inglês quanto em chinês. Ele possui capacidades multifacetadas, incluindo reconhecimento de pontos de referência, composição de poesia baseada em imagens, resposta a perguntas sobre conhecimento geral, compreensão de gráficos, reconhecimento de texto e muito mais.
A capacidade geral de perguntas e respostas do DeepSeek-VL2 | Fonte
- Conversa com Múltiplas Imagens: Ele analisa efetivamente as associações e diferenças entre múltiplas imagens, ao mesmo tempo em que permite raciocínio simples ao integrar o conteúdo de várias imagens. Por exemplo, ele pode considerar como preparar um prato com base em imagens de certos ingredientes.
Capacidade de conversa com múltiplas imagens do DeepSeek-VL2 | Fonte
- Narrativa Visual: DeepSeek-VL2 pode gerar narrativas criativas com base em uma série de imagens, mantendo contexto e coerência. Sua narrativa reflete uma compreensão da progressão temporal e das transições de cena, adicionando profundidade às narrativas geradas.
Capacidade de narrativa visual do DeepSeek-VL2 | Fonte
- Ancoragem Visual: O modelo identifica e localiza objetos em imagens com sucesso, generalizando-os de cenas naturais para cenários variados, como memes e anime. Ele demonstra desempenho robusto mesmo quando os objetos estão parcialmente obscurecidos ou apresentados em condições desafiadoras.
Capacidade de ancoragem visual do DeepSeek-VL2 | Fonte
- Conversa com Ancoragem: Com o uso de tokens especiais de ancoragem <|grounding|>, o modelo se refere a objetos-chave com detalhes precisos de localização, aprimorando suas capacidades interativas. Suas respostas ancoradas facilitam aplicações práticas em sistemas interativos do mundo real.
Conversa ancorada com DeepSeek-VL2 | Fonte
Principais Descobertas
- Eficiência e Escalabilidade: O DeepSeek-VL2 alcança resultados competitivos com menos parâmetros ativados graças ao seu design MoE eficiente e à abordagem de ladrilhamento dinâmico. Esse equilíbrio entre desempenho e uso de recursos permite a implantação em ambientes com capacidade computacional limitada.
- Compreensão Multimodal Robusta: O modelo se destaca em tarefas que abrangem OCR, análise de documentos e ancoragem visual. Sua capacidade de integrar informações visuais e textuais resulta em alta precisão em diversas aplicações.
- Acompanhamento de Instruções e Habilidades Conversacionais Aprimorados: O modelo apresenta melhorias marcantes na geração de respostas coerentes e conscientes do contexto por meio de ajuste fino supervisionado. Esse refinamento reforça seu desempenho em ambientes interativos e conversacionais.
- Aplicabilidade no Mundo Real: O forte desempenho observado tanto em benchmarks quantitativos quanto em estudos qualitativos indica que o DeepSeek-VL2 é bem adequado para aplicações práticas, como processamento automatizado de documentos, assistentes virtuais e sistemas interativos em IA incorporada.
Possíveis Direções de Pesquisa Futuras
O DeepSeek-VL2 é uma versão aprimorada de modelos de visão-linguagem baseados em MoE disponível em três tamanhos: 3B, 16B e 27B de parâmetros totais, com 1,0B, 2,8B e 4,5B ativados. Esse design inteligente torna tanto o treinamento quanto a inferência mais eficientes. Ele permite que o menor modelo seja executado em uma única GPU com apenas 10 GB de memória, enquanto variantes maiores exigem 40 GB e 80 GB.
Um dos recursos de destaque é sua estratégia de ladrilhamento dinâmico, que processa habilmente imagens de alta resolução em várias proporções de aspecto. Ao disponibilizar publicamente o código e os modelos pré-treinados, o DeepSeek-VL2 inspirará novas pesquisas e aplicações inovadoras na empolgante interseção entre visão e linguagem.
Há várias áreas nas quais o DeepSeek-VL2 poderia ser aprimorado.
- Janela de Contexto: Atualmente, o modelo oferece suporte a apenas algumas imagens por sessão de chat. Atualizações futuras poderiam estender a janela de contexto para permitir interações multi-imagem mais ricas.
- Robustez à Qualidade da Imagem: O modelo às vezes enfrenta desafios com imagens borradas ou objetos não vistos. Abordar esses problemas poderia melhorar sua confiabilidade em cenários diversos.
- Capacidades de Raciocínio: Embora o modelo tenha bom desempenho em percepção e reconhecimento visual, suas habilidades de raciocínio podem ser aprimoradas. Fortalecer esse aspecto pode ampliar seu potencial de aplicação no mundo real.
Recursos Adicionais
- Artigo de Pesquisa: DeepSeek-VL2: Mixture-of-Experts Vision-Language Models
Continue lendo

Top 10 Context Engineering Techniques You Should Know for Production RAG
A practical guide to context engineering for production LLM systems, covering RAG, context processing, memory, agents, and multimodal context.

Zilliz Cloud Enterprise Vector Search Powers High-Performance AI on AWS
Zilliz Cloud on AWS powers secure, scalable, ultra-fast vector search for enterprise AI apps, with BYOC, sub-10ms latency, and zero-DevOps simplicity.

Vector Databases vs. Key-Value Databases
Use a vector database for AI-powered similarity search; use a key-value database for high-throughput, low-latency simple data lookups.



