DeepSeek-VL2 : modèles vision-langage à mélange d’experts pour une compréhension multimodale avancée
Le monopole de l’IA est en train de changer. DeepSeek-VL2 offre une intelligence vision-langage de niveau GPT-4o à une fraction du coût, montrant que les modèles ouverts ne font pas seulement rattraper leur retard. Ils ouvrent la voie. Cela pourrait-il marquer la fin de l’IA coûteuse et fermée ?
Les grands modèles vision-langage (VLMs) sont apparus comme une force transformatrice dans l’intelligence artificielle. Ils étendent les capacités remarquables des grands modèles de langage (LLMs) pour traiter de manière fluide les informations visuelles et textuelles. Ils s’attaquent à des tâches comme la réponse à des questions visuelles et l’analyse de documents. Cependant, les VLMs font face au défi des coûts de calcul élevés. Ils ont également des difficultés avec les images haute résolution et les rapports d’aspect variés, en grande partie en raison de la mise à l’échelle quadratique des calculs généralement associée à l’augmentation des résolutions d’image.
DeepSeek-VL2, une série avancée de grands modèles vision-langage Mixture-of-Experts (MoE), résout ces problèmes. Elle introduit une stratégie dynamique d’encodage visuel haute résolution et une architecture de modèle de langage optimisée qui améliore la compréhension visuelle et accroît considérablement l’efficacité de l’entraînement et de l’inférence. Une autre avancée clé est le pipeline affiné de construction de données vision-langage, qui renforce les performances globales et étend les capacités du modèle à de nouveaux domaines, comme l’ancrage visuel précis.
DeepSeek-VL2 démontre des capacités supérieures dans diverses tâches, notamment, mais sans s’y limiter, la réponse à des questions visuelles, la reconnaissance optique de caractères, la compréhension de documents/tableaux/graphiques et l’ancrage visuel. Évalué sur des benchmarks multimodaux couramment utilisés,
DeepSeek-VL2 atteint des performances similaires ou supérieures à celles du modèle de pointe, avec moins de paramètres activés. Notamment, sur OCRBench, il obtient un score de 834, surpassant GPT-4o 736. Il atteint également 93,3 % sur DocVQA pour les tâches de questions-réponses visuelles. L’évaluation qualitative met en évidence sa capacité à raisonner sur plusieurs images et à générer des récits visuels cohérents.
Performance moyenne vs paramètres activés parmi différents modèles open source | Source
Ce blog traite des avancées techniques de DeepSeek-VL2 en vision et en langage. Nous analysons en détail ses résultats de benchmark et ses améliorations d’efficacité, et passons en revue son rôle dans la démocratisation de l’IA multimodale haute performance.
DeepSeek-VL2 : architecture centrale du modèle
Au cœur de DeepSeek-VL2 se trouve une architecture bien structurée conçue pour améliorer la compréhension multimodale. En combinant un cadre Mixture-of-Experts (MoE) avec un pipeline avancé de traitement Vision-Language (VL), DeepSeek-VL2 intègre efficacement les informations visuelles et textuelles.
Aperçu de l’architecture de DeepSeek-VL2 | Source
Vous trouverez ci-dessous l’explication des modules centraux de DeepSeek-VL2 :
Encodeur visuel
L’encodeur visuel est conçu pour extraire efficacement des caractéristiques visuelles haute résolution. L’encodeur visuel de DeepSeek-VL2 utilise une stratégie de tuilage dynamique conçue pour le traitement d’images haute résolution. L’approche consiste à diviser une haute résolution en tuiles afin de permettre un traitement efficace de différentes images haute résolution avec des rapports d’aspect variables.
DeepSeek-VL2 utilise l’encodeur visuel SigLIP-SO400M-384. L’encodeur visuel fonctionne à une résolution de base de 384x384. Pour prendre en charge des images haute résolution de divers rapports d’aspect, l’image est d’abord redimensionnée et divisée en tuiles de 384x384 pixels. Nous définissons un ensemble de résolutions candidates CR :
CR = {(m .384, n .384) | mN, n N, 1m,n,mn9}
où m:n représente le rapport d’aspect.
Le padding requis pour redimensionner chaque image d’entrée à chaque candidate est calculé, et la candidate avec le padding minimal est sélectionnée. Minimiser le padding réduit la surcharge computationnelle et garantit qu’une plus grande partie du contenu de l’image est conservée, améliorant ainsi l’efficacité du traitement. L’image redimensionnée est divisée en mini tuiles locales mesurant 384 × 384 et une tuile de vignette globale. L’encodeur de vision SigLIP-SO400M-384 traite toutes les tuiles ( 1+mini ), produisant 729 embeddings visuels de 1152 dimensions par tuile.
Adaptateur vision-langage (VL)
Après l’extraction des caractéristiques visuelles, l’adaptateur vision-langage restructure et compresse les tokens afin de combler l’écart entre les représentations visuelles et textuelles. Cette étape permet une intégration fluide des données visuelles et textuelles en introduisant des tokens spéciaux pour encoder les relations spatiales.
Tout d’abord, une opération de pixel shuffle 2×2 réduit les dimensions spatiales des tokens de chaque tuile de 27×27 à 14×14=196 tokens. L’adaptateur insère ensuite des tokens spéciaux pour encoder les relations spatiales entre les tuiles.
Vignette globale : Pour la tuile de vignette globale, 14 tokens
<tile_newline>sont ajoutés à la fin de chaque ligne, ce qui donne un nombre total de 14 lignes × 15 tokens = 210 tokens.Tuiles locales : Pour les mn tuiles locales disposées dans une grille (mi .14, ni .14), le système ajoute mi .14 tokens
<tile_newline>pour marquer la fin de chaque ligne de toutes les tuiles locales.Séparateur : Un token
<view_separator>est ajouté entre les tuiles globales et locales.
Cette sortie structurée garantit que le modèle comprend la disposition spatiale de l’image en tuiles. La séquence finale de tokens visuels 210+1+ mi⋅14 × (ni⋅14 +1) est projetée dans l’espace d’embedding du LLM via un MLP à deux couches.
Illustration de la stratégie de découpage dynamique en tuiles dans DeepSeek-VL2 | Source
Grand modèle de langage DeepSeekMoE
L’architecture linguistique de DeepSeek-VL2 repose sur un modèle Mixture-of-Experts (MoE) augmenté par la Multi-head Latent Attention (MLA). La MLA améliore l’efficacité de l’inférence en compressant le cache Key-Value dans un vecteur latent, réduisant la surcharge mémoire et augmentant la capacité de débit. Cela permet à DeepSeek-VL2 de gérer plus efficacement les séquences à contexte long tout en maintenant l’efficacité computationnelle.
L’architecture MoE permet une inférence efficace grâce au calcul parcimonieux, où seuls les six meilleurs experts sont sélectionnés pendant l’inférence. Cela réduit considérablement les coûts computationnels tout en préservant les performances. Pendant l’entraînement, un terme de biais global est introduit pour chaque expert afin d’améliorer l’équilibrage de charge et d’optimiser l’efficacité de l’apprentissage.
DeepSeek-VL2 est disponible en trois variantes de modèle, chacune avec un nombre différent de paramètres activés et d’experts :
DeepSeek-VL2-Tiny : 1,0B de paramètres, 64 experts
DeepSeek-VL2-Small : 2,8B de paramètres, 64 experts
DeepSeek-VL2 : 4,5B de paramètres, 72 experts
Méthodologie d’entraînement
DeepSeek-VL2 utilise un pipeline d’entraînement en trois étapes qui équilibre la compréhension multimodale avec l’efficacité computationnelle. Le processus global est divisé en trois phases :
Alignement vision-langage
Pré-entraînement vision-langage
Affinage supervisé
Phases de haut niveau dans le pipeline d’entraînement
Avant de discuter du pipeline d’entraînement, nous découvrirons la construction des données et les jeux de données utilisés dans les différentes phases d’entraînement.
Construction des données
Un jeu de données vision-langage complet provenant de diverses sources a été construit pour DeepSeek-VL2. Dans cette section, nous décrirons les données utilisées aux différentes étapes du pipeline d’entraînement.
Données d’alignement vision-langage
À l’étape d’alignement VL, l’accent est mis sur le rapprochement des caractéristiques visuelles avec les embeddings textuels. Le jeu de données ShareGPT4V est utilisé pour cette phase initiale. Ce jeu de données comprend environ 1,2 million d’échantillons de légendes et de conversations.
Données de pré-entraînement vision-langage
Les données de pré-entraînement combinent des données vision-langage (VL) et des données textuelles uniquement afin d’équilibrer les capacités VL et les performances sur le texte uniquement. À cette étape, environ 70 % des données proviennent de sources vision-langage, et les 30 % restants sont des données textuelles uniquement issues du corpus de pré-entraînement du LLM.
Les catégories de données VL utilisées sont décrites ici :
Données image-texte entrelacées : Des jeux de données open source comme WIT, WikiHow, ainsi que des échantillons d’OBELICS fournissent des paires image-texte variées pour des connaissances générales du monde réel.
Données de légendage d’images : Les premières expériences avec des jeux de données open source ont montré une qualité irrégulière (p. ex., texte non correspondant, hallucinations). Un pipeline complet de légendage d’images a été utilisé, prenant en compte les indices OCR, les métadonnées et les légendes originales comme prompts afin de relégender les images avec un modèle interne. Ces données relégendées et sélectionnées ont été utilisées pour l’entraînement.
Données de reconnaissance optique de caractères (OCR) : Des jeux de données publics tels que LaTeX OCR et 12M RenderedText ont été combinés avec de vastes données OCR internes couvrant divers types de documents.
Données de questions-réponses visuelles (QA) : Les données de QA visuelle se composent de quatre catégories : VQA générale (provenant de DeepSeek-VL), compréhension de documents (PubTabNet, FinTabNet, Docmatix), génération web-to-code/plot-to-Python (Websight et notebooks Jupyter, affinés avec DeepSeek V2.5), et QA avec prompts visuels (superposition d’indicateurs comme des flèches/boîtes sur des images pour créer des paires QA ciblées).
- Données d’ancrage visuel : Un jeu de données a été construit pour l’ancrage visuel. Pour les annotations de détection d’objets de chaque image, les données ont été structurées comme suit à l’aide de jetons spéciaux <|ref|>, <|/ref|>, <|det|>, <|/det|> :
Prompt : Localisez <|ref|>
<|/ref|> dans l’image donnée. Réponse : <|ref|>
<|/ref|><|det|>[[x1, y1, x2, y2],...]<|/det|>
- Données de conversation ancrée : Jeu de données conversationnel dans lequel les prompts et les réponses incluent des jetons d’ancrage spéciaux pour associer le dialogue à des régions spécifiques de l’image.
Données de fine-tuning supervisé
L’étape de fine-tuning supervisé affine les performances du modèle en matière de suivi d’instructions et de conversation. Les aspects couverts incluent :
Questions-réponses visuelles générales : Les jeux de données publics de QA visuelle souffrent souvent de réponses courtes, d’un OCR médiocre et d’hallucinations. Un nouveau jeu de données a été généré en régénérant les réponses à l’aide des questions originales, des images et des données OCR.
OCR et compréhension de documents : Utilisation de jeux de données OCR existants nettoyés en supprimant les échantillons présentant une mauvaise qualité OCR.
Compréhension de tableaux et de graphiques : Les données de QA basées sur des tableaux ont été améliorées en régénérant les réponses à partir des questions originales afin de créer des données de haute qualité.
Raisonnement, logique et mathématiques : Pour améliorer la clarté, les jeux de données publics de raisonnement sont enrichis avec des processus détaillés et des formats de réponse standardisés.
Manuels et questions académiques : Collections internes de manuels de niveau universitaire axées sur du contenu académique dans plusieurs disciplines.
Génération web-to-code et plot-to-Python : Les jeux de données internes ont été étendus avec des jeux de données open source après génération des réponses afin d’améliorer la qualité.
Ancrage visuel : Les données avec annotations de détection d’objets guident le modèle pour localiser et décrire les objets avec précision.
Conversation ancrée : Les jeux de données conversationnels intègrent des jetons d’ancrage pour relier le dialogue aux régions de l’image afin d’améliorer l’interaction.
Jeux de données textuels uniquement : Des jeux de données de réglage d’instructions textuels uniquement sont également utilisés pour maintenir les capacités linguistiques du modèle.
Pipelines d’entraînement
Avant de commencer l’entraînement, le processus est divisé en étapes définies. Cette structure garantit des transitions fluides entre l’alignement, le pré-entraînement et l’affinage. Initialement, l’encodeur visuel et l’adaptateur vision-langage MLP sont entraînés tandis que le modèle de langage reste fixe. Ensuite, tous les paramètres du modèle sont dégelés pour un pré-entraînement approfondi, et enfin, le modèle est affiné à l’aide de données supervisées. La perte est calculée uniquement sur les tokens textuels à chaque étape afin de privilégier l’apprentissage du contexte visuel.
- Alignement vision-langage : La phase d’alignement VL relie les caractéristiques visuelles aux embeddings textuels. L’entraînement utilise le jeu de données ShareGPT4V, qui se compose d’environ 1,2 million de paires image-texte. Durant cette phase, le modèle de langage reste gelé. Seuls l’encodeur visuel et l’adaptateur sont entraînés, à l’aide d’un connecteur MLP léger pour fusionner les caractéristiques visuelles et textuelles. Cette phase ajuste les encodeurs à résolution fixe afin de gérer des entrées dynamiques à haute résolution.
- Pré-entraînement vision-langage : Dans la phase de pré-entraînement VL, tous les paramètres sont dégelés pour l’optimisation. Le mélange de données comprend 70 % de données vision-langage et 30 % de données uniquement textuelles. Les données VL incluent des paires image-texte entrelacées qui couvrent des tâches telles que l’OCR et l’analyse de documents. Les données uniquement textuelles proviennent du corpus de pré-entraînement du LLM. L’entraînement utilise environ 800 milliards de tokens image-texte pour construire des représentations conjointes des entrées visuelles et textuelles.
- Affinage supervisé : Pendant l’affinage supervisé, les capacités du modèle à suivre des instructions et à converser sont améliorées. Cette phase utilise des paires question-réponse sélectionnées issues de jeux de données publics et de données internes. Les données de dialogue multimodales sont combinées à des dialogues uniquement textuels provenant de DeepSeek-V2, et les prompts système/utilisateur sont masqués afin que la supervision ne s’applique qu’aux réponses et aux tokens spéciaux.
Hyperparamètres et infrastructure
La configuration des hyperparamètres pour DeepSeek-VL2 est détaillée dans le tableau donné. Pendant l’entraînement, les différentes étapes utilisent des paramètres adaptés. Par exemple, à l’étape 1 pour DeepSeek-VL2-Tiny, le taux d’apprentissage est fixé à 5,4×10⁻⁴, tandis qu’à l’étape 3, il descend à 3,0×10⁻⁵. Le Step LR Scheduler divise le taux d’apprentissage par √10 à 50 % et 75 % du nombre total d’étapes d’entraînement. Un multiplicateur fixe de 0,1 est appliqué au taux d’apprentissage de l’encodeur visuel. Des planificateurs de taux d’apprentissage cosinus sont utilisés dans les premières étapes, avec un calendrier constant dans l’étape finale. Les paramètres supplémentaires incluent une décroissance des poids de 0,1, un écrêtage des gradients à 1,0 et l’optimiseur AdamW configuré avec β₁ = 0,9 et β₂ = 0,95.
Hyperparamètres pour l’entraînement de DeepSeek-VL2 | Source
L’entraînement est effectué sur la plateforme HAI-LLM, un système léger conçu pour les grands modèles. Le pipeline emploie une division fine des couches pour l’encodeur visuel afin d’assurer l’équilibrage de charge entre les GPU, ce qui aide à prévenir les bulles de pipeline. L’équilibrage de charge des tuiles d’image est également réalisé entre les rangs de parallélisme des données afin de gérer la variabilité introduite par la stratégie de résolution dynamique.
En outre, des techniques de parallélisme tensoriel et de parallélisme d’experts sont intégrées afin de maximiser l’efficacité. Associés à un réglage minutieux des hyperparamètres, ces choix d’infrastructure permettent à DeepSeek-VL2 de traiter efficacement des milliards de tokens d’entraînement tout en maintenant des performances multimodales robustes.
DeepSeek-VL2 a été entraîné en 7/10/14 jours à l’aide d’un cluster de 16/33/42 nœuds, chacun équipé de 8 GPU NVIDIA A100.
Évaluation
Nous examinons maintenant les performances de DeepSeek-VL2 à l’aide de benchmarks standard et de tests qualitatifs. Les sections suivantes présentent les résultats de l’évaluation et comparent DeepSeek-VL2 aux modèles à l’état de l’art.
Benchmarks
DeepSeek-VL2 est évalué sur une série de benchmarks couramment utilisés. Ceux-ci incluent DocVQA, ChartQA, InfoVQA, TextVQA, RealWorldQA, OCRBench, AI2D, MMMU, MMStar, MathVista, MME, MMBench (et MMBench-V1.1), et MMT-Bench. De plus, la capacité d’ancrage du modèle est testée sur les benchmarks RefCOCO, RefCOCO+ et RefCOCOg. Ces tests couvrent des tâches allant de la compréhension de documents et de l’interprétation de graphiques à la résolution de problèmes du monde réel, fournissant une mesure complète des performances du modèle.
Comparaison avec l’état de l’art
DeepSeek-VL2 a été comparé à plusieurs modèles vision-langage à l’état de l’art tels que LLaVA-OV, InternVL2, DeepSeek-VL, Qwen2-VL, Phi-3.5-Vision, Molmo, Pixtral, MM1.5 et Aria-MoE sur les benchmarks de compréhension multimodale. Dans les tâches d’ancrage, le modèle DeepSeek-VL2 surpasse d’autres modèles comme Grounding DINO, UNINEXT, ONE-PEACE, mPLUG-2, Florence-2, InternVL2, Shikra, TextHawk2, Ferret-v2 et MM1.5.
Comparaison avec les modèles à l’état de l’art sur les benchmarks multimodaux généraux de QA et liés aux mathématiques | Source
DeepSeek-VL2 obtient des performances similaires ou meilleures avec moins de paramètres activés. Il démontre des performances compétitives sur divers benchmarks multimodaux, égalant ou dépassant des modèles plus grands comme Qwen2-VL-7B (8.3B) et InternVL2-8B (8.0B) dans des tâches telles que MMBench (83.1 contre 85.0) et MME (2,253 contre 2,327).
Malgré son nombre plus réduit de paramètres activés, il se rapproche des performances de GPT-4o sur MMStar (61.3 contre 63.9) et surpasse la plupart des modèles open source dans les tâches à forte composante OCR comme AIDD (81.4). L’efficacité du modèle, rendue possible par son architecture MoE, équilibre efficacement les capacités et le coût computationnel.
Comparaison avec les modèles à l’état de l’art sur les benchmarks multimodaux liés à l’OCR | Source
DeepSeek-VL2 obtient des performances compétitives dans les tâches OCR, égalant ou surpassant des modèles plus grands comme Qwen2-VL-7B dans TextVQA (84.2 contre 84.3) et surpassant GPT-4o dans DocVQA (93.3 contre 92.8). Ses scores ChartQA (86.0) et InfoVQA (78.1) dépassent ceux de la plupart de ses homologues open source, tandis que son efficacité comble l’écart avec des modèles fermés comme Claude 3.5 Sonnet (OCRBench : 811 contre 788). Cela démontre de solides capacités OCR malgré son architecture compacte.
Étude qualitative
L’étude qualitative démontre les capacités de DeepSeek-VL2 dans diverses tâches. Les domaines clés incluent :
- Réponse à des questions visuelles générales : Le modèle fournit des réponses détaillées, décrit avec précision le contenu dense des images et reconnaît des monuments en anglais comme en chinois. Il possède des capacités multiples, notamment la reconnaissance de monuments, la composition de poésie à partir d’images, la réponse à des questions de culture générale, la compréhension de graphiques, la reconnaissance de texte, et plus encore.
La capacité générale de réponse aux questions de DeepSeek-VL2 | Source
- Conversation multi-images : Il analyse efficacement les associations et les différences entre plusieurs images tout en permettant un raisonnement simple en intégrant le contenu de plusieurs images. Par exemple, il peut envisager comment préparer un plat à partir d’images de certains ingrédients.
Capacité de conversation multi-images de DeepSeek-VL2 | Source
- Narration visuelle : DeepSeek-VL2 peut générer des récits créatifs à partir d’une série d’images tout en maintenant le contexte et la cohérence. Sa narration reflète une compréhension de la progression temporelle et des transitions de scène, ajoutant de la profondeur aux récits générés.
Capacité de narration visuelle de DeepSeek-VL2 | Source
- Ancrage visuel : Le modèle identifie et localise avec succès les objets dans les images, en les généralisant depuis des scènes naturelles vers des scénarios variés tels que les mèmes et les anime. Il démontre des performances robustes même lorsque les objets sont partiellement masqués ou présentés dans des conditions difficiles.
Capacité d’ancrage visuel de DeepSeek-VL2 | Source
- Conversation ancrée : Grâce à l’utilisation de jetons d’ancrage spéciaux <|grounding|>, le modèle fait référence aux objets clés avec des détails de localisation précis, renforçant ses capacités interactives. Ses réponses ancrées facilitent les applications pratiques dans des systèmes interactifs réels.
Conversation ancrée avec DeepSeek-VL2 | Source
Principales conclusions
- Efficacité et évolutivité : DeepSeek-VL2 obtient des résultats compétitifs avec moins de paramètres activés grâce à sa conception MoE efficace et à son approche de découpage dynamique. Cet équilibre entre performance et utilisation des ressources permet un déploiement dans des environnements disposant d’une capacité de calcul limitée.
- Compréhension multimodale robuste : Le modèle excelle dans des tâches couvrant l’OCR, l’analyse de documents et l’ancrage visuel. Sa capacité à intégrer les informations visuelles et textuelles se traduit par une grande précision dans diverses applications.
- Suivi d’instructions et compétences conversationnelles améliorés : Le modèle montre des améliorations notables dans la génération de réponses cohérentes et sensibles au contexte grâce à un ajustement fin supervisé. Ce raffinement renforce ses performances dans les contextes interactifs et conversationnels.
- Applicabilité dans le monde réel : Les solides performances observées dans les benchmarks quantitatifs comme dans les études qualitatives indiquent que DeepSeek-VL2 est bien adapté aux applications pratiques, telles que le traitement automatisé de documents, les assistants virtuels et les systèmes interactifs en IA incarnée.
Orientations potentielles de recherche future
DeepSeek-VL2 est une version améliorée des modèles vision-langage fondés sur MoE disponible en trois tailles : 3B, 16B et 27B paramètres au total, avec 1.0B, 2.8B et 4.5B activés. Cette conception intelligente rend l’entraînement comme l’inférence plus efficaces. Elle permet au plus petit modèle de fonctionner sur un seul GPU avec seulement 10 Go de mémoire, tandis que les variantes plus grandes nécessitent 40 Go et 80 Go.
L’une des fonctionnalités remarquables est sa stratégie de découpage dynamique, qui traite habilement les images haute résolution selon différents formats d’image. En rendant publics le code et les modèles pré-entraînés, DeepSeek-VL2 inspirera de nouvelles recherches et des applications innovantes au carrefour passionnant de la vision et du langage.
Plusieurs aspects de DeepSeek-VL2 pourraient être améliorés.
- Fenêtre de contexte : Actuellement, le modèle ne prend en charge que quelques images par session de chat. De futures mises à jour pourraient étendre la fenêtre de contexte afin de permettre des interactions multi-images plus riches.
- Robustesse à la qualité d’image : Le modèle rencontre parfois des difficultés avec les images floues ou les objets jamais vus. Résoudre ces problèmes pourrait améliorer sa fiabilité dans divers scénarios.
- Capacités de raisonnement : Bien que le modèle soit performant en perception et reconnaissance visuelles, ses capacités de raisonnement peuvent être améliorées. Renforcer cet aspect pourrait élargir son potentiel d’application dans le monde réel.
Ressources complémentaires
- Article de recherche : DeepSeek-VL2: Mixture-of-Experts Vision-Language Models
Continuer à lire

Introducing Loon: A New Storage Engine for Vector Data That Never Stops Changing
Loon is a new storage engine for Milvus 3.0 and Zilliz Vector Lakebase, built to manage evolving vector datasets with ColumnGroups, row ID alignment, and Manifests.

Zilliz Cloud Now Available in Azure North Europe: Bringing AI-Powered Vector Search Closer to European Customers
The addition of the Azure North Europe (Ireland) region further expands our global footprint to better serve our European customers.

Vector Databases vs. Hierarchical Databases
Use a vector database for AI-powered similarity search; use a hierarchical database for organizing data in parent-child relationships with efficient top-down access patterns.



