DeepSeek-VL2: Vision-Language модели Mixture-of-Experts для продвинутого мультимодального понимания
Монополия ИИ меняется. DeepSeek-VL2 предлагает визуально-языковой интеллект уровня GPT-4o за малую долю стоимости, показывая, что открытые модели не просто догоняют. Они прокладывают путь. Может ли это означать конец дорогого, закрытого ИИ?
Большие визуально-языковые модели (VLMs) стали преобразующей силой в искусственном интеллекте. Они расширяют впечатляющие возможности больших языковых моделей (LLMs), позволяя им бесшовно обрабатывать визуальную и текстовую информацию. Они решают такие задачи, как ответы на визуальные вопросы и анализ документов. Однако VLMs сталкиваются с проблемой высоких вычислительных затрат. Им также сложно работать с изображениями высокого разрешения и различными соотношениями сторон, во многом из-за квадратичного роста вычислений, обычно связанного с увеличением разрешения изображений.
DeepSeek-VL2, продвинутая серия больших Mixture-of-Experts (MoE) визуально-языковых моделей, решает эти проблемы. Она вводит динамическую стратегию кодирования изображений высокого разрешения и оптимизированную архитектуру языковой модели, которая улучшает визуальное понимание и значительно повышает эффективность обучения и инференса. Еще одним ключевым достижением является усовершенствованный конвейер построения визуально-языковых данных, который повышает общую производительность и расширяет возможности модели в новых областях, таких как точная визуальная привязка.
DeepSeek-VL2 демонстрирует превосходные возможности в различных задачах, включая, помимо прочего, ответы на визуальные вопросы, оптическое распознавание символов, понимание документов/таблиц/диаграмм и визуальную привязку. При оценке на широко используемых мультимодальных бенчмарках,
DeepSeek-VL2 достигает схожей или лучшей производительности по сравнению с передовой моделью при меньшем количестве активированных параметров. В частности, на OCRBench она набирает 834 балла, превосходя GPT-4o с 736. Она также достигает 93.3% на DocVQA в задачах визуального ответа на вопросы. Качественная оценка подчеркивает ее способность рассуждать по нескольким изображениям и генерировать связные визуальные повествования.
Средняя производительность по сравнению с активированными параметрами среди различных open-source моделей | Источник
В этом блоге рассматриваются технические достижения DeepSeek-VL2 в области зрения и языка. Мы подробно анализируем ее результаты на бенчмарках и улучшения эффективности, а также рассматриваем ее роль в демократизации высокопроизводительного мультимодального ИИ.
DeepSeek-VL2: Базовая архитектура модели
В основе DeepSeek-VL2 лежит хорошо структурированная архитектура, созданная для улучшения мультимодального понимания. Объединяя фреймворк Mixture-of-Experts (MoE) с продвинутым конвейером обработки Vision-Language (VL), DeepSeek-VL2 эффективно интегрирует визуальную и текстовую информацию.
Обзор архитектуры DeepSeek-VL2 | Источник
Ниже приведено объяснение основных модулей DeepSeek-VL2:
Визуальный энкодер
Визуальный энкодер предназначен для эффективного извлечения визуальных признаков высокого разрешения. Визуальный энкодер в DeepSeek-VL2 использует динамическую стратегию тайлинга, разработанную для обработки изображений высокого разрешения. Подход заключается в разделении изображения высокого разрешения на тайлы, чтобы обеспечить эффективную обработку различных изображений высокого разрешения с разными соотношениями сторон.
DeepSeek-VL2 использует визуальный энкодер SigLIP-SO400M-384. Визуальный энкодер работает с базовым разрешением 384x384. Чтобы поддерживать изображения высокого разрешения с различными соотношениями сторон, изображение сначала изменяется в размере и разделяется на тайлы размером 384x384 пикселей. Мы определяем набор кандидатных разрешений CR:
CR = {(m .384, n .384) | mN, n N, 1m,n,mn9}
где m:n представляет соотношение сторон.
Отступы, необходимые для изменения размера каждого входного изображения до каждого кандидата, рассчитываются, и выбирается кандидат с минимальными отступами. Минимизация отступов снижает вычислительные накладные расходы и обеспечивает сохранение большего объема содержимого изображения, повышая эффективность обработки. Изображение с измененным размером делится на мини-локальные тайлы размером 384 × 384 и один глобальный миниатюрный тайл. Визуальный энкодер SigLIP-SO400M-384 обрабатывает все ( 1+mini ) тайлы, создавая 729 визуальных эмбеддингов размерностью 1152 на тайл.
Визуально-языковой (VL) адаптер
После извлечения визуальных признаков визуально-языковой адаптер перестраивает и сжимает токены, чтобы преодолеть разрыв между визуальными и текстовыми представлениями. Этот шаг обеспечивает бесшовную интеграцию визуальных и текстовых данных путем введения специальных токенов для кодирования пространственных отношений.
Сначала операция pixel shuffle 2×2 уменьшает пространственные размеры токенов каждого тайла с 27×27 до 14×14=196 токенов. Затем адаптер вставляет специальные токены для кодирования пространственных отношений между тайлами.
Глобальная миниатюра: Для глобального миниатюрного тайла 14 токенов
<tile_newline>добавляются в конец каждой строки, в результате чего общее количество составляет 14 строк × 15 токенов = 210 токенов.Локальные тайлы: Для mn локальных тайлов, расположенных в сетке (mi .14, ni .14), система добавляет mi .14 токенов
<tile_newline>для обозначения конца каждой строки всех локальных тайлов.Разделитель: Токен
<view_separator>добавляется между глобальными и локальными тайлами.
Такой структурированный вывод гарантирует, что модель понимает пространственную компоновку разбитого на тайлы изображения. Итоговая последовательность визуальных токенов 210+1+ mi⋅14 × (ni⋅14 +1) проецируется в пространство эмбеддингов LLM через двухслойный MLP.
Иллюстрация стратегии динамического тайлинга в DeepSeek-VL2 | Источник
Большая языковая модель DeepSeekMoE
Языковая основа DeepSeek-VL2 построена на модели Mixture-of-Experts (MoE), дополненной Multi-head Latent Attention (MLA). MLA повышает эффективность инференса, сжимая кэш Key-Value в латентный вектор, снижая накладные расходы памяти и увеличивая пропускную способность. Это позволяет DeepSeek-VL2 более эффективно обрабатывать длинноконтекстные последовательности, сохраняя вычислительную эффективность.
Архитектура MoE обеспечивает эффективный инференс за счет разреженных вычислений, при которых во время инференса выбираются только шесть лучших экспертов. Это значительно снижает вычислительные затраты при сохранении производительности. Во время обучения для каждого эксперта вводится глобальный член смещения, чтобы улучшить балансировку нагрузки и оптимизировать эффективность обучения.
DeepSeek-VL2 доступна в трех вариантах модели, каждый с разным количеством активированных параметров и экспертов:
DeepSeek-VL2-Tiny: 1.0B параметров, 64 эксперта
DeepSeek-VL2-Small: 2.8B параметров, 64 эксперта
DeepSeek-VL2: 4.5B параметров, 72 эксперта
Методология обучения
DeepSeek-VL2 использует трехэтапный конвейер обучения, который балансирует мультимодальное понимание с вычислительной эффективностью. Общий процесс разделен на три фазы:
Визуально-языковое выравнивание
Визуально-языковое предварительное обучение
Контролируемая тонкая настройка
Высокоуровневые фазы в конвейере обучения
Прежде чем обсуждать конвейер обучения, мы рассмотрим построение данных и наборы данных, используемые на разных этапах обучения.
Построение данных
Для DeepSeek-VL2 был создан комплексный визуально-языковой набор данных из разнообразных источников. В этом разделе мы опишем данные, используемые на разных этапах конвейера обучения.
Данные для визуально-языкового выравнивания
На этапе VL Alignment основное внимание уделяется связыванию визуальных признаков с текстовыми эмбеддингами. Для этой начальной фазы используется набор данных ShareGPT4V. Этот набор данных включает примерно 1,2 миллиона примеров подписей и диалогов.
Данные для предобучения Vision-Language
Данные для предобучения объединяют данные vision-language (VL) и данные только с текстом, чтобы сбалансировать VL-возможности и производительность на текстовых данных. На этом этапе около 70% данных поступает из источников vision-language, а оставшиеся 30% — это данные только с текстом, полученные из корпуса предобучения LLM.
Категории используемых VL-данных описаны ниже:
Перемежающиеся данные изображение-текст: Датасеты с открытым исходным кодом, такие как WIT, WikiHow, и выборки из OBELICS предоставляют разнообразные пары изображение-текст для общих знаний о реальном мире.
Данные для описания изображений: Первоначальные эксперименты с открытыми датасетами показали нестабильное качество (например, несоответствующий текст, галлюцинации). Был использован комплексный пайплайн описания изображений, который учитывает подсказки OCR, метаданные и исходные описания как промпты для повторного описания изображений с помощью внутренней модели. Эти курированные повторно описанные данные использовались при обучении.
Данные оптического распознавания символов (OCR): Публичные датасеты, такие как LaTeX OCR и 12M RenderedText, были объединены с обширными внутренними OCR-данными, охватывающими различные типы документов.
Данные визуальных вопросов-ответов (QA): Данные Visual QA состоят из четырех категорий: общий VQA (из DeepSeek-VL), понимание документов (PubTabNet, FinTabNet, Docmatix), генерация web-to-code/plot-to-Python (Websight и Jupyter notebooks, доработанные с помощью DeepSeek V2.5), а также QA с визуальными подсказками (наложение индикаторов, таких как стрелки/рамки, на изображения для создания сфокусированных пар QA).
- Данные визуального заземления: Для визуального заземления был создан датасет. Для аннотаций обнаружения объектов каждого изображения данные были структурированы следующим образом с использованием специальных токенов <|ref|>, <|/ref|>, <|det|>, <|/det|>:
Промпт: Найдите <|ref|>
<|/ref|> на данном изображении. Ответ: <|ref|>
<|/ref|><|det|>[[x1, y1, x2, y2],...]<|/det|>
- Данные заземленного диалога: Диалоговый датасет, в котором промпты и ответы включают специальные токены заземления для связывания диалога с конкретными областями изображения.
Данные для обучения с учителем
Этап обучения с учителем тонкой настройки улучшает способность модели следовать инструкциям и вести диалог. Охватываемые аспекты включают:
Общие визуальные вопросы-ответы: Публичные датасеты visual QA часто страдают от коротких ответов, плохого OCR и галлюцинаций. Новый датасет был создан путем повторной генерации ответов с использованием исходных вопросов, изображений и OCR-данных.
OCR и понимание документов: Использовались очищенные существующие OCR-датасеты путем удаления образцов с низким качеством OCR.
Понимание таблиц и диаграмм: Данные QA на основе таблиц были улучшены путем повторной генерации ответов на основе исходных вопросов для создания данных высокого качества.
Рассуждение, логика и математика: Для повышения ясности публичные датасеты по рассуждениям улучшены подробными процессами и стандартизированными форматами ответов.
Учебники и академические вопросы: Внутренние коллекции учебников уровня колледжа, ориентированные на академический контент по множеству дисциплин.
Генерация web-to-code и plot-to-Python: Внутренние датасеты были расширены открытыми датасетами после генерации ответов для повышения качества.
Визуальное заземление: Данные с аннотациями обнаружения объектов помогают модели точно находить и описывать объекты.
Заземленный диалог: Диалоговые датасеты включают токены заземления, чтобы связывать диалог с областями изображения для улучшенного взаимодействия.
Датасеты только с текстом: Датасеты для instruction-tuning только с текстом также используются для поддержания языковых возможностей модели.
Обучающие пайплайны
Перед началом обучения процесс разделяется на определенные этапы. Такая структура обеспечивает плавные переходы между выравниванием, предварительным обучением и тонкой настройкой. Изначально обучаются визуальный энкодер и MLP-адаптер vision-language, в то время как языковая модель остается фиксированной. Позднее все параметры модели размораживаются для масштабного предварительного обучения, и, наконец, модель тонко настраивается с использованием данных с учителем. На каждом этапе функция потерь вычисляется исключительно по текстовым токенам, чтобы приоритизировать изучение визуального контекста.
- Vision-Language Alignment: Этап VL Alignment связывает визуальные признаки с текстовыми эмбеддингами. Для обучения используется датасет ShareGPT4V, состоящий примерно из 1,2 миллиона пар изображение-текст. На этом этапе языковая модель остается замороженной. Обучаются только визуальный энкодер и адаптер, при этом для объединения визуальных и текстовых признаков используется легковесный MLP-коннектор. Этот этап адаптирует энкодеры с фиксированным разрешением для обработки динамических входов высокого разрешения.
- Vision-Language Pre-training: На этапе VL Pre-training все параметры размораживаются для оптимизации. Смесь данных состоит на 70% из vision-language-данных и на 30% из данных только с текстом. VL-данные включают перемежающиеся пары изображение-текст, охватывающие такие задачи, как OCR и анализ документов. Данные только с текстом берутся из корпуса предварительного обучения LLM. Для построения совместных представлений визуальных и текстовых входов в обучении используется около 800 миллиардов токенов изображение-текст.
- Supervised Fine-Tuning: Во время Supervised Fine-Tuning уточняются способности модели следовать инструкциям и вести диалог. На этом этапе используются тщательно отобранные пары вопрос-ответ из публичных датасетов и внутренних данных. Мультимодальные диалоговые данные объединяются с текстовыми диалогами из DeepSeek-V2, а системные/пользовательские промпты маскируются, чтобы обучение с учителем применялось только к ответам и специальным токенам.
Гиперпараметры и инфраструктура
Конфигурация гиперпараметров для DeepSeek-VL2 подробно представлена в приведенной таблице. Во время обучения на разных этапах используются специально подобранные настройки. Например, на этапе 1 для DeepSeek-VL2-Tiny скорость обучения установлена на уровне 5.4×10⁻⁴, тогда как на этапе 3 она снижается до 3.0×10⁻⁵. Step LR Scheduler делит скорость обучения на √10 на отметках 50% и 75% от общего числа шагов обучения. К скорости обучения визуального энкодера применяется фиксированный множитель 0.1. На ранних этапах используются косинусные планировщики скорости обучения, а на финальном этапе — постоянное расписание. Дополнительные настройки включают weight decay 0.1, отсечение градиентов на уровне 1.0 и оптимизатор AdamW, настроенный с β₁ = 0.9 и β₂ = 0.95.
Гиперпараметры для обучения DeepSeek-VL2 | Источник
Обучение выполняется на платформе HAI-LLM, легковесной системе, разработанной для больших моделей. В пайплайне используется мелкозернистое разделение слоев для визуального энкодера, чтобы обеспечить балансировку нагрузки между GPU, что помогает предотвращать «пузыри» в конвейере. Балансировка нагрузки по тайлам изображений также выполняется между рангами data parallel для обработки вариативности, возникающей из-за стратегии динамического разрешения.
Кроме того, для максимизации эффективности используются методы tensor parallelism и expert parallelism. В сочетании с тщательной настройкой гиперпараметров эти инфраструктурные решения позволяют DeepSeek-VL2 эффективно обрабатывать миллиарды обучающих токенов, сохраняя при этом устойчивую мультимодальную производительность.
DeepSeek-VL2 обучалась за 7/10/14 дней с использованием кластера из 16/33/42 узлов, каждый из которых оснащен 8 GPU NVIDIA A100.
Оценка
Теперь мы рассмотрим производительность DeepSeek-VL2 с использованием стандартных бенчмарков и качественных тестов. В следующих разделах изложены результаты оценки и сравнение DeepSeek-VL2 с моделями уровня state-of-the-art.
Бенчмарки
DeepSeek-VL2 оценивается на ряде широко используемых бенчмарков. К ним относятся DocVQA, ChartQA, InfoVQA, TextVQA, RealWorldQA, OCRBench, AI2D, MMMU, MMStar, MathVista, MME, MMBench (и MMBench-V1.1), а также MMT-Bench. Кроме того, способность модели к grounding проверяется на бенчмарках RefCOCO, RefCOCO+ и RefCOCOg. Эти тесты охватывают задачи от понимания документов и интерпретации диаграмм до решения реальных проблем, обеспечивая всестороннюю оценку производительности модели.
Сравнение с современным уровнем
DeepSeek-VL2 сравнивалась с несколькими современными vision-language моделями, такими как LLaVA-OV, InternVL2, DeepSeek-VL, Qwen2-VL, Phi-3.5-Vision, Molmo, Pixtral, MM1.5 и Aria-MoE, на бенчмарках мультимодального понимания. В задачах grounding модель DeepSeek-VL2 превосходит другие, такие как Grounding DINO, UNINEXT, ONE-PEACE, mPLUG-2, Florence-2, InternVL2, Shikra, TextHawk2, Ferret-v2 и MM1.5.
Сравнение с современными моделями на общих QA- и связанных с математикой мультимодальных бенчмарках | Источник
DeepSeek-VL2 достигает аналогичной или лучшей производительности при меньшем числе активированных параметров. Она демонстрирует конкурентоспособную производительность на разнообразных мультимодальных бенчмарках, соответствуя более крупным моделям, таким как Qwen2-VL-7B (8.3B) и InternVL2-8B (8.0B), или превосходя их в таких задачах, как MMBench (83.1 против 85.0) и MME (2,253 против 2,327).
Несмотря на меньшее число активированных параметров, она приближается к производительности GPT-4o на MMStar (61.3 против 63.9) и превосходит большинство моделей с открытым исходным кодом в задачах с высокой нагрузкой на OCR, таких как AIDD (81.4). Эффективность модели, обеспеченная ее архитектурой MoE, успешно балансирует возможности и вычислительные затраты.
Сравнение с современными моделями на мультимодальных бенчмарках, связанных с OCR | Источник
DeepSeek-VL2 достигает конкурентоспособной производительности в задачах OCR, соответствуя более крупным моделям, таким как Qwen2-VL-7B, в TextVQA (84.2 против 84.3) и превосходя GPT-4o в DocVQA (93.3 против 92.8). Ее результаты в ChartQA (86.0) и InfoVQA (78.1) превышают показатели большинства аналогов с открытым исходным кодом, а ее эффективность сокращает разрыв с закрытыми моделями, такими как Claude 3.5 Sonnet (OCRBench: 811 против 788). Это демонстрирует надежные возможности OCR несмотря на компактную архитектуру.
Качественное исследование
Качественное исследование демонстрирует возможности DeepSeek-VL2 в различных задачах. Ключевые области включают:
- Общее визуальное ответы на вопросы: Модель предоставляет подробные ответы, точно описывает насыщенное содержимое изображений и распознает достопримечательности как на английском, так и на китайском. Она обладает многогранными возможностями, включая распознавание достопримечательностей, сочинение стихов на основе изображений, ответы на вопросы об общих знаниях, понимание диаграмм, распознавание текста и многое другое.
Общая способность DeepSeek-VL2 отвечать на вопросы | Источник
- Диалог по нескольким изображениям: Она эффективно анализирует связи и различия между несколькими изображениями, обеспечивая простые рассуждения путем интеграции содержимого нескольких изображений. Например, она может рассмотреть, как приготовить блюдо на основе изображений определенных ингредиентов.
Возможность DeepSeek-VL2 вести диалог по нескольким изображениям | Источник
- Визуальное повествование: DeepSeek-VL2 может генерировать креативные повествования на основе серии изображений, сохраняя контекст и связность. Ее повествование отражает понимание временного развития и переходов между сценами, добавляя глубину сгенерированным историям.
Возможности визуального сторителлинга DeepSeek-VL2 | Источник
- Визуальная привязка: Модель успешно идентифицирует и локализует объекты на изображениях, обобщая их от естественных сцен до разнообразных сценариев, таких как мемы и аниме. Она демонстрирует устойчивую производительность даже тогда, когда объекты частично скрыты или представлены в сложных условиях.
Способность DeepSeek-VL2 к визуальной привязке | Источник
- Диалог с привязкой: Благодаря использованию специальных токенов привязки <|grounding|> модель ссылается на ключевые объекты с точными сведениями об их местоположении, расширяя свои интерактивные возможности. Ее ответы с привязкой способствуют практическому применению в реальных интерактивных системах.
Диалог с привязкой в DeepSeek-VL2 | Источник
Ключевые выводы
- Эффективность и масштабируемость: DeepSeek-VL2 достигает конкурентоспособных результатов с меньшим числом активированных параметров благодаря эффективной архитектуре MoE и подходу динамического тайлинга. Такой баланс между производительностью и использованием ресурсов позволяет развертывать модель в средах с ограниченными вычислительными возможностями.
- Устойчивое мультимодальное понимание: Модель превосходно справляется с задачами, охватывающими OCR, анализ документов и визуальную привязку. Ее способность интегрировать визуальную и текстовую информацию обеспечивает высокую точность в разнообразных приложениях.
- Улучшенное следование инструкциям и диалоговые навыки: Модель демонстрирует заметные улучшения в генерации связных и учитывающих контекст ответов благодаря контролируемой донастройке. Это уточнение усиливает ее производительность в интерактивных и диалоговых сценариях.
- Применимость в реальном мире: Высокие результаты, наблюдаемые как в количественных бенчмарках, так и в качественных исследованиях, указывают на то, что DeepSeek-VL2 хорошо подходит для практических приложений, таких как автоматизированная обработка документов, виртуальные ассистенты и интерактивные системы в embodied AI.
Потенциальные направления будущих исследований
DeepSeek-VL2 — это улучшенная версия моделей vision-language на основе MoE, доступная в трех размерах: 3B, 16B и 27B общих параметров, с 1.0B, 2.8B и 4.5B активированными. Такая продуманная архитектура делает как обучение, так и инференс более эффективными. Она позволяет запускать самую маленькую модель на одном GPU всего с 10 GB памяти, тогда как более крупным вариантам требуется 40 GB и 80 GB.
Одна из выдающихся особенностей — стратегия динамического тайлинга, которая умело обрабатывает изображения высокого разрешения с различными соотношениями сторон. Публикуя код и предварительно обученные модели в открытом доступе, DeepSeek-VL2 вдохновит дальнейшие исследования и инновационные приложения на захватывающем стыке зрения и языка.
Есть несколько областей, в которых DeepSeek-VL2 можно улучшить.
- Контекстное окно: В настоящее время модель поддерживает только несколько изображений за один сеанс чата. Будущие обновления могут расширить контекстное окно, чтобы обеспечить более насыщенные взаимодействия с несколькими изображениями.
- Устойчивость к качеству изображений: Модель иногда сталкивается с трудностями при работе с размытыми изображениями или невиданными ранее объектами. Решение этих проблем может повысить ее надежность в разнообразных сценариях.
- Способности к рассуждению: Хотя модель хорошо справляется с визуальным восприятием и распознаванием, ее способности к рассуждению можно усилить. Укрепление этого аспекта может расширить ее потенциал применения в реальном мире.
Дополнительные ресурсы
- Научная статья: DeepSeek-VL2: Mixture-of-Experts Vision-Language Models
Читать далее

Zilliz Cloud Just Landed in Claude Code
The Zilliz Cloud Plugin brings the full power of Zilliz Cloud directly into your Claude Code terminal as natural-language conversations.

3 Easiest Ways to Use Claude Code on Your Mobile Phone
Run Claude Code from your phone with Remote Control, Happy Coder, or SSH + Tailscale. Comparison table, setup steps, and tools for typing, memory, and parallel tasks.

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.



