DeepSeek-VL2: 고급 멀티모달 이해를 위한 Mixture-of-Experts 비전-언어 모델
AI 독점 구도가 바뀌고 있습니다. DeepSeek-VL2는 훨씬 낮은 비용으로 GPT-4o 수준의 비전-언어 지능을 제공하며, 오픈 모델이 단순히 따라잡는 데 그치지 않는다는 것을 보여줍니다. 오픈 모델은 앞서 나가고 있습니다. 이것이 비싸고 폐쇄적인 AI의 종말을 의미할 수 있을까요?
대형 비전-언어 모델 (VLMs)은 인공지능에서 혁신적인 힘으로 부상했습니다. 이들은 대형 언어 모델(LLMs)의 뛰어난 능력을 확장하여 시각 정보와 텍스트 정보를 매끄럽게 처리합니다. 시각적 질문에 답하기 및 문서 분석과 같은 작업을 처리합니다. 그러나 VLMs는 높은 계산 비용이라는 과제에 직면해 있습니다. 또한 고해상도 이미지와 다양한 종횡비를 처리하는 데 어려움을 겪는데, 이는 주로 이미지 해상도가 증가함에 따라 일반적으로 수반되는 이차 계산 스케일링 때문입니다.
DeepSeek-VL2는 대형 Mixture-of-Experts (MoE) 비전-언어 모델의 고급 시리즈로, 이러한 문제를 해결합니다. 동적 고해상도 비전 인코딩 전략과 최적화된 언어 모델 아키텍처를 도입하여 시각적 이해를 향상시키고 학습 및 추론 효율성을 크게 개선합니다. 또 다른 핵심 발전은 전체 성능을 높이고 정밀한 시각적 그라운딩과 같은 새로운 영역에서 모델의 역량을 확장하는 정교한 비전 언어 데이터 구축 파이프라인입니다.
DeepSeek-VL2는 시각적 질의응답, 광학 문자 인식, 문서/표/차트 이해, 시각적 그라운딩 등을 포함하되 이에 국한되지 않는 다양한 작업에서 뛰어난 능력을 보여줍니다. 일반적으로 사용되는 멀티모달 벤치마크에서 평가했을 때,
DeepSeek-VL2는 더 적은 활성화 파라미터로 최신 모델과 유사하거나 더 나은 성능을 달성합니다. 특히 OCRBench에서 834점을 기록해 GPT-4o의 736점을 능가합니다. 또한 시각적 질의응답 작업을 위한 DocVQA에서 93.3%를 달성합니다. 정성적 평가는 여러 이미지에 걸쳐 추론하고 일관된 시각적 내러티브를 생성하는 능력을 강조합니다.
다양한 오픈 소스 모델 간 평균 성능 vs. 활성화 파라미터 | 출처
이 블로그에서는 DeepSeek-VL2의 비전 및 언어 분야 기술적 발전을 다룹니다. 벤치마크 결과와 효율성 개선을 자세히 분석하고, 고성능 멀티모달 AI의 민주화에서 그 역할을 살펴봅니다.
DeepSeek-VL2: 핵심 모델 아키텍처
DeepSeek-VL2의 핵심에는 멀티모달 이해를 향상시키도록 구축된 잘 구조화된 아키텍처가 있습니다. Mixture-of-Experts (MoE) 프레임워크와 고급 Vision-Language (VL) 처리 파이프라인을 결합함으로써, DeepSeek-VL2는 시각 정보와 텍스트 정보를 효율적으로 통합합니다.
DeepSeek-VL2의 아키텍처 개요 | 출처
아래는 DeepSeek-VL2의 핵심 모듈에 대한 설명입니다:
비전 인코더
비전 인코더는 고해상도 시각적 특징을 효율적으로 추출하도록 설계되었습니다. DeepSeek-VL2의 비전 인코더는 고해상도 이미지 처리를 위해 설계된 동적 타일링 전략을 사용합니다. 이 접근 방식은 고해상도를 타일로 분할하여 다양한 종횡비를 가진 서로 다른 고해상도 이미지를 효율적으로 처리할 수 있게 하는 것입니다.
DeepSeek-VL2는 SigLIP-SO400M-384 비전 인코더를 사용합니다. 비전 인코더는 384x384의 기본 해상도에서 작동합니다. 다양한 종횡비의 고해상도 이미지를 수용하기 위해, 이미지는 먼저 크기가 조정되고 384x384 픽셀의 타일로 분할됩니다. 후보 해상도 집합 CR을 다음과 같이 정의합니다:
CR = {(m .384, n .384) | mN, n N, 1m,n,mn9}
여기서 m:n은 종횡비를 나타냅니다.
각 입력 이미지를 각 후보 크기로 조정하는 데 필요한 패딩을 계산하고, 패딩이 가장 적은 후보를 선택합니다. 패딩을 최소화하면 계산 오버헤드가 줄어들고 더 많은 이미지 콘텐츠가 유지되어 처리 효율성이 향상됩니다. 크기가 조정된 이미지는 384 × 384 크기의 미니 로컬 타일과 하나의 글로벌 썸네일 타일로 나뉩니다. SigLIP-SO400M-384 비전 인코더는 모든 ( 1+mini ) 타일을 처리하여, 타일당 1152차원의 시각 임베딩 729개를 생성합니다.
비전-언어(VL) 어댑터
시각 특징 추출 후, 비전-언어 어댑터는 토큰을 재구성하고 압축하여 시각적 표현과 텍스트 표현 간의 간극을 연결합니다. 이 단계는 공간적 관계를 인코딩하기 위한 특수 토큰을 도입하여 시각 및 텍스트 데이터의 원활한 통합을 가능하게 합니다.
먼저, 2×2 픽셀 셔플 연산은 각 타일 토큰의 공간 차원을 27×27에서 14×14=196 토큰으로 줄입니다. 그런 다음 어댑터는 타일 간의 공간적 관계를 인코딩하기 위해 특수 토큰을 삽입합니다.
글로벌 썸네일: 글로벌 썸네일 타일의 경우, 각 행의 끝에 14개의
<tile_newline>토큰이 추가되어 총 14행 × 15토큰 = 210토큰이 됩니다.로컬 타일: 그리드(mi .14, ni .14)에 배열된 mn개의 로컬 타일의 경우, 시스템은 모든 로컬 타일의 각 행 끝을 표시하기 위해 mi .14개의
<tile_newline>토큰을 추가합니다.구분자: 글로벌 타일과 로컬 타일 사이에
<view_separator>토큰이 추가됩니다.
이 구조화된 출력은 모델이 타일링된 이미지의 공간 레이아웃을 이해하도록 보장합니다. 최종 시각 토큰 시퀀스 210+1+ mi⋅14 × (ni⋅14 +1) 는 2계층 MLP를 통해 LLM의 임베딩 공간으로 투영됩니다.
DeepSeek-VL2의 동적 타일링 전략 그림 | 출처
DeepSeekMoE 대형 언어 모델
DeepSeek-VL2의 언어 백본은 Multi-head Latent Attention(MLA)으로 강화된 Mixture-of-Experts(MoE) 모델을 기반으로 구축되었습니다. MLA는 Key-Value 캐시를 잠재 벡터로 압축하여 메모리 오버헤드를 줄이고 처리량 용량을 늘림으로써 추론 효율성을 높입니다. 이를 통해 DeepSeek-VL2는 계산 효율성을 유지하면서 긴 컨텍스트 시퀀스를 더 효과적으로 처리할 수 있습니다.
MoE 아키텍처는 희소 계산을 통해 효율적인 추론을 가능하게 하며, 추론 중에는 상위 6개 전문가만 선택됩니다. 이는 성능을 유지하면서 계산 비용을 크게 줄입니다. 학습 중에는 각 전문가에 대해 전역 바이어스 항이 도입되어 부하 분산을 개선하고 학습 효율성을 최적화합니다.
DeepSeek-VL2는 각각 활성화된 매개변수와 전문가 수가 다른 세 가지 모델 변형으로 제공됩니다:
DeepSeek-VL2-Tiny: 1.0B 매개변수, 64개 전문가
DeepSeek-VL2-Small: 2.8B 매개변수, 64개 전문가
DeepSeek-VL2: 4.5B 매개변수, 72개 전문가
학습 방법론
DeepSeek-VL2는 멀티모달 이해와 계산 효율성의 균형을 맞추는 3단계 학습 파이프라인을 사용합니다. 전체 프로세스는 세 단계로 나뉩니다:
비전-언어 정렬
비전-언어 사전 학습
지도 미세 조정
학습 파이프라인의 상위 수준 단계
학습 파이프라인을 논의하기 전에, 다양한 학습 단계에서 사용되는 데이터 구성과 데이터셋에 대해 알아보겠습니다.
데이터 구성
DeepSeek-VL2를 위해 다양한 출처의 포괄적인 비전-언어 데이터셋이 구축되었습니다. 이 섹션에서는 학습 파이프라인의 여러 단계에서 사용된 데이터를 설명합니다.
비전-언어 정렬 데이터
VL 정렬 단계에서는 시각 특징과 텍스트 임베딩을 연결하는 데 중점을 둡니다. ShareGPT4V 데이터셋은 이 초기 단계에 사용됩니다. 이 데이터셋은 약 120만 개의 캡션 및 대화 샘플로 구성됩니다.
비전-언어 사전 학습 데이터
사전 학습 데이터는 비전-언어(VL)와 텍스트 전용 데이터를 결합하여 VL 역량과 테스트 전용 성능의 균형을 맞춥니다. 이 단계에서는 데이터의 약 70%가 비전-언어 소스에서 나오며, 나머지 30%는 LLM 사전 학습 코퍼스에서 가져온 텍스트 전용 데이터입니다.
사용된 VL 데이터의 범주는 다음과 같습니다:
인터리브된 이미지-텍스트 데이터: WIT, WikiHow와 같은 오픈 소스 데이터셋 및 OBELICS의 샘플은 일반적인 실제 세계 지식을 위한 다양한 이미지-텍스트 쌍을 제공합니다.
이미지 캡셔닝 데이터: 오픈 소스 데이터셋을 사용한 초기 실험에서는 일관되지 않은 품질(예: 불일치하는 텍스트, 환각)이 나타났습니다. OCR 힌트, 메타데이터, 원본 캡션을 프롬프트로 고려하여 사내 모델로 이미지를 다시 캡션하는 포괄적인 이미지 캡셔닝 파이프라인이 사용되었습니다. 이렇게 선별된 재캡션 데이터가 학습에 사용되었습니다.
광학 문자 인식(OCR) 데이터: LaTeX OCR 및 12M RenderedText와 같은 공개 데이터셋을 다양한 문서 유형을 포괄하는 광범위한 사내 OCR 데이터와 결합했습니다.
시각적 질문-응답(QA) 데이터: 시각적 QA 데이터는 네 가지 범주로 구성됩니다: 일반 VQA(DeepSeek-VL에서 제공), 문서 이해(PubTabNet, FinTabNet, Docmatix), 웹-투-코드/플롯-투-Python 생성(Websight 및 Jupyter notebooks, DeepSeek V2.5로 정제), 시각적 프롬프트가 포함된 QA(이미지 위에 화살표/상자와 같은 표시기를 오버레이하여 집중된 QA 쌍 생성).
- 시각적 그라운딩 데이터: 시각적 그라운딩을 위한 데이터셋이 구축되었습니다. 각 이미지의 객체 감지 주석에 대해, 데이터는 특수 토큰 <|ref|>, <|/ref|>, <|det|>, <|/det|>를 사용하여 다음과 같이 구조화되었습니다:
프롬프트: 주어진 이미지에서 <|ref|>
<|/ref|>를 찾으세요. 응답: <|ref|>
<|/ref|><|det|>[[x1, y1, x2, y2],...]<|/det|>
- 그라운딩된 대화 데이터: 프롬프트와 응답에 특수 그라운딩 토큰을 포함하여 대화를 특정 이미지 영역과 연결하는 대화형 데이터셋입니다.
지도 미세 조정 데이터
지도 미세 조정 단계는 모델의 지시 따르기 및 대화 성능을 개선합니다. 다루는 측면은 다음과 같습니다:
일반 시각적 질문-응답: 공개 시각적 QA 데이터셋은 종종 짧은 응답, 낮은 OCR 품질, 환각 문제를 겪습니다. 원본 질문, 이미지, OCR 데이터를 사용하여 답변을 재생성함으로써 새로운 데이터셋이 생성되었습니다.
OCR 및 문서 이해: OCR 품질이 낮은 샘플을 제거하여 정제된 기존 OCR 데이터셋을 사용했습니다.
표 및 차트 이해: 고품질 데이터를 만들기 위해 원본 질문을 기반으로 응답을 재생성하여 표 기반 QA 데이터를 강화했습니다.
추론, 논리, 수학: 명확성을 개선하기 위해 공개 추론 데이터셋은 상세한 과정과 표준화된 응답 형식으로 강화됩니다.
교과서 및 학술 질문: 내부 대학 수준 교과서 컬렉션은 여러 학문 분야의 학술 콘텐츠에 초점을 맞췄습니다.
웹-투-코드 및 플롯-투-Python 생성: 품질을 개선하기 위해 응답 생성 후 오픈 소스 데이터셋으로 사내 데이터셋을 확장했습니다.
시각적 그라운딩: 객체 감지 주석이 있는 데이터는 모델이 객체를 정확하게 찾고 설명하도록 안내합니다.
그라운딩된 대화: 대화형 데이터셋은 향상된 상호작용을 위해 대화를 이미지 영역과 연결하는 그라운딩 토큰을 통합합니다.
텍스트 전용 데이터셋: 모델의 언어 역량을 유지하기 위해 텍스트 전용 지시 조정 데이터셋도 사용됩니다.
학습 파이프라인
훈련을 시작하기 전에, 프로세스는 정의된 단계들로 나뉩니다. 이 구조는 정렬, 사전 훈련, 파인튜닝 간의 원활한 전환을 보장합니다. 초기에는 언어 모델을 고정한 상태로 비전 인코더와 비전-언어 어댑터 MLP를 훈련합니다. 이후에는 광범위한 사전 훈련을 위해 모든 모델 파라미터의 동결을 해제하고, 마지막으로 지도 데이터를 사용해 모델을 파인튜닝합니다. 각 단계에서 손실은 시각적 맥락 학습을 우선시하기 위해 텍스트 토큰에 대해서만 계산됩니다.
- 비전-언어 정렬: VL Alignment 단계는 시각적 특징을 텍스트 임베딩과 연결합니다. 훈련에는 약 120만 개의 이미지-텍스트 쌍으로 구성된 ShareGPT4V 데이터셋이 사용됩니다. 이 단계 동안 언어 모델은 동결된 상태로 유지됩니다. 시각 및 텍스트 특징을 병합하기 위해 경량 MLP 커넥터를 사용하며, 비전 인코더와 어댑터만 훈련됩니다. 이 단계는 고정 해상도 인코더가 동적 고해상도 입력을 처리할 수 있도록 조정합니다.
- 비전-언어 사전 훈련: VL Pre-training 단계에서는 최적화를 위해 모든 파라미터의 동결이 해제됩니다. 데이터 혼합은 70% 비전-언어 데이터와 30% 텍스트 전용 데이터로 구성됩니다. VL 데이터에는 OCR 및 문서 분석과 같은 작업을 포괄하는 인터리브된 이미지-텍스트 쌍이 포함됩니다. 텍스트 전용 데이터는 LLM 사전 훈련 코퍼스에서 가져옵니다. 훈련에는 약 8,000억 개의 이미지-텍스트 토큰을 사용하여 시각 및 텍스트 입력을 위한 공동 표현을 구축합니다.
- 지도 파인튜닝: 지도 파인튜닝 동안 모델의 지시 따르기 및 대화 능력이 개선됩니다. 이 단계에서는 공개 데이터셋과 내부 데이터에서 선별한 질문-답변 쌍을 사용합니다. 멀티모달 대화 데이터는 DeepSeek-V2의 텍스트 전용 대화와 결합되며, system/user 프롬프트는 마스킹되어 감독이 답변과 특수 토큰에만 적용되도록 합니다.
하이퍼파라미터 및 인프라
DeepSeek-VL2의 하이퍼파라미터 구성은 주어진 표에 자세히 나와 있습니다. 훈련 중에는 각 단계마다 맞춤형 설정을 사용합니다. 예를 들어 DeepSeek-VL2-Tiny의 Stage 1에서는 학습률이 5.4×10⁻⁴로 설정되는 반면, Stage 3에서는 3.0×10⁻⁵로 낮아집니다. Step LR Scheduler는 전체 훈련 스텝의 50%와 75% 지점에서 학습률을 √10으로 나눕니다. 비전 인코더의 학습률에는 0.1의 고정 배수가 적용됩니다. 초기 단계에서는 Cosine 학습률 스케줄러가 사용되고, 최종 단계에서는 constant 스케줄이 사용됩니다. 추가 설정에는 0.1의 가중치 감쇠, 1.0의 그래디언트 클리핑, 그리고 β₁ = 0.9 및 β₂ = 0.95로 구성된 AdamW 옵티마이저가 포함됩니다.
DeepSeek-VL2 훈련을 위한 하이퍼파라미터 | 출처
훈련은 대형 모델을 위해 설계된 경량 시스템인 HAI-LLM 플랫폼에서 수행됩니다. 파이프라인은 GPU 간 부하 균형을 보장하기 위해 비전 인코더에 대해 세분화된 레이어 분할을 사용하며, 이는 파이프라인 버블을 방지하는 데 도움이 됩니다. 동적 해상도 전략으로 인해 발생하는 변동성을 처리하기 위해 데이터 병렬 rank 전반에 걸쳐 이미지 타일 부하 균형도 수행됩니다.
또한 효율성을 극대화하기 위해 텐서 병렬화와 전문가 병렬화 기법이 통합됩니다. 이러한 인프라 선택은 세심한 하이퍼파라미터 튜닝과 결합되어 DeepSeek-VL2가 견고한 멀티모달 성능을 유지하면서 수십억 개의 훈련 토큰을 효율적으로 처리할 수 있게 합니다.
DeepSeek-VL2는 각각 8개의 NVIDIA A100 GPU를 갖춘 16/33/42개 노드 클러스터를 사용하여 7/10/14일 동안 훈련되었습니다.
평가
이제 표준 벤치마크와 정성적 테스트를 사용하여 DeepSeek-VL2의 성능을 살펴봅니다. 다음 섹션에서는 평가 결과를 개괄하고 DeepSeek-VL2를 최첨단 모델들과 비교합니다.
벤치마크
DeepSeek-VL2는 일반적으로 사용되는 다양한 벤치마크에서 평가됩니다. 여기에는 DocVQA, ChartQA, InfoVQA, TextVQA, RealWorldQA, OCRBench, AI2D, MMMU, MMStar, MathVista, MME, MMBench(및 MMBench-V1.1), MMT-Bench가 포함됩니다. 또한 모델의 그라운딩 능력은 RefCOCO, RefCOCO+, RefCOCOg 벤치마크에서 테스트됩니다. 이러한 테스트는 문서 이해와 차트 해석부터 실제 문제 해결까지 다양한 작업을 포괄하며, 모델 성능에 대한 종합적인 측정치를 제공합니다.
최신 기술 수준과의 비교
DeepSeek-VL2는 멀티모달 이해 벤치마크에서 LLaVA-OV, InternVL2, DeepSeek-VL, Qwen2-VL, Phi-3.5-Vision, Molmo, Pixtral, MM1.5, Aria-MoE와 같은 여러 최신 비전-언어 모델과 비교되었습니다. 그라운딩 작업에서 DeepSeek-VL2 모델은 Grounding DINO, UNINEXT, ONE-PEACE, mPLUG-2, Florence-2, InternVL2, Shikra, TextHawk2, Ferret-v2, MM1.5와 같은 다른 모델보다 뛰어난 성능을 보입니다.
일반 QA 및 수학 관련 멀티모달 벤치마크에서 최신 모델과의 비교 | 출처
DeepSeek-VL2는 더 적은 활성화 파라미터로 유사하거나 더 나은 성능을 달성합니다. 다양한 멀티모달 벤치마크에서 경쟁력 있는 성능을 보여주며, MMBench(83.1 대 85.0) 및 MME(2,253 대 2,327)와 같은 작업에서 Qwen2-VL-7B(8.3B) 및 InternVL2-8B(8.0B) 같은 더 큰 모델과 맞먹거나 이를 능가합니다.
활성화 파라미터 수가 더 적음에도 불구하고, MMStar에서는 GPT-4o의 성능에 근접하며(61.3 대 63.9), AIDD(81.4)와 같은 OCR 중심 작업에서는 대부분의 오픈소스 모델보다 뛰어난 성능을 보입니다. MoE 아키텍처를 통해 구현된 모델의 효율성은 성능과 계산 비용의 균형을 효과적으로 맞춥니다.
OCR 관련 멀티모달 벤치마크에서 최신 모델과의 비교 | 출처
DeepSeek-VL2는 OCR 작업에서 경쟁력 있는 성능을 달성하며, TextVQA(84.2 대 84.3)에서 Qwen2-VL-7B 같은 더 큰 모델과 비슷한 성능을 내고 DocVQA(93.3 대 92.8)에서는 GPT-4o를 능가합니다. ChartQA(86.0) 및 InfoVQA(78.1) 점수는 대부분의 오픈소스 동료 모델을 능가하며, 효율성은 Claude 3.5 Sonnet(OCRBench: 811 대 788)과 같은 폐쇄형 모델과의 격차를 좁힙니다. 이는 컴팩트한 아키텍처에도 불구하고 강력한 OCR 능력을 보여줍니다.
정성적 연구
정성적 연구는 다양한 작업에서 DeepSeek-VL2의 능력을 보여줍니다. 주요 영역은 다음과 같습니다.
- 일반 시각 질의응답: 모델은 상세한 응답을 제공하고, 밀도 높은 이미지 콘텐츠를 정확하게 설명하며, 영어와 중국어 모두에서 랜드마크를 인식합니다. 랜드마크 인식, 이미지 기반 시 창작, 일반 지식에 대한 질문 답변, 차트 이해, 텍스트 인식 등 다면적인 능력을 갖추고 있습니다.
DeepSeek-VL2의 일반 질의응답 능력 | 출처
- 다중 이미지 대화: 여러 이미지의 내용을 통합하여 간단한 추론을 가능하게 하면서, 여러 이미지 간의 연관성과 차이점을 효과적으로 분석합니다. 예를 들어 특정 재료의 이미지를 바탕으로 요리를 어떻게 준비할지 고려할 수 있습니다.
DeepSeek-VL2의 다중 이미지 대화 능력 | 출처
- 시각적 스토리텔링: DeepSeek-VL2는 맥락과 일관성을 유지하면서 일련의 이미지를 바탕으로 창의적인 서사를 생성할 수 있습니다. 그 스토리텔링은 시간적 진행과 장면 전환에 대한 이해를 반영하여 생성된 서사에 깊이를 더합니다.
DeepSeek-VL2의 시각적 스토리텔링 능력 | 출처
- 시각적 그라운딩: 이 모델은 이미지 속 객체를 성공적으로 식별하고 위치를 파악하며, 자연 장면에서부터 밈과 애니메이션 같은 다양한 시나리오까지 일반화합니다. 객체가 부분적으로 가려져 있거나 까다로운 조건에서 제시될 때에도 견고한 성능을 보여줍니다.
DeepSeek-VL2의 시각적 그라운딩 능력 | 출처
- 그라운딩 대화: 특수 그라운딩 토큰 <|grounding|>을 사용하여, 이 모델은 정확한 위치 세부 정보와 함께 핵심 객체를 지칭함으로써 상호작용 능력을 향상시킵니다. 그라운딩된 응답은 실제 상호작용 시스템에서의 실용적 응용을 용이하게 합니다.
DeepSeek-VL2와의 그라운딩 대화 | 출처
주요 발견
- 효율성과 확장성: DeepSeek-VL2는 효율적인 MoE 설계와 동적 타일링 접근 방식 덕분에 더 적은 활성화 파라미터로 경쟁력 있는 결과를 달성합니다. 성능과 리소스 사용량 간의 이러한 균형은 제한된 연산 용량을 가진 환경에서의 배포를 가능하게 합니다.
- 견고한 멀티모달 이해: 이 모델은 OCR, 문서 분석, 시각적 그라운딩에 걸친 작업에서 탁월합니다. 시각 정보와 텍스트 정보를 통합하는 능력은 다양한 애플리케이션 전반에서 높은 정확도로 이어집니다.
- 향상된 지시 사항 준수 및 대화 능력: 이 모델은 지도 미세 조정을 통해 일관되고 맥락을 인식하는 응답을 생성하는 데 있어 뚜렷한 개선을 보여줍니다. 이러한 개선은 상호작용 및 대화 환경에서의 성능을 강화합니다.
- 실제 적용 가능성: 정량적 벤치마크와 정성적 연구 모두에서 관찰된 강력한 성능은 DeepSeek-VL2가 자동 문서 처리, 가상 비서, 체화 AI의 상호작용 시스템과 같은 실용적 애플리케이션에 매우 적합함을 나타냅니다.
향후 연구 가능 방향
DeepSeek-VL2는 3B, 16B, 27B 총 파라미터의 세 가지 크기로 제공되는 MoE 기반 비전-언어 모델의 향상된 버전이며, 활성화되는 파라미터는 각각 1.0B, 2.8B, 4.5B입니다. 이러한 스마트한 설계는 학습과 추론을 모두 더 효율적으로 만듭니다. 가장 작은 모델은 단 10 GB의 메모리를 갖춘 단일 GPU에서 실행할 수 있으며, 더 큰 변형 모델은 40 GB와 80 GB가 필요합니다.
두드러진 특징 중 하나는 다양한 화면 비율의 고해상도 이미지를 능숙하게 처리하는 동적 타일링 전략입니다. 코드와 사전 학습된 모델을 공개함으로써 DeepSeek-VL2는 비전과 언어가 만나는 흥미로운 교차점에서 추가 연구와 혁신적인 애플리케이션을 고무할 것입니다.
DeepSeek-VL2가 개선될 수 있는 몇 가지 영역이 있습니다.
- 컨텍스트 윈도우: 현재 이 모델은 채팅 세션당 몇 개의 이미지만 지원합니다. 향후 업데이트에서는 더 풍부한 다중 이미지 상호작용을 허용하도록 컨텍스트 윈도우를 확장할 수 있습니다.
- 이미지 품질에 대한 견고성: 이 모델은 때때로 흐릿한 이미지나 보지 못한 객체에서 어려움을 겪습니다. 이러한 문제를 해결하면 다양한 시나리오에서 신뢰성을 향상시킬 수 있습니다.
- 추론 능력: 이 모델은 시각적 지각과 인식에서 우수한 성능을 보이지만, 추론 능력은 향상될 수 있습니다. 이 측면을 강화하면 실제 적용 가능성을 넓힐 수 있습니다.
추가 자료
계속 읽기

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Zilliz Cloud Update: Smarter Autoscaling for Cost Savings, Stronger Compliance with Audit Logs, and More
What's new in Zilliz Cloud? Smarter autoscaling with scale-down, audit logs GA, enhanced SSO, and Milvus 2.6 in Private Preview.

Introducing DeepSearcher: A Local Open Source Deep Research
In contrast to OpenAI’s Deep Research, this example ran locally, using only open-source models and tools like Milvus and LangChain.



