VidTok: 컴팩트 토큰화로 비디오 처리 재고하기
혼잡한 거리의 영상을 보는 상황을 생각해 보세요. 건물, 나무, 도로는 모든 프레임에서 거의 동일하게 유지되는 반면, 사람과 차량만 움직입니다. 기존 비디오 처리 방식은 각 프레임을 독립적인 이미지로 분석하기 때문에, 한 프레임에서 다음 프레임으로 이어지는 자연스러운 흐름을 활용하지 못한 채 많은 반복 정보를 처리하게 됩니다. 이러한 중복성은 비디오 처리를 비효율적으로 만들어 필요한 것보다 더 많은 저장 공간, 메모리, 연산을 요구합니다.
이를 해결하기 위해, 논문 VidTok: A Versatile and Open-Source Video Tokenizer에서 소개된 VidTok은 비디오 압축과 표현에 대한 새로운 접근 방식을 제시합니다. VidTok은 각 프레임을 개별적으로 처리하는 대신, 원본 비디오를 시각적 세부 정보와 움직임을 모두 포착하는 간결한 토큰으로 변환합니다. 이는 비디오의 핵심 구조를 보존하면서 중복성을 줄여, 비디오 생성, 편집, 검색과 같은 작업을 더 효율적으로 만듭니다.
이 글에서는 기존 비디오 처리의 한계와 VidTok이 어떻게 더 효율적인 대안을 제공하는지 살펴보겠습니다. VidTok의 아키텍처를 분석하고, 공간 및 시간적 특징 추출에 대한 접근 방식을 설명하며, 비디오 데이터를 어떻게 양자화하는지 살펴보겠습니다.
기존 비디오 처리의 한계
많은 비디오 시나리오, 특히 정적인 배경이나 변화가 적은 경우에는 연속된 프레임 간의 콘텐츠가 유사하게 유지됩니다. 기존 방식은 이러한 중복성을 활용하는 대신, 각 프레임을 고립된 이미지로 취급합니다. 이 접근 방식은 비디오 데이터의 연속성을 고려하지 않으며, 성능과 리소스 사용 모두에 영향을 미치는 비효율을 초래합니다.
주요 문제는 다음과 같습니다:
과도한 연산 부하: 유사한 정보가 프레임 전반에 걸쳐 반복적으로 처리되어 중복 계산으로 이어집니다. 이는 처리 시간과 에너지 소비를 증가시키며, 고해상도 비디오와 실시간 애플리케이션에서 특히 중요해집니다.
높은 저장 공간 및 메모리 오버헤드: 각 프레임을 고유한 단위로 저장하면 중복 데이터가 누적됩니다. 비디오 전체 길이에 걸쳐 거의 동일한 배경 정보를 반복적으로 저장하면 데이터 용량이 크게 증가하여 저장 시스템과 메모리 리소스에 부담을 줍니다.
시간적 일관성 손실: 프레임 간 연속성은 움직임을 정확하게 포착하는 데 필요합니다. 각 프레임을 분리하면 시스템이 연속성을 전달하는 미묘한 변화를 놓칠 수 있으며, 동적인 장면에서 세부 정보 손실과 비디오 재구성 시 아티팩트가 발생할 가능성이 있습니다.
비효율적인 데이터 활용: 비디오의 정적인 부분을 반복적으로 처리한다는 것은 연산 리소스가 실제 변화에 집중되지 않는다는 의미입니다. 그 결과 장면의 동역학을 정의하는 요소가 아니라 중복 정보에 처리 능력이 낭비됩니다.
이러한 과제는 공간적 세부 정보와 움직임의 흐름을 모두 보존하면서 비디오 데이터를 간결하고 의미 있는 표현으로 압축하는 방법의 필요성을 강조합니다. VidTok은 원본 비디오 데이터를 의미 있는 변화를 목표로 하면서 중복성을 최소화하는 효율적인 토큰화 형식으로 변환함으로써 이러한 문제를 해결합니다.
VidTok이 원본 비디오 데이터를 변환하는 방식
VidTok은 인코딩, 정규화, 양자화, 디코딩이라는 일련의 단계를 통해 고차원 비디오를 간결한 표현으로 변환합니다.
그림 1. VidTok 파이프라인 개요
프로세스는 각 프레임에서 필수적인 공간 특징을 추출하기 위해 컨볼루션 레이어를 사용하는 신경망인 인코더로 시작됩니다. 이 네트워크는 가장자리, 텍스처, 형태와 같은 핵심 세부 정보를 식별합니다. 연속된 프레임 간의 유사성을 활용함으로써, 인코더는 정적인 정보를 반복적으로 처리하기보다 움직임을 포착하는 변화에 집중합니다.
인코딩 후, 정규화 단계는 추출된 특징을 구조화된 잠재 공간(유사한 입력이 유사한 인코딩 특징을 갖는, 데이터의 압축된 추상적 표현)으로 구성합니다. 이를 통해 유사한 프레임이 유사한 표현을 생성하도록 보장하며, 이는 나중에 일관된 재구성을 위해 매우 중요합니다.
정규화에 이어, VidTok은 잠재 특징에 Finite Scalar Quantization(FSQ)을 적용하여 이산 표현을 생성합니다. FSQ는 표현의 각 요소를 고정된 값 집합 중 하나에 매핑하여, 기존 벡터 양자화에서 나타나는 코드북 붕괴와 같은 문제를 피합니다. 그러나 VidTok은 이산 토큰화에만 국한되지 않으며, 고정된 이산 값 대신 비디오를 매끄러운 잠재 공간으로 매핑하는 연속 토큰화도 지원합니다. 연속 토큰화는 비디오 생성 및 확산 기반 모델과 같은 작업에 유용한 반면, 이산 토큰화는 압축 및 검색 작업에 더 효율적입니다. VidTok은 이산 토큰에는 FSQ를, 연속 토큰에는 KL 정규화를 사용하여 두 접근 방식을 균형 있게 조합하므로, 한 가지 유형에만 특화된 모델보다 더 유연합니다.
그런 다음 디코더는 필요할 때 비디오를 재구성하며, 토큰화된 표현을 재조립하여 공간적 세부 정보와 시간적 움직임 동역학을 모두 보존합니다. 비디오 데이터를 이 토큰화된 형식으로 압축함으로써, VidTok은 중요한 정보를 유지하면서 중복성을 줄여 비디오 편집, 생성, 검색을 더 효율적으로 만듭니다. 이제 VidTok이 비디오 데이터를 어떻게 인코딩하고 양자화하는지 살펴보았으니, 그 아키텍처 구성 요소를 더 자세히 알아보겠습니다.
VidTok 아키텍처 내부
VidTok은 원시 비디오 데이터를 공간적 세부 정보와 움직임 정보를 모두 포착하는 간결한 토큰 집합으로 변환하도록 설계되었습니다. 이 아키텍처는 중복성을 줄이고 필수 콘텐츠를 보존하기 위해 함께 작동하는 여러 상호 연결된 모듈로 구성됩니다.
2D 컨볼루션을 통한 공간 특징 추출
프로세스는 개별 비디오 프레임에 2D 컨볼루션 레이어를 적용하는 인코더로 시작됩니다. 이러한 레이어는 각 이미지에서 가장자리, 텍스처, 형태와 같은 중요한 공간 특징을 추출합니다. 예를 들어, 도시 거리 장면에서 네트워크는 정적 배경 요소의 반복적인 처리를 최소화하면서 건물 윤곽, 도로 표시, 표지판을 감지하는 법을 학습합니다.
3D 컨볼루션을 통한 시간 특징 추출
움직임을 포착하기 위해 VidTok은 여러 프레임을 동시에 처리하는 3D 컨볼루션 레이어를 사용합니다. 공간 및 시간 차원을 모두 고려함으로써, 이러한 레이어는 시간에 따른 움직임 패턴과 전환을 식별합니다. 번화한 교차로와 같은 시나리오에서 3D 컨볼루션은 대체로 정적인 주변 환경은 무시하면서 이동하는 차량과 보행자 같은 동적인 측면에 집중합니다.
분리된 공간 및 시간 샘플링
VidTok의 핵심 설계 결정은 공간 정보와 시간 정보를 별도로 처리하는 것입니다. 공간 샘플링은 각 프레임에서 세부 정보를 효율적으로 추출하는 전용 2D 연산을 사용해 수행되며, 시간 샘플링은 시간에 따른 변화를 추적하기 위해 독립적으로 관리됩니다. 이러한 분리는 네트워크가 가장 필요한 곳에 리소스를 할당할 수 있게 하여 정적인 콘텐츠에 대한 중복 계산을 줄입니다.
AlphaBlender 연산자를 통한 시간적 블렌딩
프레임 간의 부드러운 전환을 유지하는 것은 움직임을 정확하게 포착하는 데 필수적입니다. VidTok은 연속된 프레임의 특징을 블렌딩하기 위해 AlphaBlender 연산자를 통합합니다. 이 연산자는 다음 공식에 따라 가중합을 계산합니다:
x=α⋅x1+(1−α)⋅x2
이 방정식에서 x1과 x2는 두 개의 연속된 시간 단계에서의 특징 맵을 나타내며, α는 둘 사이의 균형을 제어합니다. 이 블렌딩 과정은 인접한 프레임의 정보를 효과적으로 결합함으로써, 일몰의 색조 변화처럼 점진적인 변화를 보존하는 데 중요합니다. VidTok이 공간 및 시간 정보를 어떻게 처리하는지 더 잘 이해하려면, 다음 다이어그램을 살펴보세요. 이 다이어그램은 아키텍처를 보여주고 특징 추출 및 블렌딩에 관여하는 다양한 구성 요소를 나타냅니다.
그림 2. 2D+1D DownBlocks, AlphaBlender Temporal DownBlocks 및 3D 컨볼루션을 포함한 모델의 공간 및 시간 처리
VidTok은 공간-시간 특징 추출을 위한 3D 컨볼루션, 효율적인 공간 처리를 위한 2D+1D 블록, 그리고 시간적 블렌딩을 위한 AlphaBlender의 조합을 사용해 비디오 입력을 처리합니다. 다이어그램의 오른쪽은 AlphaBlender가 부드러운 움직임 표현을 유지하기 위해 풀링과 보간을 어떻게 통합하는지 자세히 보여줍니다. 이러한 구조는 불필요한 아티팩트를 유발하지 않으면서 정적인 세부 정보가 보존되고 시간 정보가 효율적으로 포착되도록 합니다.
유한 스칼라 양자화(Finite Scalar Quantization, FSQ)
특징 추출 및 블렌딩 이후, VidTok은 유한 스칼라 양자화(FSQ)를 사용해 잠재 표현을 압축합니다. FSQ는 잠재 벡터의 각 스칼라 요소를 미리 정해진 고정된 값 집합 중 하나에 매핑하여 독립적으로 양자화합니다. 이러한 독립적 양자화는 전통적인 벡터 양자화 방법에서 발생할 수 있는 코드북 붕괴와 같은 문제를 방지합니다. 그 결과 거의 모든 토큰이 의미 있는 정보를 담는 토큰 집합이 생성됩니다.
그림 3. 전통적인 벡터 양자화와 FSQ 간의 시각적 비교
위 그림은 VQ가 전체 잠재 벡터를 학습된 codebook에서 가장 가까운 항목으로 대체하는 방식을 보여주며, 이는 불안정성을 초래할 수 있습니다. 반면 FSQ는 미리 정의된 축(z₀, z₁, z₂)을 따라 각 차원을 독립적으로 양자화하여 codebook의 필요성을 없애고 더 효율적이고 안정적인 토큰화를 보장합니다. 이 방법은 각 토큰이 의미 있는 정보를 담는 더 신뢰할 수 있는 이산 표현을 만들어냅니다.
디코더와 재구성 과정
디코더는 컴팩트한 토큰에서 비디오를 재구성하여 인코딩 과정을 역으로 수행합니다. 토큰화된 표현을 다시 조립하여 원본 비디오의 공간적 세부 정보와 시간적 흐름을 모두 재현합니다. 이러한 재구성은 모자이크를 맞추는 것과 비슷하며, 각 토큰이 완전한 이미지에 기여합니다.
학습 전략 및 정규화
VidTok은 계산 효율성과 고품질 비디오 재구성의 균형을 맞추는 2단계 접근 방식을 사용해 학습됩니다. 첫 번째 단계에서는 모델을 저해상도 비디오로 학습시켜 과도한 계산 비용 없이 구조적 패턴을 포착할 수 있게 합니다. 이는 네트워크가 더 세밀한 세부 사항을 다루기 전에 일반적인 비디오 특징을 학습하는 데 도움이 됩니다. 두 번째 단계에서는 고해상도 데이터를 사용해 디코더만 미세 조정하여, 학습 효율성을 유지하면서 재구성된 프레임을 정교하게 다듬습니다. 또한 학습 중 프레임 속도를 낮추면 모델이 중복적인 프레임별 업데이트를 처리하기보다 의미 있는 시간적 변화에 집중하는 데 도움이 됩니다. 이는 비디오 동역학에서 실제로 중요한 변화를 우선시함으로써 모션 표현을 개선합니다.
구조화된 잠재 공간을 유지하기 위해 VidTok은 안정성을 높이고 과적합을 방지하는 정규화 기법을 적용합니다. 연속 토큰에 사용되는 핵심 방법 중 하나는 KL 발산으로, 학습된 분포가 기대 분포에서 얼마나 벗어나는지를 측정합니다. KL 발산을 최소화함으로써 모델은 잠재 표현이 매끄럽게 유지되고 과도하게 집중된 값으로 붕괴되지 않도록 보장하며, 그렇지 않으면 학습된 특징의 다양성이 제한될 수 있습니다.
이산 토큰의 경우, 사용 가능한 양자화 수준을 더 균일하고 다양하게 사용하도록 장려하기 위해 엔트로피 페널티가 적용됩니다. 이러한 페널티가 없으면 모델은 소수의 토큰 하위 집합만 과도하게 사용할 수 있으며, 이는 비효율적인 압축과 정보 손실로 이어집니다. 엔트로피 정규화를 적용함으로써 VidTok은 전체 토큰 공간이 효과적으로 활용되도록 하여 비디오 표현의 품질을 향상시킵니다. 이러한 기법들은 함께 VidTok이 공간 및 시간 정보를 보존하면서 효율적인 비디오 생성, 편집, 검색을 가능하게 하도록 비디오 토큰화를 최적화하는 데 도움이 됩니다.
이제 이러한 아키텍처 선택이 주요 벤치마크와 실제 애플리케이션에서 어떻게 성능 향상으로 이어지는지 살펴보겠습니다.
벤치마크에서의 VidTok 성능
학습 전략을 개선하고 Finite Scalar Quantization을 적용한 후, VidTok은 비디오 재구성 벤치마크에서 강력한 성능을 보여줍니다. 평가는 각기 다른 장면 복잡도와 모션 동역학의 과제를 가진 다양한 비디오 데이터셋에서 공간적 세부 사항을 얼마나 잘 보존하고 모션을 얼마나 잘 포착하는지를 측정합니다.
VidTok은 MCL-JCV 및 WebVid-Val과 같은 데이터셋에서 테스트되었습니다. MCL-JCV 데이터셋은 다양한 모션 패턴과 세부 수준을 가진 비디오로 구성되어 있으며, WebVid-Val은 실제 시나리오의 자연스러운 비디오를 포함합니다. 이러한 조건에서 VidTok은 29.82 dB의 피크 신호 대 잡음비(PSNR)를 달성했으며, 이는 재구성된 비디오가 최소한의 왜곡으로 원본 콘텐츠와 매우 유사함을 나타냅니다. 또한 0.867의 구조적 유사도 지수(SSIM)에 도달하여 프레임 간 공간 구조, 텍스처, 대비를 유지하는 능력을 보여주었습니다. SSIM이 높을수록 재구성된 비디오가 원본과 더 유사하게 보입니다.
Learned Perceptual Image Patch Similarity (LPIPS) 지표를 사용한 추가 평가에서는 0.106의 점수를 기록했으며, 이는 원본 비디오와 재구성된 비디오 간의 시각적 차이가 낮게 유지됨을 시사합니다. VidTok은 또한 프레임 전반의 시간적 일관성과 모션을 모델이 얼마나 잘 보존하는지를 측정하는 Fréchet Video Distance (FVD)에서 160.1을 기록했습니다.
이러한 결과는 VidTok이 압축 효율성과 재구성 품질의 균형을 맞추는 능력을 강조합니다. 토큰화된 표현은 중복성을 줄이면서 필수 정보를 유지하므로 비디오 생성, 편집, 검색 애플리케이션에 유용합니다. 이러한 결과는 VidTok의 효율성을 보여주지만, 여전히 추가 개선이 이루어질 수 있는 영역이 있습니다.
VidTok과 비디오 토큰화의 향후 방향
VidTok은 비디오 표현에 대한 효율적인 접근 방식을 제공하여 검색, 저장 및 생성을 개선합니다. 현재 모델은 강력한 결과를 달성하지만, 그 기능을 더욱 향상하기 위해 탐구할 수 있는 여러 영역이 있습니다.
모션 표현 개선
VidTok은 3D 컨볼루션과 AlphaBlender 연산자를 사용하여 시간적 동역학을 포착하지만, 비디오에서 장거리 의존성을 처리하는 것은 여전히 어려운 과제입니다. 향후 연구에서는 프레임 전반의 장거리 의존성을 명시적으로 추적하는 transformer 기반 비디오 아키텍처를 탐구할 수 있습니다. 이러한 개선은 특히 빠르게 움직이는 객체, 가려짐 또는 급격한 전환이 있는 장면에서 모션 연속성을 향상할 것입니다.
더 높은 해상도 및 멀티스케일 인코딩
더 높은 해상도의 비디오를 효율적으로 처리하는 것은 여전히 미해결 과제입니다. 비디오의 서로 다른 부분을 다양한 세부 수준으로 압축하는 멀티스케일 인코딩 기법은 계산 비용을 크게 증가시키지 않으면서도 미세한 텍스처를 더 잘 보존할 수 있게 해줄 수 있습니다. 이는 미디어 제작 및 의료 영상과 같이 고품질 비디오 복원이 필요한 애플리케이션에 특히 유용할 것입니다.
더 나은 압축을 위한 적응형 양자화
Finite Scalar Quantization (FSQ)는 토큰화의 안정성을 제공하지만, 적응형 양자화는 효율성을 더욱 향상할 수 있습니다. 장면 복잡도에 따라 비트 할당을 동적으로 조정함으로써, 시스템은 정교한 텍스처나 높은 움직임이 있는 영역에 더 많은 세부 정보를 할당하는 동시에 정적인 영역의 중복성을 줄일 수 있습니다. 이는 비디오 품질을 유지하면서 저장 공간을 최적화할 것입니다.
비디오 이해를 위한 크로스모달 학습
VidTok의 토큰화된 표현은 텍스트 및 오디오와 같은 다른 모달리티와 결합되어 비디오 이해를 향상할 수 있습니다. 향후 연구에서는 비디오 토큰이 텍스트 설명 및 사운드 특징과 함께 매핑되는 공동 임베딩을 탐구할 수 있습니다. 이는 자동 캡션 생성, 멀티모달 검색, 비디오 기반 질의응답과 같은 작업을 개선하여 VidTok의 잠재적 애플리케이션을 검색 및 압축을 넘어 확장할 것입니다.
이러한 영역에 집중함으로써, VidTok은 비디오 처리를 위한 더 강력한 도구로 계속 발전하여 다양한 산업 전반에서 저장, 검색 및 분석의 효율성을 향상할 수 있습니다.
결론
VidTok은 중복성을 줄이고 공간적 및 시간적 세부 정보를 모두 보존함으로써 비디오 처리를 개선합니다. 각 프레임을 독립된 이미지로 취급하는 대신, 비디오 데이터를 압축된 토큰으로 변환하여 저장, 압축 및 재구성을 더 효율적으로 만듭니다. 컨볼루션 인코더, Finite Scalar Quantization (FSQ), 시간적 블렌딩을 적용함으로써 불필요한 처리를 최소화하면서 의미 있는 변화에 집중합니다.
이 접근 방식은 중요한 세부 정보를 희생하지 않으면서 비디오 생성, 편집 및 검색과 같은 작업을 더 효율적으로 만듭니다. 앞으로 모션 추적, 멀티스케일 인코딩 및 적응형 양자화의 개선은 그 성능을 더욱 정교하게 다듬을 수 있습니다. 효율적인 비디오 처리에 대한 수요가 증가함에 따라, VidTok은 정확성과 효율성을 유지하면서 비디오 데이터를 관리하기 위한 구조화되고 확장 가능한 방법을 제공합니다.
추가 자료
계속 읽기

Top 10 Context Engineering Techniques You Should Know for Production RAG
A practical guide to context engineering for production LLM systems, covering RAG, context processing, memory, agents, and multimodal context.

Context Engineering Strategies for AI Agents: A Developer’s Guide
Learn practical context engineering strategies for AI agents. Explore frameworks, tools, and techniques to improve reliability, efficiency, and cost.

Why AI Databases Don't Need SQL
Whether you like it or not, here's the truth: SQL is destined for decline in the era of AI.


