물리 AI를 위한 Cosmos World Foundation Model 플랫폼
GenAI에 대해 이야기할 때, 우리는 주로 텍스트 요약, Retrieval-Augmented Generation (RAG), 내부 챗봇 등과 같은 비물리적 분야에서의 응용을 논의합니다. 이러한 초점은 이해할 만합니다. 이러한 작업을 위한 GenAI 모델을 학습시키는 데 필요한 데이터는 비교적 쉽게 얻을 수 있기 때문입니다. 인터넷에는 GenAI 애플리케이션을 학습시키기 위해 텍스트, 이미지 또는 기타 양식의 데이터에 접근할 수 있는 풍부한 소스가 있습니다.
반면에, 물리적 분야에서의 GenAI 애플리케이션 개발은 그다지 발전하지 않았습니다. 문제는 물리적 세계에서 GenAI를 적용하는 것이 다양한 산업 전반에서 위험하고, 지루하며, 반복적인 작업을 수행하는 데 매우 유익할 수 있다는 점을 우리가 알고 있다는 것입니다. 예를 들어, 고급 GenAI 시스템은 자율 주행이나 로봇 조작에 사용될 수 있습니다.
이 글에서는 NVIDIA 팀이 개발한 Cosmos라는 플랫폼에 대해 논의하겠습니다. 이 플랫폼은 물리 세계 사용 사례를 위한 GenAI 모델을 미세 조정하는 기반 역할을 합니다. 그럼 더 이상 지체하지 말고 시작해 보겠습니다!
Cosmos란 무엇이며 왜 필요한가
물리적 분야에서 GenAI 애플리케이션 개발이 비물리적 분야만큼 빠르지 않은 데에는 몇 가지 이유가 있습니다.
첫 번째 이유는 학습 데이터의 확장성과 관련이 있습니다. 물리적 세계에서 유용하려면 AI 모델은 주어진 지시와 현재 상황을 기반으로 가능한 다음 행동을 예측하도록 학습되어야 합니다. 이는 학습 데이터가 이미지뿐만 아니라 비디오도 포함해야 한다는 것을 의미합니다. 게다가 이러한 비디오는 무작위일 수 없습니다. 입력 비디오는 특정 상황에서 모델이 적절히 반응하도록 학습하는 데 도움이 되는 관련 관찰과 행동을 보여주어야 합니다. 이러한 유형의 데이터는 찾기 어려울 뿐만 아니라 처리하기도 복잡합니다.
두 번째 이유는 안전성과 관련이 있습니다. 우리가 알다시피, 물리적 세계에서 AI 모델을 학습시키는 것은 사람과 환경에 심각한 위험을 초래할 수 있습니다. 예를 들어, 자율 주행을 위해 학습된 AI 시스템의 단 한 번의 오예측도 대형 교통사고로 이어질 수 있습니다. 따라서 물리적 세계의 디지털 트윈에서 모델을 학습시키는 것이 바람직하며, 그곳에서 모델은 주변 환경과 안전하게 상호작용할 수 있습니다.
Cosmos는 이러한 과제를 해결하기 위해 NVIDIA가 개발한 플랫폼입니다. 이는 디지털 트윈 환경에서 피지컬 AI(즉, 물리 세계 애플리케이션을 위해 설계된 AI 모델)를 학습하고 미세 조정할 수 있게 해줍니다. 이를 통해 실제 물리적 세계에서 학습하거나 배포할 필요 없이, 피지컬 AI 모델의 실제 세계 동작을 디지털 방식으로 관찰할 수 있습니다.
그림 1. Cosmos 플랫폼의 구성 요소 (출처)
Cosmos 플랫폼은 여러 구성 요소로 이루어져 있으며, 각각은 피지컬 AI 모델의 학습 과정에서 특정 단계를 담당합니다. 이러한 구성 요소에는 비디오 큐레이션, 토큰화, 사전 학습, 사후 학습, 가드레일이 포함됩니다.
이러한 구성 요소를 실행한 결과는 학습된 피지컬 AI 모델입니다. 이 모델은 시각적 관찰의 시퀀스(즉, 비디오)와 주어진 시점의 섭동을 입력으로 받아, 예측된 미래 관찰을 출력으로 생성합니다. 입력 섭동은 모델이 수행하는 행동이나 텍스트 기반 지시와 같은 다양한 형태를 취할 수 있습니다.
디지털 환경 내에서 완전히 미래 관찰을 예측함으로써, 모델은 실제 세계 동작 모방, 정책 관찰 및 학습, 합성 비디오 생성 등 다양한 애플리케이션에 유용할 수 있습니다.
그림 2. Cosmos 플랫폼으로 학습된 피지컬 AI 모델의 입력-출력 (출처)
Cosmos 플랫폼의 구성 요소와 작동 방식
앞서 언급했듯이, Cosmos는 비디오 큐레이션, 토크나이저, 사전 학습, 사후 학습, 가드레일 등 여러 구성 요소로 이루어져 있습니다. 이 섹션에서는 비디오 큐레이션 구성 요소부터 시작하여 이러한 각 구성 요소에 대해 논의하겠습니다.
비디오 큐레이션
이 구성 요소의 주요 목표는 독점 및 오픈소스 데이터셋 모두에서 얻은 원시 비디오 데이터를 큐레이션하고 필터링하는 것입니다. 우리 모두가 알다시피, 비디오 데이터에는 종종 많은 노이즈가 포함되어 있으므로 물리적 AI를 학습하는 데 사용되는 최종 데이터셋의 품질을 보장하기 위해 필터링해야 합니다.
그림 3. Cosmos 플랫폼의 비디오 큐레이션 워크플로 (출처)
데이터를 필터링하기 위해 Cosmos 플랫폼은 여러 단계를 따릅니다. 첫 번째 단계는 분할 과정입니다.
Cosmos는 비디오 분할에 샷 감지 알고리즘을 사용합니다. 원시 비디오 소스는 샷 변화가 없는 임의 길이의 짧은 클립으로 분할됩니다. 이를 통해 각 비디오 세그먼트가 모델이 학습하는 데 유용한 일관된 장면으로 구성되도록 보장합니다.
여러 벤치마크에서 다양한 방법의 성능을 바탕으로, Cosmos는 분할 과정에 TransNetV2를 사용합니다.
분할 후, Cosmos는 클립을 더욱 정제하기 위해 다음을 포함한 여러 비디오 필터링 기법을 적용합니다:
모션 필터링: 정적이거나 갑작스러운 카메라 움직임이 포함된 클립을 제거합니다.
시각적 품질 필터링: 해상도가 낮거나 품질이 좋지 않은 클립을 제거합니다.
텍스트 오버레이 필터링: 클립에서 후처리 중 추가된 텍스트를 제거합니다.
비디오 유형 필터링: 원하지 않는 비디오 유형을 걸러냅니다.
다음으로, 정제된 클립 컬렉션은 Visual Language Model (VLM)을 사용하여 주석이 달립니다. 주석 결과는 각 클립의 콘텐츠에 대한 텍스트 설명입니다. 벤치마크 결과를 바탕으로 NVIDIA 팀은 주석 생성을 위한 VLM으로 VILA를 선택했습니다.
주석이 완료되면 다음 단계는 중복 제거입니다. 각 비디오는 InternVideo라는 비디오 임베딩 모델을 사용하여 임베딩으로 변환됩니다. 그런 다음 임베딩 컬렉션이 클러스터링되고, 각 클러스터 내의 쌍별 거리가 계산되어 매우 유사한 비디오를 식별합니다. 중복이 발견되면, 더 높은 해상도의 비디오가 학습 데이터셋으로 선택됩니다.
토크나이저
토크나이저는 AI 모델이 원시 비디오를 직접 처리할 수 없기 때문에 각 비디오를 수치 표현으로 변환하는 데 중요한 구성 요소입니다. Cosmos 플랫폼에서 사용되는 토크나이저는 NVIDIA가 개발한 Cosmos-Tokenizer라는 특수 토크나이저로, 각 비디오에 대해 연속 및 이산 토큰화를 모두 생성할 수 있습니다.
연속 토큰과 이산 토큰을 모두 생성하는 능력은 필수적입니다. 다음 단계에서 Cosmos는 확산 및 자기회귀 전략이라는 두 가지 서로 다른 모델 사전 학습 접근 방식을 제공하기 때문입니다. 확산 전략은 학습에 연속 토큰이 필요하지만, 자기회귀 전략은 이산 토큰에 의존합니다.
효과적인 토크나이저의 핵심 요소 중 하나는 비디오와 같은 고차원 데이터를 품질 손실을 최소화하면서 저차원 표현으로 압축하는 능력입니다. 이 점에서 Cosmos-Tokenizer는 CogVideoX-Tokenizer, FLUX-Tokenizer, VideoGPT-Tokenizer와 같은 다른 토크나이저보다 뛰어납니다.
그림 4. Cosmos-Tokenizer와 다른 비디오 토크나이저 간의 시공간 압축률 - 재구성 품질 성능 (출처)
Cosmos-Tokenizer의 뛰어난 성능 뒤에 있는 비결은 그 설계에 있습니다. 이는 인과적 시간 설계를 채택하며, 이는 비디오의 각 프레임이 자기 자신과 그 이전 프레임만을 사용하여 토큰화된다는 것을 의미합니다. 다시 말해, 한 프레임의 토큰화는 어떤 미래 프레임의 영향도 받지 않습니다.
길이가 t초인 입력 비디오의 경우, 먼저 2단계 웨이블릿 변환을 사용하여 비디오를 그룹화하고 4배로 다운샘플링합니다. 예를 들어 첫 번째 그룹은 프레임 1부터 4까지로 구성되고, 두 번째 그룹은 프레임 5부터 8까지로 구성되며, 이런 식으로 이어집니다. 다음으로 Cosmos-Tokenizer 아키텍처 내의 일련의 인코더 블록이 다운샘플링된 출력을 인과적 방식으로 처리하여 비디오의 차원을 더욱 줄입니다.
그림 5. Cosmos-Tokenizer의 시간적 인과성 설계 (출처)
Cosmos-Tokenizer의 각 인코더 블록은 위 시각화에 표시된 것처럼 잔차 레이어, 다운샘플링 레이어, 시공간 어텐션 레이어의 조합으로 구성됩니다. 다운샘플링 레이어의 출력은 비디오의 공간적 및 시간적 특징을 모두 포착하는 시공간 어텐션 레이어로 전달됩니다. 먼저 입력은 공간 정보를 포착하기 위해 2D 컨볼루션 레이어를 거친 다음, 시간 정보를 추출하기 위해 시간적 컨볼루션 레이어를 거칩니다.
압축된 토큰에서 비디오를 재구성하기 위해, 토큰은 Cosmos-Tokenizer의 일련의 디코더 블록을 사용하여 업샘플링됩니다. 각 디코더 블록은 위 이미지에 표시된 것처럼 인코더 블록과 유사한 구조를 가집니다. 유일한 차이점은 입력을 다운샘플링하는 대신, 디코더가 비디오를 재구성하기 위해 이를 업스케일링한다는 것입니다.
모델 사전 학습 I: 확산 기반 모델
모델 사전 학습의 주요 목표는 현재 관측값과 이전 비디오가 입력으로 주어졌을 때, 타당한 미래 비디오를 생성하는 방법을 이해하는 기본 모델을 개발하는 것입니다. Cosmos에는 두 가지 서로 다른 사전 학습 모델이 있습니다. 확산 기반 모델과 자기회귀 기반 모델입니다. 이 섹션에서는 확산 기반 모델을 자세히 논의하겠습니다.
총 두 개의 확산 기반 모델이 있으며, 하나는 7B 파라미터를, 다른 하나는 14B 파라미터를 가집니다. 두 모델 모두 2단계 과정으로 학습됩니다.
첫 번째 단계에서 모델은 텍스트 프롬프트를 입력으로 받아 해당 프롬프트에 기반한 비디오를 생성합니다. 이 단계 이후 학습된 모델을 Text2World라고 합니다. 두 번째 단계에서는 현재 관측값을 나타내는 추가 입력 비디오를 사용하여 Text2World 모델을 추가로 파인튜닝합니다. 즉, 텍스트 프롬프트와 입력 비디오가 모두 주어졌을 때, 모델은 가장 가능성 높은 다음 비디오를 예측하도록 학습됩니다. 이 두 번째 단계 이후 학습된 모델을 Video2World라고 합니다.
그림 6. Video2World 확산 기반 모델의 사전 학습 아키텍처 (출처)
위 시각화에서 Video2World를 학습하기 위한 전체 설정을 볼 수 있습니다. 먼저, 현재 관측값을 나타내는 입력 비디오는 Cosmos-1.0-Tokenizer-CV8x8x8의 인코더를 사용하여 토큰화되어 입력 비디오의 연속 토큰을 생성합니다. 그런 다음 이러한 토큰은 가우시안 노이즈를 추가하여 손상됩니다. 손상된 토큰은 여전히 고차원이므로, 모델에서 처리할 수 있도록 패치화하고 평탄화해야 합니다.
그림 7. 이미지 패치화 과정의 예
평탄화 과정 후 생성된 텐서들은 일련의 Transformer 블록을 통과합니다. 각 Transformer 블록에서 입력에는 평탄화된 위치 임베딩이 주입되어 각 벡터 요소에 절대 위치 정보를 추가하고 학습 손실을 줄입니다. 다음으로 출력은 self-attention 및 cross-attention 레이어를 포함한 일련의 어텐션 레이어에 의해 처리됩니다.
어텐션 레이어에서는 3D RoPE와 시간 단계(t)를 사용하여 시공간 정보가 입력에 통합됩니다. 모델이 텍스트 프롬프트를 조건으로 동영상을 생성할 수 있도록, T5 텍스트 인코더가 생성한 텍스트 임베딩이 크로스 어텐션 레이어 내에서 입력에 포함됩니다. 마지막으로, 크로스 어텐션 레이어의 출력은 선형 레이어를 통과하며, 이 과정은 여러 Transformer 블록을 거치며 반복됩니다.
마지막 Transformer 블록은 최종 노이즈 제거 토큰을 생성합니다. 다음으로, 이러한 노이즈 제거 토큰은 업샘플링되고 디코딩되어야 하며, 이는 Cosmos-1.0-Tokenizer-CV8x8x8의 디코더에 의해 수행됩니다. 최종 결과로, 예측된 미래 동영상을 얻습니다.
모델 사전 훈련 II: 자기회귀 기반 모델
두 번째 사전 훈련 모델은 자기회귀 기반 모델입니다. 이 모델에는 두 가지 변형이 있습니다. 하나는 5B 매개변수를 가진 모델이고, 다른 하나는 13B 매개변수를 가진 모델입니다. 사전 훈련 과정도 두 단계로 구성됩니다. 첫 번째 단계에서는 모델이 현재 동영상 관찰을 기반으로 미래 동영상 프레임을 예측하도록만 훈련됩니다. 두 번째 단계에서는 텍스트를 추가 입력으로 포함하여 모델을 추가로 사전 훈련합니다. 이는 최종 모델이 입력 동영상과 텍스트 프롬프트를 모두 입력으로 받아 미래 동영상을 출력으로 생성한다는 의미입니다.
그림 8. Video2World 자기회귀 기반 모델의 사전 훈련 아키텍처 (출처)
사전 훈련 과정은 이전 섹션에서 논의한 확산 기반 모델의 과정과 상당히 유사합니다. 먼저, 입력 동영상이 토큰으로 변환됩니다. 그러나 확산 기반 접근 방식과 달리, 자기회귀 모델은 연속 토큰이 아니라 이산 토큰을 필요로 합니다. 따라서 사전 훈련 과정에서는 Cosmos-1.0-Tokenizer-DV8x16x16을 사용하여 입력 동영상을 이산 토큰으로 변환합니다. 그런 다음 이러한 이산 토큰은 임베딩 레이어에 입력되며, 이 레이어는 이를 다음 구성 요소에서 처리할 준비가 된 임베딩으로 변환합니다.
다음으로, 입력은 일련의 Transformer 블록을 통과하며, 각 블록은 셀프 어텐션 레이어, 크로스 어텐션 레이어, 선형 레이어로 구성됩니다. 각 Transformer 블록에서는 먼저 절대 위치 임베딩이 입력에 추가되어 각 토큰에 대한 절대 위치 정보를 제공합니다.
셀프 어텐션 레이어 내에서는 토큰의 상대 위치에 관한 정보를 주입하기 위해 3D RoPE가 사용됩니다. 한편, 텍스트 정보는 크로스 어텐션 레이어 내에서 입력에 통합됩니다. 마지막으로, 입력은 끝에서 선형 레이어를 통과합니다. 이 과정은 최종 블록에 도달할 때까지 여러 Transformer 블록을 거치며 반복됩니다.
마지막 Transformer 블록은 최종 토큰 표현을 생성합니다. 이러한 토큰을 예측 동영상으로 변환하려면 Cosmos-1.0-Tokenizer-DV8x16x16의 디코더를 사용하여 업샘플링하고 디코딩해야 합니다.
모델 후훈련
이전 섹션에서 언급했듯이, 모델 사전 훈련의 주요 목표는 이전 동영상 프레임과 현재 관찰을 기반으로 일관된 미래 동영상을 생성할 수 있는 기본 또는 파운데이션 모델을 개발하는 것입니다. 이 모델을 특정 영역에 특화하기 위해 파인튜닝과 같은 후훈련 기법을 적용할 수 있습니다.
그림 9. 후훈련을 통해 사전 훈련된 물리 AI 모델을 특정 작업에 사용할 수 있는 방법에 대한 그림 (출처)
확산 기반 모델과 자기회귀 기반 모델 모두 카메라 제어, 로봇 조작, 자율 주행과 같은 특정 작업에서 동영상 예측에 뛰어나도록 파인튜닝할 수 있습니다. 카메라 제어를 예로 들어보겠습니다. 아래는 모델을 카메라 제어 작업에 대해 파인튜닝한 후의 프레임별 결과 예시입니다.
그림 10. 카메라 제어 작업에 맞게 미세 조정된 확산 기반 모델에서 생성된 비디오 예시 (출처)
카메라 제어를 위해 미세 조정된 모델은 초기 비디오와 왼쪽, 오른쪽, 앞으로 또는 뒤로 회전하는 것과 같은 제어 프롬프트를 기반으로 사실적인 비디오를 생성할 수 있습니다. 모델이 생성한 예측 비디오는 실제 배포되기 전에 실제 물리적 세계에서 AI 시스템의 동작을 시뮬레이션하고 평가하는 데 사용될 수 있습니다.
가드레일
이 모델은 비디오 콘텐츠를 생성할 수 있으므로, 사용을 규제하기 위한 안전 조치를 구현하는 것이 중요합니다. NVIDIA 팀은 사전 가드와 사후 가드라는 두 가지 안전 단계를 도입했습니다.
그림 11. Cosmos 플랫폼에 구현된 가드레일 워크플로 (출처)
사전 가드 단계에서는 사용자가 제출할 수 있는 유해한 텍스트 프롬프트를 감지하기 위해 LLM 기반 가드레일이 사용됩니다. 프롬프트가 안전하지 않거나 유해한 것으로 판단되면, 시스템은 비디오 생성을 방지하고 대신 오류 메시지를 표시합니다.
한편, 사후 가드 단계에서는 모델에 제출된 입력 비디오와 모델이 생성한 비디오를 모두 모니터링합니다. 비디오 콘텐츠가 안전한지 판단하기 위해 NVIDIA 팀은 SigLIP 모델을 사용해 각 프레임에서 임베딩을 추출한 뒤, 간단한 MLP 분류기를 사용해 분류합니다.
사후 가드 단계의 또 다른 측면은 얼굴 흐림 필터입니다. 이 단계에서는 RetinaFace라는 얼굴 감지 모델을 사용해 사람 얼굴이 포함된 프레임 부분을 흐리게 처리하여 개인정보 보호를 보장합니다
확산 및 자기회귀 기반 모델의 실험 결과
사전 학습 단계 이후 확산 기반 모델과 자기회귀 기반 모델의 결과는 정성적으로 평가되었습니다. 이 섹션에서는 확산 기반 모델부터 시작하여 두 모델이 생성한 일부 출력을 살펴보겠습니다.
확산 기반 모델은 7B 및 14B 매개변수의 두 가지 변형으로 제공됩니다. 전반적으로 두 모델 모두 텍스트 프롬프트 조건에 잘 부합하는 고품질 비디오를 생성합니다.
그림 12. 주어진 지시 프롬프트를 사용한 Video2World 확산 기반 모델의 생성 비디오 예시 (출처)
위의 시각화에서 보듯이, 두 변형 모두 고품질 비디오를 생성하지만 14B 모델은 각 프레임 내의 더 세밀한 움직임 디테일을 더 효과적으로 포착합니다. 또한 복잡한 장면과 안정적인 움직임이 있는 비디오를 생성하는 데 뛰어납니다. 확산 기반 모델이 생성한 실제 비디오는 Cosmos 웹사이트에서 볼 수 있습니다.
자기회귀 기반 모델에서도 동일한 경향이 관찰되며, 이 모델 역시 5B 및 13B 매개변수의 두 가지 변형을 가지고 있습니다. 전반적으로 13B 모델은 5B 모델에 비해 더 선명한 비디오와 더 부드러운 움직임을 생성합니다.
그림 13. 주어진 지시 프롬프트를 사용한 Video2World 확산 기반 모델의 생성 비디오 예시 (출처)
자기회귀 기반 모델은 전반적으로 좋은 성능을 보이지만, 비디오 생성 중 여전히 일관성 없는 장면을 생성할 수 있습니다. 한 가지 주목할 만한 실패 사례는 아래에 설명된 것처럼 프레임에 무작위 객체가 갑자기 나타나는 것입니다. 그러나 100개의 테스트 입력에 대한 13B 모델의 실패율은 2% 미만으로 관찰되어, 이러한 오류가 드문 발생임을 나타냅니다.
그림 14. Video2World 자기회귀 기반 모델의 실패 사례 예시 (출처)
실제 세계에서 물리적 AI를 표현하는 데 모델이 적합한지 판단하기 위해 NVIDIA 팀은 3D 일관성과 물리 법칙과의 정렬이라는 두 가지 핵심 측면을 기반으로 정량적 평가를 수행했습니다.
3D 일관성
강력한 3D 일관성을 유지하는 것은 매우 중요합니다. 모델의 주요 목표가 실제 3D 환경에서 물리적 AI의 동작을 시뮬레이션하는 것이기 때문입니다. 3D 일관성을 평가하기 위해 두 가지 지표 세트를 관찰했습니다: 기하학적 일관성(Sampson error, Pose estimation)과 뷰 합성 일관성(PSNR, SSIM, LPIPS)
그림 15. Cosmos 모델의 3D 일관성 평가 (출처)
두 지표의 결과는 diffusion 기반 모델과 autoregressive 기반 모델 모두 NVIDIA의 기준 모델과 비교해 3D 일관성에서 상당한 개선을 달성했음을 보여줍니다. 이는 모델이 매우 현실적인 3D 비디오를 생성할 수 있는 역량을 입증하며, 실제 시뮬레이션에 가치 있게 활용될 수 있음을 의미합니다.
물리 법칙과의 정렬
3D 일관성 외에도, 생성된 비디오는 물리적 AI의 동작이 현실적이도록 물리 법칙도 준수해야 합니다. 이를 평가하기 위해 NVIDIA 팀은 시뮬레이션된 실제 비디오와 모델이 생성한 동일한 시나리오의 비디오를 비교했습니다. 여러 지표가 서로 다른 수준에서 사용되었습니다: 픽셀 수준(PSNR, SSIM), 특징 수준(DreamSim), 객체 수준(IoU)
그림 16. Cosmos 모델의 물리적 정렬 평가 (출처)
픽셀 수준 결과를 기준으로 보면, diffusion 기반 모델은 일반적으로 autoregressive 기반 모델에 비해 더 높은 품질의 비디오를 생성합니다. 그러나 모든 모델은 여전히 물리 법칙을 완전히 준수하는 데 어려움을 겪고 있습니다. 그 결과, 향후 모델 역량을 강화하기 위해 데이터 큐레이션과 모델 설계의 개선이 이미 NVIDIA의 로드맵에 포함되어 있습니다.
결론
NVIDIA가 개발한 Cosmos 플랫폼은 GenAI를 물리적 세계에 통합하는 데 있어 중요한 진전을 나타냅니다. 데이터 확장성과 안전 문제와 같은 핵심 과제를 해결함으로써, Cosmos는 통제된 디지털 트윈 환경에서 물리적 AI 모델의 학습과 파인튜닝을 가능하게 합니다. 비디오 큐레이션, 토큰화, 모델 사전 학습, 사후 학습, 가드레일과 같은 파이프라인을 통해 Cosmos는 미래 관측을 예측하고 로보틱스, 자율주행, 카메라 제어를 포함한 다양한 물리적 애플리케이션을 위한 현실적인 비디오 출력을 생성할 수 있는 AI 모델의 개발을 촉진합니다.
모델이 좋은 3D 일관성을 갖춘 고품질 비디오를 생성할 수는 있지만, 여전히 해결해야 할 큰 과제가 있습니다. 생성된 비디오에서 모델이 물리 법칙을 더 잘 준수하도록 개선하려면 데이터 큐레이션과 모델 설계의 추가적인 개선이 필요합니다.
계속 읽기

Introducing Business Critical Plan: Enterprise-Grade Security and Compliance for Mission-Critical AI Applications
Discover Zilliz Cloud’s Business Critical Plan—offering advanced security, compliance, and uptime for mission-critical AI and vector database workloads.

Will Amazon S3 Vectors Kill Vector Databases—or Save Them?
AWS S3 Vectors aims for 90% cost savings for vector storage. But will it kill vectordbs like Milvus? A deep dive into costs, limits, and the future of tiered storage.

Vector Databases vs. Hierarchical Databases
Use a vector database for AI-powered similarity search; use a hierarchical database for organizing data in parent-child relationships with efficient top-down access patterns.


