V-JEPA 2: 비디오 기반 세계 모델
Meta · 2025-06-01 · Vision · 오픈소스
개요
V-JEPA 2는 2025년 Meta가 발표한 비디오 기반 세계 모델(world model)로, 로보틱스와 물리적 세계 이해에 특화된 자기지도 학습 비전 모델이다. Yann LeCun이 제안한 JEPA(Joint-Embedding Predictive Architecture) 철학을 비디오 도메인에 적용한 모델로, 미래 비디오 프레임의 추상적 표현을 잠재 공간에서 예측하도록 학습하여 물리적 세계의 인과 관계와 동역학을 내재화한다.
V-JEPA 2의 핵심 철학은 MAE나 VideoMAE와 같은 마스킹 오토인코더가 픽셀 수준의 복원에 집중하는 것과 대조적이다. V-JEPA 2는 픽셀을 직접 복원하지 않고, 마스킹된 영역의 추상적(abstract) 표현만 예측한다. 이를 통해 배경 텍스처, 조명 변화 등 물리적으로 무의미한 저수준 디테일에 집착하지 않고, 객체의 움직임, 상호작용, 인과 관계 등 고수준 의미 구조를 학습한다. 궁극적으로 V-JEPA 2는 비디오를 통해 물리 세계를 이해하는 “세계 모델”을 향한 중요한 진전을 보여준다.
아키텍처 상세
JEPA 프레임워크
V-JEPA 2의 아키텍처는 세 가지 핵심 구성요소로 이루어진다:
1. 컨텍스트 인코더(Context Encoder): 마스킹되지 않은 비디오 패치를 처리하는 ViT 기반 인코더이다. 비디오를 시공간(spatio-temporal) 패치로 분할하고, 마스킹되지 않은 패치만 입력으로 받아 처리한다.
2. 타깃 인코더(Target Encoder): 컨텍스트 인코더와 동일한 아키텍처이지만, 마스킹된 패치를 포함한 전체 비디오를 처리한다. 이 인코더는 gradient 업데이트 없이 컨텍스트 인코더의 **EMA(Exponential Moving Average)**로만 업데이트된다:
3. 예측기(Predictor): 컨텍스트 인코더의 출력을 받아 마스킹된 영역의 타깃 인코더 출력을 예측하는 경량 네트워크이다.
학습 목표는 예측기의 출력과 타깃 인코더의 출력 간 L2 거리를 최소화하는 것이다:
여기서 는 stop-gradient 연산이다.
시공간 마스킹 전략
비디오에서의 마스킹은 이미지보다 복잡하다. V-JEPA 2는 시공간 블록 마스킹을 사용한다:
- 비디오를 공간적(spatial) + 시간적(temporal) 차원에서 3D 패치로 분할
- 무작위로 선택된 시공간 블록을 마스킹 (예: 연속된 프레임의 특정 영역)
- 마스킹 비율과 블록 크기를 다양하게 설정하여 다중 스케일 예측
이 전략은 모델이 단순히 인접 프레임을 복사하는 것이 아니라, 물리적 동역학을 이해하여 미래 상태를 예측하도록 강제한다.
모델 사양
| 항목 | 값 |
|---|---|
| 파라미터 | ~1B |
| 아키텍처 | ViT 기반 |
| 히든 차원 | 1536 |
| 레이어 수 | 40 |
| 어텐션 헤드 | 24 |
| 위치 인코딩 | 학습 가능한 3D (공간 2D + 시간 1D) |
핵심 혁신
-
잠재 공간 예측(Non-generative): 픽셀 복원 대신 잠재 표현을 예측함으로써, 의미적으로 풍부하면서도 불필요한 디테일에 강건한 표현을 학습한다. 이는 생성 모델(MAE, VideoMAE)과의 핵심적 차이이다.
-
물리적 세계 이해: 비디오에서 객체의 운동, 중력, 충돌, 가림/재등장 등 물리적 현상을 내재적으로 학습한다. 이는 로보틱스에서의 동작 계획에 직접적으로 유용하다.
-
JEPA 철학의 구현: Yann LeCun의 JEPA 개념을 대규모로 구현하여, 예측 기반 자기지도 학습이 세계 모델 구축에 유효한 접근임을 입증하였다.
벤치마크/성능
| 태스크 | V-JEPA 2 | VideoMAE V2 | InternVideo 2 |
|---|---|---|---|
| Kinetics-400 (top-1) | 우수 | 77.0% | 75.5% |
| Something-Something V2 | 우수 | 77.0% | - |
| 로봇 조작 계획 | 우수 | 제한적 | 제한적 |
| 물리 예측 | 우수 | 보통 | 보통 |
V-JEPA 2는 비디오 분류뿐 아니라 물리적 추론과 로봇 제어 태스크에서 특히 두드러진 성능을 보인다.
관련 모델 비교
| 모델 | 학습 방식 | 복원 타깃 | 비디오 이해 | 세계 모델 |
|---|---|---|---|---|
| MAE | 마스킹 복원 | 픽셀 | 이미지만 | 아님 |
| VideoMAE | 마스킹 복원 | 픽셀 | 비디오 | 제한적 |
| DINO/DINOv2 | 자기증류 | 잠재 표현 | 이미지만 | 아님 |
| V-JEPA 2 | 잠재 예측 | 잠재 표현 | 비디오 | 지향 |
학습 상세
- 데이터셋: 수백만 개의 비디오 클립 (다양한 도메인)
- EMA 타깃 인코더: momentum 0.996 → 1.0 (cosine 스케줄)
- 옵티마이저: AdamW
- 마스킹 전략: 멀티스케일 시공간 블록 마스킹
- 입력: 비디오 클립 (16-64 프레임)
- 패치: 2D 공간 패치 + 시간 차원 결합 → 3D 시공간 패치
- 위치 인코딩: 학습 가능한 3D 위치 임베딩 (2D 공간 + 1D 시간)
사전학습 후 로보틱스 태스크 데이터로 파인튜닝하여 물리적 세계 모델로 활용한다. 로봇 조작 환경에서 V-JEPA 2의 잠재 표현을 사용한 모델 기반 강화학습(Model-Based RL)이 기존 방법 대비 높은 샘플 효율성과 성능을 보인다.
실무 활용
V-JEPA 2는 다음과 같은 실무 시나리오에서 활용된다:
- 로봇 조작 계획: 비디오에서 학습한 세계 모델을 활용하여, 로봇이 환경을 시뮬레이션하고 최적의 행동을 계획한다.
- 비디오 이해: 행동 인식, 이벤트 예측, 비디오 캡셔닝 등 비디오 이해 태스크의 백본으로 활용된다.
- 자율주행: 주행 비디오에서 다른 차량, 보행자의 미래 궤적을 예측하는 데 활용 가능하다.
- 물리 시뮬레이션: 물리적 상호작용(충돌, 낙하 등)의 결과를 예측하는 직관 물리학(intuitive physics) 모델로 활용된다.
# V-JEPA 2 특징 추출 (개념적 예시)
from vjepa2 import load_model
model = load_model("vjepa2-large")
video_features = model.encode_video(video_frames)
# 잠재 공간에서의 미래 예측
future_repr = model.predict(
context=video_features[:8], # 처음 8프레임의 표현
target_positions=[8, 9, 10] # 예측할 프레임 위치
)한계 및 전망
- 범용성 한계: 로보틱스와 물리 이해에 특화되어, 일반적인 비디오 이해 태스크에서는 전용 모델 대비 우위가 제한적일 수 있다.
- 학습 비용: 대규모 비디오 데이터의 처리와 3D 시공간 어텐션으로 인해 학습 비용이 크다.
- 세계 모델의 한계: 현재의 V-JEPA 2는 물리적 동역학의 일부만 학습할 수 있으며, 완전한 세계 모델과는 거리가 있다.
V-JEPA 2는 Yann LeCun이 제시한 JEPA 비전의 핵심적 구현으로, 자기지도 학습으로 세계를 이해하는 AI를 향한 중요한 진전이다. MAE의 “복원”에서 JEPA의 “예측”으로의 패러다임 전환이 비전 AI의 미래 방향을 제시하고 있다.
관련 문서
- MAE — 영감