Sora 2: 물리 시뮬레이션과 오디오 동기화를 갖춘 차세대 비디오 생성
OpenAI · 2025-03-01 · Diffusion · Proprietary
개요
Sora 2는 2025년 OpenAI가 발표한 차세대 텍스트-비디오 생성 모델로, 초대 Sora의 시공간 패치 기반 DiT 아키텍처를 계승하면서 물리 시뮬레이션 정확도와 동기화된 오디오 생성 기능을 대폭 강화하였다. Sora가 비디오 생성의 가능성을 시연한 “개념 증명(proof of concept)“이었다면, Sora 2는 실제 영상 제작에 활용 가능한 수준의 품질과 기능을 갖춘 “생산 도구(production tool)“로의 전환을 목표로 한다.
Sora 2의 가장 주목할 만한 진보는 비디오 내 물리 법칙 준수 능력의 대폭 향상이다. 초대 Sora에서는 유체 역학, 물체 충돌, 중력 효과 등에서 물리적으로 비현실적인 결과가 빈번하게 발생하였다. 물체가 허공에 떠 있거나, 유리잔이 깨지는 방식이 비물리적이거나, 사람의 손가락 수가 변하는 등의 문제가 있었다. Sora 2는 이러한 물리적 사실성을 크게 개선하여, 유체 역학, 물체 충돌, 중력 효과, 관절 움직임 등 복잡한 물리적 상호작용이 더 사실적으로 표현된다.
두 번째 핵심 진보는 오디오-비디오 동기 생성(Audio-Video Synchronization) 기능이다. 초대 Sora는 무음 비디오만 생성할 수 있었으나, Sora 2는 비디오와 동기화된 자연스러운 음향 효과 및 배경 음악을 함께 생성한다. 이는 Veo 3의 네이티브 오디오 생성 기능과의 경쟁에서 빠르게 격차를 좁힌 것으로, 비디오 생성 AI 업계 전반에서 “오디오 포함 생성”이 표준화되는 흐름을 반영한다.
또한 여러 장면에 걸쳐 동일한 캐릭터나 물체의 일관성이 개선되었으며, 텍스트-비디오 정렬 품질, 카메라 제어 능력, 긴 시퀀스 일관성도 Sora 대비 전반적으로 향상된 것으로 보고된다.
아키텍처 상세
시공간 패치 DiT 기반 구조
Sora 2는 Sora의 시공간 패치 기반 DiT 구조를 유지한다. 비디오는 Video VAE로 잠재 공간에 압축된 후, 크기의 시공간 패치로 분할되어 1D 토큰 시퀀스가 된다. 이 시퀀스에 Full Self-Attention을 적용하여 시공간 의존성을 포착한다.
확산 과정의 학습 목표는 다음과 같다:
여기서 는 텍스트 조건, 카메라 제어 조건, 참조 이미지 조건 등을 포함하는 복합 조건 벡터이다.
오디오-비디오 공동 생성 모듈
오디오 생성은 비디오와 별도의 모달리티로 처리되되, 시간적 동기화가 보장되어야 한다. Sora 2의 정확한 아키텍처는 공개되지 않았으나, 두 가지 접근법이 유력하다:
방법 1: Joint Multimodal DiT — 비디오 잠재 토큰과 오디오 잠재 토큰을 함께 DiT 백본에서 처리한다. 비디오 토큰과 오디오 토큰이 동일한 Attention 레이어에서 상호작용하여 시간적 정렬이 어텐션 수준에서 이루어진다:
방법 2: 순차적 오디오 생성 — 비디오를 먼저 생성한 후, 비디오를 조건으로 오디오를 생성하는 2단계 파이프라인이다. 이 경우 오디오 모델은 비디오의 시각적 이벤트를 인식하여 동기화된 오디오를 생성한다.
물리 시뮬레이션 향상
물리적 사실성 향상을 위해 다음과 같은 전략이 적용된 것으로 추정된다:
- 합성 데이터 증강: 물리 엔진(예: Unreal Engine, Unity)으로 생성한 물리적으로 정확한 합성 비디오를 학습 데이터에 추가
- 인간 피드백 학습: 물리적 사실성에 대한 인간 선호도 데이터를 활용한 RLHF/DPO 정렬
- 스케일 확장: 모델 파라미터와 학습 데이터의 확대를 통한 물리적 패턴 학습 능력 향상
노이즈 스케줄과 샘플링
Sora 2의 노이즈 스케줄은 공개되지 않았으나, Flow Matching 또는 Rectified Flow 기반 직선 경로를 사용할 가능성이 높다. 이 경우 학습 목표는 벡터 필드 예측으로 전환된다:
핵심 혁신
Sora 2의 핵심 혁신은 물리적 사실성과 오디오 동기화라는 두 가지 실용적 과제를 동시에 해결한 것이다. 물리 시뮬레이션 정확도의 향상은 AI 생성 비디오가 “불쾌한 골짜기(uncanny valley)“를 넘어 시각적으로 신뢰할 수 있는 수준에 도달하고 있음을 보여준다. 오디오-비디오 동기 생성은 별도의 오디오 후처리 파이프라인 없이 완성된 멀티미디어 콘텐츠를 즉시 생성할 수 있게 하여, 콘텐츠 제작의 효율성을 크게 향상시킨다. 캐릭터 일관성 개선과 카메라 제어 능력의 향상도 실제 영상 제작 활용에서 중요한 진전이다.
벤치마크/성능
| 모델 | 물리 사실성 | 오디오 동기화 | 캐릭터 일관성 | ELO 순위 |
|---|---|---|---|---|
| Sora 2 | 높음 | 지원 | 개선됨 | Top 5 |
| Sora 1 | 중간 | 미지원 | 기본 | - |
| Veo 3 | 높음 | 네이티브 | 높음 | Top 3 |
| Runway Gen-4 | 높음 | 제한적 | 최고 수준 | Top 3 |
| Kling 2.6 | 중상위 | 제한적 | 높음 | Top 5 |
Sora 2는 ELO 기반 사용자 선호도 평가에서 최상위 군에 위치하며, 물리 사실성과 오디오 동기화 측면에서 Sora 1 대비 명확한 진보를 보인다. Veo 3와 함께 네이티브 오디오 생성을 지원하는 소수의 모델 중 하나이다.
학습
아키텍처 세부 사항, 학습 데이터, 파라미터 수 등은 공식 발표되지 않았다. OpenAI의 ChatGPT 및 API를 통해 서비스된다. 고품질 물리 기반 합성 데이터 및 실세계 물리 상호작용 영상이 추가 학습 데이터로 활용된 것으로 추정되며, 인간 피드백 기반 정렬 학습도 적용되었을 가능성이 높다. Sora 1 대비 모델 규모와 학습 데이터 모두 확대된 것으로 보인다.
관련 모델
Sora 2는 Sora에서 직접 발전하였으며, DiT 아키텍처에 기반한다. 주요 경쟁 모델로 Veo 3(Google DeepMind, 네이티브 오디오), Runway Gen-4(캐릭터 일관성), Kling 2.6(Kuaishou) 등이 있다.
참고 자료
관련 문서
- Sora — 발전 기반