Veo 3: 네이티브 오디오-비디오 공동 생성 모델

Google DeepMind · 2025-05-20 · Diffusion · Proprietary

개요

Veo 3는 2025년 Google DeepMind가 Google I/O에서 발표한 차세대 비디오 생성 모델로, 비디오와 오디오를 동시에 생성하는 네이티브 오디오-비디오 공동 생성(Native Audio-Video Joint Generation) 능력이 가장 큰 혁신이다. Veo 2가 무음 비디오를 생성하여 별도의 음악/음향 효과 추가가 필요했던 것과 달리, Veo 3는 텍스트 프롬프트 하나로 비디오와 오디오를 동시에 생성한다.

네이티브 오디오-비디오 공동 생성이 중요한 이유는 음향과 영상의 동기화 품질에 있다. 별도의 오디오 모델을 사후 적용하는 방식은 시각적 이벤트와 소리의 정확한 타이밍 동기화가 어렵다. 반면 Veo 3는 비디오와 오디오가 공동 확산(Joint Diffusion) 과정에서 함께 생성되므로, 시각적 사건과 소리가 자연스럽게 일치한다. 예를 들어 발자국 소리는 발이 땅에 닿는 정확한 순간에, 물 튀기는 소리는 물이 튀는 정확한 프레임에 맞춰진다.

Veo 3가 생성하는 오디오는 세 가지 범주를 포함한다: (1) 장면 내 대화(dialogue) — 등장인물의 음성과 입술 움직임이 동기화, (2) 환경 음향(ambient sound) — 바람 소리, 새 소리, 도시 소음 등 장면에 적합한 배경음, (3) 음향 효과(sound effects) — 문 여닫는 소리, 자동차 엔진 소리 등 특정 시각적 이벤트에 맞춘 효과음. 동기화된 입술 움직임과 음성도 지원되어 대화 장면의 사실성이 크게 향상되었다.

비디오 품질 측면에서도 Veo 2 대비 더 세밀한 텍스처, 복잡한 동작, 더 긴 시퀀스에서의 일관성이 향상되었다. Google의 AI 미디어 스튜디오인 VideoFX와 Flow 플랫폼에 통합 제공되며, Gemini Ultra 구독자에게 우선 제공되었다.

아키텍처 상세

공동 멀티모달 확산 (Joint Multimodal Diffusion)

Veo 3의 정확한 아키텍처는 공개되지 않았으나, 비디오와 오디오를 함께 생성하기 위한 Joint Multimodal DiT 구조가 핵심으로 추정된다. 이 구조에서 비디오 잠재 토큰과 오디오 잠재 토큰이 동일한 DiT 백본에서 처리된다.

비디오 는 Video VAE로, 오디오 는 Audio VAE(예: EnCodec, SoundStream)로 각각 잠재 공간에 인코딩된다. 두 모달리티의 잠재 토큰은 시간 축에서 정렬되어 결합 시퀀스를 구성한다:

확산 과정에서 두 모달리티에 동시에 노이즈가 추가되고, 공동 디노이징이 수행된다:

시공간-오디오 어텐션

DiT 블록의 Full Self-Attention은 비디오와 오디오 토큰을 모두 포함하는 결합 시퀀스에 적용된다:

이 구조에서 네 가지 상호작용이 계산된다: 비디오-비디오, 비디오-오디오, 오디오-비디오, 오디오-오디오. 비디오-오디오 간의 Cross-Attention은 시각적 이벤트와 음향의 시간적 정렬을 학습하는 핵심 메커니즘이다. 특정 시각적 이벤트(예: 물체 충돌)에 해당하는 비디오 토큰이 대응하는 시간대의 오디오 토큰과 높은 어텐션 가중치를 갖게 되어 자연스러운 동기화가 달성된다.

입술 동기화 (Lip Synchronization)

대화 장면에서의 입술 동작과 음성의 동기화는 특히 어려운 과제이다. 이를 위해 별도의 화자 인식(speaker recognition) 또는 키포인트 기반 모듈이 보완하는 것으로 추정된다. 텍스트 프롬프트에서 대화 내용이 지정되면, TTS(Text-to-Speech) 유사 모듈이 음성을 생성하고, 이에 맞춰 입술 움직임이 조절된다.

오디오 조건부 제어

텍스트 프롬프트로 다음 요소들을 제어할 수 있다:

  • 음향 스타일: “조용한 실내”, “활기찬 거리” 등 장면의 전체적인 음향 분위기
  • 대화 내용: 등장인물의 대사 지정
  • 환경 음향: “새 소리”, “비 소리” 등 특정 배경음 지정
  • 음향 효과: “폭발 소리”, “발자국 소리” 등 특정 이벤트 음향

핵심 혁신

Veo 3의 핵심 혁신은 비디오와 오디오를 단일 확산 과정에서 공동 생성하여, 시각적 이벤트와 음향의 정확한 시간적 동기화를 달성한 것이다. 이는 비디오 생성 AI가 “영상만 만드는 도구”에서 “완성된 멀티미디어 콘텐츠를 만드는 도구”로 진화한 중요한 이정표이다. 입술 동기화를 포함한 대화 장면 생성은 특히 높은 기술적 난이도를 요구하며, Veo 3가 이를 실용적 수준으로 구현한 것은 주목할 만하다. 이 혁신은 비디오 생성 AI 업계 전반에서 “오디오 포함 생성”이 표준이 되는 흐름을 촉발하였다.

벤치마크/성능

모델오디오 동기화입술 동기화비디오 품질대화 생성ELO 순위
Veo 3네이티브지원최상위지원Top 2
Sora 2지원제한적상위권제한적Top 5
Veo 2미지원미지원상위권미지원Top 3
Runway Gen-4제한적미지원상위권미지원Top 3
Kling 2.6제한적제한적상위권제한적Top 5

Veo 3는 2025년 발표 시점에서 네이티브 오디오-비디오 공동 생성을 지원하는 가장 앞선 모델로, 특히 입술 동기화와 대화 생성 능력에서 다른 모델들을 크게 앞서고 있다. ELO 기반 평가에서도 종합 최상위를 기록하였다.

학습

학습 데이터 및 아키텍처 세부 사항은 공개되지 않았다. 고품질 오디오-비디오 쌍 데이터셋(영화, 드라마, 다큐멘터리 등 전문 제작 영상)이 학습에 활용된 것으로 알려져 있다. Google의 Gemini 멀티모달 모델의 이해 능력이 프롬프트 해석 및 오디오-비디오 정렬 개선에 활용되었을 가능성이 높다. SynthID 워터마킹이 생성된 비디오와 오디오 모두에 적용된다. Veo 3/3.1 버전이 2025년 중 순차 출시되었다.

관련 모델

Veo 3는 Veo 2에서 직접 발전하였으며, Google DeepMind의 Imagen, Lumiere, VideoPoet 연구의 연장선상에 있다. 경쟁 모델로 Sora 2(OpenAI, 오디오 동기화 지원), Runway Gen-4(캐릭터 일관성), Kling 2.6(Kuaishou) 등이 있다.

참고 자료

관련 문서

  • Veo 2 — 발전 기반