Kling: 장시간 고해상도 비디오 생성
개요
Kling은 중국의 동영상 플랫폼 기업 Kuaishou Technology가 2024년 6월 공개한 텍스트-비디오 및 이미지-비디오 생성 모델로, 2분 길이의 1080p 영상 생성이라는 당시 업계 최장 시간 고해상도 비디오 생성 능력으로 주목받았다. DiT 아키텍처 기반 3D Full Attention을 활용한다.
- 발표: 2024년 6월, Kuaishou Technology
- 라이선스: Proprietary
아키텍처 상세
DiT 기반 비디오 생성
Kling은 DiT에서 영감을 받은 3D Full Attention 아키텍처를 사용한다:
| 구성 요소 | 사양 |
|---|---|
| 파라미터 | 비공개 |
| 어텐션 | 3D Full Attention |
| 위치 인코딩 | 3D RoPE |
| VAE | 3D Causal VAE |
| 텍스트 인코더 | 다국어 (중국어+영어) |
| 생성 해상도 | 최대 1080p |
| 최대 길이 | 2분 |
3D Causal VAE
시간 방향 4배, 공간 방향 8배 다운샘플링을 수행하며, 인과 합성곱(Causal Conv3D)을 사용한다:
인과 구조의 핵심: 현재 프레임은 이전 프레임에만 의존하므로, 스트리밍 비디오 생성과 점진적 연장(video extension)이 가능하다.
이미지-비디오 (I2V) 모드
입력 이미지를 잠재 공간에 인코딩 후 비디오 시퀀스의 첫 프레임으로 고정하고, 나머지 프레임을 생성하는 방식이다:
이 방식은 참조 이미지의 시각적 특성(인물 외형, 배경 등)을 비디오 전체에 걸쳐 일관되게 유지할 수 있다.
3D Full Attention
모든 시공간 위치 간의 어텐션을 계산하여 높은 시간적 일관성을 달성한다. 3D RoPE로 임의 해상도와 시간 길이를 지원한다.
핵심 혁신
- 2분 길이 1080p 비디오: 당시 가장 긴 고해상도 비디오 생성 능력을 시연하였다.
- 이미지-비디오 변환: 참조 이미지로부터 자연스러운 동작의 비디오를 생성하는 I2V 기능이 높은 평가를 받았다.
- 물리적 사실성: 물체 상호작용, 카메라 동작, 인체 동작의 자연스러운 표현에서 국제 수준의 경쟁력을 보였다.
- 빠른 버전 업데이트: 1.0 → 1.5 → 2.0 → 2.6으로 반년 내에 빠르게 발전하였다.
벤치마크/성능
| 모델 | 최대 해상도 | 최대 길이 | 물리 사실성 | I2V | 발표 시기 |
|---|---|---|---|---|---|
| Kling 2.6 | 1080p | 2분 | 높음 | 우수 | 2025.02 |
| Sora | 1080p | 60초 | 높음 | 제한적 | 2024.02 |
| Gen-3 Alpha | 1080p | 10초 | 중간 | 높음 | 2024.06 |
| CogVideoX | 720p | 6초 | 중간 | 높음 | 2024.08 |
ELO 기반 사용자 선호도 평가에서 Sora, Gen-3 등과 함께 최상위 군을 형성하였다.
관련 모델 비교
| 특성 | Kling | Sora | HunyuanVideo | CogVideoX |
|---|---|---|---|---|
| 개발사 | Kuaishou | OpenAI | Tencent | Zhipu AI |
| 오픈소스 | 아니오 | 아니오 | Apache 2.0 | Apache 2.0 |
| 최대 길이 | 2분 | 60초 | 5초 | 6초 |
| 해상도 | 1080p | 1080p | 720p | 720p |
| I2V | 우수 | 제한적 | 가능 | 가능 |
| 다국어 | 중/영 | 영어 | 중/영 | 중/영 |
학습 상세
- 데이터셋: Kuaishou 내부 대규모 비디오 데이터 (Kwai 플랫폼 영상 포함)
- 텍스트 인코더: 중국어·영어 이중 언어
- 버전 히스토리: 1.0(2024.06) → 1.5(2024.09) → 2.0(2024.11) → 2.6(2025.02)
- 서비스: 중국 우선 공개 후 글로벌 확장
실무 활용
1. 장시간 비디오 콘텐츠 제작
2분 길이의 고해상도 비디오 생성으로 짧은 광고, 소셜 미디어 콘텐츠, 제품 데모 영상 제작에 활용 가능하다.
2. 이미지 기반 비디오 생성
제품 사진, 인물 사진 등 정적 이미지를 자연스러운 동작의 비디오로 변환하여 e-commerce, 마케팅에 활용한다.
3. 전문 영상 제작 보조
카메라 동작 제어, 인물 일관성 등 전문 영상 제작에 필요한 기능을 제공하여 프리프로덕션 시각화에 활용된다.
한계 및 전망
한계
- 비공개 아키텍처: 논문과 코드가 공개되지 않아 재현이 불가능하다.
- 프로프라이어터리 서비스: API를 통해서만 접근 가능하다.
- 중국 우선 정책: 글로벌 서비스 확장에 시간 지연이 있었다.
후속 발전
- Kling 3 (2026): 멀티샷 시퀀스 생성, 캐릭터 일관성 강화
- 전문 워크플로우 통합: 영상 편집 소프트웨어와의 플러그인 연동
- 실시간 생성: 추론 속도 최적화를 통한 인터랙티브 생성
Kling은 중국 AI 기업이 비디오 생성 분야에서 국제적 경쟁력을 갖춤을 보여준 대표적 모델로, 장시간 고품질 비디오 생성의 실용적 가능성을 열었다.
기술적 의의
Kling의 가장 인상적인 성과는 2분 길이의 1080p 비디오를 일관된 품질로 생성할 수 있다는 것이다. 이는 단순히 생성 길이를 늘리는 것이 아니라, 장시간에 걸친 시각적 일관성과 물리적 사실성을 유지하는 것이 기술적 핵심이다. Causal VAE의 설계는 비디오 연장과 스트리밍 생성을 자연스럽게 지원하며, 이는 장시간 비디오 생성의 핵심 요소이다. Kuaishou라는 동영상 플랫폼 기업의 비디오 이해·분석 기술이 생성 모델의 품질 향상에도 기여한 것으로 보이며, 특히 물리적 사실성과 카메라 동작 표현에서 Kwai 플랫폼의 방대한 비디오 데이터가 학습에 효과적으로 활용된 것으로 추정된다. Kling의 빠른 버전 업데이트 주기(6개월에 4개 메이저 버전)는 비디오 생성 분야의 치열한 경쟁 양상을 잘 보여주며, 기술 발전 속도가 가속화되고 있음을 시사한다. 이미지-비디오 변환(I2V) 기능에서 Kling의 강점은 참조 이미지의 외형을 높은 충실도로 유지하면서 자연스러운 동작을 생성하는 데 있으며, 이는 e-commerce와 소셜 미디어 콘텐츠 제작에서 실질적인 상업 가치를 만들어내고 있다. 다국어 텍스트 인코더의 지원은 글로벌 시장 진출에 유리한 요소이며, 중국어와 영어를 모두 지원함으로써 다양한 문화권의 사용자가 자연어로 비디오를 생성할 수 있게 한다.
관련 문서
- Kling 3 — 후속 모델
- DiT (Diffusion Transformers) — 영감