DiT (Diffusion Transformers): 확산 트랜스포머

개요

Scalable Diffusion Models with Transformers(DiT)는 2022년 Meta AI와 UC Berkeley의 William Peebles, Saining Xie가 발표한 연구로, 확산 모델의 백본 네트워크를 기존 U-Net에서 Vision Transformer(ViT)로 대체한 선구적 아키텍처이다. 핵심 발견은 Transformer 스케일링 법칙이 확산 모델에도 그대로 적용된다는 것이다.

아키텍처 상세

전체 파이프라인

DiT는 LDM과 동일하게 VAE 잠재 공간에서 동작한다:

  1. VAE 인코더로 이미지를 잠재 맵 로 인코딩
  2. 잠재 맵을 패치로 분할하여 개의 토큰 시퀀스 구성
  3. 선형 임베딩 후 2D 위치 인코딩 추가
  4. 개의 DiT 블록으로 노이즈 예측
  5. VAE 디코더로 이미지 복원
구성 요소DiT-XL/2 사양
파라미터 수675M
히든 차원1152
레이어 수28
어텐션 헤드16
패치 크기2
VAEStable Diffusion VAE (KL-f8)
잠재 공간
위치 인코딩Sinusoidal 2D
정규화AdaLN-Zero
활성화GELU

네 가지 조건 주입 방법 비교

논문은 타임스텝과 클래스 레이블을 DiT 블록에 주입하는 네 가지 방법을 체계적으로 비교하였다:

방법설명FID (XL/2)
In-Context조건 토큰을 시퀀스에 추가5.11
Cross-Attention조건을 별도 KV로 어텐션3.75
Adaptive LN (adaLN)조건으로 LN 스케일·시프트 생성2.85
adaLN-ZeroadaLN + 게이트 0 초기화2.27

adaLN-Zero 블록

adaLN-Zero는 DiT의 핵심 설계 선택이다:

(잔차 게이트)는 0으로 초기화되어 학습 초기 DiT 블록이 항등 함수(identity function)로 동작한다. 이는 학습 초기 안정성을 크게 향상시킨다.

스케일링 법칙

DiT는 네 가지 크기(S/B/L/XL)와 세 가지 패치 크기(2/4/8) 조합을 실험하였다:

모델파라미터GFLOPsFID (↓)
DiT-S/233M6.0668.40
DiT-B/2130M23.0143.47
DiT-L/2458M80.719.62
DiT-XL/2675M118.642.27
DiT-XL/4675M29.669.07
DiT-XL/8675M7.4231.04

핵심 발견: GFLOPs가 증가할수록 FID가 체계적으로 감소한다. 패치 크기를 줄이는 것(시퀀스 길이 증가)이 모델 크기를 키우는 것만큼이나 효과적이다.

핵심 혁신

  1. U-Net → Transformer 전환: 확산 모델의 백본을 Transformer로 대체할 수 있음을 증명하여, 이후 Sora, SD3, Flux 등의 방향을 제시하였다.
  2. adaLN-Zero: 0 초기화 게이트를 통한 안정적이고 효과적인 조건 주입 방법으로, 이후 표준 기법이 되었다.
  3. 스케일링 법칙 증명: LLM에서 관찰된 스케일링 법칙이 확산 이미지 생성에도 적용됨을 실증하였다.
  4. 패치 크기의 중요성: 작은 패치 크기(더 긴 시퀀스)가 더 높은 품질을 가져오며, 이는 해상도 확장에 핵심 설계 변수임을 보였다.

벤치마크/성능

모델FID (↓)IS (↑)데이터셋
DiT-XL/2 (w/o CFG)9.62121.5ImageNet 256
DiT-XL/2 (CFG )2.27278.2ImageNet 256
LDM-4 (CFG)3.60-ImageNet 256
ADM (CFG)4.59186.7ImageNet 256
BigGAN-deep6.95198.2ImageNet 256

DiT-XL/2는 CFG 적용 시 FID 2.27로 기존 모든 클래스 조건부 모델을 능가하였다.

관련 모델 비교

특성DiTLDM (U-Net)PixArt-αSD3 (MMDiT)
백본ViTU-NetDiT + Cross-AttnMMDiT
조건 주입adaLN-ZeroCross-AttnadaLN-SingleDual-Stream
스케일링입증제한적효율적대규모
텍스트 조건클래스만CLIPT5-XXLCLIP + T5
패치 기반아니오

학습 상세

  • 데이터셋: ImageNet 1000 클래스, 256×256 / 512×512
  • VAE: Stable Diffusion VAE (KL-f8, 동결)
  • 학습률: 1e-4, Adam optimizer
  • EMA: 0.9999
  • 학습 스텝: 7M (약 7일, 8× A100)
  • CFG: 학습 시 10% 클래스 드롭아웃

실무 활용

1. 대규모 확산 모델의 백본

DiT 아키텍처는 Sora(비디오), SD3/Flux(이미지), PixArt-α(효율적 학습) 등 현대 대규모 확산 모델의 표준 백본이 되었다.

2. 스케일링 법칙 기반 모델 설계

Compute-optimal 모델 크기 선택 시 DiT의 스케일링 결과를 참조하여 파라미터 수, 패치 크기, GFLOPs 예산을 결정할 수 있다.

3. 비디오·3D 생성으로의 확장

패치 기반 토큰화 방식은 2D 이미지에서 3D 시공간 패치로 자연스럽게 확장되어, 비디오 생성(Sora)과 3D 생성에 적용 가능하다.

한계 및 전망

한계

  1. 클래스 조건부만 실험: 원논문은 텍스트 조건부 생성을 다루지 않아, 실용적 텍스트-이미지 생성으로의 확장이 후속 연구에 맡겨졌다.
  2. Self-Attention 비용: 시퀀스 길이의 제곱에 비례하는 어텐션 비용이 고해상도 확장에 병목이 된다.

후속 발전

  • PixArt-α (2023): DiT에 Cross-Attention을 추가한 효율적 텍스트-이미지 생성
  • SD3 (2024): MMDiT로 이미지-텍스트 이중 스트림 어텐션 도입
  • Sora (2024): 시공간 패치 DiT를 비디오 생성에 적용
  • Flux (2024): 하이브리드 이중/단일 스트림 DiT

DiT는 확산 모델의 Transformer 시대를 연 혁신적 연구로, “확산 + Transformer + 스케일링”이라는 현대 생성 AI의 핵심 공식을 확립하였다.

관련 문서