DINOv3: 7B 규모 비전 파운데이션 모델
Meta · 2025-08-01 · Vision · CC-BY-NC-4.0
개요
DINOv3는 2025년 Meta FAIR에서 발표한 7B 파라미터 규모의 비전 파운데이션 모델로, DINO(2021) → DINOv2(2023)로 이어지는 자기지도 비전 학습 계보의 최신작이다. DINOv2가 ViT-g(1.1B)까지 스케일링하여 비전 파운데이션 모델의 가능성을 증명했다면, DINOv3는 7B까지 확장하며 비전 인코더에서도 언어 모델과 유사한 스케일링 법칙(scaling law)이 유효하게 작동한다는 것을 대규모로 실증한 연구이다. 이전까지 비전 인코더의 스케일링은 1-2B 수준에서 포화된다는 회의적 시각이 있었으나, DINOv3는 7B까지 로그-선형적 성능 향상이 지속됨을 보여 이를 반증하였다.
1.7B 규모의 정제된 대규모 이미지 데이터셋(LVD-1.7B, DINOv2의 LVD-142M을 12배 확장)에서 레이블 없이 자기지도 학습을 수행하며, 의료 영상(병리 슬라이드, X-ray, CT), 위성/항공 이미지, 과학 현미경 이미지 등 학습 분포에 명시적으로 포함되지 않은 전문 도메인에서도 기존 도메인 특화 지도 학습 모델을 능가하는 범용 시각 표현을 획득한다. 이는 충분한 규모의 자기지도 학습이 도메인 간 전이 가능한 보편적 시각 패턴(텍스처, 형태, 구조, 공간 관계)을 학습함을 의미한다.
특히 LLaVA, Cambrian 등 멀티모달 LLM의 비전 백본으로 CLIP ViT-L/14를 DINOv3로 교체했을 때 시각적 그라운딩, 공간 추론, 세밀한 시각 인식 능력이 일관되게 향상되었으며, 이는 비전 인코더의 스케일 업이 멀티모달 AI 시스템 전체의 성능 향상으로 직결됨을 보여주었다. DINOv3는 비전 표현 학습의 규모와 품질 모두에서 새로운 기준을 수립한 모델이다.
아키텍처 상세
ViT-giant2 아키텍처
DINOv3는 DINOv2의 ViT-g를 기반으로 크게 확장된 ViT-giant2 아키텍처를 채택한다. 핵심 변경 사항은 SwiGLU 활성화 함수의 도입, 히든 차원의 대폭 증가, 그리고 레이어 수 확장이다:
| 사양 | DINOv2 ViT-g | DINOv3 ViT-giant2 |
|---|---|---|
| 파라미터 | 1.1B | 7B |
| 레이어 수 | 40 | 48 |
| 히든 차원 | 1,536 | 4,544 |
| 어텐션 헤드 | 24 | 32 |
| 헤드 차원 | 64 | 142 |
| FFN 중간 차원 | 6,144 | 12,288 |
| FFN 활성화 | GELU | SwiGLU |
| 패치 크기 | 14×14 | 14×14 |
SwiGLU(Swish-Gated Linear Unit) 활성화 함수는 게이트 메커니즘을 통해 입력의 특정 차원을 선택적으로 활성화하는 구조이다:
여기서 이고 는 요소별 곱이다. LLaMA, Mistral 등 최신 언어 모델에서 성공적으로 검증된 이 기법은 표준 GELU FFN 대비 동일 파라미터 예산에서 더 높은 표현력을 제공한다. SwiGLU FFN은 게이트 행렬 과 값 행렬 를 갖기 때문에, 동일 중간 차원에서도 기존 GELU FFN보다 파라미터가 1.5배 많지만, 실제 성능 대비 연산량은 더 효율적이다.
Register Token
DINOv2에서 도입된 register token(4개의 학습 가능한 추가 토큰)을 계승한다. ViT의 깊은 레이어에서 관찰되는 어텐션 아티팩트 현상(정보가 없는 배경 패치에 어텐션 가중치가 비정상적으로 집중되는 현상, “artifact tokens” 문제)을 해결하기 위해 설계되었다. 이 토큰들은 모델이 전역적 맥락 정보나 위치 정보를 저장하는 “레지스터” 역할을 수행하여, 패치 토큰의 어텐션 맵이 실제 시각적 내용을 충실히 반영하도록 보장한다. 특히 밀집 예측 태스크(세그멘테이션, 깊이 추정)에서 패치 토큰의 품질이 중요하므로 register token의 효과가 두드러진다.
14×14 패치 크기로 518×518 입력을 처리하면:
- 개 패치 토큰
- 1개 [CLS] 토큰
- 4개 register 토큰
- 총 1,374개 토큰
학습 프레임워크 계승
DINOv2의 학습 목표를 계승하여, 이미지 수준 DINO 자기증류 손실과 패치 수준 iBOT 마스킹 이미지 모델링 손실을 결합한다:
Teacher 네트워크는 Student의 EMA로 업데이트되며(, cosine 스케줄), centering과 sharpening을 적용하여 모드 붕괴(mode collapse)를 방지한다. 멀티크롭 전략으로 2개의 글로벌 뷰(518²)와 다수의 로컬 뷰(98²)를 동시에 사용하여 다중 스케일 표현을 학습한다.
핵심 혁신
-
비전 스케일링 법칙 실증: 비전 인코더를 1.1B에서 7B로 6.4배 확장했을 때, ImageNet 선형 프로빙, 세그멘테이션, 깊이 추정, k-NN 분류 등 주요 다운스트림 벤치마크에서 로그-선형 관계의 일관된 성능 향상을 확인하였다. 이는 LLM에서 관찰되는 Chinchilla scaling law가 비전 인코더에서도 유효함을 의미하며, 비전 인코더의 규모 확장이 아직 포화되지 않아 더 큰 모델의 가능성을 시사한다.
-
전문 도메인 범용성: 의료(병리 슬라이드 분석, X-ray 이상 탐지, CT 기관 세그멘테이션), 위성/항공(토지 이용 분류, 변화 감지), 과학(현미경 세포 분류, 천문 은하 분류) 등 LVD-1.7B에 명시적으로 포함되지 않은 전문 도메인에서도 해당 도메인 특화 지도 학습 모델을 능가하는 제로샷 특징 추출 성능을 보인다. 이는 7B 규모에서 학습된 자기지도 표현이 도메인 불문 보편적 시각 패턴을 내재화했음을 증명한다.
-
멀티모달 LLM 비전 백본: CLIP ViT-L/14를 DINOv3로 교체했을 때 LLaVA, Cambrian 등 멀티모달 LLM의 시각적 그라운딩(이미지 내 특정 영역 참조), 공간 추론(“왼쪽 물체의 크기”), 세밀한 시각 인식(작은 텍스트 읽기, 미세한 차이 감지) 능력이 일관되게 향상된다. DINOv3의 풍부한 패치 수준 표현이 LLM에 더 상세하고 정확한 시각 정보를 제공하기 때문이다.
-
SwiGLU 도입 및 아키텍처 현대화: LLM에서 검증된 SwiGLU 활성화를 비전 트랜스포머에 성공적으로 적용하여, GELU FFN 대비 동일 연산량에서 더 높은 표현력을 달성하였다. 비전과 언어 모델의 아키텍처 수렴 경향을 보여주는 사례이다.
벤치마크/성능
| 태스크 | DINOv3 7B | DINOv2 ViT-g | CLIP ViT-L/14 | SigLIP-2 |
|---|---|---|---|---|
| ImageNet 선형 프로빙 | ~89% | 86.5% | 75.3% | 78.0% |
| ADE20K 세그멘테이션 (mIoU) | SOTA | 49.0 | - | - |
| k-NN 분류 | SOTA | 83.5% | - | - |
| 병리 이미지 분류 | SOTA | 양호 | - | - |
| 위성 이미지 분류 | SOTA | 양호 | - | - |
| LLaVA 시각 이해 | 향상 | - | baseline | - |
파인튜닝 없는 선형 프로빙만으로도 기존 CLIP이나 SigLIP를 파인튜닝한 결과보다 우수한 성능을 달성한다. 특히 전문 도메인(의료, 위성)에서의 성능 향상폭이 가장 크며, 이는 범용 시각 표현의 진정한 가치를 보여준다.
학습
- 데이터셋: LVD-1.7B (17억 이미지, 레이블 없음, LVD-142M의 12배 확장)
- 학습 프레임워크: DINO 자기증류 + iBOT MIM + KoLeo 정규화 (DINOv2 계승)
- Teacher 업데이트: EMA (momentum cosine 스케줄, )
- 안정화 기법: Centering, Sharpening, Stochastic Depth(DropPath), Gradient Clipping
- 멀티크롭: 글로벌 뷰(518²) 2개 + 로컬 뷰(98²) 다수
- GPU: 수천 개의 A100/H100 GPU (대규모 분산 학습)
- 마스킹 비율: 높은 비율 적용 (7B 수렴 안정화)
- FFN 활성화: SwiGLU (GELU 대체)
- 학습 기간: 수 주 (대규모 분산 클러스터)
- 학습 안정성: 7B 규모에서의 학습 불안정성(loss spike 등)을 Stochastic Depth와 높은 마스킹 비율로 해결
관련 모델
DINOv3는 DINO → DINOv2로 이어지는 자기지도 비전 학습 계보의 최정점으로, 7B 규모에서 비전 스케일링 법칙을 검증한 모델이다. CLIP/SigLIP과 달리 텍스트 정렬 없이 순수 시각 데이터만으로 학습하면서도, 멀티모달 LLM 백본으로 활용 시 CLIP을 능가하는 시각 이해 성능을 제공한다. 다만 CC-BY-NC-4.0 라이선스로 상업적 활용에 제약이 있으며, 7B 규모의 추론 비용이 높아 엣지 배포가 어렵다는 실용적 한계가 있다.
참고 자료
관련 문서
- DINOv2 — 발전 기반