논문 개요
GPT-4V가 뛰어난 멀티모달 이해 능력을 보여주지만, 그 학습 방법과 데이터는 공개되지 않았습니다. Liu 등(2023)은 NeurIPS에서 발표한 **LLaVA(Large Language and Vision Assistant)**를 통해 오픈소스 구성 요소만으로도 강력한 멀티모달 언어 모델을 구축할 수 있음을 보여줍니다.
LLaVA의 두 가지 핵심 혁신은:
- GPT-4를 활용한 시각적 지시 튜닝 데이터 자동 생성: 텍스트만 처리하는 GPT-4로 이미지 설명(캡션, 박스 좌표)을 입력으로 받아 대화형 지시 데이터 생성
- 단순한 비전-언어 연결 구조: 복잡한 크로스 어텐션 없이 선형 투영(linear projection) 레이어 하나로 CLIP과 LLaMA 연결
핵심 기여
- GPT-4 기반 멀티모달 지시 데이터 생성 파이프라인: 텍스트 전용 GPT-4로 고품질 시각적 지시 데이터 158K개 생성
- 효율적인 비전-언어 정렬: 선형 프로젝션으로 CLIP 특징과 LLM 임베딩 공간 연결
- 2단계 학습 전략: (1) 특징 정렬 사전학습, (2) 엔드-투-엔드 지시 튜닝
- LLaVA-Bench 벤치마크: 멀티모달 지시 따르기 능력 평가를 위한 새로운 벤치마크 제시
방법론 상세
아키텍처
LLaVA의 전체 구조는 세 부분으로 구성됩니다:
이미지 입력
↓
[CLIP 비전 인코더 (ViT-L/14)] → 시각적 특징 Z_v ∈ ℝ^(N×D_clip)
↓
[선형 투영 W] → 언어 임베딩 H_v ∈ ℝ^(N×D_llm)
↓
[LLaMA (언어 모델)] ← 텍스트 토큰 H_q
↓
텍스트 응답 출력
비전 인코더의 출력을 언어 모델 공간으로 매핑하는 투영 행렬:
이미지와 텍스트 토큰은 단순히 연결(concatenate)되어 LLaMA의 입력으로 사용됩니다:
GPT-4 기반 데이터 생성
COCO 데이터셋의 이미지에 대해 텍스트만 처리하는 GPT-4에게 다음 정보를 제공합니다:
- 이미지 캡션 (예: “사람이 공원에서 자전거를 타고 있다”)
- 경계 박스 좌표와 객체 레이블 (예:
person: [0.2, 0.1, 0.6, 0.9])
세 가지 유형의 지시 데이터를 생성합니다:
| 유형 | 설명 | 수량 |
|---|---|---|
| 대화(Conversation) | 이미지에 대한 Q&A 형식 | 58K |
| 상세 설명(Detailed Description) | 이미지 내용을 상세히 설명 | 23K |
| 복잡한 추론(Complex Reasoning) | 다단계 추론이 필요한 질문 | 77K |
| 합계 | 158K |
2단계 학습 전략
Stage 1: 특징 정렬 사전학습 (Feature Alignment Pre-training)
CC3M 데이터셋의 595K 이미지-캡션 쌍을 사용합니다. 이 단계에서 비전 인코더와 LLaMA는 **동결(frozen)**하고, 투영 행렬 만 학습합니다:
목적: CLIP 시각적 특징을 LLaMA가 이해할 수 있는 “시각적 토큰”으로 변환하는 방법 학습
Stage 2: 엔드-투-엔드 지시 튜닝 (End-to-End Instruction Tuning)
생성된 158K 지시 데이터로 학습합니다. 비전 인코더는 동결, 투영 행렬과 LLaMA는 모두 학습합니다:
학습 목표는 자동 회귀 언어 모델링:
여기서 는 시각적 토큰, 는 지시 텍스트, 는 이전 응답 토큰입니다.
대화 형식
LLaVA는 단일 턴 및 멀티 턴 대화를 지원합니다:
사용자: <이미지>\n이 이미지에서 무엇을 볼 수 있나요?
Assistant: 이미지에는 공원에서 ...
사용자: 그 사람의 옷 색깔은?
Assistant: 파란색 재킷을 ...
첫 번째 턴에만 <이미지> 태그가 포함되며, 이후 턴은 텍스트만으로 구성됩니다.
실험 결과
LLaVA-Bench (In-the-Wild)
GPT-4를 판정관으로 사용하여 응답 품질 점수(1~10)를 평가합니다:
| 모델 | 대화 | 상세 설명 | 복잡한 추론 | 전체 |
|---|---|---|---|---|
| BLIP-2 | 47.0 | 22.0 | 46.0 | 39.0 |
| OpenFlamingo | 43.0 | 32.0 | 37.0 | 37.0 |
| MiniGPT-4 | 65.0 | 67.0 | 65.0 | 65.0 |
| LLaVA | 84.7 | 82.8 | 96.4 | 87.1 |
| GPT-4 (텍스트 전용) | 100 | 100 | 100 | 100 |
ScienceQA
과학 지식 기반 시각적 질의응답 벤치마크:
| 모델 | 정확도 |
|---|---|
| GPT-3.5 (텍스트 전용) | 75.17% |
| MM-CoT | 84.91% |
| LLaVA | 90.92% |
| GPT-4 | 83.99% |
| LLaVA + GPT-4 앙상블 | 92.53% |
LLaVA 이후 발전
LLaVA-1.5 (2023)
주요 개선사항:
- 선형 투영 → MLP 투영 (2레이어 MLP)
- CLIP ViT-L/14@336px (고해상도)
- Vicuna-13B 사용
- 학습 데이터 강화 (665K)
성능: 11개 벤치마크 중 8개에서 최고 성능 달성
LLaVA-1.6 / LLaVA-NeXT (2024)
주요 개선사항:
- 동적 고해상도(AnyRes): 이미지를 그리드로 분할하여 고해상도 처리
- 더 많은 OCR 및 문서 이해 데이터
- Mistral-7B, Mixtral-8×7B 백본 지원
LLaVA-NeXT 고해상도 처리:
원본 이미지 → 4개 타일(2×2) + 전체 이미지 1개 = 5개 서브이미지
각 서브이미지를 CLIP으로 인코딩 후 연결
LLaVA-RLHF, LLaVA-Plus 등
환각(hallucination) 감소를 위한 RLHF 적용, 도구 사용 능력 추가 등 다양한 확장 연구
의의 및 한계
의의
- 접근성: 오픈소스 구성 요소만으로 GPT-4V에 근접하는 성능 달성, 연구 커뮤니티 활성화
- 단순성의 효과: 복잡한 크로스 어텐션 없이 선형 투영만으로도 효과적인 비전-언어 정렬 가능
- 데이터 효율성: 158K 데이터만으로 강력한 멀티모달 능력 학습
- 후속 연구 기반: InternVL, MiniCPM-V, Qwen-VL 등 수많은 후속 모델의 설계 참고
한계
- 환각(Hallucination): 이미지에 없는 객체나 속성을 생성하는 문제
- 고해상도 처리 한계: 초기 버전은 336px 고정 해상도, 세밀한 텍스트/숫자 인식 어려움
- 공간적 이해 한계: 객체 위치, 계수(counting) 등 정밀한 공간 추론 부족
- 비디오/오디오 미지원: 정적 이미지만 처리 가능
- 학습 데이터 편향: GPT-4가 생성한 데이터의 편향 계승 가능성
결론
LLaVA는 “GPT-4를 선생님으로 활용하여 더 저렴한 비용으로 멀티모달 모델을 학습한다”는 아이디어를 성공적으로 구현했습니다. CLIP + 선형 투영 + LLaMA라는 단순한 구조가 놀라운 멀티모달 이해 능력을 보여준다는 점에서, 멀티모달 AI 연구에 중요한 방향성을 제시했습니다. LLaVA-1.5, LLaVA-NeXT로 이어지는 발전은 오픈소스 멀티모달 모델 생태계의 핵심 축이 되었으며, 비전-언어 통합 연구의 중요한 기준점(baseline)으로 자리매김했습니다.