논문 개요

GPT-4V가 뛰어난 멀티모달 이해 능력을 보여주지만, 그 학습 방법과 데이터는 공개되지 않았습니다. Liu 등(2023)은 NeurIPS에서 발표한 **LLaVA(Large Language and Vision Assistant)**를 통해 오픈소스 구성 요소만으로도 강력한 멀티모달 언어 모델을 구축할 수 있음을 보여줍니다.

LLaVA의 두 가지 핵심 혁신은:

  1. GPT-4를 활용한 시각적 지시 튜닝 데이터 자동 생성: 텍스트만 처리하는 GPT-4로 이미지 설명(캡션, 박스 좌표)을 입력으로 받아 대화형 지시 데이터 생성
  2. 단순한 비전-언어 연결 구조: 복잡한 크로스 어텐션 없이 선형 투영(linear projection) 레이어 하나로 CLIP과 LLaMA 연결

핵심 기여

  1. GPT-4 기반 멀티모달 지시 데이터 생성 파이프라인: 텍스트 전용 GPT-4로 고품질 시각적 지시 데이터 158K개 생성
  2. 효율적인 비전-언어 정렬: 선형 프로젝션으로 CLIP 특징과 LLM 임베딩 공간 연결
  3. 2단계 학습 전략: (1) 특징 정렬 사전학습, (2) 엔드-투-엔드 지시 튜닝
  4. LLaVA-Bench 벤치마크: 멀티모달 지시 따르기 능력 평가를 위한 새로운 벤치마크 제시

방법론 상세

아키텍처

LLaVA의 전체 구조는 세 부분으로 구성됩니다:

이미지 입력
    ↓
[CLIP 비전 인코더 (ViT-L/14)] → 시각적 특징 Z_v ∈ ℝ^(N×D_clip)
    ↓
[선형 투영 W] → 언어 임베딩 H_v ∈ ℝ^(N×D_llm)
    ↓
[LLaMA (언어 모델)] ← 텍스트 토큰 H_q
    ↓
텍스트 응답 출력

비전 인코더의 출력을 언어 모델 공간으로 매핑하는 투영 행렬:

이미지와 텍스트 토큰은 단순히 연결(concatenate)되어 LLaMA의 입력으로 사용됩니다:

GPT-4 기반 데이터 생성

COCO 데이터셋의 이미지에 대해 텍스트만 처리하는 GPT-4에게 다음 정보를 제공합니다:

  • 이미지 캡션 (예: “사람이 공원에서 자전거를 타고 있다”)
  • 경계 박스 좌표와 객체 레이블 (예: person: [0.2, 0.1, 0.6, 0.9])

세 가지 유형의 지시 데이터를 생성합니다:

유형설명수량
대화(Conversation)이미지에 대한 Q&A 형식58K
상세 설명(Detailed Description)이미지 내용을 상세히 설명23K
복잡한 추론(Complex Reasoning)다단계 추론이 필요한 질문77K
합계158K

2단계 학습 전략

Stage 1: 특징 정렬 사전학습 (Feature Alignment Pre-training)

CC3M 데이터셋의 595K 이미지-캡션 쌍을 사용합니다. 이 단계에서 비전 인코더와 LLaMA는 **동결(frozen)**하고, 투영 행렬 만 학습합니다:

목적: CLIP 시각적 특징을 LLaMA가 이해할 수 있는 “시각적 토큰”으로 변환하는 방법 학습

Stage 2: 엔드-투-엔드 지시 튜닝 (End-to-End Instruction Tuning)

생성된 158K 지시 데이터로 학습합니다. 비전 인코더는 동결, 투영 행렬과 LLaMA는 모두 학습합니다:

학습 목표는 자동 회귀 언어 모델링:

여기서 는 시각적 토큰, 는 지시 텍스트, 는 이전 응답 토큰입니다.

대화 형식

LLaVA는 단일 턴 및 멀티 턴 대화를 지원합니다:

사용자: <이미지>\n이 이미지에서 무엇을 볼 수 있나요?
Assistant: 이미지에는 공원에서 ...
사용자: 그 사람의 옷 색깔은?
Assistant: 파란색 재킷을 ...

첫 번째 턴에만 <이미지> 태그가 포함되며, 이후 턴은 텍스트만으로 구성됩니다.


실험 결과

LLaVA-Bench (In-the-Wild)

GPT-4를 판정관으로 사용하여 응답 품질 점수(1~10)를 평가합니다:

모델대화상세 설명복잡한 추론전체
BLIP-247.022.046.039.0
OpenFlamingo43.032.037.037.0
MiniGPT-465.067.065.065.0
LLaVA84.782.896.487.1
GPT-4 (텍스트 전용)100100100100

ScienceQA

과학 지식 기반 시각적 질의응답 벤치마크:

모델정확도
GPT-3.5 (텍스트 전용)75.17%
MM-CoT84.91%
LLaVA90.92%
GPT-483.99%
LLaVA + GPT-4 앙상블92.53%

LLaVA 이후 발전

LLaVA-1.5 (2023)

주요 개선사항:

  • 선형 투영 → MLP 투영 (2레이어 MLP)
  • CLIP ViT-L/14@336px (고해상도)
  • Vicuna-13B 사용
  • 학습 데이터 강화 (665K)

성능: 11개 벤치마크 중 8개에서 최고 성능 달성

LLaVA-1.6 / LLaVA-NeXT (2024)

주요 개선사항:

  • 동적 고해상도(AnyRes): 이미지를 그리드로 분할하여 고해상도 처리
  • 더 많은 OCR 및 문서 이해 데이터
  • Mistral-7B, Mixtral-8×7B 백본 지원
LLaVA-NeXT 고해상도 처리:
원본 이미지 → 4개 타일(2×2) + 전체 이미지 1개 = 5개 서브이미지
각 서브이미지를 CLIP으로 인코딩 후 연결

LLaVA-RLHF, LLaVA-Plus 등

환각(hallucination) 감소를 위한 RLHF 적용, 도구 사용 능력 추가 등 다양한 확장 연구


의의 및 한계

의의

  • 접근성: 오픈소스 구성 요소만으로 GPT-4V에 근접하는 성능 달성, 연구 커뮤니티 활성화
  • 단순성의 효과: 복잡한 크로스 어텐션 없이 선형 투영만으로도 효과적인 비전-언어 정렬 가능
  • 데이터 효율성: 158K 데이터만으로 강력한 멀티모달 능력 학습
  • 후속 연구 기반: InternVL, MiniCPM-V, Qwen-VL 등 수많은 후속 모델의 설계 참고

한계

  • 환각(Hallucination): 이미지에 없는 객체나 속성을 생성하는 문제
  • 고해상도 처리 한계: 초기 버전은 336px 고정 해상도, 세밀한 텍스트/숫자 인식 어려움
  • 공간적 이해 한계: 객체 위치, 계수(counting) 등 정밀한 공간 추론 부족
  • 비디오/오디오 미지원: 정적 이미지만 처리 가능
  • 학습 데이터 편향: GPT-4가 생성한 데이터의 편향 계승 가능성

결론

LLaVA는 “GPT-4를 선생님으로 활용하여 더 저렴한 비용으로 멀티모달 모델을 학습한다”는 아이디어를 성공적으로 구현했습니다. CLIP + 선형 투영 + LLaMA라는 단순한 구조가 놀라운 멀티모달 이해 능력을 보여준다는 점에서, 멀티모달 AI 연구에 중요한 방향성을 제시했습니다. LLaVA-1.5, LLaVA-NeXT로 이어지는 발전은 오픈소스 멀티모달 모델 생태계의 핵심 축이 되었으며, 비전-언어 통합 연구의 중요한 기준점(baseline)으로 자리매김했습니다.