Gemma 3: 단일 GPU에서 실행되는 멀티모달 오픈 모델

개요

Gemma 3는 Google DeepMind가 2025년 3월 12일 공개한 차세대 경량 오픈소스 모델 시리즈이다. Gemini 2.0의 기술을 경량화하여 1B, 4B, 12B, 27B 네 가지 규모로 제공하며, 가장 큰 27B 모델도 단일 NVIDIA H100 또는 A100 GPU에서 실행할 수 있도록 설계되었다.

Gemma 3의 핵심 진화 포인트는 세 가지이다: (1) 멀티모달 입력(이미지+텍스트) 지원, (2) 128K 토큰 컨텍스트 윈도우, (3) 140개 이상의 언어 지원. 특히 27B 모델은 LMSys Chatbot Arena에서 1338점을 기록하여, 훨씬 더 큰 DeepSeek-V3(1318)나 Llama-3-405B(1257)를 능가하는 놀라운 결과를 보여주었다.

아키텍처 상세

기본 구조

구성 요소4B12B27B
Hidden Dimension230430724608
레이어 수264662
Attention Head (Q)81232
KV Head4416
컨텍스트 길이128K128K128K
어휘 크기262,144262,144262,144
위치 인코딩RoPERoPERoPE
정규화RMSNormRMSNormRMSNorm
활성화 함수GeGLUGeGLUGeGLU

교차 로컬-글로벌 어텐션 (Interleaved Local-Global Attention)

Gemma 3의 핵심 아키텍처 혁신은 로컬 어텐션과 글로벌 어텐션을 교차 배치하는 구조이다. 대부분의 레이어는 슬라이딩 윈도우 기반 로컬 어텐션을 수행하고, 일부 레이어만 전체 시퀀스에 대한 글로벌 어텐션을 수행한다.

여기서 는 슬라이딩 윈도우 마스크이다. 글로벌 어텐션 레이어는 마스크 없이 전체 시퀀스에 접근한다.

이 설계의 장점은:

  • 로컬 어텐션: 복잡도 (는 윈도우 크기)
  • 글로벌 어텐션: 복잡도지만 소수 레이어에만 적용
  • 전체적으로 128K 컨텍스트 처리 시 메모리와 연산을 대폭 절감

멀티모달 아키텍처

Gemma 3는 4B 이상 모델에서 이미지 입력을 지원한다. 비전 인코더(SigLIP 기반)가 이미지를 토큰 시퀀스로 변환하고, 이를 텍스트 토큰과 함께 Transformer에 입력한다. Pan-and-Scan 기법으로 고해상도 이미지를 여러 크롭으로 나누어 세부 정보를 포착한다.

핵심 혁신

1. 지식 증류(Knowledge Distillation)

Gemma 3는 Gemini 2.0이라는 교사 모델의 지식을 소형 학생 모델로 전달하는 증류 기법을 적극 활용한다. 이를 통해 소형 모델이 독립적으로 학습했을 때보다 훨씬 뛰어난 성능을 달성한다.

2. 효율적인 128K 컨텍스트

교차 로컬-글로벌 어텐션 덕분에 128K 컨텍스트를 처리하면서도 메모리 사용량이 합리적이다. 기존 Gemma 2의 8K에서 16배 확장되었지만, KV 캐시 증가는 글로벌 어텐션 레이어 비율에 비례하여 제한된다.

3. 140+ 언어 지원

262,144개의 확장된 어휘와 다국어 학습 데이터를 통해 140개 이상의 언어를 지원한다. 한국어를 포함한 비영어 언어에서의 토큰화 효율이 크게 개선되었다.

벤치마크/성능

벤치마크Gemma 3 27BGemma 2 27BQwen2.5-32BLlama-3-70B
MMLU-Pro67.556.965.055.7
MATH89.074.083.164.0
HumanEval87.872.084.581.7
LMSys Arena1338-12571257
MMMU64.2---

Gemma 3 27B는 MMLU-Pro에서 19% 상대적 개선을 달성했으며, MATH 89.0은 프론티어 모델에 근접하는 수준이다.

관련 모델 비교

Gemma 시리즈 진화

특성Gemma 1Gemma 2Gemma 3
출시2024.022024.062025.03
최대 규모7B27B27B
컨텍스트8K8K128K
모달리티텍스트텍스트텍스트+이미지
어텐션MHA/MQAGQA+Local-GlobalGQA+Local-Global
언어영어 중심영어 중심140+ 언어

동급 멀티모달 오픈 모델 비교

모델파라미터컨텍스트멀티모달Arena 점수
Gemma 3 27B27B128K이미지+텍스트1338
Qwen2.5-32B32B128K텍스트1257
Llama-3-70B70B128K텍스트1257
Phi-3-medium14B128K텍스트-

실무 활용

배포 가이드

  1. 단일 GPU 배포: 27B 모델이 A100/H100 80GB 단일 GPU에서 FP16으로 실행 가능
  2. 양자화 배포: INT4 양자화 시 24GB GPU(RTX 4090)에서도 실행 가능
  3. 모바일/엣지: Gemma 3n 변형은 MatMul-Free 기법으로 모바일 최적화
  4. 멀티모달 파이프라인: 이미지+텍스트 입력으로 시각 질의응답, 문서 이해 등 구현

ShieldGemma 안전성 모델

Gemma 3와 함께 제공되는 ShieldGemma는 유해 콘텐츠를 필터링하는 안전성 모델로, 프로덕션 배포 시 안전성을 보장한다.

한계 및 전망

한계

  1. Dense 아키텍처의 한계: MoE를 사용하지 않아, 동일 파라미터 대비 MoE 모델보다 추론 효율이 낮을 수 있음
  2. 비디오/오디오 미지원: 이미지만 지원하며, 비디오나 오디오 모달리티는 처리 불가
  3. 라이선스 제한: Gemma Terms of Use는 Apache 2.0보다 제한적
  4. 27B 상한: 최대 27B 규모로, 복잡한 추론 작업에서 70B+ 모델 대비 한계

전망

Gemma 3는 “단일 GPU에서 실행 가능한 최강 오픈소스 모델”이라는 포지셔닝으로 독특한 가치를 제공한다. LMSys Arena 1338점은 이 모델이 단순한 경량 모델이 아닌, 실질적으로 유용한 프로덕션 모델임을 증명한다. 향후 Gemma 시리즈는 더욱 강화된 멀티모달 능력과 에이전트 기능으로 발전할 것으로 예상된다.

관련 문서