LLaMA 3: 오픈소스 LLM의 GPT-4 도전
개요
LLaMA 3는 Meta가 2024년 4월 18일 공개한 오픈소스 대규모 언어 모델 시리즈로, 8B, 70B, 405B 세 가지 규모로 제공된다. LLaMA 2 대비 훈련 데이터를 7.5배(2T→15T 토큰) 확대하고, 128K 토큰 컨텍스트와 GQA를 전 모델에 도입하여 성능과 효율 모두를 대폭 향상시켰다.
특히 405B 모델은 오픈소스 모델 중 최초로 GPT-4 수준에 근접하는 성능을 달성하여 오픈소스 LLM 생태계의 이정표가 되었다. 8B 모델조차 LLaMA 2-70B에 필적하는 성능을 보이며, 데이터 스케일링의 위력을 극적으로 보여주었다.
참고 논문: The Llama 3 Herd of Models
아키텍처 상세
LLaMA 2 대비 핵심 변화
1. GQA 전면 도입
LLaMA 2에서 34B/70B에만 적용했던 GQA를 전 모델(8B 포함)에 적용했다:
8B 모델: Q 32헤드, KV 8헤드. 70B: Q 64헤드, KV 8헤드. 405B: Q 128헤드, KV 8헤드. GQA를 통해 KV 캐시 메모리가 대폭 감소하면서도 MHA 수준의 표현력을 유지한다.
2. 어휘 크기 4배 확장 (32K → 128K)
토크나이저를 128,256 어휘로 확장했다. 이는 LLaMA 2의 32K 대비 4배 증가로, 다국어 텍스트의 토큰화 효율이 크게 향상된다. 동일한 텍스트를 더 적은 토큰으로 표현할 수 있어, 실질적인 컨텍스트 길이가 확대되는 효과가 있다.
3. 128K 컨텍스트
LLaMA 2의 4K에서 32배 확장했다. RoPE의 기본 주파수를 500,000으로 조정하여 장거리 위치 인코딩 성능을 확보했다.
모델 사양
| 모델 | 파라미터 | 레이어 | 히든 | Q 헤드 | KV 헤드 |
|---|---|---|---|---|---|
| 8B | 8B | 32 | 4,096 | 32 | 8 |
| 70B | 70B | 80 | 8,192 | 64 | 8 |
| 405B | 405B | 126 | 16,384 | 128 | 8 |
데이터 스케일링의 위력
LLaMA 3의 가장 중요한 혁신은 아키텍처가 아니라 데이터 규모에 있다. 15T 토큰은 Chinchilla 최적 비율()을 크게 초과하는 의도적 과학습(overtraining)이다:
| 모델 | 파라미터 | Chinchilla 최적 | 실제 학습 | 과학습 비율 |
|---|---|---|---|---|
| 8B | 8B | 160B | 15T | 94x |
| 70B | 70B | 1.4T | 15T | 11x |
| 405B | 405B | 8.1T | 15T | 1.9x |
이 전략은 추론 시 더 작은 모델을 사용할 수 있게 해, 추론 비용 최적화에 유리하다.
핵심 혁신
1. 405B: 오픈소스 최초의 Frontier급 모델
405B는 MMLU 88.6%, HumanEval 61.0%를 달성하며 GPT-4(초기)에 근접했다. 오픈소스 모델이 독점 모델의 성능 영역에 진입한 최초의 사례이다.
2. 데이터 품질 파이프라인
Meta는 15T 토큰 수집을 위해 정교한 데이터 품질 필터링 파이프라인을 구축했다. Heuristic 필터링, 중복 제거(deduplication), 분류 모델 기반 품질 점수 부여, PII 제거 등 다단계 파이프라인이 적용되었다.
3. 의도적 과학습 전략
Chinchilla 법칙을 의도적으로 초과하여 학습함으로써, 8B 같은 소형 모델에서도 이전 세대 대형 모델에 필적하는 성능을 달성했다. 이는 배포 시 추론 비용을 절감하는 실용적 전략이다.
벤치마크/성능
| 벤치마크 | LLaMA 3-8B | LLaMA 2-70B | LLaMA 3-70B | LLaMA 3-405B | GPT-4 |
|---|---|---|---|---|---|
| MMLU | 68.4% | 68.9% | 82.0% | 88.6% | ~86% |
| HumanEval | 33.5% | 29.9% | 48.2% | 61.0% | ~67% |
| GSM8K | 79.6% | 56.8% | 93.0% | 96.8% | ~95% |
| ARC-C | 61.1% | 57.4% | 68.8% | 71.2% | - |
| MATH | 30.0% | - | 50.4% | 73.8% | ~68% |
8B 모델이 LLaMA 2-70B를 MMLU에서 비슷하게 따라잡고, GSM8K에서는 크게 능가한다.
관련 모델 비교
| 특성 | LLaMA 2 | LLaMA 3 | Mistral 7B | GPT-4 |
|---|---|---|---|---|
| 최대 모델 | 70B | 405B | 7.3B | ~1.8T |
| 학습 토큰 | 2T | 15T | 미공개 | 미공개 |
| 컨텍스트 | 4,096 | 128K | 8,192 | 128K |
| GQA | 34B/70B만 | 전 모델 | 전 모델 | - |
| 어휘 | 32K | 128K | 32K | ~100K |
| 오픈소스 | 예 | 예 | 예 | 아니오 |
학습 상세
- 데이터: 15T 토큰 (영어 비중 감소, 코드·수학·다국어 비중 대폭 증가)
- 토크나이저: BPE 128,256 vocab (tiktoken 기반)
- 옵티마이저: AdamW, lr cosine decay
- 배치: 8B: 4M 토큰, 405B: 16M 토큰
- 하드웨어: 16,384개 H100 GPU (405B 기준)
- 정렬: SFT + RLHF (DPO 포함) + Rejection Sampling
- 멀티모달: LLaMA 3.2에서 비전·음성 확장
실무 활용
1. 범용 기반 모델
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")2. 128K 컨텍스트 활용
장문 문서 분석, 다중 문서 RAG, 대규모 코드베이스 분석 등에 활용할 수 있다.
3. 8B 모델의 실용성
8B 모델은 4-bit 양자화 시 약 5GB 메모리로 소비자 GPU에서 실행 가능하며, 이전 세대 70B 수준의 성능을 제공한다.
한계 및 전망
한계
- Dense 구조의 비효율: 405B 전체 파라미터가 활성화되어 추론 비용이 높다.
- 커스텀 라이선스: Apache 2.0이 아닌 Meta 커스텀 라이선스로, 7억 MAU 이상 서비스에 제한이 있다.
- 멀티모달 한계: 기본 모델은 텍스트 전용이며, LLaMA 3.2에서야 멀티모달 확장이 이루어졌다.
전망
LLaMA 3는 오픈소스 LLM이 독점 모델의 성능 영역에 진입한 이정표이다. 405B의 Dense 구조 비효율은 LLaMA 4에서 MoE로 전환하여 해결되었으며, 15T 토큰 데이터 스케일링 전략은 이후 Qwen, DeepSeek 등 경쟁 모델들의 데이터 투자를 촉진했다.
참고 논문: The Llama 3 Herd of Models
관련 문서
- Llama 2: Open Foundation and Fine-Tuned Chat Models — 발전 기반
- Behemoth) — 후속 모델