Gemini 1.5: 100만 토큰 컨텍스트의 MoE 멀티모달 모델
개요
Gemini 1.5는 Google DeepMind가 2024년 2월 15일 발표한 차세대 AI 모델로, Pro와 Flash 두 가지 버전으로 제공된다. 이 모델의 가장 혁신적인 특징은 최대 100만 토큰(Gemini 1.5 Pro 기준)의 초장문 컨텍스트 처리 능력이다. 100만 토큰은 약 700,000단어, 30,000줄의 코드, 11시간 분량의 오디오, 또는 1시간 분량의 비디오에 해당하는 분량이다.
Gemini 1.5는 Mixture of Experts(MoE) 아키텍처를 채택하여 Gemini 1.0 Ultra와 동등하거나 더 나은 성능을 훨씬 적은 연산으로 달성했다. 특히 Needle-in-a-Haystack 테스트에서 100만 토큰 전체 구간에서 99.7% 이상의 완벽한 검색 정확도를 보여 장문 이해 능력의 신뢰성을 입증했다.
아키텍처 상세
기본 구조
| 구성 요소 | 사양 |
|---|---|
| 아키텍처 | Decoder-only Transformer + MoE |
| 컨텍스트 길이 | 1,000,000 (Pro) / 32,768 (Flash) |
| Attention | Multi-Query Attention |
| 정규화 | RMSNorm |
| 활성화 함수 | GeGLU |
| 위치 인코딩 | RoPE |
| 어휘 크기 | ~256,000 |
| 모달리티 | 텍스트 + 이미지 + 오디오 + 비디오 |
Mixture of Experts (MoE)
Gemini 1.5는 Gemini 1.0의 Dense 아키텍처에서 MoE로 전환했다. 각 토큰 처리 시 전체 전문가의 일부만 활성화하여:
여기서 는 활성 전문가 수, 은 전체 전문가 수이다. 이를 통해 모델의 전체 용량(파라미터 수)을 크게 늘리면서도 추론 시 연산 비용을 제한할 수 있다.
100만 토큰 컨텍스트의 기술적 구현
100만 토큰 컨텍스트를 효과적으로 처리하기 위해 여러 기술이 결합되었다:
-
단계적 컨텍스트 확장(Progressive Context Extension): 짧은 컨텍스트에서 학습을 시작하고 점진적으로 컨텍스트 길이를 늘려가는 방식
-
효율적 어텐션 메커니즘: 장문에서의 어텐션 연산을 최적화
- 표준 Self-Attention의 복잡도:
- 100만 토큰 시 이론적 연산량이 극도로 증가하므로 최적화 필수
-
KV 캐시 최적화: MQA를 통한 KV 캐시 절감이 장문 처리의 핵심
핵심 혁신
1. Needle-in-a-Haystack: 완벽한 장문 검색
이 테스트는 긴 문맥 속에 숨겨진 특정 정보(“바늘”)를 찾는 능력을 평가한다. Gemini 1.5 Pro의 결과:
| 컨텍스트 길이 | 텍스트 검색률 | 오디오 검색률 | 비디오 검색률 |
|---|---|---|---|
| ~100K 토큰 | 100% | 100% | 100% |
| ~530K 토큰 | 100% | 100% | 99.8% |
| ~1M 토큰 | 99.7%+ | 100% | 99.2% |
| ~10M 토큰 | 99.2% | - | - |
특히 오디오 모달리티에서는 107시간(약 5일) 분량의 오디오에서도 100% 정확도로 숨겨진 키워드를 찾아냈다.
2. In-Context Learning의 극단적 확장
100만 토큰 컨텍스트를 활용한 놀라운 In-Context Learning 사례가 보고되었다:
- 새로운 언어 학습: 학습 데이터에 포함되지 않은 Kalamang 언어(파푸아뉴기니의 소멸 위기 언어)의 문법서를 컨텍스트에 제공하자, 영어-Kalamang 번역이 가능해짐
- 전체 코드베이스 이해: 수만 줄의 코드를 한 번에 입력하여 버그를 찾거나 리팩토링 제안
3. 멀티모달 장문 추론
1시간 분량의 무성 영화 내용에 대한 질문에 답하거나, 수백 페이지의 PDF 문서에서 특정 정보를 추출하는 등의 멀티모달 장문 작업이 가능하다.
벤치마크/성능
| 벤치마크 | Gemini 1.5 Pro | Gemini 1.0 Ultra | GPT-4 Turbo | Claude 3 Opus |
|---|---|---|---|---|
| MMLU | 81.9% | 90.0% | 86.4% | 86.8% |
| MATH | 58.5% | 53.2% | 52.6% | - |
| HumanEval | 71.9% | 74.4% | 67.0% | - |
| Natural2Code | 77.7% | 74.9% | 73.9% | - |
| MMMU | 58.5% | 62.4% | 56.8% | 59.4% |
Gemini 1.5 Pro는 Gemini 1.0 Ultra에 비해 대부분의 벤치마크에서 유사하거나 약간 낮은 성능을 보이지만, 훨씬 적은 연산으로 이를 달성한다는 점이 핵심이다.
관련 모델 비교
컨텍스트 길이 경쟁
| 모델 | 출시 | 컨텍스트 | 아키텍처 | Needle 정확도 |
|---|---|---|---|---|
| GPT-4 | 2023.03 | 128K | Dense | ~95% (128K) |
| Claude 2.1 | 2023.11 | 200K | Dense | ~95% (200K) |
| Gemini 1.5 Pro | 2024.02 | 1M | MoE | 99.7% (1M) |
| Claude 3 | 2024.03 | 200K | Dense | ~99% (200K) |
Gemini 시리즈 내 비교
| 특성 | Gemini 1.0 | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|
| 아키텍처 | Dense | MoE | MoE |
| 컨텍스트 | 32K | 1M | 32K→1M |
| 추론 비용 | 높음 | 중간 | 낮음 |
| 주요 강점 | 최고 품질 | 장문 + 효율 | 속도 + 비용 |
실무 활용
100만 토큰 컨텍스트 활용 사례
- 전체 코드베이스 분석: 프로젝트 전체 소스코드를 입력하여 리뷰, 버그 탐지, 문서화
- 장문 문서 처리: 법률 계약서, 학술 논문 묶음, 회의록 전체를 한 번에 분석
- 비디오 이해: 강의, 회의 녹화, 영화 등 비디오 콘텐츠의 자동 요약 및 QA
- 오디오 전사 및 분석: 팟캐스트, 콜센터 통화 등 장시간 오디오 처리
Flash vs Pro 선택 가이드
| 사용 사례 | 추천 모델 | 이유 |
|---|---|---|
| 복잡한 추론 | Pro | 높은 품질 |
| 대량 처리 | Flash | 빠른 속도, 낮은 비용 |
| 실시간 대화 | Flash | 낮은 latency |
| 장문 분석 | Pro | 1M 컨텍스트 최적화 |
한계 및 전망
한계
- 비용: 100만 토큰 입력의 API 비용이 상당하여 대량 처리에는 부담
- Latency: 장문 입력 시 첫 토큰 생성까지의 시간이 길어짐
- 비공개 구조: MoE의 전문가 수, 활성 전문가 수 등 세부 사양 미공개
- 품질 유지: 100만 토큰 전체에서 균일한 품질 유지가 어려울 수 있음
전망
Gemini 1.5는 LLM 컨텍스트 길이 경쟁에서 결정적인 이정표를 세웠다. 100만 토큰이라는 수치는 단순한 기술 데모를 넘어, RAG 없이도 전체 문서를 직접 처리하는 새로운 패러다임을 가능하게 했다. Gemini 2.5에서는 이 장문 처리 능력에 ‘사고(thinking)’ 기능이 결합되어, 더욱 정교한 장문 추론이 가능해졌다.
100만 토큰 컨텍스트는 “충분히 긴 컨텍스트가 있으면 RAG가 필요 없어질 수 있는가?”라는 근본적 질문을 제기하며, AI 시스템 설계의 패러다임 전환을 촉진하고 있다.
관련 문서
- Gemini — 발전 기반
- Gemini 2.5 — 후속 모델