Gemini 1.5: 100만 토큰 컨텍스트의 MoE 멀티모달 모델

개요

Gemini 1.5는 Google DeepMind가 2024년 2월 15일 발표한 차세대 AI 모델로, Pro와 Flash 두 가지 버전으로 제공된다. 이 모델의 가장 혁신적인 특징은 최대 100만 토큰(Gemini 1.5 Pro 기준)의 초장문 컨텍스트 처리 능력이다. 100만 토큰은 약 700,000단어, 30,000줄의 코드, 11시간 분량의 오디오, 또는 1시간 분량의 비디오에 해당하는 분량이다.

Gemini 1.5는 Mixture of Experts(MoE) 아키텍처를 채택하여 Gemini 1.0 Ultra와 동등하거나 더 나은 성능을 훨씬 적은 연산으로 달성했다. 특히 Needle-in-a-Haystack 테스트에서 100만 토큰 전체 구간에서 99.7% 이상의 완벽한 검색 정확도를 보여 장문 이해 능력의 신뢰성을 입증했다.

아키텍처 상세

기본 구조

구성 요소사양
아키텍처Decoder-only Transformer + MoE
컨텍스트 길이1,000,000 (Pro) / 32,768 (Flash)
AttentionMulti-Query Attention
정규화RMSNorm
활성화 함수GeGLU
위치 인코딩RoPE
어휘 크기~256,000
모달리티텍스트 + 이미지 + 오디오 + 비디오

Mixture of Experts (MoE)

Gemini 1.5는 Gemini 1.0의 Dense 아키텍처에서 MoE로 전환했다. 각 토큰 처리 시 전체 전문가의 일부만 활성화하여:

여기서 는 활성 전문가 수, 은 전체 전문가 수이다. 이를 통해 모델의 전체 용량(파라미터 수)을 크게 늘리면서도 추론 시 연산 비용을 제한할 수 있다.

100만 토큰 컨텍스트의 기술적 구현

100만 토큰 컨텍스트를 효과적으로 처리하기 위해 여러 기술이 결합되었다:

  1. 단계적 컨텍스트 확장(Progressive Context Extension): 짧은 컨텍스트에서 학습을 시작하고 점진적으로 컨텍스트 길이를 늘려가는 방식

  2. 효율적 어텐션 메커니즘: 장문에서의 어텐션 연산을 최적화

    • 표준 Self-Attention의 복잡도:
    • 100만 토큰 시 이론적 연산량이 극도로 증가하므로 최적화 필수
  3. KV 캐시 최적화: MQA를 통한 KV 캐시 절감이 장문 처리의 핵심

핵심 혁신

1. Needle-in-a-Haystack: 완벽한 장문 검색

이 테스트는 긴 문맥 속에 숨겨진 특정 정보(“바늘”)를 찾는 능력을 평가한다. Gemini 1.5 Pro의 결과:

컨텍스트 길이텍스트 검색률오디오 검색률비디오 검색률
~100K 토큰100%100%100%
~530K 토큰100%100%99.8%
~1M 토큰99.7%+100%99.2%
~10M 토큰99.2%--

특히 오디오 모달리티에서는 107시간(약 5일) 분량의 오디오에서도 100% 정확도로 숨겨진 키워드를 찾아냈다.

2. In-Context Learning의 극단적 확장

100만 토큰 컨텍스트를 활용한 놀라운 In-Context Learning 사례가 보고되었다:

  • 새로운 언어 학습: 학습 데이터에 포함되지 않은 Kalamang 언어(파푸아뉴기니의 소멸 위기 언어)의 문법서를 컨텍스트에 제공하자, 영어-Kalamang 번역이 가능해짐
  • 전체 코드베이스 이해: 수만 줄의 코드를 한 번에 입력하여 버그를 찾거나 리팩토링 제안

3. 멀티모달 장문 추론

1시간 분량의 무성 영화 내용에 대한 질문에 답하거나, 수백 페이지의 PDF 문서에서 특정 정보를 추출하는 등의 멀티모달 장문 작업이 가능하다.

벤치마크/성능

벤치마크Gemini 1.5 ProGemini 1.0 UltraGPT-4 TurboClaude 3 Opus
MMLU81.9%90.0%86.4%86.8%
MATH58.5%53.2%52.6%-
HumanEval71.9%74.4%67.0%-
Natural2Code77.7%74.9%73.9%-
MMMU58.5%62.4%56.8%59.4%

Gemini 1.5 Pro는 Gemini 1.0 Ultra에 비해 대부분의 벤치마크에서 유사하거나 약간 낮은 성능을 보이지만, 훨씬 적은 연산으로 이를 달성한다는 점이 핵심이다.

관련 모델 비교

컨텍스트 길이 경쟁

모델출시컨텍스트아키텍처Needle 정확도
GPT-42023.03128KDense~95% (128K)
Claude 2.12023.11200KDense~95% (200K)
Gemini 1.5 Pro2024.021MMoE99.7% (1M)
Claude 32024.03200KDense~99% (200K)

Gemini 시리즈 내 비교

특성Gemini 1.0Gemini 1.5 ProGemini 1.5 Flash
아키텍처DenseMoEMoE
컨텍스트32K1M32K→1M
추론 비용높음중간낮음
주요 강점최고 품질장문 + 효율속도 + 비용

실무 활용

100만 토큰 컨텍스트 활용 사례

  1. 전체 코드베이스 분석: 프로젝트 전체 소스코드를 입력하여 리뷰, 버그 탐지, 문서화
  2. 장문 문서 처리: 법률 계약서, 학술 논문 묶음, 회의록 전체를 한 번에 분석
  3. 비디오 이해: 강의, 회의 녹화, 영화 등 비디오 콘텐츠의 자동 요약 및 QA
  4. 오디오 전사 및 분석: 팟캐스트, 콜센터 통화 등 장시간 오디오 처리

Flash vs Pro 선택 가이드

사용 사례추천 모델이유
복잡한 추론Pro높은 품질
대량 처리Flash빠른 속도, 낮은 비용
실시간 대화Flash낮은 latency
장문 분석Pro1M 컨텍스트 최적화

한계 및 전망

한계

  1. 비용: 100만 토큰 입력의 API 비용이 상당하여 대량 처리에는 부담
  2. Latency: 장문 입력 시 첫 토큰 생성까지의 시간이 길어짐
  3. 비공개 구조: MoE의 전문가 수, 활성 전문가 수 등 세부 사양 미공개
  4. 품질 유지: 100만 토큰 전체에서 균일한 품질 유지가 어려울 수 있음

전망

Gemini 1.5는 LLM 컨텍스트 길이 경쟁에서 결정적인 이정표를 세웠다. 100만 토큰이라는 수치는 단순한 기술 데모를 넘어, RAG 없이도 전체 문서를 직접 처리하는 새로운 패러다임을 가능하게 했다. Gemini 2.5에서는 이 장문 처리 능력에 ‘사고(thinking)’ 기능이 결합되어, 더욱 정교한 장문 추론이 가능해졌다.

100만 토큰 컨텍스트는 “충분히 긴 컨텍스트가 있으면 RAG가 필요 없어질 수 있는가?”라는 근본적 질문을 제기하며, AI 시스템 설계의 패러다임 전환을 촉진하고 있다.

관련 문서