논문 개요
희소 전문가 모델(Sparse Expert Models), 일반적으로 Mixture-of-Experts(MoE)로 불리는 이 아키텍처는 조건부 계산(conditional computation)의 대표적 구현체이다. 핵심 아이디어는 모델 내에 다수의 ‘전문가(expert)’ 모듈을 배치하되, 각 입력에 대해 일부 전문가만 활성화하는 것이다. 이를 통해 모델의 총 파라미터 수를 늘리면서도 실제 계산량(FLOPs)은 고정할 수 있다.
Switch Transformers를 포함한 여러 MoE 논문을 저술한 Fedus et al.(2022)은 이 리뷰를 통해 흩어져 있던 MoE 연구를 통합적 관점으로 정리하였다. 이 논문은 MoE를 연구하거나 적용하고자 하는 연구자에게 필수적인 참고 자료가 되었다.
핵심 기여
- MoE 역사 정리: 1991년 Jacobs et al.의 원조 MoE부터 현대의 대규모 언어 모델 MoE까지 30년에 걸친 발전 과정을 체계화한다.
- 라우팅 메커니즘 분류: Top-k, Expert Choice, Hashing, Linear Assignment 등 다양한 라우팅 방법의 특성과 트레이드오프를 비교한다.
- 학습 과제 분석: 로드 불균형, 학습 불안정성, 전문화 부족 등 MoE의 주요 학습 과제와 해결책을 정리한다.
- 미래 연구 방향 제시: 더 나은 라우팅, 메모리 효율, 전문가 전문화, 하드웨어 최적화 등 열린 연구 문제를 식별한다.
방법론 상세
MoE의 수학적 정의
개의 전문가 과 게이팅 함수 이 있을 때, MoE 레이어의 출력은:
여기서 는 번째 전문가에 대한 게이팅 가중치이다. 희소성은 의 대부분의 원소가 0이 되도록 강제함으로써 달성된다.
라우팅 메커니즘 분류
1. Top-k 토큰 라우팅 (Token Choice)
가장 일반적인 방식. 각 토큰이 자신에게 가장 적합한 개의 전문가를 선택한다:
- k=1 (Switch): 계산량 최소, 학습 안정성 이슈 있음
- k=2 (GShard): 균형 우수, 통신 비용 증가
- k=.5N (Dense): MoE가 아닌 조밀 모델과 동일
2. Expert Choice 라우팅
역방향 접근: 각 전문가가 처리할 토큰을 직접 선택한다. 전문가 는 자신의 용량 에 해당하는 상위 개 토큰을 선택:
이 방식은 각 전문가의 로드가 자동으로 균등하게 유지되는 장점이 있다. 다만, 일부 토큰이 어떤 전문가도 선택하지 않을 수 있다는 단점이 있다.
3. 해시 라우팅 (Hash Routing)
토큰의 내용과 무관하게 결정론적 해시 함수로 전문가를 배정한다:
학습이 필요 없고 완벽한 균형을 보장하지만, 입력 내용을 고려하지 않아 전문화가 불가능하다.
4. 선형 할당 라우팅 (Linear Assignment)
전체 배치에서 전문가-토큰 할당을 최적화 문제로 풀어, 균형을 유지하면서 선호도를 최대화한다:
이는 이산 최적화 문제이므로 학습 시 미분 근사가 필요하다.
학습 안정성 과제
로드 불균형: 일부 전문가에 토큰이 집중되고 다른 전문가는 소외되는 현상. 해결책:
- 보조 손실: (Switch Transformer)
- Expert Choice 라우팅 (내재적 균형)
- 전문가 용량 강제 (오버플로우 토큰 드롭)
표현 붕괴: 여러 전문가가 동일한 표현을 학습하는 현상. 해결책:
- 다양성 정규화: (전문가 가중치의 다양성 장려)
- 별도 초기화: 각 전문가를 다른 랜덤 시드로 초기화
전문가 전문화 측정: 전문가 의 전문화 정도를 측정하는 지표:
여기서 는 전문가 에 라우팅된 토큰의 집합이다.
전문화 vs 균형 트레이드오프
MoE의 핵심 긴장 관계는 전문화(specialization)와 균형(load balance) 사이에 있다:
- 전문화 극대화: 특정 유형의 입력(언어, 도메인, 문법 구조 등)에 특화된 전문가가 형성될수록 성능이 향상된다.
- 균형 요구: 하지만 전문화가 심화될수록 일부 전문가에 토큰이 집중되어 로드 불균형이 발생한다.
보조 손실의 가중치 가 이 트레이드오프를 조절한다. 가 클수록 균형을 우선하고, 작을수록 전문화를 허용한다.
주요 MoE 모델 비교
| 모델 | 전문가 수 | 라우팅 | 전체 파라미터 | 특징 |
|---|---|---|---|---|
| GShard | 2048 | Top-2 | 600B | 다국어 MT |
| Switch | 2048 | Top-1 | 1.6T | 단순 라우팅 |
| GLaM | 64 | Top-2 | 1.2T | 에너지 효율 |
| ST-MoE | 64 | Top-2 | 269B | 학습 안정성 |
| Mixtral 8×7B | 8 | Top-2 | 46.7B | 오픈소스 |
실험 결과
리뷰 논문 특성상 자체 실험보다 기존 결과를 종합·분석한다. 주요 발견:
- 파라미터 효율: MoE는 동일한 FLOPs에서 Dense 모델 대비 일관되게 더 낮은 perplexity를 달성한다.
- 스케일링: 전문가 수 이 증가할수록 성능은 에 비례하여 개선된다.
- 데이터 효율: 동일한 학습 토큰 수에서 MoE는 Dense보다 빠르게 수렴한다.
- 전문화 증거: 학습된 전문가들이 특정 언어, 문법 구조, 도메인에 대해 자연스럽게 전문화되는 현상이 관찰된다.
의의 및 한계
의의
- 분야 통합: 분산되어 있던 MoE 연구를 하나의 일관된 프레임워크로 통합하여 비교·분석하였다.
- 실무 가이드: 새로운 MoE 모델을 설계할 때 참고할 수 있는 실용적 지침(라우팅 선택, 하이퍼파라미터 가이드 등)을 제공한다.
- 연구 방향 제시: 아직 해결되지 않은 문제들을 명확히 식별하여 후속 연구의 로드맵을 제시한다.
한계
- 빠른 진화: MoE 분야가 매우 빠르게 발전하고 있어, 리뷰 발표 이후 Mixtral, DeepSeek-MoE 등 중요한 모델들이 등장하여 일부 내용이 이미 outdated되었다.
- 추론 비용: 모든 전문가 가중치를 메모리에 올려야 하는 추론 메모리 비용 문제에 대한 해결책이 여전히 미흡하다.
- 멀티모달 MoE: 언어 이외의 모달리티(이미지, 오디오)에 MoE를 적용하는 방법에 대한 논의가 제한적이다.