Grok 3: 초대규모 컴퓨트로 추론의 한계를 밀어붙인 모델
개요
Grok 3는 일론 머스크가 이끄는 xAI가 2025년 2월 17일 공개한 대형 언어 모델이다. 별도의 기술 보고서 없이 발표되었으며, 파라미터 규모는 약 **3조(~3T)**로 추정된다. xAI의 콜로서스(Colossus) 슈퍼컴퓨터에서 H100 GPU 20만 개 이상을 동원하여 학습된 것으로 알려져 있으며, 이는 당시 단일 학습 런 기준으로 가장 큰 컴퓨트 규모이다.
Grok 3는 수학, 과학, 코딩 분야에서 GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro를 능가하는 성능을 주장하며, 특히 AIME와 GPQA 벤치마크에서 업계 최고 수준의 결과를 기록하였다. 추론에 특화된 Grok 3 Thinking 변형도 함께 제공된다.
아키텍처 상세
추정 구조
Grok 3의 구체적 아키텍처는 공개되지 않았으나, 공개된 정보와 업계 분석을 종합하면 다음과 같이 추정된다.
| 구성 요소 | 추정 사양 |
|---|---|
| 파라미터 | ~3T (추정) |
| 컨텍스트 길이 | 131K |
| 어텐션 | Multi-Head Attention |
| 정규화 | RMSNorm |
| 활성화 | SwiGLU |
| 위치 인코딩 | RoPE |
| 아키텍처 유형 | Dense 또는 MoE (미확인) |
콜로서스 슈퍼컴퓨터
Grok 3의 학습을 가능하게 한 핵심 인프라는 xAI의 콜로서스(Colossus) 슈퍼컴퓨터이다:
- GPU: NVIDIA H100 20만 개 이상
- 위치: 미국 테네시주 멤피스
- 구축 기간: 약 122일만에 가동 시작
- 확장: 초기 10만 개에서 20만 개로 확장
이 규모는 Meta의 LLaMA 3 학습에 사용된 16,384개의 약 12배에 달하며, 단일 조직의 학습 인프라로는 당시 최대 규모였다.
Grok 3 Thinking
Grok 3 Thinking은 OpenAI o1과 유사한 내부 Chain-of-Thought(CoT) 추론을 수행하는 변형이다:
복잡한 수학, 과학 문제에서 내부적으로 여러 추론 단계를 거치며, 사용자에게는 최종 답변만 제공된다. RL(강화학습) 기반 추론 강화 훈련을 거친 것으로 추정된다.
X 플랫폼 실시간 데이터
Grok 3의 독특한 차별점은 X(구 트위터) 플랫폼의 실시간 데이터를 훈련 및 검색에 활용한다는 것이다. 이를 통해 최신 트렌드, 뉴스, 여론에 대한 응답이 가능하며, 기존 LLM의 학습 데이터 컷오프 문제를 부분적으로 해결한다.
핵심 혁신
1. 초대규모 컴퓨트 스케일링
Grok 3는 “더 많은 컴퓨트를 투입하면 더 나은 모델이 나온다”는 스케일링 가설을 극한까지 밀어붙인 모델이다. H100 20만 개는 약 FLOPs 이상의 학습 연산을 가능하게 하며, 이는 GPT-4의 추정 학습 연산량을 크게 상회한다.
2. Chain-of-Thought 추론 통합
Grok 3 Thinking 모드는 o1 스타일의 내부 추론을 도입하여, 복잡한 수학과 과학 문제에서 단순 프롬프팅 대비 큰 성능 향상을 보인다.
3. 실시간 정보 통합
X 플랫폼과의 긴밀한 통합으로 실시간 정보에 접근할 수 있어, 최신 이벤트에 대한 응답이 가능하다는 점에서 기존 LLM과 차별화된다.
4. 빠른 인프라 구축
122일만에 10만 GPU 규모의 슈퍼컴퓨터를 가동한 것은, AI 인프라 구축 속도의 새로운 기준을 세운 것으로 평가된다.
벤치마크/성능
| 벤치마크 | Grok 3 | GPT-4o | Claude 3.5 | Gemini 1.5 Pro |
|---|---|---|---|---|
| AIME 2025 | 83.3% | ~50% | ~55% | ~60% |
| GPQA Diamond | 84.0% | 53.6% | 65.0% | ~62% |
| MATH-500 | 93.3% | 74.6% | 78.3% | ~80% |
| Codeforces | 2100+ Elo | ~1800 | ~1900 | ~1850 |
| MMLU | 91.8% | 87.2% | 88.7% | ~87% |
Grok 3 Thinking 모드에서의 성능은 더 높으며, 특히 AIME 같은 수학 올림피아드 문제에서 두드러진다.
관련 모델 비교
| 특성 | Grok 2 | Grok 3 | GPT-4o | Claude 3.5 |
|---|---|---|---|---|
| 파라미터 | 미공개 | ~3T | 미공개 | 미공개 |
| 컨텍스트 | 128K | 131K | 128K | 200K |
| Thinking 모드 | 없음 | 있음 | 없음 | 없음 |
| 실시간 데이터 | X | X (강화) | 검색 도구 | 없음 |
| GPU 규모 | 미공개 | ~200K H100 | 미공개 | 미공개 |
| 오픈소스 | 부분 | 아니오 | 아니오 | 아니오 |
학습 상세
- 하드웨어: 콜로서스 클러스터 H100 GPU 20만 개 이상
- 데이터: 광범위한 인터넷 데이터 + X 플랫폼 실시간 데이터 (구체적 토큰 수 미공개)
- 정렬: 추정 RLHF/DPO 기반 (구체적 방법론 미공개)
- Thinking 변형: RL 기반 추론 강화 훈련 (별도 학습)
- 기술 보고서: 미발표
실무 활용
1. 수학/과학 연구 보조
AIME 83.3%, GPQA 84.0%의 성능으로 올림피아드 수준의 수학 문제 풀이와 박사 수준 과학 질문에 활용할 수 있다.
2. X 플랫폼 통합 서비스
X Premium+ 구독자에게 제공되며, X 플랫폼의 실시간 정보를 활용한 트렌드 분석, 여론 모니터링에 적합하다.
3. 코딩 어시스턴트
Codeforces 2100+ Elo로 알고리즘 문제 풀이와 코드 생성에서 경쟁력 있는 성능을 보인다.
한계 및 전망
한계
- 기술 보고서 부재: 아키텍처, 학습 데이터, 안전성 평가에 대한 공식 문서가 없어 검증이 어렵다.
- 플랫폼 종속: X Premium+에서만 완전한 기능 접근이 가능하다.
- 편향 우려: X 플랫폼 데이터의 특성상 특정 정치적, 사회적 편향이 있을 수 있다.
- 재현 불가능: 아키텍처와 학습 세부사항이 비공개이다.
전망
Grok 3는 초대규모 컴퓨트 투입과 플랫폼 통합이라는 두 가지 축에서 차별화를 추구한다. xAI의 Grok 시리즈는 빠른 진화 속도를 보이고 있으며, 향후 Grok 4에서는 멀티모달 능력과 에이전틱 기능이 더욱 강화될 것으로 예상된다.
어텐션 메커니즘: MHA
Multi-Head Attention(MHA)은 Transformer의 핵심 메커니즘으로, 입력을 여러 헤드로 분할하여 병렬적으로 어텐션을 계산한다:
각 헤드는 서로 다른 표현 부분공간(subspace)에서 정보를 추출하며, 결과를 결합하여 풍부한 표현을 학습한다. 추론 시에는 모든 Q 헤드에 대해 별도의 KV를 유지해야 하므로 KV 캐시 비용이 높다는 단점이 있다.
위치 인코딩: RoPE
RoPE(Rotary Position Embedding)는 위치 정보를 복소수 회전으로 인코딩하여 상대적 위치를 자연스럽게 포착한다:
이 방식은 절대 위치 임베딩의 한계를 극복하며, 학습 시 보지 못한 더 긴 시퀀스에 대한 외삽(extrapolation)이 가능하다는 핵심 장점이 있다. NTK-aware Scaling이나 YaRN 등의 확장 기법을 적용하면 학습 컨텍스트의 수십 배까지 외삽할 수 있다.
실무 코드 예시
# Grok 3 활용 예시 (xAI API 기반)
response = client.chat(
model="grok-3",
messages=[{"role": "user", "content": "질문"}]
)
print(response.content)스케일링 법칙과의 관계
Chinchilla 스케일링 법칙에 따르면, 모델 파라미터 수 과 학습 토큰 수 의 최적 비율은 다음과 같이 결정된다:
여기서 , 이다. 이 법칙은 학습 예산이 주어졌을 때 모델 크기와 데이터 양의 최적 균형점을 결정하는 데 핵심적인 역할을 하며, 이 모델의 학습 전략에도 영향을 미쳤을 것으로 추정된다.
Reasoning에 관하여
추론 능력은 논리적 사고, 수학적 증명, 다단계 분석, 추상적 패턴 인식 등 복잡한 인지 과정을 수행하는 능력이다. 강화 학습 기반 추론 훈련과 Chain-of-Thought 기법이 핵심이며, 검증 가능한 태스크(수학, 코딩)에서의 보상 신호를 통해 추론 전략이 최적화된다.
아키텍처 설계 분석
정규화: RMSNorm을 Pre-Norm 방식으로 적용하여 학습 안정성을 확보한다. RMSNorm은 LayerNorm 대비 평균 계산을 생략하여 연산 효율이 높으면서도 동등한 안정화 효과를 제공한다.
활성화 함수: SwiGLU 활성화 함수를 사용하여 FFN의 표현력을 높인다. 형태로, 게이트 메커니즘이 정보 흐름을 선택적으로 제어한다.
모델 규모와 효율: Grok 3은 ~3T (추정) 규모의 파라미터를 가지며, 131K 토큰의 컨텍스트 윈도우를 지원한다. 효율적인 아키텍처 설계를 통해 동급 모델 대비 경쟁력 있는 성능을 달성한다.
아키텍처 설계 분석
정규화: RMSNorm을 Pre-Norm 방식으로 적용하여 학습 안정성을 확보한다. RMSNorm은 LayerNorm 대비 평균 계산을 생략하여 연산 효율이 높으면서도 동등한 안정화 효과를 제공한다. 형태로, 학습 가능한 스케일 파라미터 만 사용한다.
활성화 함수: SwiGLU 활성화 함수를 사용하여 FFN의 표현력을 높인다. 형태로, 게이트 메커니즘이 정보 흐름을 선택적으로 제어한다. FFN 차원이 로 조정되어 게이트 프로젝션에 사용되는 추가 파라미터를 보상한다.
모델 규모와 효율: Grok 3은 ~3T (추정) 규모의 파라미터를 가지며, 131K 토큰의 컨텍스트 윈도우를 지원한다. 효율적인 아키텍처 설계를 통해 동급 모델 대비 경쟁력 있는 성능을 달성한다.
관련 문서
- GPT-4 — 영감