OpenAI o3: ARC-AGI 87.5%로 인간 평균을 넘어선 추론 AI의 이정표
개요
OpenAI o3는 o1의 후속으로 2025년 4월 16일 공개된 차세대 추론 특화 모델이다. AI 추론 연구에서 역사적 이정표를 세운 모델로, ARC-AGI 벤치마크에서 87.5%(고연산 설정)를 달성하며 처음으로 인간 평균(85%)을 초과하였다.
수학(AIME 96.7%), 과학(GPQA Diamond 87.7%), 코딩(Codeforces 2727 Elo) 등 전 분야에서 o1을 대폭 능가하며, 테스트 시간 컴퓨트 스케일링의 실용적 한계를 크게 확장했다. 특히 적응적 컴퓨트(adaptive compute) 메커니즘의 도입으로 o1 대비 비용 효율도 개선되었다.
아키텍처 상세
기본 구조
| 구성 요소 | 사양 |
|---|---|
| 아키텍처 | Dense Decoder-only Transformer |
| 어텐션 | Multi-Head Attention (MHA) |
| 정규화 | RMSNorm |
| 활성화 함수 | SwiGLU |
| 위치 인코딩 | RoPE |
| 컨텍스트 길이 | 200K 토큰 |
| 파라미터 수 | 미공개 |
o1 대비 컨텍스트 길이가 128K에서 200K로 확장되었다.
핵심 혁신
1. 적응적 컴퓨트 (Adaptive Compute)
o3의 가장 중요한 혁신은 문제 난이도에 따라 추론에 투입하는 연산량을 동적으로 조절하는 적응적 컴퓨트 메커니즘이다:
여기서 는 난이도에 따른 컴퓨트 스케일링 함수이다. 간단한 문제에는 적은 연산을, 복잡한 문제에는 더 많은 연산을 투입한다.
o3는 low, medium, high의 세 가지 컴퓨트 설정을 제공하며, ARC-AGI에서의 성능 변화가 이를 명확히 보여준다:
| 설정 | ARC-AGI | 상대 비용 |
|---|---|---|
| o3-low | 41.0% | 1x |
| o3-medium | 53.0% | ~10x |
| o3-high | 87.5% | ~172x |
2. ARC-AGI 돌파
ARC-AGI(Abstraction and Reasoning Corpus)는 추상적 패턴 인식과 새로운 문제에 대한 일반화 능력을 측정하는 벤치마크로, 기존 AI 모델이 가장 어려워하던 영역이다. o3가 인간 평균(85%)을 넘어선 87.5%를 달성한 것은, 단순 패턴 매칭을 넘어서는 추상적 추론 능력의 획기적 발전을 시사한다.
다만 더 어려운 ARC-AGI-2에서는 2.9%에 그쳐, 진정한 일반 추론 능력에는 아직 한계가 있음을 보여준다.
3. 추론 품질과 효율의 동시 향상
o3는 o1의 테스트 시간 컴퓨트 접근법을 계승하면서, 내부 추론 과정의 품질과 효율을 동시에 향상시켰다:
- 깊이 있는 CoT: 더 체계적이고 논리적인 추론 체인
- 효율적 탐색: 불필요한 추론 경로를 조기에 가지치기
- 다중 검증: 답변에 대한 다각도 검증 강화
벤치마크/성능
o1 → o3 성능 도약
| 벤치마크 | o3 | o1 | 향상 |
|---|---|---|---|
| AIME 2024 | 96.7% | 74.4% | +22.3%p |
| GPQA Diamond | 87.7% | 78.1% | +9.6%p |
| Codeforces | 2727 Elo | 1891 Elo | +836 |
| ARC-AGI (high) | 87.5% | ~25% | +62.5%p |
| AIME 2025 | 88.9% | - | 신규 |
모든 주요 벤치마크에서 o1 대비 대폭적인 향상을 보인다. 특히 Codeforces +836 Elo는 아마추어에서 최상위 프로그래머로의 도약에 해당한다.
경쟁 모델 비교
| 벤치마크 | o3 | DeepSeek-R1 | Gemini 2.5 Pro |
|---|---|---|---|
| AIME 2024 | 96.7% | 79.8% | ~92% |
| GPQA Diamond | 87.7% | 71.5% | ~84% |
| Codeforces | 2727 Elo | 2029 Elo | ~2400 |
관련 모델 비교
| 특성 | o3 | o1 | DeepSeek-R1 | o3-pro |
|---|---|---|---|---|
| AIME 2024 | 96.7% | 74.4% | 79.8% | 93% |
| GPQA Diamond | 87.7% | 78.1% | 71.5% | 84.9% |
| 컨텍스트 | 200K | 128K | 128K | 200K |
| 적응적 컴퓨트 | ✅ | ❌ | ❌ | ✅ (최대) |
| 오픈소스 | ❌ | ❌ | ✅ | ❌ |
| 비용 | 높음 | 매우 높음 | 낮음 | 극히 높음 |
훈련 추정
o3의 훈련 세부 사항은 공개되지 않았다. o1의 RL 기반 추론 훈련 패러다임을 개선한 것으로 추정되며:
- 기반 모델: GPT 계열 Dense Transformer 사전 학습
- 추론 RL: 더 정교한 보상 모델과 RL 알고리즘
- 적응적 컴퓨트 학습: 문제 난이도에 따른 컴퓨트 배분 최적화
- 안전성 정렬: Deliberative alignment 기법 적용
실무 활용
1. 최상위 수학/과학 연구
AIME 96.7%, GPQA 87.7%로 올림피아드급 수학 문제와 박사 수준 과학 연구 보조에 최적이다.
2. 경쟁 프로그래밍
Codeforces 2727 Elo로 최상위 프로그래머 수준의 알고리즘 문제 풀이가 가능하다.
3. 비용 최적화된 추론
적응적 컴퓨트로 문제 난이도에 따라 비용을 조절할 수 있어, o1보다 실용적이다.
4. 추상적 문제 해결
ARC-AGI 87.5%로 새로운 유형의 문제에 대한 추상적 패턴 인식과 일반화가 가능하다.
한계 및 전망
한계
- 높은 비용: 고연산 설정에서 비용이 매우 높다 (o3-high는 o3-low의 172배).
- ARC-AGI-2 한계: 더 어려운 ARC-AGI-2에서 2.9%에 그쳐, 진정한 일반 추론 능력에는 한계가 있다.
- 추론 과정 비공개: 내부 CoT가 여전히 비공개이다.
- 과도한 추론 비용: 간단한 문제에도 많은 추론 토큰을 소비할 수 있다.
전망
o3는 테스트 시간 컴퓨트 스케일링의 실용성을 입증하였으며, o3-pro(최대 컴퓨트), o4-mini(효율 최적화) 등 다양한 변형으로 비용-성능 트레이드오프를 제공한다. ARC-AGI에서 인간을 넘어선 것은 상징적이지만, ARC-AGI-2에서의 한계는 진정한 일반 지능까지는 아직 갈 길이 멀다는 것을 시사한다. 향후에는 멀티모달 추론, 더 효율적인 적응적 컴퓨트, 그리고 추론 과정의 투명성 확보가 핵심 과제가 될 것이다.
어텐션 메커니즘: MHA
Multi-Head Attention(MHA)은 Transformer의 핵심 메커니즘으로, 입력을 여러 헤드로 분할하여 병렬적으로 어텐션을 계산한다:
각 헤드는 서로 다른 표현 부분공간(subspace)에서 정보를 추출하며, 결과를 결합하여 풍부한 표현을 학습한다. 추론 시에는 모든 Q 헤드에 대해 별도의 KV를 유지해야 하므로 KV 캐시 비용이 높다는 단점이 있다.
위치 인코딩: RoPE
RoPE(Rotary Position Embedding)는 위치 정보를 복소수 회전으로 인코딩하여 상대적 위치를 자연스럽게 포착한다:
이 방식은 절대 위치 임베딩의 한계를 극복하며, 학습 시 보지 못한 더 긴 시퀀스에 대한 외삽(extrapolation)이 가능하다는 핵심 장점이 있다. NTK-aware Scaling이나 YaRN 등의 확장 기법을 적용하면 학습 컨텍스트의 수십 배까지 외삽할 수 있다.
실무 코드 예시
from openai import OpenAI
client = OpenAI()
# OpenAI o3 API 호출 예시
response = client.chat.completions.create(
model="o3",
messages=[
{"role": "system", "content": "당신은 유능한 AI 어시스턴트입니다."},
{"role": "user", "content": "트랜스포머 아키텍처의 핵심 원리를 설명해줘"}
],
temperature=0.7
)
print(response.choices[0].message.content)스케일링 법칙과의 관계
Chinchilla 스케일링 법칙에 따르면, 모델 파라미터 수 과 학습 토큰 수 의 최적 비율은 다음과 같이 결정된다:
여기서 , 이다. 이 법칙은 학습 예산이 주어졌을 때 모델 크기와 데이터 양의 최적 균형점을 결정하는 데 핵심적인 역할을 하며, 이 모델의 학습 전략에도 영향을 미쳤을 것으로 추정된다.
Test-Time Compute에 관하여
테스트 시간 컴퓨트 스케일링은 추론 시점에 더 많은 연산을 투입하여 성능을 향상시키는 패러다임이다. 내부적으로 긴 Chain-of-Thought 추론 토큰을 생성하고, reasoning effort 파라미터로 연산량을 조절한다. 학습 시점의 스케일링과 상보적으로 작용하며, 문제 난이도에 따라 적응적으로 연산량을 조절할 수 있다.
아키텍처 설계 분석
정규화: RMSNorm을 Pre-Norm 방식으로 적용하여 학습 안정성을 확보한다. RMSNorm은 LayerNorm 대비 평균 계산을 생략하여 연산 효율이 높으면서도 동등한 안정화 효과를 제공한다.
활성화 함수: SwiGLU 활성화 함수를 사용하여 FFN의 표현력을 높인다. 형태로, 게이트 메커니즘이 정보 흐름을 선택적으로 제어한다.
모델 규모와 효율: OpenAI o3은 미공개 규모의 파라미터를 가지며, 200K 토큰의 컨텍스트 윈도우를 지원한다. 효율적인 아키텍처 설계를 통해 동급 모델 대비 경쟁력 있는 성능을 달성한다.
아키텍처 설계 분석
정규화: RMSNorm을 Pre-Norm 방식으로 적용하여 학습 안정성을 확보한다. RMSNorm은 LayerNorm 대비 평균 계산을 생략하여 연산 효율이 높으면서도 동등한 안정화 효과를 제공한다. 형태로, 학습 가능한 스케일 파라미터 만 사용한다.
활성화 함수: SwiGLU 활성화 함수를 사용하여 FFN의 표현력을 높인다. 형태로, 게이트 메커니즘이 정보 흐름을 선택적으로 제어한다. FFN 차원이 로 조정되어 게이트 프로젝션에 사용되는 추가 파라미터를 보상한다.
모델 규모와 효율: OpenAI o3은 미공개 규모의 파라미터를 가지며, 200K 토큰의 컨텍스트 윈도우를 지원한다. 효율적인 아키텍처 설계를 통해 동급 모델 대비 경쟁력 있는 성능을 달성한다.
관련 문서
- OpenAI o1 — 발전 기반
- OpenAI o4-mini — 후속 모델
- OpenAI o3-pro — 변형 모델