Claude Opus 4.5: SWE-bench 80.9%를 달성한 Anthropic의 최강 에이전트 모델
개요
Claude Opus 4.5는 2025년 7월 15일 Anthropic이 공개한 최신 플래그십 모델로, Claude Opus 4를 직접 계승한다. GPT-4o, Gemini 2.5 Pro 등 경쟁 모델들이 MoE 아키텍처를 채택하는 추세 속에서, Dense Transformer 구조를 유지하면서도 소프트웨어 엔지니어링, 과학적 추론, 에이전틱 태스크 전 분야에서 업계 최고 성능을 달성하였다.
특히 SWE-bench Verified에서 **80.9%**를 기록하며 최초로 80% 벽을 돌파하였고, 이는 GPT-5.1(76.3%), Gemini 3 Pro(76.2%)를 크게 앞서는 수치이다. Anthropic 내부 엔지니어링 채용 시험에서도 인간 최고 점수를 초과하는 전례 없는 성과를 보여주었다.
아키텍처 상세
기본 구조
| 구성 요소 | 사양 |
|---|---|
| 아키텍처 | Dense Decoder-only Transformer |
| 어텐션 | Multi-Head Attention (MHA) |
| 정규화 | RMSNorm |
| 활성화 함수 | SwiGLU |
| 위치 인코딩 | RoPE |
| 컨텍스트 길이 | 200K 토큰 |
| 파라미터 수 | 미공개 |
Anthropic의 기존 정책에 따라 기술 보고서 없이 시스템 카드만 공개되었다.
Dense vs. MoE 선택의 의미
MoE 모델은 토큰당 활성 파라미터를 줄여 추론 비용을 절감하지만, 전문가 라우팅의 불안정성과 학습 복잡도가 높다. Anthropic이 Dense 구조를 고수하는 것은:
- 에이전틱 안정성: 긴 멀티스텝 추론에서 MoE 라우팅 변동이 누적 오차를 유발할 수 있다
- 일관성: Dense 모델은 동일 입력에 대해 더 일관된 출력을 생성한다
- 디버깅 용이성: 에이전트 실패 시 원인 추적이 MoE 대비 용이하다
핵심 혁신
1. 에이전틱 워크플로의 완성
Claude Opus 4.5의 에이전틱 능력은 세 가지 축에서 혁신을 이루었다:
에러 복구 및 재계획: 멀티스텝 도구 호출 시 중간 단계의 에러를 감지하고, 계획을 수정하며, 자율적으로 재시도하는 능력이 Opus 4 대비 크게 향상되었다.
Claude Code 통합: Claude Code와 같은 코딩 에이전트에서 실질적인 성능 차이를 보이며, 실제 소프트웨어 개발 워크플로를 자동화할 수 있는 수준에 도달했다.
도구 사용 신뢰성: 함수 호출, 파일 시스템 접근, API 연쇄 호출 등에서 기존 모델 대비 현저한 신뢰성 향상을 달성했다.
2. 장문 컨텍스트 일관성 강화
200K 토큰 컨텍스트에서 ‘Lost in the Middle’ 문제를 완화하기 위한 개선이 이루어졌다. RoPE 기반 위치 인코딩의 외삽 능력이 개선된 것으로 추정된다:
여기서 은 토큰 위치, 는 주파수 파라미터이다. 긴 시퀀스에서 이 커질 때의 안정성이 향상되었다.
3. 멀티모달 교차 추론
텍스트-이미지 간 교차 추론이 강화되어, 다이어그램 해석과 코드 스크린샷 분석에서 우수한 성능을 보인다.
벤치마크/성능
SWE-bench 계보
| 모델 | SWE-bench Verified |
|---|---|
| Claude Opus 4.5 | 80.9% |
| GPT-5.1 | 76.3% |
| Gemini 3 Pro | 76.2% |
| Claude Opus 4.1 | 74.5% |
| Claude Opus 4 | 72.5% |
| Claude 3.5 Sonnet | 49.0% |
주요 벤치마크 비교
| 벤치마크 | Claude Opus 4.5 | GPT-5.1 | Gemini 3 Pro |
|---|---|---|---|
| SWE-bench Verified | 80.9% | 76.3% | 76.2% |
| GPQA Diamond | ~85% | ~82% | ~80% |
| 컨텍스트 길이 | 200K | 200K | 1M |
| 에이전틱 태스크 | 업계 1위 | 2위권 | 3위권 |
Claude Opus 4.5의 SWE-bench 80.9%는 Claude 3.5 Sonnet(49.0%) 대비 65% 상대적 향상으로, Anthropic의 급속한 발전 속도를 보여준다.
관련 모델 비교
| 특성 | Claude Opus 4.5 | GPT-5.1 | Gemini 3 Pro | DeepSeek-V3 |
|---|---|---|---|---|
| 아키텍처 | Dense | 미공개 | MoE | MoE (671B/37B) |
| 컨텍스트 | 200K | 200K | 1M | 128K |
| 에이전틱 | ✅ 최적화 | ✅ | ✅ | 부분적 |
| 오픈소스 | ❌ | ❌ | ❌ | ✅ |
| 안전 수준 | ASL-3 | 자체 | 자체 | 커뮤니티 |
훈련 파이프라인 (추정)
- 사전 학습: 대규모 웹 코퍼스, 코드 저장소, 학술 문헌 — Opus 4 대비 데이터 필터링 강화
- RLHF + RLAIF: Constitutional AI 3세대 정교화, 인간 피드백 없이도 헌법 원칙만으로 유해성 최소화
- 에이전틱 SFT: 도구 사용, 멀티스텝 추론 특화 합성 데이터
- 안전성 훈련: Red-teaming + adversarial testing이 훈련 루프에 통합
Constitutional AI의 보상 함수는:
여기서 는 에이전틱 태스크에서의 인간 의도 부합도를 평가하는 새로운 보상 항이다.
실무 활용
1. 자율적 소프트웨어 엔지니어링
SWE-bench 80.9%는 실제 GitHub 이슈의 대부분을 자동으로 해결할 수 있는 수준이다. Claude Code를 통해 코드 작성, 테스트, 디버깅을 자율적으로 수행한다.
2. 대규모 코드베이스 분석
200K 토큰 컨텍스트로 전체 프로젝트 구조를 이해하고, 크로스 파일 리팩토링을 수행할 수 있다.
3. 멀티모달 문서 처리
다이어그램, 차트, 코드 스크린샷을 포함한 기술 문서를 종합적으로 분석한다.
4. 엔터프라이즈 AI 에이전트
복잡한 비즈니스 워크플로를 자동화하는 에이전트의 백엔드로 최적이다.
한계 및 전망
한계
- 완전 비공개: 기술 보고서와 아키텍처 세부 사항이 없어 학술적 분석이 불가능하다.
- 비용: 플래그십 모델의 높은 API 비용이 대규모 활용에 장벽이 된다.
- 추론 특화 부재: o3, DeepSeek-R1 같은 테스트 시간 컴퓨트 스케일링 모델 대비 수학/과학 추론에서 뒤처질 수 있다.
- Dense 구조의 비용 비효율: MoE 대비 추론 시 모든 파라미터가 활성화되어 비용 효율이 낮다.
전망
Claude Opus 4.5는 AI가 실제 소프트웨어 엔지니어를 대체할 수 있는 수준에 근접했음을 보여주는 이정표이다. 이후 Claude Opus 4.6에서 SWE-bench 81.42%까지 향상되었으며, Anthropic의 에이전틱 AI 전략은 계속 가속화되고 있다. 향후에는 추론 시간 스케일링(thinking mode)의 도입, 더 광범위한 도구 생태계 지원, 그리고 자율적 소프트웨어 개발 에이전트의 상용화가 핵심 방향이 될 것이다.
관련 문서
- Claude Opus 4 — 발전 기반