Mistral Large 3: Apache 2.0 플래그십 오픈소스 LLM

Mistral AI · 2025-05-20 · Decoder-only · Sparse MoE · Apache 2.0

개요

Mistral Large 3는 Mistral AI가 2025년 5월 공개한 플래그십 모델 시리즈로, 41B Dense 버전과 대규모 MoE(675B) 변형을 포함한다. Mistral AI의 효율적 아키텍처 설계 철학을 계승하면서, 특히 함수 호출(function calling)과 에이전트 워크플로 지원을 크게 강화한 것이 특징이다.

Mistral Large 3의 가장 중요한 경쟁력은 Apache 2.0 라이선스로 완전 오픈소스 공개되었다는 점이다. Meta의 LLaMA 시리즈가 커스텀 라이선스(상업적 사용 제한 조건 포함)를 적용하는 것과 대비되며, 기업 환경에서의 자유로운 상업적 활용이 가능하다. 코딩, 수학, 다국어 추론 분야에서 동급 오픈소스 모델 대비 최고 수준의 성능을 달성하였으며, Mistral의 Le Chat 서비스와 API를 통한 상용 배포에도 최적화되어 있다.

이 모델은 Mistral 7B에서 시작된 Mistral AI의 여정에서 Mixtral(MoE 도입), Mistral Large(성능 확장)를 거쳐 도달한 플래그십 모델로, 프랑스 AI 스타트업이 글로벌 LLM 시장에서 확고한 위치를 차지했음을 보여주는 이정표이다.

아키텍처 상세

기본 구조

Mistral Large 3는 두 가지 변형이 제공된다:

구성 요소Mistral Large 3 (Dense)Mistral Large 3 (MoE)
파라미터41B675B
활성 파라미터41B미공개
컨텍스트 길이128K128K
어텐션GQAGQA
정규화RMSNormRMSNorm
활성화 함수SwiGLUSwiGLU
위치 인코딩RoPERoPE
어휘 크기131,072131,072

131,072개의 대규모 어휘는 다국어 토큰화 효율을 극대화하기 위한 것으로, LLaMA의 32K이나 Mistral 7B의 32K 대비 약 4배에 달한다.

GQA + 슬라이딩 윈도우 어텐션

Mistral 7B에서 도입된 GQA와 Sliding Window Attention의 조합을 계승한다. GQA로 KV 캐시 메모리를 절감하고, 슬라이딩 윈도우 어텐션으로 장문 컨텍스트에서의 연산 효율을 최적화한다:

128K 컨텍스트 윈도우와 슬라이딩 윈도우의 조합으로 긴 문서, 코드베이스, 대화 이력 등을 효율적으로 처리할 수 있다.

함수 호출 및 에이전트 기능

Mistral Large 3의 가장 차별화된 기능은 네이티브 함수 호출(function calling)과 구조화된 출력(structured output) 지원이다:

# Mistral Large 3 함수 호출 예시
from mistralai import Mistral
 
client = Mistral(api_key="your-api-key")
 
tools = [{
    "type": "function",
    "function": {
        "name": "get_weather",
        "description": "Get the current weather in a location",
        "parameters": {
            "type": "object",
            "properties": {
                "location": {"type": "string"},
                "unit": {"type": "string", "enum": ["celsius", "fahrenheit"]}
            },
            "required": ["location"]
        }
    }
}]
 
response = client.chat.complete(
    model="mistral-large-latest",
    messages=[{"role": "user", "content": "서울 날씨 알려줘"}],
    tools=tools,
    tool_choice="auto"
)

다단계 에이전트 워크플로를 지원하여, 복잡한 태스크를 여러 도구 호출로 분해하고 순차적으로 실행할 수 있다.

핵심 혁신

Mistral Large 3의 핵심 혁신은 세 가지이다. 첫째, Apache 2.0 완전 오픈소스로 LLaMA의 커스텀 라이선스 제약 없이 상업적 사용이 자유롭다. 이는 기업 환경에서의 채택 장벽을 크게 낮춘다.

둘째, 에이전틱 AI 특화로 함수 호출, 구조화된 출력, 다단계 에이전트 태스크 등 실용적 기능이 모델 수준에서 네이티브로 지원된다. 이는 단순한 텍스트 생성을 넘어 도구 사용이 가능한 AI 에이전트로의 진화를 반영한다.

셋째, Dense + MoE 듀얼 라인업으로 배포 환경에 따른 유연한 선택이 가능하다. 41B Dense 모델은 단일 GPU에서 구동 가능하며, 675B MoE는 최고 성능을 필요로 하는 환경에 적합하다.

벤치마크/성능

벤치마크Mistral Large 3 (41B)Llama-3-70BGPT-4o-miniQwen2.5-72B
MMLU~82%82.0%82.0%86.1%
HumanEval~80%81.7%87.2%86.6%
MATH~72%68.4%70.2%83.1%
MT-Bench~9.08.958.709.35
Function Calling최고 수준보통좋음좋음

Mistral Large 3는 특히 함수 호출과 에이전트 태스크에서 경쟁 모델 대비 우위를 보인다.

학습

대규모 다국어 사전 학습 데이터와 코드, 수학, 명령 수행 데이터를 혼합하여 훈련하였다. Mistral의 독자적인 미세조정 파이프라인을 통해 함수 호출 및 에이전트 태스크 특화 정렬을 수행한다. 구체적인 사전 학습 토큰 수 및 데이터 구성은 공개되지 않았으나, 함수 호출 데이터의 비중이 상당한 것으로 추정된다.

관련 모델

Mistral Large 3는 Mixtral에서 진화한 모델로, Mistral 7B(2023) Mixtral 8x7B(2023) Mistral Large(2024) Mistral Large 3(2025)의 진화 과정을 거쳤다. Mixtral이 MoE 구조를 도입했다면, Mistral Large 3는 이를 더 큰 규모에서 최적화하고 에이전틱 기능을 강화한 버전이다.

어텐션 메커니즘: GQA

GQA(Grouped Query Attention)는 Query 헤드를 여러 그룹으로 나누어 각 그룹이 하나의 KV 헤드를 공유하는 어텐션 변형이다:

이를 통해 MHA 대비 KV 캐시 메모리를 배 절감하면서도 MHA에 근접하는 성능을 유지한다. MQA(Multi-Query Attention)가 단일 KV 헤드로 인해 품질 저하가 발생할 수 있는 반면, GQA는 적절한 수의 KV 그룹을 사용하여 성능과 효율의 균형을 맞춘다.

위치 인코딩: RoPE

RoPE(Rotary Position Embedding)는 위치 정보를 복소수 회전으로 인코딩하여 상대적 위치를 자연스럽게 포착한다:

이 방식은 절대 위치 임베딩의 한계를 극복하며, 학습 시 보지 못한 더 긴 시퀀스에 대한 외삽(extrapolation)이 가능하다는 핵심 장점이 있다. NTK-aware Scaling이나 YaRN 등의 확장 기법을 적용하면 학습 컨텍스트의 수십 배까지 외삽할 수 있다.

스케일링 법칙과의 관계

Chinchilla 스케일링 법칙에 따르면, 모델 파라미터 수 과 학습 토큰 수 의 최적 비율은 다음과 같이 결정된다:

여기서 , 이다. 이 법칙은 학습 예산이 주어졌을 때 모델 크기와 데이터 양의 최적 균형점을 결정하는 데 핵심적인 역할을 하며, 이 모델의 학습 전략에도 영향을 미쳤을 것으로 추정된다.

Agentic AI에 관하여

에이전틱 AI는 도구 사용, 멀티스텝 추론, 자율적 의사결정을 통해 복잡한 태스크를 수행하는 AI 시스템이다. MCP(Model Context Protocol) 기반 도구 사용과 적응적 추론 능력이 강화되어, 복잡한 워크플로 자동화와 장기 수평(long-horizon) 에이전트 작업을 수행할 수 있다.

실무 활용

1. 파인튜닝

Mistral Large 3 / Mistral 3은 오픈소스로 공개되어 LoRA, QLoRA 등의 PEFT 기법을 활용한 도메인 특화 파인튜닝이 가능하다.

2. 추론 배포

양자화(GPTQ, AWQ, GGUF)를 통한 효율적 배포가 가능하며, vLLM이나 TGI 같은 추론 프레임워크에서 최적화된 서빙을 제공한다.

3. 연구 기반

Mistral Large 3 / Mistral 3은 Function Calling, Agentic AI 연구의 중요한 베이스라인으로 활용된다.

한계 및 전망

한계

  1. 배포 인프라: 41B (Dense) / 675B MoE 규모의 모델은 적절한 GPU 인프라가 필요하다.
  2. 데이터 편향: 사전 학습 데이터의 편향이 출력에 반영될 수 있다.
  3. 환각: 사실이 아닌 정보를 생성할 수 있다.

전망

Mistral Large 3 / Mistral 3은 Function Calling, Agentic AI, GQA 분야의 발전에 기여하며, 향후 더 발전된 후속 모델로 진화할 것으로 예상된다.

아키텍처 설계 분석

정규화: RMSNorm을 Pre-Norm 방식으로 적용하여 학습 안정성을 확보한다. RMSNorm은 LayerNorm 대비 평균 계산을 생략하여 연산 효율이 높으면서도 동등한 안정화 효과를 제공한다.

활성화 함수: SwiGLU 활성화 함수를 사용하여 FFN의 표현력을 높인다. 형태로, 게이트 메커니즘이 정보 흐름을 선택적으로 제어한다.

모델 규모와 효율: Mistral Large 3 / Mistral 3은 41B (Dense) / 675B MoE 규모의 파라미터를 가지며, 128K 토큰의 컨텍스트 윈도우를 지원한다. 효율적인 아키텍처 설계를 통해 동급 모델 대비 경쟁력 있는 성능을 달성한다.

아키텍처 설계 분석

정규화: RMSNorm을 Pre-Norm 방식으로 적용하여 학습 안정성을 확보한다. RMSNorm은 LayerNorm 대비 평균 계산을 생략하여 연산 효율이 높으면서도 동등한 안정화 효과를 제공한다. 형태로, 학습 가능한 스케일 파라미터 만 사용한다.

활성화 함수: SwiGLU 활성화 함수를 사용하여 FFN의 표현력을 높인다. 형태로, 게이트 메커니즘이 정보 흐름을 선택적으로 제어한다. FFN 차원이 로 조정되어 게이트 프로젝션에 사용되는 추가 파라미터를 보상한다.

모델 규모와 효율: Mistral Large 3 / Mistral 3은 41B (Dense) / 675B MoE 규모의 파라미터를 가지며, 128K 토큰의 컨텍스트 윈도우를 지원한다. 효율적인 아키텍처 설계를 통해 동급 모델 대비 경쟁력 있는 성능을 달성한다.

참고 자료

관련 문서