개요

Qwen2는 알리바바 그룹의 Qwen 팀이 2024년 발표한 두 번째 세대 대형 언어 모델 시리즈다. Qwen1.5의 후속으로, 0.5B, 1.5B, 7B, 57B-A14B(MoE), 72B 다섯 가지 밀집(dense) 크기와 하나의 MoE 변형이 공개되었다. 특히 **Dual Chunk Attention(DCA)**과 **YARN(Yet Another RoPE Extension)**을 결합하여 최대 128K 토큰 컨텍스트를 지원하는 것이 핵심이다.

7조(7T) 토큰의 방대한 데이터로 학습되었으며, 29개 언어를 지원해 특히 중국어와 동아시아 언어 처리에서 강점을 보인다. Qwen2-72B는 동급 오픈소스 모델들을 광범위한 벤치마크에서 능가한다.

배경 및 문제

1세대 Qwen의 한계

Qwen1.5는 다국어 지원과 오픈소스 공개에서 진전을 이뤘으나, 컨텍스트 길이(최대 32K), 추론 효율성, 수학/코드 특화 능력에서 개선 여지가 있었다.

긴 컨텍스트의 기술적 난관

RoPE(Rotary Position Embedding)는 훈련 길이를 초과하는 시퀀스에 대해 성능이 급격히 저하된다. 또한 어텐션 연산의 복잡도는 128K 토큰 처리를 매우 비효율적으로 만든다.

핵심 아이디어

Grouped Query Attention (GQA)

모든 Qwen2 모델에 GQA를 적용한다. 쿼리 헤드 수()가 KV 헤드 수()보다 많으며, 여러 쿼리가 하나의 KV 헤드를 공유한다.

여기서 는 그룹 크기다.

Dual Chunk Attention (DCA)

DCA는 긴 시퀀스를 처리할 때 어텐션을 **청크 내(intra-chunk)**와 **청크 간(inter-chunk)**으로 분리하여 계산한다.

  • Intra-chunk Attention: 같은 청크 내 토큰 간 표준 어텐션 (상대 위치 완전 보존)
  • Inter-chunk Attention: 다른 청크의 토큰 간 어텐션 (청크 요약 표현 사용)

이를 통해 긴 시퀀스에서도 위치 정보를 효율적으로 유지하면서 계산 복잡도를 줄인다.

YARN (RoPE 외삽)

훈련 시 컨텍스트보다 긴 시퀀스를 처리하기 위해 YARN을 사용한다. YARN은 RoPE의 회전 주파수를 동적으로 스케일링한다.

4K 토큰으로 훈련된 모델이 128K 토큰으로 외삽될 수 있도록 한다.

사전학습 데이터

  • 총 토큰: 7조(7T)
  • 언어: 29개 (영어, 중국어, 일본어, 한국어 등)
  • 데이터 품질: 다단계 필터링, 중복 제거, 품질 점수 기반 선별

방법론

모델 구성

모델파라미터레이어Q 헤드KV 헤드컨텍스트
Qwen2-0.5B0.49B2414232K
Qwen2-1.5B1.54B2816232K
Qwen2-7B7.07B28284128K
Qwen2-57B-A14B57.4B (14.7B active)2864864K
Qwen2-72B72.7B80648128K

정렬 훈련

사전학습 후 SFT + RLHF 파이프라인을 적용하여 Qwen2-Instruct 모델을 만든다. DPO(Direct Preference Optimization)도 병행하여 사용한다.

실험 결과

일반 능력 벤치마크

모델MMLUGSM8KHumanEvalIFEvalMBPP
Llama 3-8B66.679.662.276.865.0
Mistral-7B64.252.240.2-49.0
Qwen2-7B70.389.979.977.675.2
Llama 3-70B82.093.081.786.280.2
Qwen2-72B84.293.286.087.682.6

다국어 벤치마크

모델중국어일본어한국어아랍어
Llama 3-70B74.368.162.859.0
Qwen2-72B91.179.373.271.5

특히 중국어와 동아시아 언어에서 Llama 3-70B를 크게 앞선다.

긴 컨텍스트 성능

Needle-in-a-Haystack 평가에서 Qwen2-72B는 128K 토큰 길이까지 거의 완벽한 검색 정확도를 유지한다.

의의 및 한계

의의

  • 긴 컨텍스트 오픈소스: DCA + YARN으로 128K 오픈소스 모델의 실용적 기준 수립
  • 다국어 선두: 29개 언어 지원, 특히 아시아권 언어에서 강점
  • 규모 대비 성능: Qwen2-7B가 Llama 3-8B를 대부분 벤치마크에서 능가
  • MoE 변형 제공: 57B-A14B로 비용 효율적 대용량 모델 제공

한계

  • 훈련 데이터 세부사항 제한적 공개: 데이터 구성의 완전한 투명성 부족
  • 안전성 정렬 지속 과제: 29개 언어 전반에 걸친 일관된 안전성 확보 어려움
  • 서구권 벤치마크 편향: MMLU, HumanEval 등은 영어 중심으로, 다국어 우위가 실제 사용성에서 다를 수 있음

Qwen2는 Qwen 시리즈를 글로벌 경쟁력 있는 오픈소스 LLM으로 자리매김시켰으며, 이후 Qwen2.5, Qwen2-VL 등 멀티모달 확장의 기반이 되었다.