Qwen3-VL: 강화된 추론 능력의 시각-언어 모델

Alibaba · 2025-11-01 · Multimodal · Apache-2.0

개요

Qwen3-VL은 2025년 Alibaba가 발표한 Qwen2-VL의 후속 비전-언어 모델로, Qwen3 언어 모델의 강화된 추론 능력을 시각 도메인으로 확장한 모델이다. 오픈소스 멀티모달 모델 중 최고 수준의 벤치마크 성능을 달성하였으며, 특히 복잡한 시각적 수학 문제, 과학 다이어그램 해석, 고해상도 문서 분석 등에서 탁월한 성능을 보인다.

Qwen2-VL이 네이티브 동적 해상도와 M-RoPE라는 구조적 혁신을 제시했다면, Qwen3-VL은 이를 계승하면서 추론 능력의 질적 향상에 집중하였다. Chain-of-thought 추론, 장문 추론(long-form reasoning), 다단계 논리 전개 등에서 Qwen3 LLM의 강화된 능력이 시각 이해와 결합되어, 복잡한 다단계 시각 추론 태스크에서 GPT-4V 및 Claude 3.5를 상회하는 성능을 달성하였다. 이는 단순히 “이미지에 무엇이 있는가”를 넘어 “이미지의 정보로부터 어떤 결론을 도출할 수 있는가”라는 고차원적 추론을 수행할 수 있음을 의미한다.

비디오 이해 능력도 대폭 강화되었으며, 더 긴 비디오 시퀀스와 다수 이미지를 효율적으로 처리할 수 있다. 동적 해상도 처리 기술은 이미지뿐만 아니라 비디오 프레임에도 적용되어, 다양한 해상도와 종횡비의 비디오를 네이티브하게 처리한다. 장시간 비디오에서 핵심 장면을 식별하고 시간 순서에 따른 변화를 추론하는 능력이 크게 개선되었다. 이를 통해 교육 영상의 핵심 내용 요약, 스포츠 경기의 주요 장면 분석, 보안 카메라 영상의 이상 탐지 등 실용적인 비디오 이해 시나리오에 직접 적용할 수 있다. Qwen3-VL은 2B, 7B, 72B의 세 가지 크기로 제공되어, 모바일 환경부터 서버 환경까지 다양한 배포 시나리오를 지원한다.

아키텍처 상세

비전 인코더

Qwen3-VL의 비전 인코더는 Qwen2-VL에서 검증된 네이티브 동적 해상도 ViT를 기반으로 하되, 여러 가지 개선이 이루어졌다. 핵심은 입력 이미지를 고정 해상도로 리사이즈하지 않고, 원본 종횡비를 유지한 채 가변 개수의 패치로 분할하는 것이다. 이를 통해 고해상도 문서 이미지에서 세밀한 텍스트를 놓치지 않으면서도, 저해상도 이미지에서 불필요한 계산을 줄일 수 있다.

패치 분할 후 각 패치는 ViT를 통해 임베딩되며, 2D 위치 정보는 M-RoPE(Multimodal Rotary Position Embedding)를 통해 인코딩된다. M-RoPE는 시간(temporal), 높이(height), 너비(width)의 3차원 위치 정보를 독립적으로 인코딩하여 다양한 해상도와 비디오 시퀀스를 통합적으로 처리한다:

여기서 는 로터리 임베딩의 결합 연산이며, 각 축에 대해 독립적인 주파수로 위치를 인코딩한다. 이미지 입력의 경우 시간 차원 는 상수가 되고, 비디오 입력의 경우 프레임 인덱스에 따라 증가하여 시간적 순서를 인코딩한다.

비전 인코더의 출력은 이미지당 가변 개수의 비전 토큰을 생성하며, 이 토큰들은 프로젝션 레이어를 통해 LLM의 임베딩 공간으로 변환된다. 고해상도 이미지는 수백 개의 토큰을 생성하고, 저해상도 이미지는 수십 개의 토큰만을 생성하여 효율적인 처리가 가능하다.

언어 모델 디코더

디코더는 Qwen3 LLM을 기반으로 하며, 80개 레이어, 히든 차원 8192, 64개 어텐션 헤드의 대규모 구조를 갖는다. GQA(Grouped Query Attention)를 사용하여 KV 캐시를 효율적으로 관리하며, 정규화에는 RMSNorm, 활성화 함수로는 SiLU를 사용한다. Qwen3의 핵심 강점인 chain-of-thought 추론 능력이 시각 입력과 결합되어, 복잡한 시각 문제에 대해 단계적이고 논리적인 추론 과정을 전개할 수 있다.

비전-언어 정렬은 프로젝션 레이어를 통해 이루어지며, ViT의 출력 토큰이 LLM의 임베딩 공간으로 사영된다:

여기서 번째 이미지 패치이고, 는 학습 가능한 사영 행렬이다. 이 프로젝션을 통해 시각적 정보가 언어 모델의 토큰 공간과 호환되는 표현으로 변환되어, 텍스트와 이미지 간의 자유로운 추론이 가능해진다.

비디오 처리 파이프라인

비디오 입력은 시간축을 따라 동적으로 프레임을 샘플링하고, 각 프레임에 동적 해상도 처리를 적용한다. 프레임 샘플링은 비디오의 길이와 내용 변화량에 따라 동적으로 조절되며, 변화가 큰 구간에서는 더 많은 프레임을 추출한다. M-RoPE의 시간 차원이 프레임 순서를 인코딩하여, 시간적 관계 추론이 자연스럽게 이루어진다. 이를 통해 긴 비디오에서도 핵심 장면을 효과적으로 포착하고, 시간 순서에 따른 변화를 추론할 수 있다. 비디오와 오디오 트랙이 함께 제공되는 경우, 시각 정보와 청각 정보를 동시에 활용하여 더 정확한 장면 이해가 가능하다.

멀티스케일 시각 표현

Qwen3-VL의 비전 인코더는 다양한 스케일에서 시각 정보를 추출하는 능력을 갖추고 있다. 동적 해상도 처리를 통해 이미지의 전역적 구조(장면 레이아웃, 객체 배치)와 세밀한 디테일(텍스트, 수식, 작은 기호)을 동시에 포착한다. 고해상도 문서 이미지의 경우, 문서의 전체적인 레이아웃을 파악하면서도 개별 글자와 수식 기호까지 정확하게 인식할 수 있다.

비전 인코더의 출력은 압축 과정을 거쳐 LLM에 전달된다. 수백 개의 ViT 출력 토큰을 그대로 전달하면 컨텍스트 길이를 과도하게 소비하므로, 적응적 풀링(adaptive pooling)이나 리샘플러(resampler)를 통해 핵심 정보를 보존하면서 토큰 수를 줄인다. 이를 통해 여러 장의 고해상도 이미지나 긴 비디오도 32,768 토큰의 컨텍스트 내에서 효율적으로 처리할 수 있다.

핵심 혁신

Qwen3-VL의 가장 중요한 혁신은 추론 능력의 시각 도메인 확장이다. 단순한 시각적 질의응답을 넘어, 복잡한 수학 문제의 그래프를 해석하거나, 과학 논문의 다이어그램에서 정보를 추출하여 논리적 추론을 수행하는 등 고차원적 시각 추론이 가능하다. 예를 들어 함수 그래프의 교점을 찾거나, 통계 차트에서 추세를 분석하고 미래 값을 예측하는 등의 복잡한 태스크를 단계적으로 풀어낸다.

또한 동적 해상도의 완성도 향상이 두드러진다. Qwen2-VL에서 도입된 동적 해상도 기술이 더욱 안정화되고 효율적으로 개선되어, 초고해상도(4K 이상) 문서 이미지부터 저해상도 썸네일까지 일관된 성능을 제공한다. 패치 수의 동적 조절로 계산 비용도 입력 이미지의 복잡도에 비례하여 자동 조절된다.

멀티이미지 추론 능력도 크게 강화되어, 여러 장의 이미지를 동시에 참조하면서 비교, 대조, 통합 분석을 수행할 수 있다. 이는 의료 영상 비교 분석, 상품 비교, 다중 문서 분석, 인포그래픽 해석 등의 실용적 시나리오에 직접 활용 가능하다. 각 이미지의 위치 정보가 M-RoPE를 통해 독립적으로 인코딩되므로, 모델이 어떤 이미지에서 어떤 정보를 참조했는지 정확하게 추적할 수 있다.

벤치마크/성능

Qwen3-VL은 이미지 이해, 문서 분석, 수학적 시각 추론, 비디오 이해 등 다양한 멀티모달 벤치마크에서 체계적으로 평가되었다. 오픈소스 모델 중 최초로 대부분의 벤치마크에서 GPT-4V와 Claude 3.5 Sonnet을 동시에 상회하는 성능을 달성하였으며, 이전 버전인 Qwen2-VL-72B 대비 모든 벤치마크에서 유의미한 성능 향상을 보인다. 특히 추론 능력이 직접적으로 반영되는 MathVista와 ChartQA에서의 성능 향상이 두드러진다.

벤치마크Qwen3-VL-72BGPT-4VClaude 3.5 SonnetQwen2-VL-72B
MMMU74.269.168.364.5
MathVista73.863.861.658.2
DocVQA96.188.490.894.5
ChartQA89.578.581.283.0
OCRBench882736788866
Video-MME (long)72.164.258.963.3

Qwen3-VL은 시각 추론 벤치마크 전반에서 오픈소스 모델 최고 성능을 달성하며, 다수의 벤치마크에서 GPT-4V와 Claude 3.5를 상회한다. 특히 수학적 시각 추론(MathVista)에서 73.8점으로 GPT-4V의 63.8점을 10점 이상 상회하며, 문서 이해(DocVQA)에서 96.1점이라는 거의 완벽에 가까운 성능을 보인다. 이전 버전인 Qwen2-VL-72B 대비 MMMU에서 약 10점, MathVista에서 약 15점의 대폭적인 성능 향상이 이루어졌다.

학습

Qwen3-VL의 학습 파이프라인은 효율성과 성능 극대화를 동시에 추구하는 정교한 다단계 프로세스로 구성된다. 각 단계는 이전 단계에서 확보한 표현을 기반으로 점진적으로 능력을 확장하며, 특히 추론 능력을 강화하기 위한 전략적 데이터 구성이 핵심이다. 수학적 시각 추론 학습 데이터는 GPT-4V를 활용한 합성 데이터 생성과 인간 검수를 결합하여 구축하였으며, chain-of-thought 형식의 상세한 풀이 과정을 포함한다. 비디오 이해 학습 데이터는 다양한 길이(30초~10분)와 장르(교육, 엔터테인먼트, 스포츠 등)를 포괄하여 범용적인 비디오 이해 능력을 확보한다.

학습은 다단계로 진행된다. 먼저 비전 인코더와 프로젝션 레이어를 대규모 이미지-텍스트 쌍(수십억 쌍)으로 사전학습하여 시각-언어 정렬을 확보한다. 이 단계에서 LLM 파라미터는 고정하고 비전 인코더와 프로젝션 레이어만 학습한다. 이어서 대규모 멀티모달 데이터와 수학·과학 특화 시각 추론 데이터를 혼합하여 전체 모델 통합 학습을 수행한다. Qwen3 LLM의 강화된 추론 능력을 바탕으로 멀티모달 인스트럭션 튜닝과 RLHF 정렬을 수행하며, 동적 해상도 혼합 배치 학습 전략을 계승하면서 개선된 데이터 큐레이션 파이프라인을 적용한다. 특히 수학적 시각 추론 데이터의 비중을 높여 추론 능력을 극대화하였으며, 합성 데이터 생성을 통해 고품질 추론 학습 데이터를 확보한다. 전체 학습 데이터는 수십억 개의 이미지-텍스트 쌍과 수백만 개의 비디오-텍스트 쌍으로 구성되며, 데이터 품질 관리를 위한 자동화된 필터링 파이프라인이 적용된다. 데이터 품질이 낮은 샘플은 자동으로 제거되어 학습 효율성을 극대화한다.

관련 모델

  • Qwen2-VL: 동적 해상도와 M-RoPE를 최초 도입한 전신 모델로 Qwen3-VL의 구조적 기반
  • Qwen3: 강화된 chain-of-thought 추론 능력의 기반이 되는 LLM
  • LLaVA-OneVision: 유사한 시각-언어 통합 접근의 오픈소스 경쟁 모델
  • InternVL 3: 대규모 오픈소스 VLM 경쟁 모델로, 유사한 동적 해상도 접근을 사용한다

참고 자료

관련 문서