Qwen3-Omni: 텍스트·이미지·오디오·비디오를 통합하는 옴니모달 AI

Alibaba · 2025-09-01 · Multimodal · Apache-2.0

개요

Qwen3-Omni는 2025년 Alibaba가 발표한 옴니모달(omnimodal) 모델로, 텍스트·이미지·오디오·비디오 네 가지 모달리티를 모두 이해하고 텍스트와 음성으로 출력할 수 있는 완전한 멀티모달 시스템이다. 기존 멀티모달 모델들이 텍스트-이미지 또는 텍스트-오디오와 같이 제한된 모달리티 조합만을 처리했던 것과 달리, Qwen3-Omni는 모든 입력 모달리티를 단일 모델 내에서 통합적으로 처리한다는 점에서 근본적인 패러다임 전환을 시도한다.

Qwen3의 강력한 텍스트 추론 능력과 Qwen2-VL의 시각 이해, Qwen2-Audio의 음성 처리를 하나의 통합 모델로 결합하여 GPT-4o와 같은 네이티브 멀티모달 인터랙션을 실현한다. 특히 실시간 음성 대화, 비디오 이해, 복잡한 시각적 추론을 단일 모델로 처리할 수 있으며, 이는 별도의 파이프라인 연결 없이 엔드-투-엔드로 동작한다. 중간 모듈 간의 정보 손실이 없으므로 각 모달리티의 미세한 뉘앙스까지 보존되며, 전체적인 응답 품질이 파이프라인 방식 대비 크게 향상된다. 기존 Qwen 시리즈의 개별 전문 모델들(Qwen3 텍스트, Qwen2-VL 비전, Qwen2-Audio 음성)을 하나로 통합함으로써, 모달리티 간 교차 추론(cross-modal reasoning)이 자연스럽게 이루어진다. 예를 들어 비디오의 시각 정보와 오디오 정보를 동시에 이해하여 장면 분석을 수행하거나, 음성 질문에 대해 이미지를 참조하여 응답하는 등의 복합적인 태스크가 가능하다.

옴니모달의 핵심 가치는 사용자가 어떤 형태의 입력을 제공하든 자연스러운 응답을 받을 수 있다는 것이다. 텍스트로 질문하면서 이미지를 첨부할 수도 있고, 음성으로 대화하면서 화면에 보이는 내용에 대해 실시간으로 설명을 요청할 수도 있다. 이러한 자연스러운 멀티모달 인터랙션은 기존의 파이프라인 방식(ASR → LLM → TTS)에서는 달성하기 어려웠던 것으로, 모달리티 간 지연 없는 통합 처리가 핵심이다.

아키텍처 상세

통합 인코더 시스템

Qwen3-Omni의 입력 처리는 모달리티별 전문 인코더를 통해 이루어진다. 각 인코더는 해당 모달리티에 최적화된 구조를 채택하되, 출력은 동일한 토큰 공간으로 매핑된다. 이를 통해 서로 다른 모달리티의 정보가 하나의 트랜스포머 내에서 자유롭게 상호작용할 수 있다.

비전 인코더는 동적 해상도 Vision Transformer(ViT)를 기반으로 한다. Qwen2-VL에서 검증된 네이티브 동적 해상도 기술을 계승하여, 입력 이미지의 해상도에 관계없이 최적의 패치 분할을 수행한다. 고해상도 이미지는 더 많은 패치로, 저해상도 이미지는 적은 패치로 처리되어 계산 효율성과 세밀한 이해를 동시에 달성한다. 예를 들어 4K 해상도의 문서 이미지는 수백 개의 패치로 분할되어 세밀한 텍스트까지 인식할 수 있고, 224x224 썸네일은 최소한의 패치로 효율적으로 처리된다.

오디오 인코더는 Whisper 계열의 음성 인코더를 기반으로 하며, 80채널 로그 멜 스펙트로그램을 입력으로 받아 음성 특징을 추출한다. 오디오 스트리밍 처리를 지원하여 실시간 음성 입력에 대한 낮은 지연시간을 보장한다. 스트리밍 모드에서는 오디오를 일정 크기의 청크로 분할하여 점진적으로 처리하며, 이전 청크의 컨텍스트를 유지하여 연속적인 음성 인식이 가능하다.

비디오 처리는 시간축을 따라 프레임을 동적으로 샘플링한 후, 각 프레임을 비전 인코더로 처리하고 시간적 컨텍스트를 추가하는 방식으로 이루어진다. Multimodal RoPE(M-RoPE)를 활용하여 공간(높이, 너비)과 시간 위치 정보를 통합적으로 인코딩한다. M-RoPE는 각 차원에 독립적인 회전 주파수를 적용하여, 이미지의 2D 공간 위치와 비디오의 시간 위치를 동시에 표현한다:

Qwen3 디코더

중심 디코더는 Qwen3 LLM을 기반으로 한 80개 레이어, 히든 차원 8192의 대규모 트랜스포머이다. Grouped Query Attention(GQA)을 사용하여 추론 시 KV 캐시 메모리를 절약하면서도 높은 성능을 유지한다. 72B 파라미터 규모에서 64개의 쿼리 헤드와 8개의 키-값 헤드를 사용하며, 이를 통해 메모리 사용량을 크게 줄이면서도 Multi-Head Attention에 근접하는 성능을 달성한다.

모든 모달리티에서 추출된 토큰은 텍스트 토큰과 동일한 임베딩 공간에 매핑되어, 하나의 통합 시퀀스로 디코더에 입력된다. 멀티모달 정렬(alignment)은 각 인코더의 출력을 LLM의 임베딩 공간에 사영(project)하는 모달리티별 프로젝션 레이어를 통해 달성된다. 이 사영 과정에서 각 모달리티의 의미적 표현이 텍스트 토큰과 호환되는 공간으로 변환된다:

정규화에는 RMSNorm이 사용되며, 활성화 함수로 SiLU를 채택한다. 컨텍스트 길이는 32,768 토큰으로, 긴 비디오나 다수의 이미지를 포함하는 복잡한 멀티모달 입력도 처리할 수 있다.

모달리티 간 교차 어텐션

Qwen3-Omni의 통합 시퀀스 내에서 서로 다른 모달리티의 토큰들은 셀프 어텐션을 통해 자유롭게 상호작용한다. 이미지 토큰이 오디오 토큰을 참조하거나, 비디오의 시각 프레임 토큰이 해당 시간대의 오디오 토큰을 참조하는 등의 교차 모달 어텐션이 자연스럽게 발생한다. 이를 통해 “화면에서 누군가가 말하는 내용”과 “실제 들리는 음성”을 교차 검증하거나, 비디오의 시각적 사건과 배경 음악의 분위기를 동시에 고려한 장면 설명을 생성할 수 있다. 이러한 교차 모달 어텐션은 명시적으로 설계된 것이 아니라, 통합 학습 과정에서 자연스럽게 발현되는 능력으로, 옴니모달 통합의 핵심 장점이다.

음성 출력 시스템

Qwen3-Omni는 텍스트 출력과 함께 음성 출력 기능을 갖추어 음성-음성 대화가 가능하다. 내부 TTS(Text-to-Speech) 모듈이 통합되어 있으며, 디코더의 텍스트 출력을 실시간으로 음성으로 변환한다. 이를 통해 사용자는 음성으로 질문하고 음성으로 답변을 받는 자연스러운 대화 경험을 얻을 수 있다. TTS 모듈은 텍스트 생성과 병렬로 동작하여 응답 지연을 최소화하며, 자연스러운 억양과 프로소디를 생성하도록 학습되었다.

핵심 혁신

Qwen3-Omni는 기존 멀티모달 모델들과 구별되는 세 가지 핵심 혁신을 제시한다. 이 혁신들은 개별적으로도 의미가 있지만, 함께 결합되었을 때 진정한 옴니모달 시스템의 가능성을 보여준다.

Qwen3-Omni의 가장 중요한 혁신은 모달리티 통합의 깊이에 있다. 기존의 파이프라인 방식(예: 음성 인식 → 텍스트 처리 → 이미지 이해)과 달리, 모든 모달리티가 동일한 트랜스포머 내부에서 상호작용한다. 이는 모달리티 간 정보 손실을 최소화하고, 복합 추론을 가능하게 한다. 예를 들어 음성의 감정적 톤과 시각적 맥락을 동시에 고려한 응답 생성이 가능하다.

두 번째 혁신은 실시간 스트리밍 처리이다. 오디오 입력을 청크 단위로 처리하면서 동시에 시각 정보를 참조할 수 있어, 화상 회의 보조, 실시간 통역, 라이브 비디오 분석 등의 시나리오에 적합하다. 500ms 이하의 응답 지연으로 자연스러운 대화 경험을 제공한다. 이는 기존 파이프라인 방식(ASR → LLM → TTS)의 누적 지연(1~3초)에 비해 획기적으로 빠른 것이다.

세 번째는 통합 학습을 통한 시너지 효과이다. 각 모달리티를 별도로 학습한 전문 모델을 단순히 연결하는 것이 아니라, 통합 학습을 통해 모달리티 간 상호 보완적인 표현을 학습한다. 비디오 이해 태스크에서 오디오 단서가 시각적 이해를 보완하고, 시각적 맥락이 음성 인식의 정확도를 향상시키는 등의 시너지가 발생한다.

벤치마크/성능

Qwen3-Omni는 멀티모달 이해와 생성 벤치마크 전반에서 최고 수준의 성능을 달성한다. 기존의 텍스트-이미지 벤치마크뿐만 아니라, 오디오 이해, 비디오 이해, 교차 모달 추론 등 다양한 멀티모달 태스크에서 평가되었다. 특히 여러 모달리티를 동시에 활용해야 하는 복합 태스크에서 단일 모달리티 전문 모델들의 파이프라인 조합보다 우수한 성능을 보이며, 이는 통합 아키텍처의 장점을 명확하게 보여준다. 오디오-비주얼 장면 이해에서는 시각 정보만으로는 판단할 수 없는 오디오 단서를 활용하여 더 정확한 응답을 생성한다.

벤치마크Qwen3-OmniGPT-4oGemini 1.5 Pro
MMMU (멀티모달 이해)72.869.162.2
MathVista (시각 수학)70.563.858.3
Video-MME (비디오 이해)75.371.970.1
AudioBench (오디오 이해)82.178.574.2
실시간 음성 응답 지연< 500ms~800msN/A

Qwen3-Omni는 멀티모달 이해 벤치마크 전반에서 GPT-4o를 상회하는 성능을 보이며, 특히 비디오와 오디오를 동시에 처리하는 복합 태스크에서 강점을 보인다. 시각 수학(MathVista)에서 70.5점으로 GPT-4o의 63.8점을 크게 상회하며, 오디오 이해(AudioBench)에서도 82.1점으로 최고 성능을 달성한다.

학습

Qwen3-Omni의 학습은 모든 모달리티를 포괄하는 대규모 데이터와 정교한 다단계 전략을 결합한다. 학습 데이터는 수십억 개의 텍스트 문서, 수십억 개의 이미지-텍스트 쌍, 수백만 시간의 오디오-텍스트 쌍, 수백만 시간의 비디오-텍스트 쌍으로 구성된다. 모달리티 간 데이터 불균형을 해소하기 위해 각 모달리티별 샘플링 비율을 동적으로 조절하며, 학습이 진행됨에 따라 더 복잡한 교차 모달 태스크의 비중을 점진적으로 높인다.

학습은 크게 세 단계로 진행된다. 1단계에서는 각 모달리티별 인코더를 독립적으로 사전학습한다. 비전 인코더는 대규모 이미지-텍스트 쌍으로, 오디오 인코더는 대규모 음성-텍스트 쌍으로 각각 학습하여 모달리티 특화 표현을 확보한다. 2단계에서는 텍스트, 이미지-텍스트, 오디오-텍스트, 비디오-텍스트 데이터를 대규모로 혼합하여 통합 멀티모달 사전학습을 수행한다. 이 단계에서 모달리티 간 정렬(alignment)이 이루어지며, 교차 모달 추론 능력이 형성된다. 3단계에서는 인스트럭션 튜닝과 RLHF를 통해 응답 품질과 안전성을 정렬한다. 음성 출력을 위한 TTS 모듈도 통합하여 엔드-투-엔드 학습을 수행하며, 전체 학습 과정에서 모달리티 간 균형을 유지하기 위한 동적 배치 전략(각 배치에서 모달리티별 데이터 비율을 동적으로 조절)을 적용한다.

관련 모델

  • Qwen3: 텍스트 추론 기반이 되는 핵심 LLM으로, chain-of-thought 추론과 장문 추론 능력을 제공
  • Qwen2-VL: 비전 인코더와 동적 해상도 기술, M-RoPE의 기반
  • Qwen2-Audio: 오디오 인코더의 기반으로 Whisper 계열 아키텍처 채택
  • GPT-4o: 유사한 옴니모달 접근을 취하는 대표적 경쟁 모델

참고 자료

관련 문서

  • Qwen3 — 발전 기반