도형준 지식 볼트
Search
검색
다크 모드
라이트 모드
탐색기
Home
❯
20.AI
❯
25.Multimodal
폴더: 20.AI/25.Multimodal
25건의 항목
2026년 7월 21일
DeepSeek-VL2: 멀티모달 AI 모델
DeepSeek
DeepSeek-VL2
Dynamic-Tiling
MoE-VLM
Parameter-Efficiency
2026년 7월 21일
Qwen2-VL: 멀티모달 AI 모델
Alibaba
Multimodal-RoPE
Naive-Dynamic-Resolution
Qwen2-VL
Video-Understanding
2026년 7월 21일
Chameleon: 멀티모달 AI 모델
All-Token-Multimodal
Chameleon
Early-Fusion
Meta
Unified-Autoregressive
2026년 7월 21일
CogVLM: 멀티모달 AI 모델
CogVLM
Deep-Fusion
Tsinghua
Vision-Language-Alignment
Visual-Expert
2026년 7월 21일
MiniCPM-V: 멀티모달 AI 모델
Edge-Deployment
High-Resolution-OCR
MiniCPM-V
Mobile-VLM
Tsinghua
2026년 7월 21일
Qwen3-Omni: 멀티모달 AI 모델
Alibaba
Omnimodal
Qwen3-Omni
Real-Time-Audio
Unified-Multimodal
2026년 7월 21일
InternVL: 멀티모달 AI 모델
InternVL
Large-Scale-Vision-Encoder
Progressive-Alignment
Shanghai-AI-Lab
Vision-Foundation-Model
2026년 7월 21일
Phi-4-Multimodal: 멀티모달 AI 모델
Efficient-Multimodal
Long-Context-Multimodal
Microsoft
Phi-4-Multimodal
Speech+Vision+Text
2026년 7월 21일
Pixtral: 멀티모달 AI 모델
Arbitrary-Resolution
Long-Context-Multimodal
Mistral-AI
Native-Vision-Encoder
Pixtral
2026년 7월 21일
Qwen3-VL: 멀티모달 AI 모델
Alibaba
Dynamic-Resolution
Enhanced-Reasoning
Qwen3-VL
Video-Understanding
2026년 7월 21일
BLIP-2: Q-Former를 이용한 효율적 멀티모달 사전학습
BLIP-2
Efficient-Training
Frozen-LLM
Frozen-LLM-Bridge
Modular-Multimodal-Learning
Q-Former
Salesforce
Visual-Question-Answering
VQA
2026년 7월 21일
Molmo: 멀티모달 AI 모델
AI2
Coordinate-Grounding
Molmo
PixMo-Dataset
Visual-Pointing
2026년 7월 21일
Show-o2: 멀티모달 AI 모델
Autoregressive-Image-Generation
NUS
Show-o2
Understanding+Generation
Unified-Multimodal-Generation
2026년 7월 21일
SigLIP: 시그모이드 손실 기반 시각-언어 사전학습
Contrastive-Learning
Efficient-Contrastive-Learning
Efficient-Training
Google
SigLIP
Sigmoid-Loss
Vision-Encoder
VLM-Backbone
Zero-Shot
Zero-Shot-Transfer
2026년 7월 21일
CLIP: 대조 학습 기반 시각-언어 사전학습 모델
CLIP
Contrastive-Learning
Dual-Encoder
OpenAI
Vision-Language
Vision-Language-Alignment
ViT
Zero-Shot
Zero-Shot-Transfer
2026년 7월 21일
InternVL 3: 멀티모달 AI 모델
High-Resolution-Understanding
InternVL-3
MoE-Vision-Language
Native-Multimodal-Pre-training
Shanghai-AI-Lab
2026년 7월 21일
LLaVA-OneVision: 멀티모달 AI 모델
AnyRes
ByteDance
LLaVA-OneVision
Multi-Image-Understanding
Unified-VLM
2026년 7월 21일
PaliGemma 2: 멀티모달 AI 모델
Fine-Tuning-Base-Model
Google
Multi-Resolution
PaliGemma-2
SigLIP+Gemma
2026년 7월 21일
Emu3: 멀티모달 AI 모델
BAAI
Discrete-Tokenization
Emu3
Next-Token-Prediction-Only
Unified-Multimodal
2026년 7월 21일
Flamingo: 소수샷 시각-언어 모델의 선구자
DeepMind
Few-Shot
Few-Shot-VLM
Flamingo
Gated-Cross-Attention
Interleaved-Multimodal
Perceiver-Resampler
VLM
2026년 7월 21일
GPT-4o: 멀티모달 AI 모델
End-to-End-Multimodal
GPT-4o
Native-Multimodal
OpenAI
Real-Time-Voice
2026년 7월 21일
Janus-Pro: 멀티모달 AI 모델
Decoupled-Vision-Encoder
DeepSeek
Discrete-Image-Tokenization
Janus-Pro
Unified-Understanding-Generation
2026년 7월 21일
00.Multimodal MOC
multimodal
2026년 7월 21일
Transfusion: 멀티모달 AI 모델
Continuous-Image-Modeling
LM+Diffusion
Meta
Transfusion
Unified-Generation
2026년 7월 21일
Whisper: 멀티모달 AI 모델
Multitask-Learning
OpenAI
Speech-Recognition
Weakly-Supervised
Whisper