SAM 3: 개념 기반 세그멘테이션의 새 패러다임
Meta · 2025-11-01 · Vision · Apache-2.0
개요
SAM 3(Segment Anything Model 3)는 2025년 Meta가 발표한 프롬프트 기반 개념 세그멘테이션(Concept Segmentation) 모델로, SAM 시리즈의 세 번째 버전이다. SAM(2023)이 점·박스 프롬프트 기반 이미지 세그멘테이션을, SAM 2(2024)가 스트리밍 메모리를 통한 비디오 추적으로의 확장을 이루었다면, SAM 3는 의미적 개념 기반 세그멘테이션이라는 완전히 새로운 패러다임을 개척한다.
기존 SAM과 SAM 2는 “이 위치(점/박스)의 객체를 분할하라”는 공간적 프롬프트에 응답하는 모델이었다. 이는 사용자가 분할하고자 하는 객체의 정확한 위치를 이미 알고 있어야 하며, “이미지에서 빨간색인 것을 모두 찾아라”, “음식에 해당하는 모든 영역을 분할하라” 같은 추상적 요청은 원천적으로 처리할 수 없었다. 이를 해결하기 위해 Grounding DINO + SAM을 파이프라인으로 연결한 “Grounded SAM”이 사용되었으나, 두 개의 개별 모델을 순차적으로 실행해야 하므로 지연 시간이 길고, 모듈 간 정보 손실이 발생하며, 탐지 모델이 찾지 못한 객체는 세그멘테이션도 불가능한 한계가 있었다.
SAM 3는 이 한계를 근본적으로 해결하여, “모든 빨간 물체”, “유리로 된 것”, “음식”, “움직이는 물체”, “위험해 보이는 것” 같은 **추상적 개념(concept)**에 해당하는 모든 영역을 이미지와 비디오에서 동시에 분할한다. 카테고리 기반(“자동차”, “사람”)뿐 아니라 속성 기반(“빨간”, “투명한”), 재질 기반(“금속”, “유리”), 상태 기반(“움직이는”, “깨진”), 관계 기반(“테이블 위의”) 등 다양한 차원의 개념을 처리할 수 있다. 시각적 프롬프트(점, 박스, 마스크)와 언어적 프롬프트(텍스트 개념)를 자유롭게 조합할 수 있는 멀티모달 프롬프트 인터페이스를 갖추어, 인스턴스 세그멘테이션, 의미론적 세그멘테이션, 개념 기반 분할, 비디오 추적을 하나의 종단간 모델에서 통합적으로 처리한다.
아키텍처 상세
프롬프트 가능한 개념 세그멘테이션 (Promptable Concept Segmentation)
SAM 3는 Promptable Concept Segmentation이라는 새로운 태스크를 정의한다. 기존의 인스턴스 세그멘테이션(개별 객체 분할), 의미론적 세그멘테이션(픽셀별 클래스 분류), 파노라마 세그멘테이션(stuff + things)과 구분되는 이 태스크는 다음 세 가지를 동시에 요구한다:
- 텍스트 개념(“빨간 물체”, “유리”, “음식”)이 주어지면 이미지 내 해당 개념에 해당하는 모든 인스턴스를 개별 마스크로 분할
- 시각적 프롬프트와 텍스트 프롬프트를 조합하여 복합적인 분할 수행 (예: “이 점이 가리키는 것과 같은 종류의 모든 객체”)
- 비디오에서 개념 기반 객체를 시간적으로 일관되게 추적하며 분할
멀티모달 인코더 통합
SAM 3는 SAM 2의 Hiera 이미지 인코더와 스트리밍 메모리 구조를 계승하면서, 추가로 언어 인코더를 통합한 멀티모달 아키텍처를 채택한다:
| 구성요소 | 역할 | 기반 |
|---|---|---|
| 이미지 인코더 | 멀티스케일 시각 특징 추출 | Hiera (SAM 2 계승) |
| 언어 인코더 | 텍스트 개념을 임베딩으로 변환 | Transformer 기반 |
| 프롬프트 인코더 | 점/박스/마스크 프롬프트 처리 | SAM 2 계승 |
| 교차 모달 융합 | 이미지-텍스트 특징 정렬 | Bidirectional Cross-Attention |
| 메모리 시스템 | 비디오 시간적 일관성 | SAM 2 스트리밍 메모리 |
| 개념 인식 디코더 | 가변 개수 인스턴스 마스크 예측 | 확장된 SAM 2 디코더 |
교차 모달 융합(Cross-Modal Fusion) 모듈은 이미지 특징과 텍스트 특징 간 양방향 교차 어텐션으로 개념-시각 정렬을 수행한다:
여기서 , , 이다. Grounding DINO의 깊은 융합 접근법에서 영감을 받았으나, SAM의 프롬프트 기반 세그멘테이션 프레임워크와 자연스럽게 통합되도록 설계되었다.
개념 인식 마스크 디코더
SAM/SAM 2의 마스크 디코더를 확장하여, 텍스트 개념에 조건화된 마스크 예측을 수행한다. 기존 SAM이 프롬프트당 1-3개의 고정 수 마스크를 예측한 것과 달리, SAM 3는 개념에 매칭되는 가변 개수의 인스턴스 마스크를 생성한다. 이 과정은 DETR 스타일의 집합 예측(set prediction)으로 공식화된다:
각 인스턴스 마스크는 개별 IoU 신뢰도 점수와 함께 출력되며, 점수 임계값으로 최종 출력 수를 조절할 수 있다. “빨간 물체”라는 개념에 대해 이미지 내 3개의 빨간 물체가 있다면 3개의 독립적 마스크를 예측한다.
스트리밍 메모리 계승
SAM 2의 스트리밍 메모리(메모리 인코더, 메모리 뱅크, 메모리 어텐션)를 완전히 계승하여 비디오에서의 개념 기반 추적을 가능하게 한다. 첫 프레임에서 “빨간 차”라는 텍스트 개념으로 분할하면, 메모리 시스템이 해당 객체의 외관 정보와 개념 정보를 함께 저장하고, 이후 프레임에서 가림이나 외관 변화가 발생해도 메모리 어텐션을 통해 안정적으로 추적한다. 새로운 “빨간 차”가 프레임에 등장하면 이를 개념 매칭으로 감지하여 자동으로 추적에 포함시킬 수도 있다.
핵심 혁신
-
개념 세그멘테이션 태스크 정의: 기존의 인스턴스/의미론적/파노라마 세그멘테이션과 구분되는 새로운 태스크를 정의하고 이를 단일 모델로 해결한다. 카테고리(“자동차”), 속성(“빨간”), 재질(“유리”), 상태(“움직이는”), 관계(“테이블 위의”) 등 다양한 차원의 개념을 통합적으로 처리한다.
-
종단간 멀티모달 통합: Grounded SAM(Grounding DINO + SAM의 2단계 파이프라인)과 달리, 단일 종단간 모델에서 텍스트 이해와 세그멘테이션을 통합한다. 파이프라인의 복잡도를 줄이고, 모듈 간 정보 손실 없이 최적의 텍스트-시각 정렬을 달성하며, 추론 지연도 감소한다.
-
오픈 세트 세그멘테이션: 학습 시 보지 못한 완전히 새로운 개념에 대해서도 강력한 일반화를 보이며, 자연어의 유연성을 활용하여 사실상 무한한 세그멘테이션 클래스를 처리할 수 있다.
-
SAM 시리즈 비전 완성: 점 프롬프트(인스턴스 세그멘테이션), 텍스트 프롬프트(개념 세그멘테이션), 비디오 추적을 하나의 모델에서 통합하여, SAM 시리즈의 “Segment Anything” 비전(어디든, 무엇이든, 언제든 분할)을 완성한다.
벤치마크/성능
| 태스크 | SAM 3 | SAM 2 | SAM | Grounded SAM |
|---|---|---|---|---|
| 이미지 인스턴스 세그멘테이션 (mIoU) | SOTA | 양호 | 양호 | 양호 |
| 비디오 객체 추적 (J&F) | SOTA | SOTA | 미지원 | 미지원 |
| 개념 기반 세그멘테이션 (mIoU) | 지원 | 미지원 | 미지원 | 부분적 |
| 오픈 세트 세그멘테이션 | 크게 향상 | 제한적 | 제한적 | 양호 |
| 텍스트 프롬프트 응답 시간 | 단일 추론 | - | - | 2단계 추론 |
| 속성/재질 기반 쿼리 | 지원 | 미지원 | 미지원 | 제한적 |
| 비디오 내 개념 추적 | 지원 | 미지원 | 미지원 | 미지원 |
SAM 3는 SAM/SAM 2의 공간적 프롬프트 기반 성능을 유지하면서, 개념 기반 세그멘테이션과 비디오 내 개념 추적이라는 새로운 능력을 추가하였다. 특히 Grounded SAM 대비 종단간 통합의 이점으로 추론 속도가 빠르고, 탐지 모듈의 한계에 의한 누락이 감소한다.
학습
- 데이터셋: 대규모 이미지·비디오 세그멘테이션 + 개념-마스크 쌍 데이터 (SA-1B, SA-V 확장 + 캡션-마스크 쌍)
- 아키텍처 기반: SAM 2 + 언어 인코더 통합
- 학습 목표: 개념 정렬 대조 학습 + 마스크 예측 손실 + IoU 예측 손실
- 개념 정렬 대조 손실: 텍스트 임베딩과 마스크 영역의 시각 임베딩 간 InfoNCE 대조 학습
- 마스크 손실: Focal Loss + Dice Loss (SAM 2 계승)
- 인스턴스 집합 예측: 헝가리안 매칭 기반 (DETR 계열 계승)
- 학습 전략: 이미지 세그멘테이션, 비디오 추적, 개념 분할을 멀티태스크로 통합 학습
관련 모델
SAM 3는 SAM(이미지, 2023) → SAM 2(비디오, 2024) → SAM 3(개념, 2025)로 이어지는 Segment Anything 시리즈의 최신작이다. Grounded SAM(Grounding DINO + SAM 파이프라인)과 달리 단일 종단간 모델에서 텍스트 기반 세그멘테이션을 수행하며, 비디오에서의 개념 추적까지 통합한다. 컴퓨터 비전과 자연어 이해의 진정한 통합을 향한 중요한 진전으로, SAM 시리즈의 “어디든(Anywhere) → 비디오(Video) → 무엇이든(Anything conceptual)” 확장 비전을 완성하였다.
참고 자료
관련 문서
- SAM 2 — 발전 기반