SAM 2: 이미지와 비디오 통합 세그멘테이션

Meta · 2024-08-01 · Vision · Apache-2.0

개요

SAM 2(Segment Anything Model 2)는 2024년 Meta의 Nikhila Ravi 등이 발표한 이미지 및 비디오 통합 세그멘테이션 파운데이션 모델이다. 기존 SAM(2023)이 단일 이미지에서의 세그멘테이션에 초점을 맞추었다면, SAM 2는 스트리밍 메모리 아키텍처를 도입하여 비디오에서 시간적 일관성을 유지하며 객체를 추적하고 분할하는 능력을 갖추었다. 비디오에서의 객체 세그멘테이션은 외관 변화(조명, 자세, 변형), 가림(occlusion), 객체의 등장과 퇴장, 카메라 이동, 모션 블러 등 단일 이미지에서는 존재하지 않는 도전적 상황을 처리해야 하며, SAM 2는 메모리 기반 어텐션으로 이러한 문제를 효과적으로 해결한다.

SAM 2의 핵심 설계 철학은 이미지를 “1프레임짜리 비디오”로 취급하는 통합 프레임워크이다. 이미지 처리 시에는 메모리를 사용하지 않고, 비디오 처리 시에만 메모리가 활성화되므로, 하나의 모델로 이미지와 비디오 세그멘테이션을 모두 처리한다. 사용자가 첫 프레임에서 점이나 박스 프롬프트를 한 번 주면, SAM 2는 메모리 시스템을 통해 해당 객체의 외관 정보를 축적하면서 이후 모든 프레임에서 자동으로 추적·분할한다. 객체가 가려졌다가 다시 나타나거나, 외관이 크게 변하는 상황에서도 메모리 기반 매칭으로 안정적으로 추적을 유지한다.

Hiera(Hierarchical Vision Transformer) 기반 경량 이미지 인코더를 채택하여 SAM의 ViT-H(632M) 대비 파라미터를 1/3로 줄이면서 추론 속도를 약 6배 향상시켰다. 놀랍게도 이미지 세그멘테이션 성능에서도 원래 SAM을 능가한다. 51K 비디오, 643K 마스크릿(비디오 내 객체 마스크 시퀀스)으로 구성된 SA-V(SA-Video) 데이터셋과 함께 공개되어, 비디오 세그멘테이션 연구의 데이터 부족 문제를 완화하였다.

아키텍처 상세

SAM 2는 네 가지 핵심 모듈로 구성된다: 이미지 인코더, 메모리 어텐션, 프롬프트 인코더/마스크 디코더, 메모리 인코더/뱅크이다.

Hiera 이미지 인코더

SAM의 ViT-H(632M) 대신 Hiera(Hierarchical Vision Transformer)를 채택하였다. Hiera는 MAE 스타일의 마스킹 사전학습에 최적화된 계층적 ViT로, 기존 계층적 ViT(Swin Transformer 등)에서 MAE 사전학습 시 불필요하거나 방해가 되는 구성요소(상대적 위치 편향, 분리된 다운샘플링 블록, 패치 머징 레이어 등)를 제거하여, 사전학습과 추론 모두에서 효율성을 극대화하였다:

사양SAM (ViT-H)SAM 2 (Hiera-B+)SAM 2 (Hiera-L)
파라미터632M80M224M
추론 속도~8×~6×
구조단일 스케일계층적 (4단계)계층적 (4단계)
멀티스케일 특징미지원지원지원
COCO 1-click mIoU75.475.276.8

Hiera는 4단계의 계층적 구조를 가지며, 각 단계에서 토큰 풀링으로 해상도를 줄이면서 채널 수를 2배로 늘린다. 이 멀티스케일 설계는 다양한 크기의 객체를 효과적으로 처리하며, 특히 SAM이 약했던 소형 객체 세그멘테이션에서 개선을 보인다.

스트리밍 메모리 아키텍처

SAM 2의 가장 핵심적인 혁신은 스트리밍 메모리 시스템이다. 비디오의 각 프레임을 순차적(streaming)으로 처리하면서, 과거 프레임의 정보를 메모리에 저장하고 현재 프레임 처리 시 참조한다:

메모리 인코더(Memory Encoder): 각 프레임의 마스크 예측 결과( 이진 마스크)를 이미지 인코더의 중간 특징과 결합하여, 경량 컨볼루션 모듈로 메모리 벡터 로 인코딩한다. 마스크 정보가 포함되므로, 메모리는 “어떤 영역이 추적 대상인지”를 기억한다.

메모리 뱅크(Memory Bank): 두 종류의 메모리를 유지한다:

  • 최근 메모리(Recent Memory): 가장 최근 개 프레임의 메모리 (FIFO 큐, 기본 ). 객체의 최근 외관을 반영한다.
  • 프롬프트 메모리(Prompted Memory): 사용자가 프롬프트를 제공한 프레임의 메모리 (영구 보존, 최대 2개). 초기 프롬프트의 정보를 비디오 전체에 걸쳐 유지한다.

메모리 어텐션(Memory Attention): 현재 프레임 의 이미지 특징이 메모리 뱅크에 저장된 과거 메모리에 교차 어텐션을 수행한다:

이를 통해 추적 중인 객체의 외관 변화(자세 변경, 조명 변화), 가림(다른 객체 뒤로 사라짐), 재등장(가림 후 복귀) 등을 효과적으로 처리한다. 스트리밍 방식이므로 메모리 사용량이 일정하고, 비디오 길이에 무관하게 동작한다.

가림 인식 모듈 (Occlusion Awareness)

SAM 2는 객체가 프레임에서 사라졌다가 다시 나타나는 상황을 명시적으로 처리하기 위한 가림 인식 메커니즘을 포함한다. 마스크 디코더가 각 프레임에서 객체의 존재 확률(IoU 신뢰도 점수)을 함께 출력하며, 신뢰도가 임계값 미만인 프레임에서는 (1) 마스크 출력을 빈 마스크로 대체하고, (2) 해당 프레임의 메모리를 뱅크에 추가하지 않아 잘못된 정보로 메모리가 오염되는 것을 방지한다.

핵심 혁신

  1. 이미지-비디오 통합 프레임워크: 이미지를 1프레임 비디오로 취급하여 단일 모델로 양쪽 태스크를 처리한다. 비디오 학습 데이터가 이미지 세그멘테이션 성능도 향상시키는 시너지 효과를 확인하였으며(COCO 1-click mIoU 75.4 → 76.8), 이는 시간적 맥락 학습이 공간적 이해를 강화함을 시사한다.

  2. 경량 고효율 스트리밍 메모리: 비디오 전체를 한 번에 처리하는 오프라인 방식이 아닌 프레임 단위 스트리밍 처리로, 메모리 사용량이 비디오 길이와 무관하게 일정하다. 실시간에 가까운 속도(~44 FPS)로 객체를 추적·분할하며, 임의 길이의 비디오에 적용 가능하다.

  3. Hiera 인코더: MAE 사전학습에 최적화된 계층적 ViT로, SAM의 ViT-H 대비 파라미터를 65% 줄이면서(632M → 224M) 속도를 6배 향상시키고, 세그멘테이션 성능은 오히려 개선하였다.

  4. SA-V 데이터셋: 51K 비디오, 643K 마스크릿으로 구성된 대규모 비디오 세그멘테이션 데이터셋을 공개하였다. 기존 최대 비디오 세그멘테이션 데이터셋(YouTube-VOS: 4.5K 비디오) 대비 10배 이상 크다.

벤치마크/성능

벤치마크SAM 2 (Hiera-L)SAM 2 (Hiera-B+)SAMXMemCutieDeAOT
SA-V (J&F)79.274.7-66.771.568.0
DAVIS 2017 (J&F)82.580.2-81.082.580.1
MOSE (J&F)73.069.8-60.267.662.5
COCO 1-click mIoU76.875.275.4---
추론 속도 (FPS)~44~73~7~22~28~19

SAM 2(Hiera-L)은 비디오 세그멘테이션에서 기존 최강 모델들(XMem, Cutie, DeAOT)을 SA-V(+7.7), MOSE(+5.4)에서 크게 능가하면서, 이미지 세그멘테이션(COCO 1-click)에서도 SAM ViT-H보다 우수한 76.8을 달성한다.

학습

  • 데이터셋: SA-V(51K 비디오) + SA-1B(11M 이미지) + DAVIS, YouTube-VOS 등 기존 데이터 혼합
  • 이미지 인코더 초기화: MAE 사전학습된 Hiera
  • 통합 학습: 이미지와 비디오 세그멘테이션을 번갈아 학습 (이미지: 메모리 비활성화)
  • 옵티마이저: AdamW, cosine 학습률 스케줄러
  • GPU: 64×A100
  • 비디오 학습: 8프레임 클립 단위, 시뮬레이션된 프롬프트(GT 마스크에서 점/박스 샘플링)
  • 학습 손실: Focal Loss + Dice Loss + IoU 예측 Loss
  • 메모리 뱅크: 최근 6프레임 + 프롬프트 2프레임 (학습/추론 동일)

관련 모델

SAM 2는 SAM의 이미지 세그멘테이션에 비디오 추적 능력을 추가한 통합 모델이다. 기존 비디오 객체 세그멘테이션(VOS) 모델인 XMem(단기+장기 메모리), Cutie(메모리 읽기 최적화), AOT/DeAOT(계층적 매칭) 등과 경쟁하면서도 이미지 세그멘테이션까지 포함하는 범용성을 갖추었다. SAM 3(2025)에서 언어 인코더 통합을 통한 개념 기반 세그멘테이션으로 더욱 확장되었다.

참고 자료

관련 문서

  • SAM — 발전 기반
  • SAM 3 — 후속 모델