포스트

Sa2VA는 문장으로 비디오 객체를 어떻게 찾나: SAM-2, LLaVA와 [SEG] 토큰 연결

Sa2VA는 “노란 드레스를 입은 사람”처럼 문장으로 가리킨 대상을 LLaVA가 해석하고, 생성된 [SEG] 토큰을 SAM-2 decoder에 연결해 이미지 마스크나 비디오 추적으로 바꿉니다. 대화 모델과 분할 모델을 단순히 나란히 놓은 것이 아니라 언어 출력이 픽셀 출력의 조건이 된다는 점이 핵심입니다.

자료는 논문, GitHub, Hugging Face 모델 모음에 공개돼 있습니다.

Sa2VA 개요

Sa2VA의 성패는 문장을 잘 설명하는지보다 지칭한 객체를 올바른 mask로 바꾸고 영상 끝까지 같은 대상으로 유지하는지에 달려 있습니다. 언어 grounding, 첫 mask, 시간 추적을 분리해 채점해야 오류의 시작점을 찾을 수 있습니다.

LLaVA의 문장과 SAM-2의 마스크를 어떻게 잇나

Sa2VA의 입력은 텍스트와 이미지 또는 비디오입니다. 텍스트는 “무엇을 설명할지”뿐 아니라 “어떤 객체를 분할할지”를 지정합니다. 포인트나 바운딩 박스 같은 visual prompt도 함께 받을 수 있습니다.

모델 흐름은 세 부분으로 정리할 수 있습니다.

  1. 입력 모듈이 자연어와 이미지, 비디오를 받습니다.
  2. LLaVA 계열 멀티모달 모델이 지시와 시각 정보를 공통 token sequence에서 처리합니다.
  3. 분할이 필요하면 [SEG] 토큰이 SAM-2 decoder에 전달되고 대상 mask를 만듭니다.

Sa2VA 모델 구조

출력도 하나로 고정되지 않습니다.

요청출력
장면 질문텍스트 설명
객체 지칭이미지 segmentation mask
비디오 객체 지칭프레임 사이의 mask 추적
포인트, 박스 입력해당 visual prompt의 mask

“노란 드레스를 입은 여성을 찾아줘”라는 문장에서 속성과 대상이 함께 전달되면, 모델은 관련 visual feature를 찾고 [SEG] 토큰으로 분할을 요청합니다. 이 설명은 처리 구조를 보여주는 예시이며, 임의의 장면에서 대상과 행동 설명이 항상 정확하다는 보장은 아닙니다.

같은 객체를 비디오 끝까지 유지하는 것이 어려운 이유

이미지 분할은 한 장에서 지칭 대상과 영역을 맞추면 됩니다. 비디오는 대상이 움직이고 가려지고 모양이 변해도 같은 identity를 유지해야 합니다. Sa2VA가 SAM-2를 결합한 이유는 언어로 찾은 객체를 시간축에서 이어 가기 위해서입니다.

이미지와 비디오의 grounded understanding

실제 평가에서는 다음 오류를 나눠 봐야 합니다.

  • 문장을 잘못 이해해 처음부터 다른 객체를 선택
  • 첫 프레임 선택은 맞지만 이후 프레임에서 대상을 놓침
  • 비슷한 객체가 나타났을 때 identity가 바뀜
  • 텍스트 설명은 맞지만 mask 경계가 부정확
  • mask는 맞지만 행동이나 장면 설명이 틀림

대화 점수 하나로 분할 품질을 대신할 수 없고, 한 프레임의 좋은 mask로 비디오 추적을 대신할 수도 없습니다. Sa2VA의 “dense grounded understanding”은 언어, 공간, 시간 출력을 한 모델에서 다룬다는 뜻이지, 세 종류의 오류가 사라졌다는 뜻은 아닙니다.

Ref-SAV는 어떤 학습 공백을 채우나

원문은 Sa2VA가 Ref-SAV 데이터셋을 새로 구성했다고 설명합니다.

  • 7만 2천 개 이상의 객체 표현
  • 복잡한 장면과 다양한 길이의 텍스트 설명
  • 2천 개 이상의 비디오 객체 수동 검증
  • Ref-VOS, 즉 문장으로 지칭한 비디오 객체 분할 학습에 사용

여기에 COCO, RefCOCO, RefCOCO+와 SAM-2 관련 데이터를 함께 활용합니다. 이미지의 referring expression만으로는 가림과 이동이 있는 비디오 identity를 충분히 보여주기 어렵기 때문에, Ref-SAV가 언어 지칭과 시간 추적 사이를 보완합니다.

수동 검증된 2천 객체가 있다는 사실은 품질 관리가 포함됐음을 보여주지만, 나머지 표현이 모두 같은 방식으로 검증됐다는 뜻은 아닙니다. 실제 적용 분야의 영상 길이, 객체 수, 가림 정도가 Ref-SAV와 얼마나 비슷한지 확인해야 합니다.

벤치마크 표에서 비교할 수 있는 범위

원문에 제시된 결과는 다음과 같습니다.

모델Ref-VOS이미지 분할비디오 분할비디오 대화
GLaMM74.275.371.868.5
OMG-LLaVA76.177.272.969.8
Sa2VA79.581.377.174.2

Sa2VA 벤치마크

표의 네 열에서 Sa2VA가 비교 모델보다 높습니다. 원문은 GLaMM보다 3배 적은 데이터로 동등하거나 더 높은 성능을 냈다고도 설명합니다.

다만 열마다 평가 과제와 척도가 다르므로 79.574.2를 직접 비교해 “분할이 대화보다 5.3점 좋다”고 읽으면 안 됩니다. 실험 세부 조건 없이 이 수치를 모든 이미지, 비디오에 적용할 수도 없습니다.

Sa2VA 결과 예시

도입 판단은 사용 과제에 맞춰야 합니다.

  1. 텍스트로 지칭한 단일 객체가 핵심이면 Ref-VOS를 봅니다.
  2. 여러 프레임의 mask 일관성이 중요하면 비디오 분할과 identity 오류를 봅니다.
  3. 설명 생성도 필요하면 mask와 텍스트를 별도 평가합니다.
  4. 포인트, 박스 prompt를 쓴다면 자연어-only 결과와 나눠 측정합니다.
  5. 실시간이나 edge 배포가 필요하면 정확도 표와 별개로 처리 시간과 메모리를 확인합니다.

기존 글에 적힌 모바일, 감시, 스포츠 적용은 가능한 연구 방향이지 이 표가 입증한 제품 성능은 아닙니다. Sa2VA의 실질적인 장점은 문장으로 객체를 선택하고 SAM-2의 픽셀, 시간 추적 능력으로 이어 주는 통합 인터페이스입니다. 그 가치가 필요한지는 “대화를 잘하나”보다 “우리 영상에서 올바른 대상을 끝까지 같은 객체로 유지하나”로 판단해야 합니다.

문장에서 Mask까지 세 단계로 확인한다

“노란 드레스를 입은 사람”이라는 요청이 들어오면 먼저 LLaVA가 대상의 속성과 관계를 해석합니다. 다음으로 [SEG] token이 SAM-2 decoder가 사용할 조건으로 전달되고, 첫 frame의 mask가 만들어집니다. 비디오에서는 이 mask와 memory를 바탕으로 뒤 frame의 같은 객체를 추적합니다. 세 단계 중 하나가 틀리면 최종 mask만 보고 원인을 알기 어렵습니다.

평가 기록에는 문장이 가리킨 객체, 첫 frame mask의 IoU, frame별 identity 유지 여부를 따로 둡니다. 언어는 맞았지만 비슷한 옷을 입은 다른 사람을 선택한 경우, 첫 mask는 맞지만 가림 뒤 대상이 바뀐 경우, 추적은 유지됐지만 경계가 배경을 포함한 경우를 다른 오류로 분류합니다.

비디오 Failure Set을 어떻게 만들까

동일 class 객체가 여러 개 있는 장면, 대상이 다른 물체 뒤로 완전히 가려지는 장면, camera가 빠르게 움직이는 장면, 조명과 크기가 크게 바뀌는 장면을 포함합니다. 문장에는 색, 위치, 행동, 관계를 각각 사용해 어떤 표현에서 grounding이 약해지는지 봅니다.

한 frame의 평균 IoU만으로는 identity switch를 놓칠 수 있습니다. frame별 mask score와 함께 target ID가 바뀐 시점, 누락된 frame 수, 다시 나타난 뒤 회복 여부를 기록합니다. 여러 객체를 동시에 지칭할 때는 합쳐진 mask와 객체별 mask가 요청에 맞는지도 확인합니다.

통합 모델과 분리 Pipeline을 비교한다

기존 VLM으로 대상 설명을 만든 뒤 별도 SAM-2 prompt로 넘기는 방식과 Sa2VA를 같은 영상에서 비교합니다. 정확도뿐 아니라 중간 변환 오류, latency, memory, 사람이 prompt를 수정한 횟수를 기록해야 통합 interface의 이득을 계산할 수 있습니다.

실시간 사용이라면 frame 처리율과 end-to-end 지연을 따로 잽니다. 평균 속도가 높아도 가림이나 장면 전환에서 memory가 커지며 지연이 튈 수 있습니다. 안전 관련 영상에서는 낮은 confidence와 identity switch가 감지되면 자동 결과를 보류하고 사람이 확인하는 절차가 필요합니다.

Sa2VA가 적합한지는 자연어, point, box를 한 모델이 받는 편의성보다 자신의 영상에서 지칭 대상과 mask가 끝까지 일치하는지로 판단합니다. 문장 이해 점수와 segmentation 점수를 하나로 합치지 않아야 실제 약점을 고칠 수 있습니다.

함께 읽으면 이해가 이어지는 글

자주 묻는 질문

SEG 토큰은 무엇을 연결하나요?

LLaVA가 해석한 언어 표현을 SAM-2 decoder가 mask 생성 조건으로 사용할 수 있게 연결합니다.

첫 프레임 Mask가 맞으면 추적도 보장되나요?

아닙니다. 가림, 유사 객체와 camera 이동 뒤 identity가 바뀔 수 있으므로 frame별 누락과 identity switch를 별도로 봐야 합니다.

Sa2VA 평가는 무엇을 나눠야 하나요?

언어 grounding, 첫 mask 정확도, 시간 추적 일관성과 처리 지연을 분리해야 오류가 어느 단계에서 시작됐는지 알 수 있습니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    9개 장 15 분읽는 시간