Sa2VA는 “노란 드레스를 입은 사람”처럼 문장으로 가리킨 대상을 LLaVA가 해석하고, 생성된 [SEG] 토큰을 SAM-2 decoder에 연결해 이미지 마스크나 비디오 추적으로 바꿉니다. 대화 모델과 분할 모델을 단순히 나란히 놓은 것이 아니라 언어 출력이 픽셀 출력의 조건이 된다는 점이 핵심입니다.
자료는 논문, GitHub, Hugging Face 모델 모음에 공개돼 있습니다.
Sa2VA의 성패는 문장을 잘 설명하는지보다 지칭한 객체를 올바른 mask로 바꾸고 영상 끝까지 같은 대상으로 유지하는지에 달려 있습니다. 언어 grounding, 첫 mask, 시간 추적을 분리해 채점해야 오류의 시작점을 찾을 수 있습니다.




