SAMA의 해법은 “무엇을 바꿀지”와 “원래 움직임을 어떻게 유지할지”를 한 번에 학습하지 않고 시맨틱 앵커링과 모션 정렬로 나누는 것입니다. 외부 VLM이나 ControlNet 없이 단일 비디오 백본을 쓰지만, 원문 시점에는 코드, 모델, 데이터가 공개 예정이라 즉시 실행 가능한 절차는 아닙니다.
비디오 편집에서 대상만 바꾸고 움직임은 지키려면: SAMA의 분리 학습
앵커 간격은 어떻게 정해야 할까
느리게 움직이는 피사체와 빠르게 회전하거나 가려지는 피사체에 같은 간격을 쓰면 결과가 달라질 수 있습니다. 앵커가 너무 드물면 중간 프레임에서 목표 대상의 색, 형태가 원본으로 되돌아가거나 정체성이 흔들릴 수 있습니다. 반대로 모든 순간을 촘촘하게 앵커로 잡으면 원본 시간 흐름을 유연하게 보존하려는 분리의 이점이 줄어들 수 있습니다.
비교 실험에서는 영상 길이와 지시를 고정하고 앵커 수만 바꿉니다. 대상의 크기 변화, 회전, 가림 전후와 장면 전환 부근에서 오류를 따로 봅니다. 평균 화질 하나보다 앵커에서 먼 프레임의 지시 준수율, 대상 경계의 흔들림과 원본 움직임 오차를 함께 기록해야 간격의 효과를 알 수 있습니다.
실제 편집에서는 일정 간격만 고집하지 않고 변화가 큰 구간을 후보로 삼는 설계도 비교할 수 있습니다. 다만 SAMA가 자동으로 최적 앵커를 골라 준다고 가정해서는 안 됩니다. 원문이 제시한 선택 방식과 자신의 구현 범위를 구분하고, 추가 선택 로직이 들어가면 그 비용과 효과를 별도 절제로 확인해야 합니다.
세 가지 교란을 복원하며 모션을 익힌다
Stage 0의 factorized pre-training은 짝지어진 편집 정답 없이 원본 비디오를 교란하고 복원하는 사전 과제를 사용합니다. Cube Inpainting은 시공간 블록을 가리고, Speed Perturbation은 재생 속도를 흔들며, Tube Shuffle은 시간축의 묶음을 섞습니다. 모델은 손상된 흐름을 복구하면서 공간과 시간의 연결을 학습합니다.
Stage 1에서는 편집 지시에 맞춘 지도 학습으로 의미 변환을 다듬습니다. Stage 0에서 raw video를 쓸 수 있다는 설명은 데이터가 공짜이거나 품질 검사가 불필요하다는 뜻이 아닙니다. 장면 전환, 반복 프레임과 비정상 속도가 많은 자료는 모션 사전 학습 자체를 흐릴 수 있습니다.
세 사전 과제는 어떤 실패를 겨냥하나
Cube Inpainting은 가려진 시공간 블록을 주변 맥락에서 복원하게 하므로 대상의 일부가 사라져도 연결을 찾는 능력을 시험합니다. Speed Perturbation은 시간 간격이 달라졌을 때 움직임의 순서를 이해하게 하고, Tube Shuffle은 시간축 조각의 순서를 다시 맞추게 합니다. 세 과제가 모두 “모션”을 다루지만 같은 오류를 고치는 것은 아닙니다.
자신의 데이터에서 하나씩 뺀 모델을 같은 편집 세트로 비교해야 합니다. 느린 제품 회전에는 속도 교란의 이득이 작고, 격한 동작이나 불규칙 프레임에는 다르게 나타날 수 있습니다. 전체 구성이 좋다는 결과만으로 어느 과제가 비용을 정당화하는지 알 수 없습니다. 학습 시간과 데이터 처리량도 과제별 품질 변화와 함께 기록합니다.
교란 자체가 원본의 의미를 망가뜨리지 않는지도 봐야 합니다. 이미 장면 전환이 있는 구간을 섞거나 속도를 과도하게 바꾸면 현실적인 모션 복원보다 인위적 패턴 탐지를 배우게 될 수 있습니다. 클립 경계, 중복 프레임, 깨진 영상과 비정상 프레임률을 걸러 내는 데이터 검사가 사전 학습 규모보다 먼저입니다.
비교 실험은 대상, 배경, 모션을 따로 본다
논문이 제시하는 제로샷과 SOTA 결과는 해당 데이터와 평가 설정의 보고값입니다. 자신의 영상에서는 편집 대상의 지시 준수, 대상 외 배경 보존, 프레임 간 모양 변화와 원본 움직임 정렬을 별도 지표로 봐야 합니다. 한 종합 점수만 쓰면 배경을 잘 보존했지만 편집을 거의 하지 않은 결과가 좋아 보일 수 있습니다.
VLM, ControlNet 기반 기준선, SAMA의 Stage 0만 적용한 조건, Stage 1까지 적용한 조건을 같은 입력으로 비교하면 어느 단계의 효과인지 알 수 있습니다. 속도 교란과 튜브 셔플을 각각 뺀 절제 실험도 실제 도메인에 필요한 사전 과제를 고르는 데 도움이 됩니다.
편집 성공과 원본 보존을 어떻게 나눠 볼까
강아지를 고양이로 바꾸라는 지시에서 대상이 거의 그대로면 시간 일관성은 높아도 편집은 실패입니다. 반대로 모든 프레임이 고양이처럼 보여도 걸음걸이와 카메라 궤적이 달라지면 원본 모션 보존은 실패입니다. 대상 의미, 대상 외 배경, 시간적 정체성과 원본 모션을 각각 점수화해야 두 목표의 교환 관계를 볼 수 있습니다.
평가 세트에는 색, 재질처럼 작은 변화, 종이나 형태가 달라지는 큰 변화, 가림과 빠른 회전을 따로 둡니다. 대상 마스크 안과 밖의 변화를 분리하고, 가림에서 다시 나타난 뒤 같은 정체성을 유지하는지 봅니다. 텍스트 지시를 약간 바꿨을 때 배경까지 불필요하게 달라지는지도 좋은 실패 조건입니다.
사람 평가를 쓸 때는 “더 보기 좋은 영상” 한 질문 대신 지시 준수, 배경 보존, 흔들림과 모션 일치를 따로 묻습니다. 종합 선호만 받으면 화려한 변화가 원본 보존 실패를 가릴 수 있습니다. 자동 지표와 사람 판단이 어긋난 사례를 모아 어느 목표를 우선할지도 사용 목적에 맞춰 정해야 합니다.
공개 범위와 학습 비용이 도입을 결정한다
원문은 코드, 모델과 데이터셋을 추후 공개한다고 적습니다. 논문과 논문 페이지에서 실제 공개 상태, 라이선스, 백본과 입력 규격을 확인하기 전에는 의사 코드만으로 재현 가능하다고 말할 수 없습니다.
추론 시 외부 조건 모델을 줄여도 Stage 0 사전 학습의 GPU 시간은 남습니다. 새로운 도메인에서 처음부터 다시 학습해야 하는지, 공개 가중치를 이어 쓸 수 있는지에 따라 비용이 크게 달라집니다. 먼저 짧은 영상에서 미세한 색, 재질 변경과 큰 형태 변경을 나눠 시험하고, 대상 밖 흔들림과 처리 시간을 함께 측정해야 합니다.
어떤 실패에서 도입을 멈춰야 하나
가림 뒤 정체성이 반복해서 바뀌거나 대상 밖 배경이 지시와 함께 움직인다면 앵커링과 모션 분리가 자신의 영상에 맞지 않는 신호입니다. 장면 전환이 많은 편집, 참조할 원본 모션 자체가 불안정한 영상과 지시가 여러 대상을 동시에 바꾸는 경우도 별도 시험이 필요합니다. 단일 데모의 부드러움으로 범위를 넓히면 어려운 구간에서 실패 원인을 찾기 어렵습니다.
작은 파일럿에는 기준 모델, Stage 0만, 전체 SAMA를 같은 해상도와 길이로 실행합니다. 학습 GPU 시간, 추론 지연, 최고 메모리와 사람 수정 시간을 함께 둡니다. 품질 차이가 작은데 사전 학습 비용이 크거나 공개 구현이 논문 설정을 재현하지 못하면 기다리거나 더 단순한 조건 모델을 쓰는 선택이 합리적입니다.
반대로 대상 의미와 모션 보존이 모두 반복적으로 좋아지고 가중치, 데이터 라이선스가 사용 목적에 맞으면 제한된 도메인부터 확장할 수 있습니다. 이때도 논문의 제로샷 결과를 다른 촬영 조건의 보장으로 해석하지 않고, 새 카메라와 움직임이 추가될 때마다 실패 세트를 갱신해야 합니다.
편집 결과를 저장할 때는 사용한 원본 클립, 지시문, 앵커 위치와 모델 설정을 함께 남깁니다. 같은 입력을 다시 처리했을 때 대상 밖 변화가 크게 달라지면 제작 흐름에서 수정 비용을 예측하기 어렵습니다. 성공한 결과만 모으지 말고 흔들림이 컸던 구간과 선택한 앵커의 관계를 기록하면 다음 데이터와 간격을 정하는 근거가 됩니다.
함께 읽으면 이해가 이어지는 글
- Claude Code로 영상을 대화하듯 편집하는 Video Use의 원리와 실전 활용법 — Video Use는 Claude Code, Codex 등 AI 코딩 에이전트와 자연어로 대화하며 타임라인 편집 없이 영상을 완성하는 오픈소스 파이프라인입니다. 영상 프레임을 직접 LLM에 전달하는 대신 단어 단위 음성 스크립트를…
- OpenMontage로 AI 영상을 만들 때: 에이전트 파이프라인, 비용, 검수 기준 — OpenMontage가 YAML 파이프라인, Markdown 스킬, Python 도구, Remotion과 FFmpeg를 연결해 영상 제작 단계를 조율하는 방식을 설명합니다. 설치 비용, 사람 승인, 재현성과 보안까지 포함한 파일럿…
- OpenCut 아키텍처 가이드: AI가 영상을 편집하고 코드가 타임라인을 제어하는 방법 — 비공개 상용 소프트웨어가 지배하던 영상 편집 시장에 등장한 완전히 새로운 대안, OpenCut 프로젝트를 조명합니다. 프라이버시를 보장하는 로컬 기반 아키텍처부터 시작해, Rust 코어 기반의 크로스플랫폼 통합, 플러그인 생태계…
자주 묻는 질문
SAMA는 모든 프레임을 직접 편집하나요?
의미 변화는 희소한 앵커 프레임에서 잡고, 앵커 사이의 시간 흐름은 모션 정렬로 유지하는 구조이므로 모든 프레임을 같은 세기로 고치는 접근과 다릅니다.
앵커 프레임은 많을수록 좋은가요?
아닙니다. 너무 적으면 편집 대상이 중간에 흔들릴 수 있고 너무 많으면 원본 모션을 과도하게 구속할 수 있으므로 움직임 속도와 가림이 다른 영상에서 간격을 비교해야 합니다.
현재 논문만으로 바로 재현할 수 있나요?
원문 시점에는 코드, 모델, 데이터가 공개 예정이므로 실제 공개 상태와 라이선스, 백본, 입력 규격을 확인한 뒤 같은 절제 실험이 가능한지 판단해야 합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.


