긴 자동회귀 영상이 뒤로 갈수록 색과 형태를 잃는다면, TokenTrim은 프레임 전체를 버리는 대신 급격히 변한 잠재 토큰만 찾아 다음 생성 문맥에서 제외합니다. 모델을 다시 학습하지 않고 추론 중 KV 캐시를 조정한다는 점이 장점이지만, 정상적인 빠른 움직임도 오류로 오인할 수 있습니다. 품질 향상 여부는 최종 영상뿐 아니라 프루닝 발동과 재생성 지연을 함께 측정해 판단해야 합니다.
긴 AI 영상이 뒤로 갈수록 무너질 때: TokenTrim의 추론 토큰 가지치기
잠재 드리프트는 왜 다음 프레임으로 번질까?
자동회귀 모델은 방금 생성한 결과를 다음 단계의 조건으로 다시 사용합니다. 한 영역의 잠재 토큰이 잘못되면 그 값이 KV 캐시에 남아 이후 프레임에서도 반복 참조될 수 있습니다. TokenTrim의 가설은 이 오염된 문맥을 그대로 누적하는 것이 장기 드리프트의 한 원인이라는 것입니다.
이 설명은 모든 품질 저하가 토큰 오염 때문이라는 뜻은 아닙니다. 모델이 움직임 자체를 이해하지 못하거나 학습 분포 밖 장면을 만난 경우에는 문맥 일부를 지워도 원인이 사라지지 않습니다.
자동회귀 생성에서는 이전 결과가 단순한 참고 이미지가 아니라 다음 계산의 문맥이 됩니다. 작은 형태 오류가 캐시에 남으면 이후 프레임이 그 잘못된 형태를 정상 상태처럼 이어 갈 수 있고, 시간이 지날수록 원래 객체와 멀어질 수 있습니다. TokenTrim은 이런 누적 경로를 일부 끊어 다시 생성할 기회를 만듭니다.
하지만 변화량이 크다는 사실만으로 오염이라고 결론 내릴 수 없습니다. 빠르게 회전하는 물체, 카메라 전환, 화면에 새로 들어오는 객체는 정상이어도 잠재 표현이 크게 바뀝니다. 오류 탐지와 움직임 탐지를 혼동하면 역동적인 장면을 지나치게 평탄하게 만들 수 있습니다.
불안정 토큰은 어떤 네 단계로 골라낼까?
먼저 현재 후보 배치와 직전 배치의 잠재 표현을 시간축으로 요약합니다. 각 공간 위치의 두 요약 사이에서 L2 거리 $d_i$를 계산하고, 값이 큰 상위 $p$ 비율을 불안정 집합으로 둡니다. 그 집합의 평균 드리프트 $D_t$가 이동 통계로 만든 임계값 $\mu_t+\lambda\sigma_t$를 넘으면 해당 토큰을 KV 캐시에서 마스킹하거나 제거한 뒤 현재 배치를 다시 생성합니다.
원문은 $p=0.1$, 즉 상위 10%를 실험상 효율적인 설정으로 제시합니다. 이 값은 보편 기본값이 아닙니다. 빠른 카메라 이동이나 격한 동작은 정상이어도 L2 거리가 크므로, 콘텐츠 유형별로 오탐률을 확인해야 합니다.
상위 비율과 발동 임계값은 서로 다른 역할을 합니다. $p$는 한 번 발동했을 때 의심할 공간 위치의 범위를 정하고, $\lambda$가 포함된 임계값은 현재 배치 전체가 평소보다 불안정한지 판단합니다. 둘을 동시에 낮추면 개입이 잦아질 수 있고, 둘을 높이면 큰 오류가 이미 누적된 뒤에야 반응할 수 있습니다.
이동 통계는 영상 초반과 후반의 정상 변화 수준을 비교하는 기준이 됩니다. 다만 장면이 갑자기 바뀌면 과거 평균과 표준편차가 새 구간을 잘 설명하지 못할 수 있습니다. 장면 전환 직후의 발동률과 제거 위치를 따로 기록하면 기법이 전환 자체를 오염으로 보는지 확인할 수 있습니다.
“재학습 없이 적용”은 어느 환경까지 가능할까?
연구는 Rolling Forcing, Self Forcing뿐 아니라 Llama-Gen과 FlowMo 계열에 결합해 적용 범위를 살핍니다.
VideoJAM-bench와 사람 선호 평가에서는 시간 일관성, 움직임 품질, 전반적 시각 품질의 개선을 보고합니다.
하지만 “추론 시점 기법”이 “구현 변경이 없다”는 뜻은 아닙니다. 잠재 표현과 KV 캐시에 접근하고, 조건에 따라 재생성을 호출할 수 있어야 합니다. 닫힌 생성 API처럼 내부 캐시를 노출하지 않는 환경에는 그대로 붙일 수 없습니다.
지원 가능성을 확인하려면 세 가지 접근점이 필요합니다. 배치 사이의 잠재 표현을 읽을 수 있어야 하고, 선택한 토큰을 캐시에서 마스킹하거나 제거할 수 있어야 하며, 현재 배치를 같은 조건에서 다시 생성할 수 있어야 합니다. 이 중 하나라도 모델 인터페이스가 막으면 논문의 절차를 그대로 재현하기 어렵습니다.
여러 계열에서 효과가 보고됐다는 사실도 구현이 동일하다는 뜻은 아닙니다. 토큰 배치와 캐시 구조가 다르면 공간 위치의 대응과 제거 방식도 달라질 수 있습니다. 각 모델에서 제거 전후의 캐시가 올바르게 정렬되는지 먼저 작은 영상으로 검증해야 합니다.
품질 개선이 재생성 지연을 상쇄하는가?
재생성이 발생하면 생성 시간이 늘어납니다. 원문은 드리프트가 심한 조건에서 기준선보다 1.5~2배의 시간이 들 수 있다는 한계를 언급합니다. 임계값을 낮추면 오염을 더 자주 제거하지만 정상 움직임까지 지울 수 있고, 높이면 속도는 유지해도 드리프트를 놓칠 수 있습니다.
시험할 때는 최종 품질 점수만 기록하지 말고 프루닝 발동률, 제거 토큰 비율, 재생성 횟수, 전체 지연을 함께 봐야 합니다. 정적인 장면과 빠른 동작 장면을 분리해 비교하면 임계값이 장면 변화 자체를 오류로 취급하는지도 드러납니다. 이 글에는 실행 코드가 없으므로 TokenTrim을 즉시 적용 가능한 플러그인으로 보아서는 안 됩니다.
대표 세트는 정적 대화 장면, 반복 동작, 빠른 카메라 이동처럼 드리프트와 정상 변화가 다른 구간으로 나눌 수 있습니다. 각 구간에서 객체 정체성, 배경 안정성, 움직임의 생동감, 처리 시간을 같은 길이로 비교합니다. 평균 품질이 올라도 빠른 동작이 뭉개지거나 특정 장면에서 시간이 두 배 가까이 늘어난다면 단일 설정을 전체 서비스에 적용하기 어렵습니다.
발동 로그는 실패를 설명하는 자료가 됩니다. 어느 프레임의 어느 위치가 제거됐는지와 다시 생성된 결과가 실제로 나아졌는지를 연결하면, 과잉 개입과 늦은 개입을 구분할 수 있습니다. 제거 후에도 같은 오류가 반복되면 캐시 오염이 아닌 모델의 장면 이해가 원인일 가능성을 의심해야 합니다.
따라서 TokenTrim은 긴 영상에서 형태 드리프트가 반복되고 내부 캐시를 제어할 수 있는 환경에 더 잘 맞습니다. 닫힌 API를 사용하거나 지연 상한이 엄격하거나 빠른 움직임이 핵심인 서비스라면 먼저 적용 가능성과 오탐 비용을 확인해야 합니다. “재학습 없음”보다 “우리 추론 경로를 안전하게 수정할 수 있는가”가 실제 도입 질문입니다.
프루닝 임계값은 어떤 절차로 조정해야 할까?
처음에는 원문이 제시한 $p=0.1$을 비교점으로 삼되 정답으로 고정하지 않습니다. 같은 프롬프트와 시드에서 프루닝을 끈 결과, 더 작은 비율, 더 큰 비율을 나란히 만들고 어느 공간 위치가 제거됐는지 기록합니다. 객체 경계와 빠른 움직임에 제거가 몰리면 정상 변화를 오류로 보는지 확인해야 합니다.
$\lambda$를 바꿀 때는 발동 빈도와 첫 발동 시점을 함께 봅니다. 너무 낮아 거의 매 배치가 재생성되면 지연이 커지고 움직임이 약해질 수 있으며, 너무 높아 영상이 이미 무너진 뒤에만 발동하면 복구 기회가 없습니다. 정적 장면과 동적 장면에 같은 값이 맞지 않으면 콘텐츠 유형별 설정이 필요합니다.
사람 평가는 프레임 몇 장보다 전체 움직임을 봐야 합니다. 객체 정체성이 유지됐는지, 카메라 움직임이 끊기지 않는지, 제거 뒤 반복이나 깜빡임이 생기지 않는지를 확인합니다. 프루닝한 영상이 더 선명해 보여도 의도한 동작이 약해졌다면 품질 개선으로만 기록할 수 없습니다.
운영 기준에는 최대 재생성 횟수를 포함할 수 있습니다. 한 구간에서 계속 임계값을 넘으면 반복 재생성을 멈추고 기준 생성으로 돌아가거나 실패로 표시해야 지연 상한을 지킬 수 있습니다. 실용성은 오류를 많이 감지하는지가 아니라 제한된 추가 비용으로 실제 드리프트를 얼마나 자주 복구하는지에 달려 있습니다.
프루닝 전후를 공정하게 비교하려면 동일한 생성 조건을 유지하고 재생성에 쓴 총 계산을 포함해야 합니다. 최종 선택된 영상의 한 번짜리 추론 시간만 기록하면 버린 재생성 비용이 사라집니다. 성공 영상 한 편당 전체 시도 수와 처리 시간을 함께 계산해야 운영 비용을 알 수 있습니다.
제거 토큰의 공간 분포를 시각화하면 임계값 조정의 근거가 됩니다. 배경 노이즈에 고르게 흩어지는지, 얼굴이나 손 같은 핵심 객체에 집중되는지, 장면 전환 때 화면 전체로 퍼지는지에 따라 같은 발동률의 의미가 달라집니다. 이 기록은 품질 저하가 프루닝 때문인지 원래 모델 때문인지 구분하는 데도 도움이 됩니다.
기준선 영상에서 드리프트가 거의 없는 장르라면 TokenTrim을 항상 켜 둘 필요가 없습니다. 사전 감지로 위험 구간에만 적용하거나 긴 영상의 후반부에 제한할 수 있습니다. 개입이 필요 없는 콘텐츠까지 재생성하는 비용을 줄이는 것도 품질 개선만큼 중요한 최적화입니다.
복구 가능성을 위해 프루닝 직전의 캐시와 프레임을 체크포인트로 남기는 방법도 검토할 수 있습니다. 재생성 결과가 객체 정체성이나 동작을 더 나쁘게 만들면 해당 체크포인트로 돌아가 기준 경로를 이어야 합니다. 어떤 토큰을 지웠는지 재현할 수 없는 구현에서는 같은 시드로도 실패 분석이 어려워집니다. 캐시 상태, 임계값, 제거 위치와 재생성 횟수를 한 묶음으로 기록해야 품질 회귀를 프루닝 정책의 문제인지 원래 생성 모델의 문제인지 구분할 수 있습니다.
함께 읽으면 이해가 이어지는 글
- 비디오 편집에서 대상만 바꾸고 움직임은 지키려면: SAMA의 분리 학습 — SAMA가 희소 프레임 시맨틱 앵커링과 세 가지 모션 사전 과제로 의미 편집과 시간 일관성을 나누는 방식, 미공개 코드와 학습 비용 한계를 정리합니다.
- 화질 좋은 AI 영상이 물리 법칙은 틀리는 이유: RISE-Video 467개 Test — RISE-Video가 467개 human-annotated prompt로 영상 생성기의 상식, 공간 변화, 물리, 시간 인과를 평가하고, visual quality와 reasoning score가 갈리는 지점을 보여줍니다.
- 예쁜 영상이 물리까지 맞는지 어떻게 알까: Omni-WorldBench 평가법 — Omni-WorldBench의 상호작용 중심 Suite와 MLLM 기반 AgenticScore가 인과, 상태 변화, 카메라 제어를 평가하는 방식과 비용, 평가자 편향을 정리합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.




