DreamVideo-Omni는 여러 캐릭터의 동선과 Identity를 분리하도록 설계됐지만, 교차 장면에서 얼굴 융합이 완전히 사라진다고 단정할 수는 없습니다.
Paper ID 2603.12257은 Reference Image, Subject별 Bounding Box Trajectory와 Global Camera Motion을 한 Video DiT에 조건으로 넣습니다. 핵심은 누구의 외형과 움직임인지 구분하는 Stage 1, Pixel로 매번 Decode하지 않고 Latent에서 Identity Reward를 주는 Stage 2의 조합입니다.


