실험 결과는 어디까지 말해 주나요?
학습에는 자세 라벨이 붙은 1인칭 영상을 사용했고, PyTorch와 H100 환경에서 실험했습니다. 키보드 기반 조건과 비교했을 때 FVD가 개선됐으며, 사용자 평가에서는 제어감과 현존감을 측정했습니다.
이 결과는 손과 카메라를 직접 조건으로 넣는 것이 상호작용 인식에 도움이 된다는 근거입니다. 다만 생성 영상은 가능한 다음 장면을 확률적으로 그린 결과입니다. 실제 물체의 질량, 충돌, 마찰을 계산하는 시뮬레이터와 같다고 보면 안 됩니다. 동작에 반응하는 화면과 물리적으로 올바른 세계는 서로 다른 목표입니다.
FVD는 생성 영상의 분포와 참조 영상 분포 사이 차이를 보는 지표이므로, 사용자의 특정 손동작을 정확히 따랐는지 모두 설명하지는 못합니다. 사용자 평가의 제어감과 현존감도 중요하지만 평가한 장면, 세션 길이, 참가자가 경험한 지연에 영향을 받습니다. 자동 지표와 주관 평가가 모두 좋아도 충돌이나 접촉의 물리 오류가 남을 수 있습니다.
제어 신호가 실제 원인인지 확인하려면 같은 시작 영상에서 손 조건만 바꾸고 나머지 입력을 고정하는 대조가 필요합니다. 오른손을 왼쪽으로 움직인 조건과 오른쪽으로 움직인 조건에서 물체 반응이 구분되는지, 머리 자세만 돌렸을 때 장면 시점만 변하고 물체 상태는 유지되는지를 봅니다. 입력을 무시하고 그럴듯한 평균 영상을 생성하는 모델이라면 영상 품질은 좋아도 상호작용 모델로 쓰기 어렵습니다.