카메라가 움직일 때 배경 구조가 무너지는 비디오 모델은 기하학 보상으로 개선할 수 있으며, VGGRPO는 그 보상을 RGB가 아닌 latent에서 계산해 학습 부담을 줄입니다. 다만 Latent Geometry Model이 잘못 본 깊이와 궤적도 그대로 보상이 될 수 있어 선행 모델의 품질이 핵심입니다.
VGGRPO 논문은 생성된 비디오의 카메라 흔들림과 뷰 간 구조 불일치를 RL로 조정합니다. 보상을 계산할 때마다 VAE로 전체 영상을 복원하지 않고, diffusion latent를 가벼운 connector를 통해 geometry foundation model에 연결합니다.




