포스트

손은 움직였는데 AI 영상 속 물체가 안 따라오면? Generated Reality의 2D, 3D 제어

2D 손 골격만으로는 부족합니다. Generated Reality는 3D 손 관절과 6DoF 머리 자세를 함께 넣어 사용자가 어디를 보고 어떤 손동작을 하는지 영상 생성 모델에 직접 전달합니다. 다만 반응하는 영상이 곧 물리적으로 정확한 시뮬레이션은 아니므로, 제어 지연, 추적 실패, 접촉 뒤의 시간 일관성을 따로 검증해야 합니다.

논문은 미리 정한 키보드 입력으로 장면을 움직이는 방식보다 사람의 실제 몸동작을 조건으로 쓰는 월드 시뮬레이션을 제안합니다. 목표는 완전한 물리 엔진을 만드는 것이 아니라, 헤드셋이 측정한 손과 카메라 움직임에 반응하는 다음 영상을 생성하는 것입니다.

손과 시선을 어떤 조건 신호로 바꾸나요?

상용 헤드셋에서 머리의 6DoF 자세, 손목의 이동과 회전, 손마다 20개 관절의 회전을 얻습니다. 손 관절은 UmeTrack으로 추적합니다. 이 값을 그대로 영상 모델에 밀어 넣지 않고 두 경로로 나눕니다.

  • 2D 경로는 손 골격을 이미지 평면에 렌더링해 손의 위치와 모양을 제공합니다.
  • 3D 경로는 관절과 머리 자세를 MLP와 이미지 인코더로 표현해 깊이와 시점 정보를 보충합니다.

Generated Reality의 손, 카메라 제어 구조

두 조건은 Diffusion Transformer의 토큰에 더해집니다. 모델은 직전 몇 프레임과 현재 동작을 보고 다음 프레임을 자기회귀적으로 만듭니다. 2D만 쓰면 화면상 위치는 알기 쉽지만 깊이 방향 움직임이 모호하고, 3D 수치만 쓰면 영상의 구체적인 배치와 연결하기 어렵습니다. 두 표현을 함께 쓰는 이유가 여기에 있습니다.

두 경로는 같은 손동작을 중복해서 표현하는 것이 아니라 서로 다른 모호성을 줄입니다. 2D 골격은 손가락이 화면의 어느 물체와 겹치는지 보여 주지만 카메라 쪽으로 움직였는지 멀어졌는지는 한 장면만으로 판단하기 어렵습니다. 3D 관절과 머리 자세는 깊이와 시점 변화를 보충하지만, 그 수치만으로 현재 영상의 어느 픽셀이 손과 물체인지 연결하기는 어렵습니다.

조건 하나가 실패했을 때 다른 조건이 자동으로 복구해 준다고 가정해서도 안 됩니다. 빠른 손동작이나 가림으로 UmeTrack 관절이 튀면 3D 조건이 잘못될 수 있고, 모션 블러가 크면 렌더링된 2D 골격과 실제 손 윤곽이 어긋날 수 있습니다. 두 신호가 서로 모순될 때 모델이 어느 쪽을 따르는지 확인하려면 정상 조건, 2D만 흔든 조건, 3D만 흔든 조건을 별도로 시험해야 합니다.

자기회귀 생성에서는 왜 작은 오류가 커질 수 있나요?

모델은 직전 생성 프레임을 다음 프레임의 문맥으로 다시 사용합니다. 한 번 물체의 위치를 잘못 그리면 다음 단계는 잘못된 위치를 출발점으로 삼고, 이후 손 조건과 장면이 충돌할 수 있습니다. 짧은 클립이 자연스럽다는 사실만으로 긴 상호작용에서도 물체 정체성과 배치가 유지된다고 볼 수 없는 이유입니다.

오류를 분석할 때는 매 프레임 화질만 보지 말고 사건 전후 상태를 연결해야 합니다. 손이 컵을 잡기 전, 접촉 순간, 들어 올린 뒤, 놓은 뒤에 컵의 위치와 모양이 이어지는지 기록합니다. 카메라가 돌아갔다가 원래 방향으로 돌아왔을 때 사라진 물체가 다시 같은 위치에 나타나는지도 시간 일관성을 판단하는 사례가 됩니다.

자기회귀 드리프트가 일정 수준을 넘으면 새 관측으로 상태를 다시 맞출지, 세션을 재시작할지, 안전한 정지 화면으로 전환할지 결정해야 합니다. 논문 구조 자체가 이러한 운영 정책을 제공한다는 뜻은 아니며, 실제 상호작용 제품에서는 생성 모델 밖의 복구 규칙이 필요하다는 의미입니다.

비인과 교사를 왜 인과 학생 모델로 옮기나요?

고품질 비디오 생성기는 미래 프레임까지 참고하는 비인과 구조를 쓰기 쉽지만, 사용자의 현재 움직임에 즉시 반응해야 하는 시스템에는 맞지 않습니다. 연구진은 비인과 모델을 교사로 두고, 과거 정보만 보는 인과 학생 모델로 지식을 옮기는 causal distillation을 사용합니다.

학생 모델은 한두 번의 샘플링 단계로 다음 영상을 생성하도록 학습됩니다. 단계 수가 줄면 상호작용 지연을 낮출 수 있지만, 교사의 품질과 물리적 일관성을 그대로 보존한다는 보장은 없습니다. 빠른 반응과 장면 품질 사이의 절충입니다.

비인과 교사는 학습할 때 미래 정보를 볼 수 있으므로 장면 전체를 매끄럽게 만드는 데 유리합니다. 하지만 실제 사용자는 다음 동작을 아직 하지 않았기 때문에 온라인 생성기는 과거 프레임과 현재 자세만으로 응답해야 합니다. causal distillation은 교사의 출력 분포를 참고하면서도 이 입력 제한을 지키는 학생 모델을 만들려는 과정입니다.

증류가 잘됐는지는 정지 이미지 품질 하나로 판단하기 어렵습니다. 교사와 학생에게 같은 과거 프레임과 자세를 주고 손 위치의 반응, 카메라 회전 방향, 물체 상태 보존을 비교해야 합니다. 샘플링 단계를 줄인 조건별로 첫 반응까지 걸린 시간과 장기 드리프트를 함께 재면 어느 지점부터 속도 이득보다 제어 손실이 커지는지 볼 수 있습니다.

낮은 지연은 어떤 구간으로 나눠 측정해야 하나요?

사용자가 느끼는 지연은 모델 추론 시간만으로 결정되지 않습니다. 헤드셋 센서 수집, 손 추적, 조건 인코딩, 영상 생성, 화면 전송과 표시가 차례로 이어집니다. 평균 생성 속도가 목표 프레임률에 가까워도 추적이나 전송에서 긴 꼬리 지연이 생기면 손과 화면이 순간적으로 벌어질 수 있습니다.

따라서 각 단계의 평균과 상위 지연을 따로 기록하고, 손동작이 시작된 시점부터 화면에서 결과가 보인 시점까지 종단 지연도 측정해야 합니다. 프레임률은 일정 시간 동안 몇 장을 냈는지를 말하지만, 사용자의 동작이 어느 프레임에 반영됐는지는 직접 설명하지 못합니다. 상호작용 제어에서는 처리량과 반응 시간을 같은 지표로 취급하지 않는 것이 중요합니다.

실험 결과는 어디까지 말해 주나요?

학습에는 자세 라벨이 붙은 1인칭 영상을 사용했고, PyTorch와 H100 환경에서 실험했습니다. 키보드 기반 조건과 비교했을 때 FVD가 개선됐으며, 사용자 평가에서는 제어감과 현존감을 측정했습니다.

이 결과는 손과 카메라를 직접 조건으로 넣는 것이 상호작용 인식에 도움이 된다는 근거입니다. 다만 생성 영상은 가능한 다음 장면을 확률적으로 그린 결과입니다. 실제 물체의 질량, 충돌, 마찰을 계산하는 시뮬레이터와 같다고 보면 안 됩니다. 동작에 반응하는 화면과 물리적으로 올바른 세계는 서로 다른 목표입니다.

FVD는 생성 영상의 분포와 참조 영상 분포 사이 차이를 보는 지표이므로, 사용자의 특정 손동작을 정확히 따랐는지 모두 설명하지는 못합니다. 사용자 평가의 제어감과 현존감도 중요하지만 평가한 장면, 세션 길이, 참가자가 경험한 지연에 영향을 받습니다. 자동 지표와 주관 평가가 모두 좋아도 충돌이나 접촉의 물리 오류가 남을 수 있습니다.

제어 신호가 실제 원인인지 확인하려면 같은 시작 영상에서 손 조건만 바꾸고 나머지 입력을 고정하는 대조가 필요합니다. 오른손을 왼쪽으로 움직인 조건과 오른쪽으로 움직인 조건에서 물체 반응이 구분되는지, 머리 자세만 돌렸을 때 장면 시점만 변하고 물체 상태는 유지되는지를 봅니다. 입력을 무시하고 그럴듯한 평균 영상을 생성하는 모델이라면 영상 품질은 좋아도 상호작용 모델로 쓰기 어렵습니다.

어떤 과제부터 시험해야 위험을 분리할 수 있나요?

첫 시험은 한 번에 복잡한 VR 훈련을 구현하기보다 오류 원인이 분명한 짧은 동작으로 구성하는 편이 좋습니다. 빈 공간에서 손가락 자세만 바꾸는 과제는 추적과 손 모양을, 고정된 물체를 향해 손을 뻗는 과제는 깊이와 접촉 시점을, 머리만 회전하는 과제는 카메라 조건을 각각 확인할 수 있습니다.

그다음 물체를 집어 이동하고 다시 내려놓는 긴 과제로 넘어갑니다. 이때 성공 여부만 기록하지 말고 손 가림, 잘못된 접촉, 물체 복제나 소실, 카메라 회전 후 위치 변경을 유형별로 나눕니다. 학습 데이터에 적은 손 모양과 조명에서 같은 표를 반복하면 일반화 실패가 추적 오류인지 생성 모델의 편향인지 좁혀 갈 수 있습니다.

60fps 목표보다 먼저 무엇을 확인해야 하나요?

원문은 1024×1024 해상도와 60fps를 지향하지만, 이를 일반 하드웨어에서 보장되는 실행 조건으로 받아들이면 곤란합니다. 영상과 자세 조건을 계속 처리하는 연산량이 크고, 모델의 한 번의 오류가 다음 프레임 입력으로 이어질 수 있습니다.

적용 전에는 다음을 따로 측정해야 합니다.

  1. 손 추적이 가려지거나 빠르게 움직일 때 제어가 유지되는가
  2. 생성 지연이 누적돼 실제 손과 화면이 어긋나지 않는가
  3. 물체 접촉 뒤의 결과가 시간에 따라 일관적인가
  4. 학습 데이터에 적은 손 모양과 환경에서도 동작하는가

Generated Reality의 의미는 현실을 그대로 복제했다는 데 있지 않습니다. 키보드처럼 거친 명령 대신 몸의 세밀한 움직임을 생성 모델의 제어 신호로 바꿨다는 데 있습니다. VR 훈련이나 상호작용 콘텐츠에 검토할 수 있지만, 물리 정확도가 필요한 작업에서는 별도 시뮬레이터와 검증이 필요합니다.

도입 결정은 콘텐츠 목적에 따라 달라집니다. 사용자의 몸짓에 맞춰 장면이 자연스럽게 변하는 체험이 목표라면 생성 방식의 표현력이 장점이 될 수 있습니다. 반대로 훈련 결과가 실제 힘, 충돌, 도구 사용의 정확성에 의존한다면 생성 영상만으로 정답 상태를 판단해서는 안 됩니다.

운영 기준에는 허용할 종단 지연, 손 추적 신뢰도가 낮을 때의 동작, 물체 상태가 갑자기 달라졌을 때의 중단 조건을 포함해야 합니다. Generated Reality는 손과 카메라를 풍부한 입력으로 바꾸는 방법을 보여 주지만, 그 신호를 안전한 상호작용으로 만드는 책임까지 자동으로 해결하지는 않습니다.

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    8개 장 20 분읽는 시간