포스트

화면 밖 자동차를 비디오 모델이 잊는다면? HyDRA의 Top-K 기억

카메라 밖으로 사라진 객체가 다시 나타날 때 형태와 궤적이 무너진다면, HyDRA처럼 과거 특징을 메모리로 남기고 관련 토큰만 되찾는 방식이 도움이 됩니다. 다만 화면 밖에서 실제 상태가 바뀐 경우까지 기억만으로 맞힐 수 있는 것은 아닙니다.

HyDRA 논문은 긴 비디오 월드 모델의 object permanence 문제를 다룹니다. 단순히 컨텍스트 창을 늘리면 모든 프레임 사이의 어텐션과 KV 메모리가 커집니다. HyDRA는 배경과 동적 객체의 과거 정보를 압축해 Memory Bank에 저장하고 현재 장면에 필요한 단서만 검색합니다.

시야를 벗어났다가 돌아오는 객체 사례

프레임 전체 대신 시공간 토큰을 기억한다

과거 특징을 공간과 시간 축으로 풀링해 밀도 높은 메모리 토큰으로 바꿉니다. 현재 프레임의 쿼리는 메모리 전체와 관련도를 계산하고 상위 K개 토큰만 값으로 가져옵니다. 이전 자동차의 외형과 이동 단서가 남아 있다면 재등장 위치에서 그 정보를 다시 참조할 수 있습니다.

메모리 뱅크를 포함한 HyDRA 전체 구조

현재 쿼리와 관련된 Top-K 토큰을 찾는 모듈

원문은 긴 전체 어텐션을 O(N²), 고정 K 검색을 O(N×K)로 비교합니다. 그러나 메모리 후보의 점수를 계산하고 값을 모으는 비용은 사라지지 않습니다. 실제 속도는 메모리 뱅크 크기, 압축률, 검색 구현과 GPU 메모리 대역폭에 좌우됩니다.

HM-World는 재등장 장면을 통제해 만든다

연구팀은 Unreal Engine 5에서 카메라 궤적과 객체 궤적을 분리해 5만 9천 개 클립의 HM-World를 구성했습니다. 객체가 화면을 나갔다 다시 들어오는 시점과 움직임을 정확히 통제할 수 있어, 기억 모듈을 학습하고 비교하기 좋은 데이터입니다.

HM-World 데이터 제작 과정

동시에 합성 데이터라는 한계도 분명합니다. 실제 영상의 가림, 센서 노이즈, 조명 변화, 예측하지 못한 상호작용은 더 복잡합니다. 합성 장면에서 잘 찾은 토큰이 실제 도로와 로봇 카메라에서도 같은 의미를 갖는지 별도 검증해야 합니다.

비교 그림은 외형 유지와 물리 예측을 나눠 읽는다

논문의 정성 비교에서는 기존 방법보다 재등장 객체의 모양과 정체성이 잘 유지되는 사례를 보여 줍니다. 이는 메모리가 외형 붕괴를 줄였다는 근거가 될 수 있지만, 객체가 시야 밖에서 어떤 사건을 겪었는지 정확히 시뮬레이션했다는 증명은 아닙니다.

기존 모델과 HyDRA의 재등장 결과 비교

원문의 PyTorch 코드는 Top-K 어텐션 아이디어를 단순화한 목업입니다. 실제 모델 정의, 학습 손실, 메모리 갱신과 커널 최적화가 빠져 있으므로 그대로 실행할 수 있는 재현 코드로 보면 안 됩니다.

도입 전에는 잘못된 기억과 캐시 상한을 시험한다

자율주행이나 로봇 데이터 생성에 적용한다면 화면 밖으로 나간 시간, 객체 수, 재등장 위치를 바꾼 검증 세트를 먼저 만듭니다. 같은 외형의 다른 객체를 잘못 가져오는지, K를 줄일 때 작은 객체가 사라지는지, 메모리 길이별 VRAM과 지연이 어떻게 변하는지 측정해야 합니다.

화면 밖에서 차량이 멈추거나 충돌하는 상태 변화는 외부 행동 조건이나 동역학 모델이 없으면 추측에 머뭅니다. 논문 자료는 기억 검색의 가능성을 보여 주지만, HyDRA를 완전한 물리 시뮬레이터로 해석해서는 안 됩니다.

기억과 예측을 분리하면 무엇이 선명해지나

HyDRA가 해결하려는 첫 질문은 “과거에 보였던 객체를 다시 알아볼 수 있는가”입니다. 두 번째 질문인 “보이지 않는 동안 그 객체가 무엇을 했는가”에는 카메라 밖의 사건을 추론할 동역학과 행동 조건이 필요합니다. 두 문제를 한 점수로 합치면 외형은 잘 유지했지만 위치가 틀린 모델과, 위치는 그럴듯하지만 다른 자동차로 바뀐 모델을 구분하기 어렵습니다.

검증할 때는 객체 정체성, 재등장 위치, 속도 연속성, 배경 구조를 따로 채점하는 편이 좋습니다. 동일한 외형의 자동차 두 대를 교차시키거나, 객체가 가려진 사이 진행 방향을 바꾸는 장면을 넣으면 단순 복사와 실제 상태 추적의 차이가 드러납니다. 화면 밖 체류 시간을 짧음, 중간, 김으로 나누면 메모리가 언제부터 오래된 단서에 매달리는지도 볼 수 있습니다.

Top-K와 압축률은 어떤 trade-off를 만들까

K를 늘리면 필요한 단서를 놓칠 가능성은 줄지만, 관계없는 과거까지 가져와 계산량과 혼선이 커집니다. K를 줄이면 빠르지만 작은 객체나 잠깐 등장한 신호가 후보에서 밀릴 수 있습니다. 압축률도 마찬가지입니다. 배경의 큰 구조는 강한 풀링에도 남지만 번호판, 손동작, 얇은 장애물 같은 세부 정보는 먼저 사라집니다.

따라서 평균 품질 하나보다 K별 recall과 지연 곡선을 그려야 합니다. 메모리 뱅크 길이, 토큰 수, 검색 시간, 추가 VRAM을 같은 표에 놓고, 품질이 거의 오르지 않는 지점에서 상한을 정합니다. 객체가 늘어날수록 검색 후보가 어떻게 변하는지 확인하지 않으면 한두 객체로 만든 데모가 복잡한 장면의 운영 비용을 가릴 수 있습니다.

비교 실험은 어떤 기준선이 필요하나

전체 과거 어텐션은 비싸지만 품질 상한을 보는 기준선입니다. 고정 길이 슬라이딩 윈도는 메모리가 없는 저비용 기준선이고, 균일 샘플링은 단순 압축과 학습된 검색의 차이를 보여 줍니다. 여기에 최근 프레임만 쓰는 모델과 무작위 Top-K를 더하면 HyDRA의 개선이 압축 때문인지 관련도 검색 때문인지 나눠 볼 수 있습니다.

모든 기준선에는 같은 생성 모델, 같은 프레임 수와 같은 해상도를 써야 합니다. 정성 그림은 실패 사례를 찾는 데 유용하지만 선택된 예시일 수 있으므로, 여러 seed의 정량 결과와 함께 읽습니다. HM-World에서 조정한 임계값을 실제 영상 평가 전에 다시 맞추면 테스트 데이터에 적응한 결과가 되므로, 조정 세트와 최종 세트를 분리해야 합니다.

실제 서비스에서는 메모리를 언제 지워야 하나

긴 세션은 무한히 늘 수 없으므로 시간, 장면 전환 또는 객체 생명주기를 기준으로 퇴출 규칙이 필요합니다. 카메라가 다른 장소로 이동했는데 옛 배경 토큰을 남기면 현재 장면에 잘못 섞일 수 있습니다. 반대로 잠깐 화면 밖으로 나간 핵심 객체를 장면 전환으로 오인해 지우면 이 방법의 장점이 사라집니다.

운영 로그에는 선택된 메모리 토큰의 시점과 객체, 검색 점수, 생성 결과를 함께 남기는 편이 좋습니다. 잘못된 재등장이 발생했을 때 저장 단계, 검색 단계, 생성 단계 중 어디서 정체성이 바뀌었는지 찾아야 하기 때문입니다. 메모리 갱신 실패 시 최근 프레임만 쓰는 안전한 fallback도 준비해야 합니다.

메모리를 session 사이에 재사용할지 여부도 별도 결정입니다. 같은 장면을 계속 생성하는 동안에는 cache 재사용이 지연을 줄일 수 있지만, 다른 사용자나 다른 prompt의 token이 섞이면 개인정보와 품질 문제가 동시에 생깁니다. 기본은 session별 격리로 두고, 재사용이 필요하면 장면 id, 모델 version, 압축 설정이 모두 같은 경우에만 허용합니다. session 종료 뒤에는 원본 특징과 파생 cache가 실제로 해제됐는지 메모리 지표로 확인해야 합니다.

검색 점수에 절대 threshold가 없다면 항상 K개를 고르기 때문에 관련 기억이 전혀 없는 장면에서도 과거 token을 억지로 가져옵니다. “검색하지 않음” 선택지를 두고, 낮은 점수에서는 Recent context만 사용하는 기준선과 비교하는 편이 좋습니다. 이 abstention 비율을 기록하면 모델이 불확실한 장면에서 잘못된 기억을 주입하는 문제를 더 쉽게 찾을 수 있습니다.

어떤 용도부터 시험하는 것이 현실적인가

연속적인 카메라 영상에서 동일 객체를 다시 보여 주는 게임, 로봇 시뮬레이션은 통제된 평가가 쉬워 첫 PoC에 적합합니다. 반면 안전 판단이 필요한 자율주행에서는 생성 영상의 자연스러움보다 실제 센서 궤적과 충돌 여부가 더 중요하므로, 이 모델의 출력만으로 결정을 내려서는 안 됩니다. 영상 편집에서도 배우의 외형 유지에는 도움을 줄 수 있지만 서사적 인과까지 자동으로 생기지는 않습니다.

채택 기준은 “긴 영상을 만든다”가 아니라 기존 모델이 화면 밖 객체 때문에 실패하는 비율을 의미 있게 줄이면서 메모리 상한을 지키는지입니다. 이 조건을 만족하지 못하면 더 짧은 shot 단위 생성과 명시적 객체 상태표가 오히려 단순하고 검증하기 쉽습니다.

함께 읽으면 이해가 이어지는 글

자주 묻는 질문

HyDRA의 메모리 뱅크는 원본 프레임을 저장하나요?

핵심은 원본 프레임 전체가 아니라 압축한 시공간 특징 토큰을 저장하는 것입니다. 그래서 비용을 줄일 수 있지만 사람이 원본을 다시 읽듯 모든 세부를 복원할 수는 없습니다.

Top-K를 크게 하면 항상 좋아지나요?

아닙니다. 관련 단서 recall은 오를 수 있어도 계산량과 잘못된 기억의 혼입이 늘어납니다. 객체 수와 가림 길이를 바꾼 검증 세트에서 품질, 지연을 함께 보며 정해야 합니다.

실제 도로 영상에도 바로 적용할 수 있나요?

HM-World는 통제된 합성 데이터이므로 센서 노이즈, 반사, 복잡한 가림이 있는 실제 영상으로 전이 평가가 필요합니다. 생성 결과는 안전 판단의 근거가 아니라 별도 검증 대상입니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    11개 장 18 분읽는 시간