LoGeR는 원문 기준 128프레임 학습으로 19,000프레임 추론을 보여 주지만, 모든 긴 영상에서 Drift 없이 실시간 재구성된다는 뜻은 아닙니다.
Paper ID 2603.03269은 긴 비디오를 한 번에 Attention에 넣는 대신 청크로 나누고, 고정 크기의 전역 메모리와 최근 구간의 로컬 메모리를 함께 사용합니다. 목표는 전체 Attention의 $O(N^2)$ 증가를 피하면서 청크 사이 좌표계와 세부 정합을 유지하는 것입니다.
LoGeR는 원문 기준 128프레임 학습으로 19,000프레임 추론을 보여 주지만, 모든 긴 영상에서 Drift 없이 실시간 재구성된다는 뜻은 아닙니다.
Paper ID 2603.03269은 긴 비디오를 한 번에 Attention에 넣는 대신 청크로 나누고, 고정 크기의 전역 메모리와 최근 구간의 로컬 메모리를 함께 사용합니다. 목표는 전체 Attention의 $O(N^2)$ 증가를 피하면서 청크 사이 좌표계와 세부 정합을 유지하는 것입니다.
청크 내부에서는 양방향 문맥으로 비교적 정밀한 Geometry를 추론할 수 있습니다. 문제는 다음 청크로 넘어갈 때 이전 공간의 Scale과 Camera 경로를 어떻게 이어받느냐입니다. 최근 프레임만 보면 지역 정합은 좋아도 오랜 이동 뒤 전역 좌표가 조금씩 틀어질 수 있습니다.
LoGeR의 Hybrid Memory는 이 두 요구를 분리합니다.
TTT가 긴 범위의 Anchor, SWA가 인접 청크의 Detail을 맡는 구조입니다. 둘 중 하나만으로는 장기 일관성과 국소 정밀도를 동시에 얻기 어렵다는 판단입니다.
Test-Time Training Memory는 새 청크를 처리할 때 Parameter를 갱신해 과거 정보를 담습니다. Frame 수와 함께 KV Tensor를 계속 쌓지 않으므로 저장 용량의 상한을 관리하기 쉽습니다. 그러나 “고정 크기”가 “무한 Context를 손실 없이 저장”한다는 의미는 아닙니다. 제한된 Parameter에 오래된 Scene을 압축하면서 정보가 사라질 수 있습니다.
추론 중 Update가 일어나므로 순수 Feedforward Serving과 운영 특성도 다릅니다. Gradient 계산과 Update 빈도, Stream별 State 분리, 중단 후 복구, 여러 Video를 Batch로 처리하는 방식이 필요합니다. 잘못 갱신된 전역 상태가 이후 모든 청크에 퍼지는지 확인해야 합니다.
Sliding Window Attention은 직전의 고해상도 Geometry를 그대로 유지해 인접 구간을 맞춥니다. Window가 작으면 Memory는 줄지만 빠른 Camera 이동이나 재방문 장면의 연결 정보를 놓칠 수 있고, 크면 다시 VRAM과 Attention 비용이 증가합니다.
실험할 때는 전체 Scene의 평균 오차만 보지 말고 다음 구간을 따로 살펴야 합니다.
Hybrid Memory의 가치는 이름이 아니라 Window 크기와 Update 규칙이 이런 실패를 얼마나 줄이는지로 판단해야 합니다.
원문은 VBR 데이터셋에서 19,000프레임 이상을 처리하고, KITTI에서 기존 모델 대비 ATE를 74% 줄였다고 설명합니다. 또 별도의 Bundle Adjustment 없이 End-to-end 추론하는 점을 강조합니다. 이는 특정 Dataset과 Baseline의 결과이며 영상 종류, 해상도, Hardware가 달라져도 같은 수치가 나온다는 보장은 아닙니다.
검증에는 Peak VRAM뿐 아니라 Frame당 시간, TTT Update 시간, 장기 ATE, 국소 Depth 품질을 함께 넣어야 합니다. Bundle Adjustment를 제거해도 전체 처리 시간이 거의 실시간이라는 근거는 원문에 제시되지 않았습니다. 전통적 SfM, SLAM과 비교할 때는 정확도와 처리 시간을 같은 장비와 입력으로 맞춰야 합니다.
LoGeR의 첫 후보는 긴 드론, GoPro 영상을 서버에서 비동기로 재구성하는 작업입니다. 60FPS 실시간 로봇에 바로 넣기보다 끊어진 영상, 재시작, State Checkpoint와 Throughput을 먼저 검증하는 편이 좋습니다.
짧은 기준 Sequence, 긴 연속 Sequence, Loop가 있는 Sequence를 준비해 기존 Pipeline과 결과를 비교합니다. 128프레임 밖으로 길이가 늘 때 오차 곡선이 어떻게 변하는지와 TTT State가 Video 사이에 섞이지 않는지를 확인해야 합니다. LoGeR는 $O(N^2)$를 “찢어버린 구원자”라기보다 전역 압축과 로컬 원본 Context의 교환 관계를 설계한 연구입니다.
청크가 짧으면 각 구간의 계산은 작아지지만 경계가 자주 생기고 TTT 상태를 더 자주 갱신해야 합니다. 청크가 길면 내부 정합에 더 많은 프레임을 활용할 수 있지만 VRAM과 지연이 커질 수 있습니다. SWA 윈도도 같은 교환 관계를 가지므로 청크 길이와 윈도 크기를 한꺼번에 바꾸지 말고 각각의 영향을 분리해야 합니다.
실험에서는 짧은 이동, 빠른 회전, 반복 질감, 긴 직선 이동을 포함한 시퀀스별로 설정을 바꿉니다. 평균 ATE가 비슷해도 청크 경계 직후의 순간 오차가 커질 수 있으므로 경계 전후를 따로 표시합니다. 목표가 오프라인 재구성인지 실시간 위치 추정인지에 따라 허용 가능한 지연과 오차의 우선순위도 달라집니다.
모션 블러나 잘못된 카메라 추정이 들어온 청크에서 TTT 업데이트가 틀리면 이후 청크가 그 상태를 전역 기준으로 사용할 수 있습니다. 낮은 신뢰도의 청크에서는 업데이트를 건너뛰거나 이전 체크포인트로 되돌리는 규칙이 필요합니다. 단순히 다음 관측을 더 넣으면 자동으로 복구된다고 가정해서는 안 됩니다.
오류 주입 테스트로 프레임 일부를 흐리거나 순서를 바꾸고, 잘못된 상태가 몇 청크 동안 영향을 주는지 봅니다. 주기적으로 상태를 저장하되 영상별 식별자와 모델 버전을 함께 남깁니다. 재시작 후 로드한 상태가 같은 결과를 내는지, 완전히 새 영상에서는 빈 상태로 시작하는지 확인해야 합니다.
오래전에 지나간 장소로 돌아오는 장면은 고정 크기 전역 메모리가 장기 기준을 얼마나 보존하는지 시험합니다. 최근 윈도에는 그 장소가 남아 있지 않으므로 TTT 상태가 공간 앵커를 유지해야 합니다. 반복되는 복도처럼 비슷한 장면에서는 잘못된 장소와 연결하는 오류도 생길 수 있습니다.
루프 평가에서는 재방문 전후의 카메라 위치와 스케일 차이, 지역 표면 정합을 함께 봅니다. 전통적인 후처리를 쓰지 않는 비교라면 그 조건을 모든 기준선에 동일하게 적용해야 합니다. 루프가 없는 시퀀스의 평균만으로는 장기 전역 일관성을 충분히 검증할 수 없습니다.
전체 프레임당 시간에는 특징 추출, 청크 추론, SWA 읽기, TTT 업데이트, 결과 저장을 모두 포함합니다. 업데이트를 빼고 순전파 시간만 보고하면 실제 스트리밍 비용을 과소평가할 수 있습니다. 최대 VRAM과 함께 호스트 메모리, 상태 체크포인트 크기와 저장 주기도 기록합니다.
여러 영상을 동시에 처리할 때는 각 스트림의 TTT 상태가 별도로 필요합니다. 배치가 커지면서 업데이트가 직렬화되거나 상태를 잘못 공유하는지 확인합니다. 짧은 데모의 처리량과 긴 영상 후반의 처리량이 다른지도 재야 메모리 누수나 상태 관리 비용을 찾을 수 있습니다.
같은 해상도와 프레임 샘플링, 카메라 보정, 하드웨어를 사용합니다. 전통적인 SfM, SLAM이 번들 조정을 포함한다면 정확도뿐 아니라 총 처리 시간을 함께 보고, LoGeR의 전처리와 상태 업데이트도 포함합니다. 입력이 실패했을 때 제외한 프레임 수와 완주율을 같이 표시해야 선택적으로 쉬운 구간만 비교하는 일을 막을 수 있습니다.
배포 전에는 128프레임 안의 짧은 기준선, 학습 길이를 조금 넘는 시퀀스, 수천 프레임, 루프가 있는 긴 시퀀스로 단계적으로 늘립니다. 길이가 늘 때 오차가 선형인지 특정 지점에서 급격히 커지는지 확인합니다. 가장 긴 한 사례보다 다양한 장면에서 반복되는 오차 곡선이 실용성을 더 잘 보여 줍니다.
아닙니다. 특정 데이터와 설정에서 긴 시퀀스를 처리한 결과이며, 제한된 TTT 상태에 정보가 압축되므로 영상이 길어질 때 드리프트와 오래된 장면 손실을 다시 측정해야 합니다.
그렇지 않습니다. 새 청크마다 상태를 갱신하려면 계산과 상태 관리가 필요하며, 스트림 분리, 체크포인트, 잘못된 업데이트 복구 비용도 포함해야 합니다.
현재 글의 근거만으로 실시간성을 보장할 수 없습니다. 목표 하드웨어에서 청크 추론과 TTT 업데이트를 포함한 끝단 지연, 오차 누적과 안전한 상태 초기화를 먼저 검증해야 합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.