포스트

로봇은 미래 픽셀까지 그려야 할까? FRAPPE의 다중 VFM 정렬

반드시 미래 픽셀을 그릴 필요는 없습니다. FRAPPE는 로봇 행동에 중요한 의미를 여러 시각 기초 모델의 잠재 표현에서 예측해, 질감 복원에 쓰이는 비용과 한 표현에 치우치는 위험을 줄입니다. 다만 장점은 작업의 시간 길이와 접촉 정밀도에 따라 달라지므로, 성공률과 함께 표현별 오류, 추론 지연, 실패 복구 조건을 확인해야 합니다.

논문이 출발한 지점은 VLA 정책의 두 가지 선택지입니다. 다음 프레임을 픽셀로 복원하면 배경과 질감까지 맞추느라 제어와 무관한 계산이 커지고, 미래를 여러 단계 자기회귀로 전개하면 앞선 예측 오류가 뒤로 누적됩니다. FRAPPE는 먼 미래의 표현 하나를 직접 맞추고, 서로 다른 VFM의 시각 기준을 함께 사용합니다.

왜 미래 픽셀 대신 잠재 표현을 예측하나요?

첫 단계에서 정책은 현재 관측으로부터 미래 시점의 잠재 표현을 예측합니다. 화면 전체를 그리는 대신 물체, 관계, 의미처럼 제어에 필요한 정보를 압축해 다룹니다.

FRAPPE의 미래 표현 학습 구조

두 번째 단계에서는 DINOv2, CLIP, SigLIP 등 여러 VFM의 표현 공간에 예측을 정렬합니다. 각 모델은 시각 정보를 보는 기준이 다르므로 하나만 교사로 삼을 때의 편향을 완화하는 목적입니다. 연구진은 병렬적이고 점진적인 확장 방식으로 표현을 추가하며, 미래 표현의 평균제곱오차와 행동 복제 손실을 함께 최적화합니다.

여기서 “다중 미래”는 많은 영상을 차례로 생성한다는 뜻이 아닙니다. 하나의 미래 상태를 여러 표현 기준으로 검사한다는 의미에 가깝습니다.

픽셀 복원은 관측을 세밀하게 보존하지만 제어에 필요하지 않은 색, 조명, 배경 변화에도 손실을 지불합니다. 반면 잠재 표현은 교사 VFM이 중요하다고 본 물체와 관계를 압축해 정책이 미래의 의미 변화에 집중하도록 합니다. 어느 쪽이 항상 우월한 것이 아니라, 과제의 성공을 결정하는 신호가 어디에 남아 있는지가 선택 기준입니다.

예를 들어 물체를 올바른 위치까지 옮기는 장기 과제는 장면 관계의 변화가 중요하므로 의미 표현과 잘 맞을 수 있습니다. 반대로 손가락과 물체가 닿는 순간이나 표면의 작은 변형이 성공을 가르는 과제에서는 압축 과정이 필요한 신호를 지울 수 있습니다. 따라서 “영상 생성 비용을 줄였다”는 설명만으로 도입하지 말고, 기존 픽셀 기반 정책이 실제로 배경 복원에 용량을 낭비하는지 오류 사례부터 분류해야 합니다.

먼 미래를 직접 맞추면 오류 누적이 사라지나요?

FRAPPE는 여러 중간 프레임을 하나씩 생성한 뒤 마지막 상태에 도달하는 대신, 목표한 미래 시점의 표현을 직접 예측합니다. 이 구조는 이전 생성 결과를 다음 입력으로 다시 넣을 때 생기는 연쇄 오류를 피하려는 선택입니다. 그러나 직접 예측도 현재 관측만으로 미래가 여러 갈래인 상황에서는 평균적인 표현으로 수렴하거나, 실제 행동 경로와 맞지 않는 상태를 택할 수 있습니다.

미래 시점을 멀리 잡을수록 장기 의도는 강조되지만 가능한 결과의 수가 늘어납니다. 너무 가깝게 잡으면 현재와 거의 같은 표현을 맞추는 쉬운 보조 과제가 되어 장기 계획에 주는 정보가 줄 수 있습니다. 논문의 설정을 다른 로봇에 옮길 때는 예측 간격을 고정값으로 받아들이기보다, 짧은 조작과 긴 조작에서 간격별 성공률과 표현 손실이 함께 어떻게 변하는지 확인해야 합니다.

직접 예측의 이점은 “미래를 정확히 안다”가 아니라 정책이 장기 변화에 민감해지도록 학습 신호를 주는 데 있습니다. 표현 손실이 낮은데 행동 성공률은 오르지 않는다면 교사 표현이 제어 신호와 맞지 않거나, 행동 복제 손실과 보조 손실의 균형이 어긋났을 가능성을 먼저 살펴야 합니다.

여러 VFM을 함께 쓰면 무엇을 비교해야 하나요?

DINOv2, CLIP, SigLIP은 같은 화면을 입력받아도 강조하는 단서가 같지 않습니다. 여러 표현에 맞추는 목적은 단순한 모델 수 증가가 아니라, 한 교사의 사각지대를 다른 교사가 보완하게 하는 것입니다. 그래서 총 성공률만 비교하면 어떤 표현이 기여했는지, 어느 조합이 계산만 늘렸는지 알기 어렵습니다.

가장 먼저 한 개 VFM을 사용한 조건과 각 VFM을 하나씩 뺀 조건을 같은 데이터, 학습량으로 비교할 수 있습니다. 특정 교사를 제외했을 때 접촉 과제만 좋아진다면 그 표현이 미세 상태를 흐렸을 가능성이 있고, 새로운 배경에서만 성능이 떨어진다면 일반화 단서를 제공했을 수 있습니다. 이는 논문의 구조에서 도출되는 점검 방법이며, 실제 원인은 오류 장면과 표현별 손실을 함께 보아야 판단할 수 있습니다.

표현별 예측이 서로 크게 어긋나는 장면도 유용한 진단 신호입니다. 그런 장면을 물체 가림, 카메라 변화, 도구 접촉처럼 유형별로 모으면 다중 정렬이 보완적으로 작동하는지 확인할 수 있습니다. 모든 교사가 같은 실수를 내면 모델 수를 늘려도 편향이 줄지 않으므로, 새로운 VFM을 추가하기 전에 기존 표현의 오류 상관부터 살피는 편이 합리적입니다.

행동이 없는 영상은 어디까지 도움이 되나요?

로봇 시연에는 관측과 행동이 함께 있지만 수집 비용이 큽니다. FRAPPE의 월드 모델 부분은 행동 라벨이 없는 인터넷 영상에서도 장면이 어떻게 변하는지 배울 수 있습니다. 연구는 전문가 로봇 데이터와 일반 영상을 층으로 쌓는 데이터 피라미드를 사용합니다.

FRAPPE의 데이터 구성

일반 영상은 변화의 폭을 넓히고, 로봇 시연은 그 변화에 맞는 행동을 연결합니다. 다만 영상 속 움직임이 로봇의 물리적 제약과 일치한다는 보장은 없습니다. 인터넷 영상과 CGI의 편향을 그대로 흡수할 수 있으므로, 행동 학습을 대체하는 자료라기보다 표현 예측을 보강하는 자료로 보는 편이 안전합니다.

영상에서 보이는 상태 변화와 로봇이 실행할 수 있는 행동은 구분해야 합니다. 사람 손이 물체를 빠르게 돌리는 장면이나 카메라 편집으로 상태가 바뀐 장면은 시각적 미래로는 존재하지만, 해당 로봇의 관절, 속도, 그리퍼 제약에서는 재현할 수 없을 수 있습니다. 월드 모델이 이런 변화를 자주 학습하면 의미 예측은 맞아 보여도 정책이 실행 불가능한 경로에 의존할 위험이 있습니다.

데이터 피라미드를 옮길 때는 영상의 양보다 역할을 나누어 기록하는 것이 중요합니다. 일반 영상은 어떤 물체와 장면 변화를 넓혔는지, 로봇 시연은 어떤 행동과 실패를 포함하는지, CGI는 실제 카메라와 접촉 조건에서 무엇이 다른지를 구분합니다. 일반 영상을 추가한 뒤 로봇 시연만 사용한 기준선보다 보지 못한 배경에서는 좋아졌지만 접촉 실패가 늘었다면, 표현의 범위와 실행 가능성 사이에 교환 관계가 생겼다고 볼 수 있습니다.

행동 없는 데이터의 효과를 평가할 때는 전체 평균만 보지 말고 데이터 출처와 유사한 장면, 전혀 다른 장면, 실제 로봇 접촉 장면을 나눠야 합니다. 그래야 인터넷 영상의 외형 다양성이 실제 일반화로 이어졌는지, 단순히 평가 장면과 비슷한 시각 패턴을 더 많이 본 결과인지 구분할 수 있습니다.

보고된 장기 작업 결과는 어떻게 읽어야 하나요?

연구는 RoboTwin과 실제 로봇 작업에서 OpenVLA, Octo, RT-X 계열과 비교하고 H100 환경에서 학습했습니다. 장기 작업에서 성공률 곡선이 더 안정적으로 유지됐고, 보지 못한 설정에서는 픽셀 복원 방식보다 약 35% 높은 결과를 보고합니다.

장기 조작 성능 비교

이 수치는 특정 실험 설정의 상대 결과입니다. 모든 로봇과 작업에서 35%가 보장되는 것으로 확대하면 안 됩니다. 의미 표현이 물체 관계를 잘 보존하는 작업에는 유리하지만, 미세한 접촉이나 표면 상태처럼 픽셀 수준 정보가 중요한 조작에서는 장점이 줄 수 있습니다.

공정한 비교를 위해서는 정책의 크기, 로봇 시연 수, 일반 영상 사용량, 학습 계산량을 함께 확인해야 합니다. FRAPPE가 더 많은 VFM과 영상 데이터를 사용했다면 성공률 차이에는 표현 정렬뿐 아니라 데이터와 계산 예산의 효과도 섞일 수 있습니다. 동일한 자원 조건의 기준선과 보조 손실만 바꾼 절제 실험을 함께 보아야 구조 자체의 기여를 판단하기 쉽습니다.

실제 도입 실험은 과제를 시간 길이와 감각 정밀도로 나누면 해석이 선명해집니다. 짧고 접촉이 정밀한 과제, 짧고 의미 관계가 중요한 과제, 길고 접촉이 정밀한 과제, 길고 관계 변화가 중요한 과제를 구분해 픽셀 방식과 표현 방식을 비교합니다. 장기, 관계 과제에서만 개선된다면 FRAPPE의 설계 의도와 맞는 결과이고, 모든 구간에서 비슷하다면 추가 계산 비용을 정당화하기 어렵습니다.

도입 전에 어떤 비용과 실패 조건을 정해야 하나요?

FRAPPE를 검토할 때는 성공률뿐 아니라 다음 조건을 함께 봐야 합니다.

  • 여러 VFM을 학습 과정에 올릴 GPU 메모리가 있는가
  • 50Hz 같은 제어 주기 안에서 표현 예측과 행동 출력을 끝낼 수 있는가
  • 선택한 VFM이 현장의 물체와 시점을 충분히 이해하는가
  • 예측이 틀릴 때 정책을 멈출 별도 안전 장치가 있는가

FRAPPE의 추가 실험

VFM 수를 늘리는 것 자체가 목표가 되어서는 안 됩니다. 서로 다른 오류를 내는 표현을 조합할 때 의미가 있으며, 비슷한 편향의 모델을 여럿 붙이면 계산만 증가할 수 있습니다. 적용의 현실적인 출발점은 픽셀 복원이 약한 장기 작업을 고르고, 한 개 VFM과 다중 VFM의 이득을 같은 지연, 메모리 조건에서 비교하는 것입니다.

온라인 제어에서는 평균 지연보다 가장 느린 구간도 확인해야 합니다. 가림이나 복잡한 배경에서 표현 계산이 길어지면 제어 주기를 놓칠 수 있으므로, 입력 수집, VFM 추론, 정책 출력 시간을 따로 기록합니다. 목표 주기 안에 못 들어오는 경우 프레임을 건너뛸지, 이전 행동을 유지할지, 안전 정지할지를 정책 바깥의 규칙으로 정해야 합니다.

실패 판정도 성공률 집계 전에 고정해야 합니다. 목표 물체를 놓친 경우, 올바른 물체를 잘못된 위치에 둔 경우, 제한 시간을 넘긴 경우, 안전 영역을 벗어난 경우를 따로 기록하면 표현 예측이 어떤 실패를 줄이고 늘렸는지 알 수 있습니다. 특히 표현 손실이 낮은데 물리적 실패가 반복되면 잠재 공간의 정확도를 행동 안전성으로 오해해서는 안 됩니다.

결국 FRAPPE를 선택할 질문은 “픽셀을 생성하지 않아 더 가벼운가” 하나가 아닙니다. 현재 병목이 장기 의미 추적인지 미세 접촉인지, 여러 VFM이 서로 다른 오류를 내는지, 추가 학습 비용을 감수할 만큼 실제 성공과 회복성이 개선되는지를 함께 답해야 합니다. 이 세 조건이 확인되지 않으면 단일 표현 정책을 먼저 개선하는 편이 더 단순한 기준선이 됩니다.

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    7개 장 21 분읽는 시간