포스트

로봇이 미래 영상을 만들지 않고도 다음 행동을 고를 수 있나: World Guidance

World Guidance가 미래 관측을 Q-former 조건 공간으로 압축해 VLA 행동을 지도하는 원리와 2단계 학습, 사람 영상, 제어 지연 검증 기준을 설명합니다.

로봇이 미래 영상을 만들지 않고도 다음 행동을 고를 수 있나: World Guidance

World Guidance(WoG)는 미래 프레임 전체를 생성하는 대신 행동에 필요한 미래 특징만 조건 공간으로 압축해, VLA가 다음 행동과 그 조건을 함께 예측하도록 학습합니다. 픽셀 생성 비용을 줄일 가능성은 있지만 압축된 조건이 접촉과 작은 물체처럼 제어에 필요한 정보를 보존한다는 보장은 없습니다. 실제 도입에서는 조건 예측 정확도와 행동 성공, 제어 지연을 서로 분리해 확인해야 합니다.

왜 미래 픽셀 대신 조건 공간을 예측하나요?

픽셀 단위 비디오 예측은 풍부한 정보를 주지만 로봇 제어에 필요하지 않은 배경과 질감까지 계산합니다. 예측 노이즈도 행동 모델로 전달될 수 있습니다. WoG는 미래 관측을 저차원 조건 표현으로 바꿔 목표 상태의 핵심만 행동 생성에 사용하려 합니다.

미래 관측을 조건 공간으로 옮기는 WoG의 개념

조건이 작다고 해서 정밀 정보가 자동으로 보존되는 것은 아닙니다. 압축 과정에서 접촉 위치나 얇은 물체처럼 성공을 좌우하는 특징이 사라지는지 확인해야 합니다.

조건 공간은 미래 영상의 모든 정보를 저장하는 것이 아니라 행동 손실에 도움이 되는 특징을 남기도록 학습됩니다. 배경 질감과 조명처럼 제어와 무관한 변화는 줄일 수 있지만, 학습 데이터에서 우연히 성공과 함께 나타난 시각 단서를 핵심 조건으로 압축할 수도 있습니다. 작다는 사실과 올바른 인과 상태를 담는다는 주장은 다릅니다.

조건 표현이 행동에 필요한 정보를 담는지는 어떻게 보나요?

미래 조건을 준 모델과 현재 관측만 본 기준선을 같은 정책 크기에서 비교하고, 조건 벡터를 섞거나 제거했을 때 행동이 어떻게 바뀌는지 확인합니다. 조건이 바뀌어도 출력이 거의 같다면 보조 경로를 무시할 수 있고, 작은 잡음에 행동이 크게 흔들리면 과도하게 의존할 수 있습니다. 전체 성공률뿐 아니라 접촉, 물체 선택, 장기 순서 오류를 나눕니다.

Q-former 쿼리 수나 조건 차원을 줄여도 성능이 유지되는 지점을 찾으면 압축의 실제 필요 용량을 볼 수 있습니다. 차원을 늘릴수록 훈련 성능만 좋아지고 OOD 성능은 그대로라면 제어 신호보다 장면 세부를 기억했을 가능성이 있습니다. 반대로 얇은 물체나 정밀 접촉에서만 성능이 떨어진다면 압축 과정에서 미세 특징이 사라졌는지 살펴야 합니다.

미래 시점의 거리도 중요한 변수입니다. 너무 가까운 미래는 현재와 비슷해 장기 목표 신호가 약하고, 너무 먼 미래는 가능한 경로가 많아 하나의 조건으로 예측하기 어려울 수 있습니다. 작업 길이별로 미래 간격을 바꾸고 조건 손실과 최종 성공을 함께 비교해야 합니다.

두 학습 단계는 미래 정답 없이 추론하도록 어떻게 바꾸나요?

첫 단계에서는 동결된 비전 기반 모델이 미래 관측을 특징으로 만들고, 학습 가능한 Q-former Future Encoder가 이를 행동 관련 조건으로 압축합니다. 현재 관측과 명령, 미래 조건을 모두 본 상태에서 행동을 학습합니다.

WoG의 2단계 학습 구조

두 번째 단계에서는 Future Encoder와 비전 모델을 고정합니다. 실제 추론에는 미래 관측이 없으므로 VLM이 현재 관측에서 행동을 예측하면서, 첫 단계가 만든 목표 조건에도 정렬되도록 학습합니다.

조건 추출과 조건 예측의 쿼리 메커니즘

원문의 Python 코드는 손실 구조를 설명하는 의사 코드입니다. 실제 클래스, 손실 가중치, 데이터 정렬이 빠져 있어 그대로 실행할 수 없습니다.

첫 단계의 정책은 실제 미래 관측에서 추출한 조건을 보므로 추론 때보다 쉬운 정보를 받습니다. 두 번째 단계에서 현재 관측만으로 그 조건을 예측하지 못하면 학습 중 성능과 배포 성능 사이에 간격이 생깁니다. Future Encoder의 조건이 행동에 유용한 정도와 VLM이 그 조건을 재현하는 정도를 따로 측정해야 합니다.

첫 단계의 교사 조건과 예측 조건의 간격은 어떻게 측정하나요?

같은 평가 에피소드에서 실제 미래 관측으로 만든 조건을 넣은 상한, 현재 관측으로 예측한 조건, 조건 없이 행동만 낸 기준선을 비교합니다. 상한은 높은데 예측 조건이 낮다면 조건 공간보다 예측기가 병목이고, 두 조건이 모두 기준선과 비슷하면 보조 목표의 행동 기여가 작을 수 있습니다.

조건 벡터 사이 거리만 낮다고 행동 의미가 같다고 볼 수는 없습니다. 예측 오차가 어느 차원에 있는지보다 그 오차로 그리퍼 방향이나 목표 물체가 바뀌는지를 봅니다. 조건 손실과 행동 성공의 상관이 약하면 손실 가중치나 표현 목표를 다시 점검해야 합니다.

두 단계의 체크포인트와 데이터 정렬도 재현에 중요합니다. Future Encoder를 고정하기 전 충분히 학습됐는지, 두 번째 단계가 같은 미래 간격과 전처리를 사용하는지, 첫 단계의 조건 분포가 이후 데이터에서 바뀌지 않는지 확인합니다. 모델을 고정했다는 사실이 잘못된 조건을 수정하지 못하게 만드는 제약이 될 수도 있습니다.

사람 조작 영상은 무엇을 더하나요?

UMI 사람 조작 데이터를 함께 학습했을 때 원문은 Pick-and-Place에서 42%, Fold에서 33%의 성능 향상을 보고합니다.

UMI 데이터 추가 전후의 두 작업 성능

이는 해당 작업과 실험 조건에서 사람 영상이 미래 조건 학습을 보완했다는 결과입니다. 사람 손과 로봇 그리퍼의 형태, 속도, 접촉 방식은 다르므로, 임의의 사람 영상이 곧바로 로봇 행동 데이터가 된다는 뜻은 아닙니다.

사람 영상은 로봇 시연보다 다양한 장면과 목표 상태를 제공할 수 있지만 행동 라벨과 로봇 동역학이 같지 않습니다. WoG에서는 미래 조건 학습을 보강하는 자료로 이해해야 하며, 사람 손의 동작을 로봇 행동으로 직접 복제한다고 보면 안 됩니다. 보고된 42%와 33%도 Pick-and-Place와 Fold의 특정 비교 조건에 한정됩니다.

사람과 로봇의 차이는 어떤 대조로 확인하나요?

로봇 데이터만 쓴 조건, 사람 영상을 추가한 조건을 같은 로봇 평가에서 비교하고 개선을 작업 유형별로 나눕니다. 목표 물체와 배경 다양성에서는 좋아졌지만 접촉 실패가 늘 수 있으므로 물체 인식, 접근, 잡기, 완료 단계를 따로 봅니다. 사람 영상과 비슷한 외형의 평가 장면만 좋아졌다면 넓은 일반화로 확대하지 않습니다.

손과 그리퍼의 모양, 움직임 속도와 카메라 시점이 다르면 Future Encoder가 사람 고유 단서를 조건에 넣을 수 있습니다. 사람 손을 가리거나 로봇 형태를 바꾼 대조, 같은 목표 상태의 서로 다른 수행 경로를 사용해 조건이 주체 외형보다 목표 변화를 담는지 시험합니다.

사람 영상의 수가 늘어난 효과와 조건 공간 구조의 효과도 분리해야 합니다. 같은 양의 로봇 또는 다른 비디오 데이터를 추가한 기준선이 있어야 “사람 조작이라서” 얻은 이득을 판단할 수 있습니다. 데이터 양과 다양성, 학습 스텝을 함께 기록합니다.

실제 제어에서는 어떤 병목을 확인해야 하나요?

분포 내부와 외부 조건을 포함한 실제 로봇 평가 환경

WoG는 조명이나 장애물이 바뀐 OOD 조건도 평가하지만, 도입할 때는 목표 물체 교체, 카메라 이동, 새로운 배경을 나눠 실패율을 봐야 합니다. 조건 예측이 틀렸는데도 행동이 성공한 사례와 그 반대도 기록하면 보조 손실이 실제로 행동에 기여하는지 알 수 있습니다.

2단계 학습은 데이터와 체크포인트 관리가 복잡하고, VLM 지연은 여전히 남습니다. 원문에는 100Hz 이상의 고속 제어를 보장하는 프로파일이 없습니다. 제어 주기 안에 관측 전처리, 조건 예측, 행동 출력을 모두 마칠 수 있는지 대상 하드웨어에서 측정해야 합니다.

제어 지연은 관측 전처리, VLM, 조건 예측과 행동 디코딩으로 나눠 측정합니다. 평균이 목표 주기를 만족해도 p95에서 오래된 관측의 행동이 나올 수 있으므로 타임스탬프를 맞추고 늦은 출력은 실행하지 않는 규칙이 필요합니다. 조건 벡터가 픽셀보다 작다는 사실이 VLM 전체 추론을 없애지는 않습니다.

조건과 행동이 서로 모순될 때의 중단 기준도 정합니다. 예측 조건은 목표가 가까워졌다고 보는데 실제 센서와 화면에서는 물체를 놓쳤다면 새 관측으로 계획을 다시 시작하거나 사람이 개입해야 합니다. 미래 조건을 안전 판단의 단일 근거로 쓰지 않고 힘, 접촉, 작업 공간 제한 같은 독립 장치를 유지합니다.

도입 시험은 미래 픽셀 기반 월드 모델, 조건 없는 VLA와 WoG를 같은 데이터, 지연 예산에서 비교해야 합니다. 성공률뿐 아니라 조건 예측 실패, 위험 행동, peak memory와 두 단계 학습 비용을 함께 볼 때 조건 공간 압축의 실질적 이득을 판단할 수 있습니다.

로봇과 물체 배치가 조금 달라진 반복 실험도 필요합니다. 조건 예측이 학습 장면의 외형을 기억한 것인지 행동에 필요한 접촉과 이동 구조를 포착한 것인지 구분하려면 배경, 카메라, 물체 위치를 하나씩 바꾸어야 합니다. 성공 동작만 모으지 말고 예측 조건이 빗나간 시점과 실제 정책이 이를 따라간 정도를 함께 기록합니다.

조건 공간이 작아져 메모리를 아꼈더라도 센서 변화에 취약하거나 재계획이 늦으면 실제 제어 이점은 제한됩니다. WoG의 압축 표현을 채택할지는 평균 성공률보다 실패를 조기에 감지하고 안전하게 멈출 수 있는지까지 포함해 결정해야 합니다.

arXiv 논문, 프로젝트 페이지, 논문 페이지

함께 읽으면 이해가 이어지는 글

이 기사는 저작권자의 CC BY 4.0 라이센스를 따릅니다.