RISE는 실제 로봇을 반복해서 움직이지 않고도 세계 모델 안의 후보 미래를 평가해 정책을 개선하지만, 그 개선은 상상한 미래가 실제 물리를 얼마나 잘 반영하는지에 제한됩니다. Controllable Dynamics Model이 행동 뒤의 영상을 만들고 Progress Value Model이 목표 진행도를 평가해 정책 학습 신호를 제공합니다. 가상 점수가 높아도 실제 성공을 보장하지 않으므로 짧은 롤아웃부터 실물 순위와 대조해야 합니다.
실물 시행착오 없이 로봇 정책을 개선할 수 있나: RISE의 상상 롤아웃
왜 세계 모델을 예측과 평가 두 역할로 나눌까?
RISE의 Compositional World Model은 Controllable Dynamics Model과 Progress Value Model로 구성됩니다. 동역학 모델은 여러 카메라 화면과 행동 묶음을 받아 미래 영상을 예측하고, 진행 가치 모델은 그 미래가 목표 달성에 얼마나 가까운지 점수로 평가합니다.
예측과 평가를 분리하면 같은 시작 상태에서 여러 행동을 비교할 수 있습니다. 동역학 모델이 보기 좋은 실패를 만들거나 가치 모델이 잘못된 단서를 성공으로 판단할 수 있으므로, 두 모델의 오류도 따로 측정해야 합니다.
동역학 모델의 질문은 “이 행동을 하면 무엇이 보일까”이고 가치 모델의 질문은 “그 결과가 목표에 얼마나 가까운가”입니다. 한 모델이 두 판단을 모두 맡으면 예측의 시각적 오류와 목표 평가의 오류를 구분하기 어렵습니다. 역할을 나누면 같은 예측에 다른 진행 점수를 적용하거나 예측 품질만 별도로 검사할 수 있습니다.
그러나 분리는 오류를 없애지 않고 두 군데로 나눕니다. 지퍼가 닫힌 것처럼 보이지만 실제로 천이 끼인 미래를 동역학 모델이 만들 수 있고, 가치 모델은 닫힌 모양만 보고 높은 점수를 줄 수 있습니다. 접촉과 힘처럼 영상에 잘 드러나지 않는 상태는 별도 센서와 실물 검증이 필요합니다.
상상 롤아웃의 점수는 어떻게 정책 학습으로 돌아올까?
현재 정책이 세계 모델 안에서 행동을 제안하면 동역학 모델이 그 결과를 만들고 가치 모델이 성과를 평가합니다. 높은 성과가 예상되는 경로에서 advantage 신호를 계산해, 행동 정책이 더 나은 행동을 생성하도록 다시 학습합니다.
이 루프는 실물 데이터 수집 비용과 파손 위험을 줄일 가능성이 있습니다. 그러나 같은 모델 안에서 롤아웃과 평가를 반복하면 초기 편향이 스스로 강화될 수 있습니다. 가상 점수가 올라도 실제 로봇의 성공률을 주기적으로 확인해야 합니다.
후보 행동을 같은 시작 상태에서 비교하면 실제로 모두 실행하지 않고도 우선순위를 정할 수 있습니다. 높은 가치가 예상된 행동의 advantage를 이용해 정책이 비슷한 선택을 더 자주 하도록 학습하는 흐름입니다. 이때 후보 다양성이 부족하면 현재 정책이 이미 아는 행동 안에서만 개선될 수 있습니다.
세계 모델이 선호하는 영상과 실제로 안전한 행동이 다르면 정책은 모델의 빈틈을 학습할 수 있습니다. 가상 점수와 실제 성공 순위가 어긋난 사례를 모아 동역학 모델과 가치 모델 중 어디가 원인인지 나눠야 합니다. 실물 확인 없이 가상 학습을 오래 반복할수록 편향이 누적될 수 있습니다.
세 조작 과제의 개선률은 무엇을 보여 줄까?
평가는 움직이는 컨베이어의 벽돌 분류, 옷을 넣고 지퍼를 닫는 백팩 패킹, 상자 날개와 탭을 맞추는 박스 닫기를 사용합니다.
원문은 기준 정책 대비 Dynamic Brick Sorting에서 35%, Backpack Packing에서 45%, Box Closing에서 35%의 절대 성능 향상을 보고합니다. 서로 다른 종류의 접촉과 정밀 제어에서 개선을 확인했다는 의미가 있지만, 세 과제의 결과를 모든 로봇과 환경에 그대로 적용할 수는 없습니다.
절대 성능 향상은 기준 정책의 성공률에 퍼센트포인트를 더한 개념으로 읽어야 하며, 상대 향상과 혼동하면 안 됩니다. 세 숫자를 평균 내 하나의 종합 성능으로 만드는 것도 과제별 난도와 실패 비용을 가립니다. 각 과제에서 어떤 시작 상태와 실패가 포함됐는지를 함께 봐야 합니다.
벽돌 분류는 움직이는 대상의 시간 판단, 백팩 패킹은 유연 물체와 지퍼의 접촉, 박스 닫기는 날개와 탭의 정렬을 요구합니다. 서로 다른 과제에서 개선이 보고됐다는 점은 구조의 범위를 살펴보는 근거가 되지만, 새로운 로봇 손이나 카메라 배치에서도 같은 결과가 난다는 보장은 없습니다.
어떤 조건에서 실물 평가를 반드시 유지해야 할까?
긴 롤아웃에서는 작은 위치와 접촉 예측 오류가 쌓여 실제로 불가능한 성공 경로를 만들 수 있습니다. 가치 모델이 배경이나 카메라 각도 같은 우연한 단서를 보상하면 정책도 그 편향을 학습합니다. DiT 동역학 모델과 가치 모델을 함께 실행하는 계산 비용도 고려해야 합니다.
도입한다면 짧은 예측 구간부터 시작해 가상 순위와 실제 성공 순위가 일치하는지 측정하고, 불일치 사례를 세계 모델 학습에 되돌려야 합니다. 충돌 제한과 비상 정지는 상상 모델과 독립된 안전 계층에 남겨야 합니다. RISE는 실물 시행착오를 줄이는 방법이지, 실물 검증을 제거하는 방법은 아닙니다.
검증 기록에는 예측 영상의 시각 품질보다 행동 결과의 핵심 상태를 남겨야 합니다. 물체 위치 오차, 접촉 성공, 목표 진행 점수, 실제 성공 여부와 첫 실패 시점을 같은 롤아웃에 연결하면 가상 순위가 왜 틀렸는지 찾기 쉽습니다. 예측 길이를 늘릴수록 순위 상관이 어떻게 변하는지도 확인해야 합니다.
가상 상위 후보가 실물에서 반복적으로 실패하거나 가치 모델이 배경 단서를 이용하거나 추가 계산이 제어 주기를 맞추지 못한다면 도입을 보류해야 합니다. 반대로 짧은 구간에서 가상 순위와 실물 순위가 안정적으로 일치하고 실물 시도 수와 파손 위험이 줄어든다면 제한된 과제부터 확장할 수 있습니다. 안전 계층은 정책과 세계 모델의 성능과 무관하게 독립적으로 작동해야 합니다.
가상 순위와 실물 순위를 어떻게 대조해야 할까?
같은 시작 상태에서 정책이 제안한 후보 행동을 세계 모델로 순위화한 뒤, 안전한 범위의 상위 후보 몇 개를 실제 로봇에서 실행합니다. 가상 1위가 실물에서도 가장 높은 진행도를 보이는지뿐 아니라 하위 후보와의 순서가 얼마나 자주 뒤집히는지 기록합니다. 성공과 실패만 보면 작은 진행 차이를 놓칠 수 있습니다.
불일치가 생기면 먼저 동역학 예측을 실제 관측과 비교합니다. 물체 위치나 접촉 결과가 틀렸다면 미래 생성 쪽 문제이고, 영상은 비슷한데 가치 점수만 잘못됐다면 진행 평가 쪽 문제일 가능성이 큽니다. 두 모델을 함께 다시 학습하기 전에 오류 원인을 분리해야 같은 편향을 강화하지 않습니다.
예측 구간을 한 단계씩 늘려 순위 일치가 무너지는 지점을 찾을 수 있습니다. 짧은 구간에서는 맞지만 긴 구간에서 뒤집히면 모델 편향이 누적되는 것이므로 롤아웃 길이를 제한하거나 중간 실물 관측으로 다시 계획해야 합니다. 과제마다 안전하게 허용할 수 있는 최대 상상 길이가 다를 수 있습니다.
실물 실행에는 충돌 제한, 속도 제한, 비상 정지와 사람 감독을 그대로 둡니다. 가상 평가가 좋다는 이유로 안전 장치를 제거하면 세계 모델이 보지 못한 상황에서 위험이 커집니다. RISE의 성공 기준은 실물 시도를 0으로 만드는 것이 아니라 같은 안전 수준에서 시행착오를 줄이고 개선된 정책을 실제 환경에서 재현하는 것입니다.
정책 업데이트 전후를 비교할 때는 쉬운 시작 상태만 반복하지 않습니다. 물체 위치, 재질, 조명과 카메라 조건을 허용 범위 안에서 바꾸고 어느 변화에서 가상 순위와 실물 결과가 갈라지는지 봅니다. 개선 정책이 세계 모델이 자주 본 상태에만 맞으면 새로운 배치에서 이득이 사라질 수 있습니다.
인간 교정 데이터도 성공 횟수만 집계해서는 안 됩니다. 어느 실패 단계에서 얼마나 자주 개입했고, 교정 뒤 같은 종류의 오류가 줄었는지를 기록해야 비용과 정책 개선을 연결할 수 있습니다. 전문가마다 수정 방식이 다르면 정책이 모순된 신호를 받는지도 확인해야 합니다.
배포 뒤에는 세계 모델과 실제 환경의 차이가 커지는 징후를 감시해야 합니다. 장비 마모나 카메라 위치 변화로 예측 오차가 늘어도 가상 점수만 보면 알아채지 못할 수 있습니다. 정기적인 실물 표본 평가와 안전 사건 검토를 유지해야 편향을 조기에 발견할 수 있습니다.
가상 학습으로 성능이 좋아진 과제와 나빠진 과제를 모두 공개된 검토표에 남겨야 합니다. 평균 성공률만 유지하면 특정 물체나 시작 상태에서 생긴 회귀가 숨을 수 있습니다. 새 정책은 기존 안전 과제를 다시 통과한 뒤 제한된 로봇부터 단계적으로 배포하는 편이 적절합니다.
상상 롤아웃을 많이 만들수록 현실과 다른 상태를 정책이 이용할 가능성도 커집니다. 월드 모델 안에서는 성공하지만 실물에서는 불가능한 손 위치나 접촉을 반복해서 선택한다면 보상 점수보다 현실성 필터가 먼저 필요합니다. 가상 상위 후보와 무작위 후보를 소량의 실물 시험에서 함께 비교하고, 둘의 순위 상관이 낮아지는 과제는 자기개선 대상에서 제외해야 합니다. 실물 데이터가 새로 쌓이면 월드 모델의 오류 유형이 줄었는지도 다시 확인해야 같은 편향을 반복 학습하지 않습니다.
함께 읽으면 이해가 이어지는 글
- 인간 영상 4만 4천 시간은 로봇 행동이 될 수 있나: DreamDojo — DreamDojo가 사람의 1인칭 영상에서 잠재 행동을 배우고 소량의 로봇 데이터로 연결하는 방법, 10.81 FPS 성과와 실제 적용 한계를 살펴봅니다.
- GigaBrain-0.5M*는 월드 모델을 로봇 정책에 어떻게 연결하나 — GigaBrain-0.5M*의 RAMP가 월드 모델, 인간 개입 롤아웃, 지속 학습을 연결하는 방식과 보고된 로봇 과제 성능의 한계를 분석합니다.
- 로봇이 미래 영상을 만들지 않고도 다음 행동을 고를 수 있나: World Guidance — WoG가 미래 관측을 Q-former 조건 표현으로 압축하고 VLA가 행동과 함께 예측하게 하는 2단계 학습, UMI 성과와 지연 한계를 설명합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.




