DreamZero는 14B 규모의 비디오 디퓨전 백본에서 미래 영상과 로봇 행동을 함께 예측하는 World Action Model입니다. 원문은 새로운 작업, 환경에서의 일반화 개선, DreamZero-Flash의 7Hz 제어와 짧은 비디오를 이용한 전이 결과를 보고합니다. 이 수치는 특정 로봇, 과제, 하드웨어의 결과이며, “제로샷”이라는 이름만으로 미학습 환경의 안전한 실행이나 저가 로봇 배치를 보장하지는 않습니다.
World Action Model(WAM)이란? DreamZero의 영상과 로봇 행동 예측
DreamZero는 무엇을 공동으로 학습할까?
기존 VLA가 현재 관측에서 행동을 직접 예측하는 데 초점을 둔다면, DreamZero는 행동 뒤에 보일 미래 상태를 비디오 표현으로 함께 학습합니다. 행동과 시각 변화의 대응을 같은 시공간 context에 두어 새로운 물체와 배경에서 사용할 단서를 얻으려는 접근입니다. 다만 생성한 미래가 실제 물리와 어긋나면 행동 예측도 함께 잘못될 수 있습니다.
그림 1: DreamZero의 개요. 비디오와 행동을 공동 예측함으로써 물리적 사전 지식을 상속받아 높은 일반화 성능과 이기종 전이 능력을 확보함.
기존 VLA는 왜 미학습 동작에 취약할 수 있을까?
직접 행동 예측의 한계
OpenVLA, RT-2 같은 VLA 모델은 시각, 언어 사전학습을 활용하지만 정적인 표현만으로 물체 변화와 행동의 인과를 충분히 학습하기 어려울 수 있습니다.
- 물리적 인과관계의 결여: 정적인 이미지 기반 학습은 물체가 움직이는 방식, 즉 ‘물리적 연속성’에 대한 깊은 이해를 제공하지 못합니다.
- 데이터 효율성 저하: 새로운 동작을 가르치기 위해 수천 번의 반복적인 데모(Demonstration)가 필요합니다.
- 환경 변화에 대한 취약성: 학습 데이터에 포함되지 않은 새로운 배경이나 조명 조건에서 성능이 급격히 저하됩니다.
World Action Model의 가설
연구는 비디오의 시간 변화를 학습하면 행동이 환경에 미치는 결과를 더 풍부하게 표현할 수 있다는 가설을 둡니다. 그러나 비디오의 상관관계가 물리적 인과와 같지는 않으며, 카메라 움직임이나 편집을 행동 결과로 오인할 가능성도 남습니다.
비디오와 행동은 어떤 아키텍처에서 연결될까?
DreamZero의 핵심은 Autoregressive Video Diffusion Transformer (DiT) 구조입니다. 모델은 과거의 시각 정보와 현재의 행동 의도를 결합하여 미래의 시각적 결과와 구체적인 제어 값을 동시에 생성합니다.
통합 입력과 출력
DreamZero는 세 가지 입력을 수용합니다:
- Visual Context: VAE(Variational Autoencoder)로 인코딩된 과거 영상 프레임.
- Language Instructions: 텍스트 인코더를 통해 처리된 자연어 명령.
- Proprioceptive State: 로봇의 관절 각도 등 현재 상태 정보.
이 입력들은 DiT 백본 내에서 Flow Matching 기법을 통해 처리됩니다. 여기서 중요한 점은 비디오 잠재 변수(Video Latents)와 행동 잠재 변수(Action Latents)가 동일한 시공간적 컨텍스트 내에서 함께 예측된다는 것입니다.
그림 4: DreamZero의 모델 아키텍처. Flow Matching 기반의 DiT 백본이 비디오와 행동을 공동으로 예측함.
비디오-행동 공동 예측
DreamZero는 비디오와 행동을 같은 context에서 예측하되 별도 decoder로 출력합니다. 예측 행동과 생성 영상이 정렬된 사례는 설계의 목적을 보여 주지만, 상상한 영상이 틀렸을 때 행동도 함께 잘못될 수 있으므로 실제 관측으로 다시 교정해야 합니다.
그림 2: 공동 예측 예시. 예측된 행동이 생성된 비디오의 물리적 변화와 정확히 일치함을 보여줌.
DreamZero-Flash와 제어 지연
14B 모델을 로봇 제어 루프에 적용할 때 생기는 지연을 줄이기 위해 두 가지 최적화를 사용합니다.
- Decoupled Noise Schedules (분리된 노이즈 스케줄): 비디오 생성에는 높은 노이즈 레벨을 적용하여 풍부한 물리 정보를 학습하게 하는 반면, 행동 예측에는 낮은 노이즈를 적용하여 빠르게 정답에 수렴하게 합니다 (DreamZero-Flash).
- KV Cache 및 비동기 실행: 추론 시 이전 계산 결과를 재사용하고, 예측된 행동 시퀀스를 비동기적으로 실행하여 하드웨어 제약 내에서 7Hz의 제어 속도를 달성했습니다.
그림 5: 분리된 노이즈 스케줄링. DreamZero-Flash는 비디오 노이즈 분포를 조정하여 추론 속도와 정확도를 최적화함.
어떤 데이터와 로봇에서 시험했을까?
학습 데이터
DreamZero는 이질적인(Heterogeneous) 로봇 데이터셋을 사용하여 학습되었습니다. 여기에는 RT-1, BridgeV2와 같은 표준 로봇 데이터뿐만 아니라, 로봇 팔의 행동 레이블이 없는 Video-only 데이터(인간의 활동 영상 등)도 포함됩니다. 총 학습 데이터는 수백만 개의 비디오 클립에 달하며, 이는 모델이 광범위한 객체 조작 기술을 습득하는 밑거름이 되었습니다.
로봇과 계산 환경
- Robot Platforms: ALOHA (Dual-arm), WidowX, Unitree H1 (Humanoid) 등 다양한 폼팩터.
- Compute: NVIDIA H100 GPU 클러스터를 사용하여 14B 모델의 분산 학습을 수행.
- Real-world Evaluation: 실험실 환경을 벗어난 야외 및 일반 가정집 환경에서의 제로샷 평가 진행.
보고된 일반화와 전이 수치를 어떻게 읽어야 할까?
일반화 성능
원문은 OpenVLA와 비교해 미학습 물체와 새로운 배경에서의 결과를 제시합니다.
- 성공률(Success Rate): 새로운 환경에서의 작업 성공률이 OpenVLA 대비 115% 향상되었습니다.
- Robustness: 조명과 배경이 달라진 조건의 결과를 보고합니다.
이기종 전이 학습
원문은 다른 로봇이나 사람이 수행한 10~20분 분량의 video-only 데이터를 사용한 뒤 해당 작업 성능이 42% 이상 개선된 비교를 설명합니다. 이는 선택된 설정에서 영상 전이가 도움이 됐다는 근거이며, 모든 로봇 형태에서 같은 시간의 데이터로 같은 개선을 얻는다는 보장은 아닙니다.
115%와 42%가 절대 퍼센트포인트인지 상대 개선인지, 기준 성공률과 trial 수가 무엇인지 함께 확인해야 합니다. 제로샷 기본 성능과 짧은 데이터로 적응한 결과도 구분해야 합니다. “제로샷 정책”이라는 이름과 few-shot adaptation 결과를 하나로 합치면 데이터 요구량을 과소평가할 수 있습니다.
그림 3: 자유 형식 평가 결과. 도구 사용, 인간-로봇 상호작용 등 다양한 고난도 작업을 자연어 명령만으로 수행함.
어떤 응용부터 제한적으로 검토할 수 있을까?
논문의 실험 범위를 바탕으로 다음 응용을 연구 후보로 볼 수 있습니다.
- 물류, 제조 연구: 기존 행동 데이터에 video-only 사전학습을 더해 새로운 배치의 적응성을 시험할 수 있습니다.
- 서비스 로봇 연구: 정형화되지 않은 배경에서 제한된 조작 과제를 평가할 수 있습니다.
- 교차 로봇 데이터 활용: 다른 embodiment의 영상이 목표 로봇에 주는 이득을 과제별로 측정할 수 있습니다.
일반 비디오에는 행동 값과 안전 제약이 없으므로 로봇 데모를 완전히 대체한다고 볼 수 없습니다. Cloud를 제어 루프에 넣는 구성도 네트워크 지연과 중단, 영상 전송의 프라이버시를 별도로 해결해야 합니다.
어떤 한계가 남으면 실제 로봇 적용을 보류해야 할까?
엔지니어링 관점에서는 다음 한계를 확인해야 합니다.
- 컴퓨팅 비용의 한계: 14B 파라미터 모델을 7Hz로 구동하기 위해서는 여전히 강력한 GPU 성능이 뒷받침되어야 합니다. 저가형 로봇 하드웨어에 내장(On-device)하기에는 모델 경량화가 더 필요합니다.
- Flow Matching의 샘플링 속도: DiT 백본은 근본적으로 샘플링 과정에서 여러 번의 Forward pass가 필요합니다. DreamZero-Flash가 이를 개선했음에도 불구하고, 고속 기동(High-speed motion)이 필요한 작업(예: 탁구, 드론 제어)에는 여전히 지연 시간이 병목이 될 수 있습니다.
- 인과관계 오류(Causal Confusion): 비디오 생성 모델 특성상, 로봇의 움직임과 상관없이 배경이 변하는 경우 이를 로봇의 행동 결과로 오인할 위험이 존재합니다. 물리적 인과관계를 더 명확히 분리하는 메커니즘이 보완되어야 합니다.
결론: WAM을 로봇 정책으로 선택할 기준은 무엇인가?
DreamZero의 기여는 미래 비디오와 행동을 함께 예측해 video-only 데이터의 시간 정보를 정책 학습에 연결한 데 있습니다. 실제 선택에서는 직접 행동 정책과 같은 과제, 데이터 예산으로 비교하고 새로운 물체, 배경, 로봇별 성공률, 첫 실패 시점, 7Hz 종단 지연과 복구를 측정해야 합니다.
생성 영상과 실제 관측이 어긋났을 때 독립된 안전 제어기가 행동을 중단하고, 짧은 적응 데이터의 범위와 효과를 재현할 수 있을 때 제한된 과제로 확장할 수 있습니다. 장기 계획에서 오류가 누적되거나 계산 지연이 제어 주기를 넘거나 비디오의 상관관계를 인과로 오인한다면 보고된 평균 개선과 관계없이 적용을 보류해야 합니다.
함께 읽으면 이해가 이어지는 글
- 로봇이 미래 Frame을 맞히면 Action도 나아질까? LingBot-VA의 World Model — LingBot-VA가 video와 action token을 교차 배치하고 미래 visual state를 flow matching으로 예측한 뒤 inverse dynamics로 action을 내는 구조, 지연, 환각, 안전 한계를…
- 로봇은 미래 픽셀까지 그려야 할까? FRAPPE의 다중 VFM 정렬 — FRAPPE가 다음 화면의 픽셀 대신 여러 시각 기초 모델의 미래 표현을 맞추는 이유와 장기 조작에서 얻는 이점, 계산 비용을 정리합니다.
- RoboVIP은 로봇 영상을 왜 텍스트 대신 참조 이미지로 바꾸나 — 객체와 배경의 시각적 정체성을 유지한 다중 뷰 비디오로 로봇 정책 데이터를 늘리는 방법과 물리 오류 검수
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.