월드모델 17
- 화면 밖 자동차를 비디오 모델이 잊는다면? HyDRA의 Top-K 기억
- WildWorld 1억8천만 프레임이 월드 모델을 만들까: 450개 Action과 게임 편향
- 예쁜 영상이 물리까지 맞는지 어떻게 알까: Omni-WorldBench 평가법
- 로봇 비디오가 물체를 뚫고 지나간다면? Kinema4D의 URDF, Pointmap 제어
- 생성 영상의 배경과 움직임이 무너진다면: DreamWorld의 결합 월드 모델링
- VLM은 텍스트 모델부터 학습해야 할까? Transfusion 공동 사전학습의 대안
- 로봇이 미래 영상을 만들지 않고도 다음 행동을 고를 수 있나: World Guidance
- 두 플레이어가 본 세계를 동시에 맞출 수 있나: Minecraft 월드 모델 Solaris
- 로봇은 미래 픽셀까지 그려야 할까? FRAPPE의 다중 VFM 정렬
- AI 에이전트가 클릭하기 전 결과를 미리 보면 실수가 줄까? CUWM의 2단계 예측
- 실물 시행착오 없이 로봇 정책을 개선할 수 있나: RISE의 상상 롤아웃
- GigaBrain-0.5M*는 월드 모델을 로봇 정책에 어떻게 연결하나
- GUI 에이전트는 클릭 전에 다음 화면을 예측할 수 있나: Code2World
- 인간 영상 4만 4천 시간은 로봇 행동이 될 수 있나: DreamDojo
- 로봇이 미래 Frame을 맞히면 Action도 나아질까? LingBot-VA의 World Model
- LingBot-World의 16 FPS는 실시간 월드 모델을 뜻할까: 1초 지연과 장기 기억 점검
- 로봇이 목표까지의 중간 장면을 상상하면 왜 나아질까? Act2Goal의 MSTH