RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
로봇 조작을 위해 장면의 시각적, 기하학적, 시간적 역학을 통합적으로 예측하는 4D 생성 모델과 그 기반의 정책 학습 프레임워크를 제안한다.
오픈 월드 로봇 조작은 장면의 시각적 정보뿐만 아니라, 상호작용에 따른 3D 구조의 동적 변화를 예측해야 한다. 기존 2D 비디오 기반 접근법은 로봇의 저수준 엔드이펙터 행동과의 괴리를 해소하기 어렵다.
동기화된 RGB, 깊이, 옵티컬 플로우(RGB-DF)를 물리적으로 근거가 있는 4D 표현으로 활용한다. 단일 RGB-D 이미지와 언어 지시로부터 미래 프레임을 생성하는 통합 확산 과정을 사용하는 RynnWorld-4D를 설계하고, 대규모 4D 데이터셋(Rynn4DDataset 1.0)을 구축한다. 또한, 생성 모델의 내부 4D 표현을 직접 활용해 로봇 행동을 출력하는 역동학 정책(RynnWorld-4D-Policy)을 제안한다.
제안된 모델은 시간적, 공간적으로 일관된 4D 예측을 생성하며, 역동학 정책은 실제 세계의 정교한 양손 조작 과제에서 최신 성능을 달성한다. 특히 공간적 정밀도와 시간적 조율이 중요한 과제에서 뛰어난 성능을 보여, 월드 예측과 정책 학습 사이의 격차를 줄이는 데 기여한다.