Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
Jie Zhang, Xiaoyue Chen, Anzhe Chen, Chenxu Lv, Deqing Li, Gengze Zhou, Hang Yin, Haoqi Yuan 외
Qwen-RobotWorld는 자연어를 행동 명령으로 받아 로봇 조작, 자율주행, 실내 내비게이션, 인간-로봇 전이 등 다양한 임베디드 태스크의 미래 시각 궤적을 생성하는 통합 비디오 세계 모델이다.
기존 임베디드 세계 모델은 특정 태스크나 도메인에 국한되어 일반화가 어렵고, 자연어를 통한 유연한 제어가 부족했다. 또한 정책 학습을 위한 합성 데이터 생성, 평가 환경 구축, 계획 신호 제공 등 다양한 응용을 하나의 모델로 통합하는 것이 과제였다.
1) Double-Stream MMDiT with MLLM Action Encoding: 60층 이중 스트림 확산 트랜스포머로, 고정된 Qwen2.5-VL 시맨틱과 비디오 VAE 잠재 변수를 층별 공동 어텐션으로 결합한다. 2) Embodied World Knowledge (EWK): 20개 이상의 임베디드 플랫폼과 500개 이상의 행동 카테고리를 포함한 860만 개 비디오-텍스트 코퍼스(2억+ 프레임)를 구축하여 행동-언어 매핑을 학습한다. 3) General+Expert Progressive Curriculum: 2단계 훈련 전략으로, 먼저 일반 시각 사전 지식을 학습하고 이후 공유 언어 인터페이스 하에 임베디드 특화 지식을 주입한다.
EWMBench와 DreamGen Bench에서 종합 1위, WorldModelBench와 PBench에서 모든 오픈소스 모델을 능가했다. RoboTwin-IF 벤치마크에서 제로샷 분석을 통해 강건한 일반화와 다중 뷰 일관성을 입증했다. 합성 데이터 생성, 가상 환경 평가, 언어 기반 계획 신호 등 세 가지 응용 방향을 제시하여 임베디드 AI의 확장성을 크게 높였다.