Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction
Jen-Hao Cheng, Yipeng Wang, Hao Zhang, Gengshan Yang, Jenq-Neng Hwang
Flex4DHuman은 단일 또는 희소 멀티뷰 동영상에서 상대 카메라 포즈 조건만으로 밀집 멀티뷰 동영상을 생성하고, 이를 4D 가우시안 스플랫으로 재구성하는 확산 모델이다.
동적인 인간을 4D로 재구성하려면 여러 시점의 동기화된 동영상이 필요하지만, 실제 환경에서는 단일 카메라나 소수의 카메라만으로 촬영하는 경우가 대부분이다. 기존 방법은 스켈레톤, 깊이 맵, 법선 맵 등 명시적 기하학적 사전 정보에 의존하거나, 특정 도메인에 한정되어 일반화가 어렵다.
Flex4DHuman은 Wan 2.1 1.3B 텍스트-투-비디오 모델을 기반으로, 상대 카메라 포즈를 5축 위치 인코딩(시공간 RoPE에 뷰 인덱스와 SE(3) 상대 기하학 추가)으로 조건화한다. 3단계 커리큘럼 학습(포즈 추종, 유연한 참조-타겟 뷰 생성, 시간적 롤아웃)을 통해 훈련되며, 시간적 롤아웃 시 깨끗한 과거 타겟 뷰 토큰을 사용한다. 또한 멀티뷰 캡션을 추가하여 테스트 시 텍스트 제어가 가능하다.
DNA-Rendering과 ActorsHQ 데이터셋에서 기존 최신 방법을 능가하는 성능을 보였으며, 인간-동물 혼합 훈련 후 동물 카테고리에도 일반화된다. 단일 동영상으로부터 4D 콘텐츠 생성을 가능하게 하여 시뮬레이션, 게임, AR/VR 등에 실용적으로 기여한다.