Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors
Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li
동물 데이터 없이 생성형 AI를 활용해 사지 로봇의 다양하고 표현적인 동작을 자동 생성하고 실제 로봇에 배포하는 방법을 제시한다.
사지 로봇의 동작 데이터는 동물 관찰, 재구성, 모핑학적 변환에 의존하여 수집이 어렵고 한정적이다. 이로 인해 로봇의 동작 레퍼토리가 몇 가지 기본 보행법으로 제한되어, 풍부하고 표현적인 동작을 구현하기 어렵다.
동물 데이터를 제외하고 데이터 부족 문제를 생성 문제로 재정의한다. LLM이 동작 프롬프트를 제안하고, 비디오 확산 모델이 해당 로봇 동작을 합성한다. 합성된 비디오에서 3D 참조 궤적을 추출하기 위해 프레임 간 일관성을 강제하는 Identity Consistency Loss를 도입한다. 추출된 궤적으로 추적 정책을 학습하여 실제 로봇에 배포한다.
7,488개의 언어 주석이 달린 사지 로봇 동작 데이터셋(Quad-Imaginarium)을 공개했다. 실제 유닛리 고2 로봇에서 무작위로 샘플링한 392개 동작을 검증하여 96.7%의 배포 성공률을 달성했으며, 시뮬레이션에서는 전체 데이터셋에 대해 97.6%의 성공률을 보였다. 이는 동물 데이터 없이도 풍부한 로봇 동작을 생성하고 배포할 수 있는 새로운 가능성을 제시한다.