HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
Juncheng Ma, Jianxin Bi, Yufan Deng, Xuanran Zhai, Kewei Zhang, Ye Huang, Bo Liang, Shukai Gong 외
자기중심 인간 영상 데이터를 적절히 가공하면 실제 로봇 원격조작 데이터보다 체화 기반 모델 사전학습에 더 효과적임을 실험적으로 입증했다.
체화 기반 파운데이션 모델은 대규모 데이터로 학습해야 하지만, 실제 로봇 원격조작 데이터는 수집 비용이 높고 다양성이 부족하여 확장에 한계가 있다. 반면 자기중심 인간 영상은 저비용으로 대량 수집 가능하지만, 행동 레이블이 없어 사전학습 효과가 의문시되었다.
동일한 양의 자기중심 인간 영상과 원격조작 로봇 데이터를 사용하여 체화 모델을 사전학습하고, 동일한 파인튜닝 및 평가 프로토콜로 성능을 비교했다. 인간 영상에는 행동 레이블을 자동 생성하는 파이프라인을 적용했다.
자기중심 인간 영상으로 사전학습한 모델이 로봇 데이터로 학습한 모델보다 실제 로봇 행동 예측 검증 손실이 24% 낮았고, 분포 내 작업 성공률 52.5%, 분포 외 작업 성공률 90% 향상되었다. 이는 인간 영상 기반 사전학습 후 소량의 로봇 데이터로 적응하는 확장 가능한 패러다임을 제시한다.