Human Universal Grasping
Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu, Billy Yan, Irmak Guzey, David Fouhey, Dandan Shan, Lerrel Pinto
인간의 일상적인 물건 잡기 데이터를 대규모로 수집하고, 플로우 매칭 모델로 다양한 인간 그립을 생성하여 로봇 손에 리타겟팅함으로써 제로샷 범용 그리핑을 달성했다.
다지 로봇 손은 인간처럼 다양한 물건을 자연스럽게 잡지 못한다. 기존 로봇 그리핑 방법은 특정 물체나 환경에 한정되거나, 인간의 자연스러운 그립 분포를 반영하지 못한다.
스마트 안경을 사용하여 41개 건물에서 6,707개 물체 인스턴스에 대한 100만 프레임(27.8시간)의 에고센트릭 인간 그립 데이터를 수집했다. RGB-D 이미지를 입력으로 받아 손목 위치, 회전, MANO 손 자세를 출력하는 플로우 매칭 모델을 학습했다. 생성된 그립은 다양한 로봇 손에 리타겟팅 가능하다. 평가를 위해 90개 물체로 구성된 HUG-Bench 시뮬레이션 벤치마크를 구축했다.
HUG는 기존 최첨단 그리핑 방법보다 23~34% 높은 성공률을 보였으며, 실제 로봇에서 제로샷으로 다양한 물체를 잡을 수 있음을 입증했다. 대규모 데이터셋과 벤치마크, 코드를 공개하여 범용 그리핑 연구를 촉진한다.