T-Rex: Tactile-Reactive Dexterous Manipulation
Dantong Niu, Zhuoyang Liu, Zekai Wang, Boning Shao, Zhao-Heng Yin, Anirudh Pai, Yuvan Sharma, Stefano Saravalle 외
촉각 신호를 실시간으로 반영하는 로봇 손 조작 정책을 위해, 대규모 촉각 데이터셋과 가변 속도 Mixture-of-Transformers 아키텍처를 제안하여 기존 VLA 모델의 한계를 극복하고 12가지 과제에서 30% 이상 성능 향상을 달성했다.
로봇의 손재주 있는 조작을 위해서는 촉각 신호에 동적으로 반응하는 능력이 필수적이지만, 기존의 VLA 모델은 촉각 데이터 부족, 표준 평가 부재, VLA 모델의 구조적 한계, 정적 촉각 인코더의 한계로 인해 촉각 양식을 간과하거나 정적 단서에만 의존했다.
1) 기본 운동 프리미티브를 우선시하는 데이터 효율적인 수집 방법을 통해 100시간 규모의 촉각 풍부 데이터셋을 구축했다. 2) 고주파 촉각 신호를 효과적으로 활용하면서 기존 VLA의 능력을 유지하기 위해, 새로운 시간적 촉각 VQ-VAE 인코더와 가변 속도 Mixture-of-Transformers (MoT) 아키텍처를 도입했다.
미세 힘 제어와 변형체 조작이 필요한 12가지 조작 과제에서, 제안 방법은 가장 강력한 기준선보다 평균 성공률이 30% 이상 높았다. 이는 촉각 반응형 조작의 새로운 기준을 제시하며, 로봇 손재주 연구에 중요한 진전을 이룬다.