Geometric Action Model for Robot Policy Learning
Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys 외
기하 기초 모델(GFM)을 공유 기반으로 삼아 언어 조건부 로봇 조작 정책을 학습하는 Geometric Action Model (GAM)을 제안한다.
기존의 VLA나 비디오 월드-액션 모델은 2D 이미지 프레임이나 2D 유래 잠재 공간에서 작동하여 접촉이 많은 조작에 필요한 3D 기하 정보를 명시적으로 다루지 못한다.
GAM은 사전 학습된 GFM을 중간 계층에서 분할하여, 얕은 계층은 관측 인코더로, 분할 지점에 삽입된 인과적 미래 예측기는 언어, 고유수용감각, 행동 이력을 조건으로 미래 잠재 토큰을 예측한다. 예측된 토큰은 나머지 GFM 블록을 통해 특징 전파 및 디코딩되어 단일 백본으로 미래 기하와 행동을 모두 생성한다.
시뮬레이션 및 실제 로봇 조작 벤치마크에서 GAM은 기존 기초 모델 규모의 기준선보다 더 정확하고, 강건하며, 빠르고, 가볍다.