VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving
Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman
VLGA는 자율주행 VLA 모델에 기하(geometry)를 네 번째 모달리티로 추가하여, LiDAR 포인트맵 복원을 통해 조밀한 3D 공간 이해를 학습하는 최초의 방법이다.
기존 VLA 모델은 언어적 추론은 가능하지만, 3D 공간에서의 행동 근거(grounding)가 부족하다. 3D 파운데이션 모델을 주입하거나 희소한 박스/맵 손실을 사용하는 방식은 정책이 기하 정보를 효과적으로 활용하도록 보장하지 못한다.
VLGA는 시각, 언어, 행동에 더해 기하(geometry)를 네 번째 모달리티로 도입한다. 전용 기하 전문가(geometry expert)를 설계하고, LiDAR로부터 얻은 픽셀 단위 포인트맵(pointmap) 회귀 손실로 학습하여 조밀한 공간 신호를 제공한다. 이를 통해 에이전트가 3D 세계를 재구성하도록 강제한다.
오픈루프 nuScenes에서 ego 상태 없이 VLA 방법 중 SOTA 달성 (L2 오차 0.50m, 3초 충돌률 0.18%). 폐루프 Bench2Drive에서 주행 점수 79.08로 기존 VLA 대비 +0.71 향상, 효율성과 승차감은 유지.