AssemLM: Spatial Reasoning Multimodal Large Language Models for Robotic Assembly
Zhi Jing, Jinbin Qiao, Ouyang Lu, Jicong Ao, Shuang Qiu, Yu-Gang Jiang, Chenjia Bai
AssemLM은 로봇 조립을 위해 3D 공간 추론을 가능하게 하는 다중모달 거대 언어 모델로, 조립 매뉴얼과 포인트 클라우드를 활용해 6D 자세를 예측한다.
기존 비전-언어 모델은 2D 인식에 의존하여 3D 기하학적 추론이 부족하고, 로봇 조립과 같은 정밀한 작업에 필요한 6D 자세 추론이 어렵다.
AssemLM은 포인트 클라우드 인코더를 통해 세밀한 기하학적 및 회전 특징을 추출하고, 이를 다중모달 언어 모델에 통합하여 3D 공간 추론을 수행한다. 또한 90만 개 이상의 샘플을 포함한 AssemBench 데이터셋을 구축하여 학습 및 평가를 진행한다.
다양한 조립 시나리오에서 6D 자세 추론 최고 성능을 달성했으며, 실제 로봇 실험에서도 정밀하고 다단계 조립을 성공적으로 수행하여 로봇 조립 응용 가능성을 입증했다.