CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy
Ria Doshi, Tian Gao, Annie Chen, Chelsea Finn, Jeannette Bohg
CHORUS는 단일 VLA(Vision-Language-Action) 백본을 다양한 로봇 팀에 적용하여, 각 로봇이 자신의 관찰만으로 분산 협업을 가능하게 하는 프레임워크다.
다중 로봇 협업에서 중앙 집중식 방법은 팀 규모에 따라 확장성이 떨어지고, 분산 방식은 각 로봇마다 별도 정책을 학습해야 하며 추론 시 명시적 정렬이나 정보 공유가 필요해 실용성이 낮다.
사전 훈련된 VLA 모델의 시각-운동 사전 지식을 활용하여, 각 로봇이 자신의 로컬 관찰과 로봇 식별 프롬프트만으로 협업 행동을 생성하도록 한다. 단일 VLA 백본을 공유하며, 추론 시 각 로봇이 독립적으로 CHORUS를 실행한다.
실제 환경에서 테이프 측정, 책 전달, 세탁바구니 들기 등 다양한 작업에서 처음부터 학습한 분산 모델 대비 64% 성공률 향상, 팀원 행동에 대한 반응성 40% 포인트 개선, 중앙 집중식 기준선보다도 우수한 성능을 보였다. 이는 단일 VLA 백본으로 분산 다중 로봇 협업이 가능함을 입증했다.