EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
Rui Yang, Hanyang Chen, Junyu Zhang, Mark Zhao, Cheng Qian, Kangrui Wang, Qineng Wang, Teja Venkat Koripella 외
비전 기반 임베디드 에이전트의 멀티모달 LLM 성능을 종합 평가하는 벤치마크로, 4개 환경 1,128개 작업과 6개 능력 평가 세트를 제공한다.
멀티모달 LLM 기반 임베디드 에이전트는 언어 중심 에이전트에 비해 평가 체계가 부족하여 실제 성능과 한계를 파악하기 어렵다.
가정, 내비게이션, 조작 등 다양한 환경에서 고수준 의미 작업부터 저수준 원자적 행동까지 포괄하는 1,128개 테스트 작업을 설계하고, 상식 추론, 복잡한 명령 이해, 공간 인식, 시각 지각, 장기 계획 등 6가지 핵심 능력을 평가하는 세트를 구성했다.
24개 최신 MLLM 평가 결과, GPT-4o가 평균 28.9%로 최고 성능을 보였으나 저수준 조작에서 큰 어려움을 확인했다. 이 벤치마크는 MLLM 기반 임베디드 에이전트 연구의 표준 평가 플랫폼을 제공하며 향후 발전 방향에 대한 통찰을 제시한다.