Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games
Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang
멀티모달 LLM이 과거 관찰을 기억하고 이를 바탕으로 행동해야 하는 비마르코프 게임 환경에서의 성능을 평가하는 벤치마크 RNG-Bench를 제안한다.
기존 벤치마크는 전체 상태를 노출하거나, 은닉 상태 재구성을 다른 능력과 혼동하거나, 에피소드 종료 후 회상만 테스트한다. 실제 배포 환경에서는 에이전트가 더 이상 보이지 않는 관찰을 조건으로 행동해야 하는 경우가 많다.
RNG-Bench는 두 가지 보완 게임(Matching Pairs, 3D Maze)을 포함하며, 세 가지 난이도 축(그리드 크기, 시각 패턴, 관찰 양식)을 제어한다. 또한 인스턴스 수준 변동을 통제하기 위한 1:1 결투 프로토콜과 망각과 행동 선택 오류를 분리하는 Memory Gap 메트릭을 도입한다.
가장 어려운 설정은 에피소드당 약 128K 토큰과 350개 이미지 입력을 필요로 하며, 최첨단 MLLM도 포화 상태와 거리가 멀다. Memory Gap 분석은 대부분의 잔여 오류가 최적이 아닌 의사 결정보다는 초기 관찰 망각에서 비롯됨을 보여준다. Qwen3.5-9B를 최적 정책 롤아웃과 필터링된 모델 시연으로 미세 조정하면 RNG-Bench 성능이 향상되고 일반 멀티모달 능력을 저하시키지 않으면서 기존 벤치마크로 전이된다.