Native Active Perception as Reasoning for Omni-Modal Understanding
Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu 외
긴 영상 이해를 위해 모든 프레임을 균일하게 처리하는 기존의 비관습적 패러다임의 비효율성을 해결하기 위해, 오디오-비주얼 단서를 선택적으로 추출하는 오니모달 에이전트 OmniAgent를 제안한다.
기존의 긴 영상 이해 모델은 '모두 보는' 패러다임에 의존하여 영상 길이가 증가함에 따라 계산 비용이 비례적으로 증가하는 문제가 있다. 상호작용 프레임워크가 등장했음에도, 전역 사전 스캔에 의존하거나 컨텍스트 비용이 영상 길이에 비례하여 증가하는 한계가 있다.
OmniAgent는 영상 이해를 POMDP 기반의 관찰-사고-행동 순환으로 공식화한다. 온디맨드 행동을 통해 오디오-비주얼 단서를 선택적으로 텍스트 메모리로 증류하여 영상 길이와 추론 복잡도를 효과적으로 분리한다. 이를 위해 에이전트 지도 학습 미세조와 TAURA를 활용한 에이전트 강화학습을 도입한다.
10개의 벤치마크에서 최신 성능을 달성했으며, 특히 LVBench에서 7B 모델이 10배 더 큰 Qwen2.5-VL-72B를 능가했다. 추론 턴 수가 증가할 때 성능이 향상되는 긍정적인 테스트 시트 스케일링을 보여주어 능동적 인식의 효용성을 검증했다.