S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu 외
S-Agent는 VLM을 의미론적 계획자로 삼고, 2D 객체 탐지 및 3D 리프팅 도구를 활용해 시공간적 증거를 축적함으로써 공간 지능을 향상시키는 에이전트 패러다임이다.
기존 VLM과 도구 증강 에이전트는 정적이고 상태가 없는 단일 시점 추론에 의존하여, 연속적이고 진화하는 3D 세계에서의 공간 지능을 제대로 처리하지 못한다.
S-Agent는 VLM을 의미론적 계획자로 사용하여 어떤 증거가 필요한지 결정하고, 계층적 공간 도구(2D 객체 탐지, 3D 리프팅, 공간 지식 집계)를 통해 증거를 축적한다. 또한 Scene Memory와 Agent Memory라는 시간적 메모리 메커니즘을 도입하여 여러 프레임과 추론 단계에 걸쳐 증거를 통합한다.
다중 시점 및 비디오 공간 추론 벤치마크에서 S-Agent는 오픈소스 및 폐쇄소스 VLM 모두를 훈련 없이 일관되게 개선한다. S-Agent 생성 궤적(300K)으로 미세 조정된 S-Agent-8B는 Qwen3-VL-8B 등 유사 규모 기준선을 크게 능가하고 GPT-5.4, Gemini 3와 비슷한 성능을 보인다.