AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition
Jixuan Chen, Jianzhi Shen, Haoqiang Kang, Zhi Hong, Qingyi Jiang, Soham Bose, Yiming Zhang, Leon Leng 외
AgentSpec은 LLM 에이전트의 스캐폴드를 구성하는 모듈(지각, 기억, 추론, 반성, 행동, 학습)을 표준 인터페이스로 분리하고, 이를 조립·교체하며 통제된 실험을 가능하게 하는 프레임워크다.
현재 LLM 에이전트는 다양한 모듈이 밀접하게 결합된 파이프라인으로 구현되어, 각 구성 요소의 기여도를 분리하거나 대안 설계를 비교하기 어렵다. 모듈 간 상호작용이 에이전트 행동에 미치는 영향을 체계적으로 분석할 방법이 부족하다.
AgentSpec은 각 모듈의 입출력 인터페이스를 표준화하고, 타입 시스템을 도입하여 모듈 간 호환성을 검증한다. DeliveryBench, ALFRED, MiniGrid, RoboTHOR 등 다양한 환경에서 추론, 기억, 반성, 강화학습 모듈을 백본 모델별로 교체하며 실험을 수행한다.
에이전트 성능은 개별 모듈의 강점보다 모듈 간 호환성과 상호작용 효과에 의해 결정된다. 다중 세분화 기억 구조는 장기 상태 추적을 개선하고, 추론과 기억은 환경에 따라 비균일하게 상호작용하며, 반성은 정확도와 비용 사이의 트레이드오프를 보인다. RL 정책은 배포 시 스캐폴드 구조에 맞춰 최적화될 때 가장 좋은 성능을 낸다.