Self-Evolving World Models for LLM Agent Planning
Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng
LLM 에이전트의 장기 계획 성능을 높이기 위해, 테스트 시간에 예측 오차를 기반으로 자체적으로 맥락을 개선하는 월드 모델 프레임워크를 제안한다.
월드 모델은 에이전트에게 미래를 예측해 주어 장기 계획을 돕지만, 예측이 불확실하거나 잘못되면 에이전트의 의사결정을 오히려 저해할 수 있다. 기존의 정적 월드 모델은 새로운 환경이나 예측 오차에 적응하지 못하는 한계가 있다.
WorldEvolver는 세 가지 모듈을 통해 배포 시점에 월드 모델의 맥락을 자기 진화시킨다. (1) 에피소드 기억: 실제 행동 전이를 기반으로 한 검색 기반 시뮬레이션을 활용한다. (2) 의미 기억: 예측과 관찰의 불일치에서 지속적인 휴리스틱 규칙을 추출한다. (3) 선택적 전망: 에이전트의 추론 컨텍스트에 통합하기 전에 신뢰도가 낮은 예측을 필터링한다. 핵심은 에이전트와 모든 모델 파라미터를 고정한 상태로 월드 모델의 맥락만 업데이트하는 것이다.
ALFWorld와 ScienceWorld 환경에서의 실험 결과, WorldEvolver는 세 가지 기본 모델 모두에서 가장 높은 예측 정확도를 달성했으며, 하류 에이전트 성공률에서도 다른 월드 모델 기반선들을 능가했다. 이는 테스트 시간의 기억 수정이 예측 충실도와 계획 성능을 모두 향상시킬 수 있음을 보여준다.