Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces
Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao 외
실제 인간 행동 데이터를 기반으로 장기·교차 시나리오·이질적 행동을 통합한 최초의 사용자 시뮬레이션 벤치마크를 구축하고, 현재 LLM이 현실적인 행동 시뮬레이션에 실패함을 실증적으로 보여준다.
기존 사용자 시뮬레이션 벤치마크는 단일 시나리오, 좁은 행동 공간, 합성 데이터에 국한되어 실제 인간 행동의 전체적 특성(장기적 인과 관계, 교차 시나리오 의사결정, 개인차 등)을 포착하지 못한다.
실세계 데이터(실제 사용자 행동 로그)를 수집하여 장기적(최대 30일 이상), 교차 시나리오(여러 앱/서비스에 걸친 행동), 이질적(다양한 행동 유형) 패턴을 포함하는 벤치마크 OmniBehavior를 구축한다. 최신 LLM(GPT-4, Claude 등)을 대상으로 시뮬레이션 정확도를 평가하고, 실제 행동과 시뮬레이션 행동을 체계적으로 비교 분석한다.
LLM은 장기적·교차 시나리오 행동 시뮬레이션에서 성능이 정체되며, 긍정적 편향(과잉 활동, 개인성 동질화, 유토피아 편향)을 보여 개인차와 롱테일 행동을 상실한다. 이는 고충실도 시뮬레이션 연구의 방향성을 제시한다.