From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
Chenchen Zhang
LLM 강화학습에서 희소 보상으로 인한 신용할당 문제를 추론 RL과 에이전트 RL 두 영역으로 나누어 47가지 방법을 체계적으로 분류한 서베이 논문.
LLM에 강화학습을 적용할 때, 긴 시퀀스(500~3만+ 토큰)나 다중 턴 환경(100턴 이상)에서 최종 보상만 주어지면 어떤 토큰이나 행동이 성공에 기여했는지 알기 어렵다. 이 신용할당 문제는 추론 RL(chain-of-thought 생성)과 에이전트 RL(환경 상호작용)에서 각각 다른 양상으로 나타난다.
2024~2026년 초까지 발표된 47개 신용할당 방법(41개 핵심, 6개 인접)을 수집하여 2차원 분류 체계로 정리했다. 첫 번째 축은 할당 세분성(토큰, 세그먼트, 단계, 턴, 멀티에이전트), 두 번째 축은 방법론(몬테카를로, 시간차, 모델 기반, 게임 이론, 정보 이론)이다. 추가로 기계 판독 가능한 논문 인벤토리, 보고 체크리스트, 벤치마크 프로토콜 명세를 제공한다.
추론 RL에서는 과정 보상 모델과 비평가 없는 그룹 비교 방식이 성숙해지고 있는 반면, 에이전트 RL에서는 사후 반사실 분석, 특권 비대칭 비평가, 턴 수준 MDP 재구성 등 새로운 접근이 등장하고 있음을 밝혔다. 체계적인 분류와 재사용 가능한 자원을 제공하여 향후 연구의 방법론적 격차를 메우는 데 기여한다.