Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
Fengli Xu, Qianyue Hao, Zefang Zong, Jingwei Wang, Yunke Zhang, Jingyi Wang, Xiaochong Lan, Jiahui Gong 외
LLM의 추론 능력을 강화학습으로 향상시키는 방법론을 체계적으로 정리한 서베이 논문.
기존 LLM은 단순 자회귀 생성에 의존하여 복잡한 추론 작업에서 한계를 보임. 사람처럼 중간 사고 과정을 생성하고, 시행착오를 통해 학습하며, 테스트 시간에 더 많은 연산을 투입하여 정확도를 높이는 방법이 필요.
강화학습을 활용한 추론 학습(learning-to-reason) 패러다임을 중심으로, 자동 데이터 구축, 학습 기반 추론 기술(트리 탐색, 반성적 사고 등), 테스트 시간 스케일링(scaling)의 세 가지 주요 기술 축을 분석. OpenAI o1 시리즈를 대표 사례로 제시.
LLM 추론 연구의 전반적인 흐름을 체계적으로 정리하고, 대규모 추론 모델(Large Reasoning Model)로의 발전 방향을 제시. 자동 데이터 생성과 RL 기반 학습, 테스트 시간 스케일링의 결합이 추론 성능 향상에 핵심임을 강조.