Reinforcement Learning for Reasoning in Large Language Models with One Training Example
Yiping Wang, Qing Yang, Zhiyuan Zeng, Liliang Ren, Lucas Liu, Baolin Peng, Hao Cheng, Xuehai He 외
단 하나의 학습 예제로 강화학습(1-shot RLVR)을 수행하여 LLM의 수학 추론 능력을 크게 향상시킬 수 있음을 보였다.
LLM의 수학 추론 능력을 향상시키기 위해 강화학습(RLVR)을 사용할 때, 일반적으로 수천 개의 학습 예제가 필요하다. 학습 예제 수를 극단적으로 줄여도 효과적인지, 그리고 그 메커니즘은 무엇인지 탐구한다.
Qwen2.5-Math-1.5B 모델에 대해 단 하나의 수학 문제 예제만을 사용하여 RLVR(verifiable reward를 이용한 강화학습)을 적용한다. GRPO와 PPO 알고리즘을 사용하며, 탐험을 촉진하기 위해 엔트로피 손실을 적절히 조절한다. 다양한 모델과 예제에 대해 실험하고, 성능 향상의 원인을 분석한다.
1-shot RLVR로 MATH500 정확도가 36.0%에서 73.6%로 향상되었고, 6개 수학 벤치마크 평균이 17.6%에서 35.7%로 향상되었다. 이는 1,200개 예제를 사용한 결과와 유사하다. 또한, 교차 카테고리 일반화, 자기 반성 빈도 증가, 훈련 정확도 포화 후에도 테스트 성능이 지속적으로 향상되는 현상(post-saturation generalization)을 발견했다. 정책 그래디언트 손실이 주요 원인임을 확인하고, 탐험의 중요성을 강조했다.