REINFORCE++: A Simple and Efficient Approach for Aligning Large Language Models
Jian Hu
REINFORCE++는 REINFORCE 알고리즘을 간단히 개선하여 PPO 수준의 성능을 내면서도 구현이 훨씬 간단하고 효율적인 LLM 정렬 방법이다.
LLM을 인간의 선호에 맞게 정렬하는 과정에서 PPO(Proximal Policy Optimization)가 널리 사용되지만, 구현이 복잡하고 여러 하이퍼파라미터에 민감하며 계산 비용이 높다. 반면 REINFORCE 알고리즘은 단순하지만 성능이 떨어지고 학습이 불안정하다. 따라서 간단하면서도 효과적인 정렬 방법이 필요하다.
REINFORCE++는 기본 REINFORCE 알고리즘에 세 가지 주요 개선을 적용한다: (1) 보상 정규화(reward normalization)로 학습 안정성 향상, (2) 토큰 단위 보상(token-level reward)으로 미세한 피드백 제공, (3) 학습률 코사인 스케줄링(cosine learning rate scheduling)으로 수렴 개선. 이러한 수정은 PPO의 복잡한 클리핑(clipping)이나 KL 페널티 없이도 PPO와 유사한 성능을 달성하게 한다.
다양한 LLM 정렬 벤치마크(예: Anthropic Helpful, Harmless, TL;DR 요약)에서 REINFORCE++는 PPO와 동등하거나 더 나은 성능을 보였으며, 학습 속도는 최대 2배 빠르고 메모리 사용량은 30% 적었다. 이 방법은 구현이 간단하여 연구자들이 쉽게 채택할 수 있으며, LLM 정렬 연구의 진입 장벽을 낮춘다.