STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
Haipeng Luo, Qingfeng Sun, Songli Wu, Can Xu, Wenfeng Deng, Han Hu, Yansong Tang
GRPO의 정책 엔트로피 붕괴 문제를 해결하기 위해 서프라이절 기반 토큰 수준 어드밴티지 재가중 방식을 제안한다.
GRPO와 같은 검증 가능한 보상 기반 RL 알고리즘은 훈련 중 정책 엔트로피가 붕괴되어 탐험 능력이 저하되는 문제를 겪는다. 이는 모델의 복잡한 추론 능력을 제한하는 주요 원인이다.
토큰 수준의 엔트로피 역학에 대한 1차 그래디언트 분석을 수행하여 어드밴티지-서프라이절 4사분면 구조와 임계 특성을 발견했다. 이를 바탕으로 배치 내 서프라이절 분위수를 사용해 엔트로피 임계 토큰을 식별하고, 해당 토큰들의 어드밴티지를 선택적으로 재가중하며, 목표 엔트로피 폐루프 게이트를 통합하는 STARE를 제안했다.
1.5B부터 32B까지의 다양한 모델 스케일과 세 가지 태스크 패밀리에서 STARE는 수천 단계에 걸쳐 안정적인 RL 훈련을 유지했다. AIME24와 AIME25에서 DAPO 및 다른 경쟁 기반선보다 평균 정확도가 4%-8% 높았으며, 반사 토큰과 응답 길이가 함께 증가하여 지속적인 탐험-활용 균형을 보여주었다.