Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling
Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou 외
강화학습(RL) 훈련에서 롤아웃 병목을 해결하기 위해 다중토큰예측(MTP)과 리젝션 샘플링을 결합한 Bebop 방법을 제안하며, 엔트로피 기반 수용률 한계를 극복하고 최대 1.8배 가속을 달성했다.
LLM 후반 훈련(post-training)에서 RL은 중요한 역할을 하지만, 롤아웃(rollout) 단계가 전체 파이프라인의 주요 병목이다. MTP를 통한 추측 디코딩이 해결책으로 제시되었으나, RL 훈련 중 모델 엔트로피 변화로 인해 수용률이 크게 떨어져 속도 향상이 제한적이다.
수학 추론, 코드 생성, 에이전트 태스크에서 수용률을 최대 95%까지 향상시키고, 추가 처리량 25%를 얻었다. Qwen3.5, Qwen3.6, Qwen3.7 모델의 비동기 RL 훈련에서 최대 1.8배 종단간 가속을 달성했다. 엔트로피와 수용률의 관계를 체계적으로 분석하고, 실용적인 통합 레시피를 제공했다.