ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models
Aaron Defazio
스케줄 프리 학습을 대규모 LLM 학습에 적용하기 위한 확장 방법과 그 효과를 제시한다.
스케줄 프리 학습은 다양한 벤치마크에서 성과를 보였으나, 대규모 언어 모델 학습에서는 소규모에서만 강력한 성능이 입증되었다. 더 큰 배치 크기와 모델 크기로의 확장이 필요하다.
대규모 학습에 필요한 수정 사항들을 식별하고, 학습률과 스케줄 모두에 의존하지 않는 ScheduleFree+ 방법을 제안한다. 모델 평균 및 체크포인트 병합의 이론적 근거도 제공한다.
제안된 방법은 기존의 Warmup-Stable-Decay(WSD) 스케줄을 크게 능가한다. 특히 1000 토큰/파라미터의 장기 학습에서 최신 기존 스케줄보다 31% 성능이 향상되었다. 이는 사전 학습 중 모델 평균 및 체크포인트 병합 사용의 이론적 기반을 제공한다.