Reversible Foundations: Training a 120B Sparse MoE through State-Preserving Scaling
Rohan Shravan
단일 8-GPU 노드에서 120B 파라미터 희소 MoE 언어모델을 종단간 학습한 시스템 경험 보고서로, 가역성·상태 보존 성장·단일 노드 경제성 원칙을 제시한다.
초대규모 언어모델 학습은 수백 개의 GPU 클러스터가 필요하여 자원이 제한된 연구자에게 접근이 어렵다. 또한 모델 크기가 커질수록 활성화 메모리와 옵티마이저 상태 메모리가 급증하는 문제가 있다.
1) 가역성(Reversibility): 가변 순환 스택을 사용해 역전파 시 활성화를 재구성, 활성화 메모리를 모델 크기와 무관하게 일정하게 유지. 2) 상태 보존 성장(State-preserving growth): 밀집→MoE, 얕은→깊은, 적은 전문가→많은 전문가로 확장할 때 각 단계에서 이전 가중치를 보존하며 성장시키는 원칙과 실패 사례를 제시. 3) 단일 노드 경제성(Single-node economics): TQP(Quantized base expert weights + Trained low-rank adapters) 전략으로 전문가 경로의 옵티마이저 상태를 약 45배 절감.
120B 모델을 단일 8-GPU 노드에서 8K 컨텍스트로 학습, 최종 학습 손실 1.78 달성. 다국어(인도어) 및 코드 능력이 설계적으로 학습되었음을 도메인별 홀드아웃 손실로 입증. 모델군, 토크나이저, 학습 코드를 공개.