Knowledge Distillation for Large Language Models
A. Torre, Barbara M. Flores, Diego Rodríguez
지식 증류와 사고사슬 강화학습을 결합하여 대규모 언어 모델을 효율적으로 압축하는 방법을 제안하며, 소형 모델이 교사 모델의 성능을 대부분 유지함을 보였다.
대규모 언어 모델은 뛰어난 성능을 보이지만 막대한 계산 자원과 메모리를 필요로 하여 자원 제약 환경에서 배포가 어렵다. 기존 지식 증류만으로는 복잡한 추론 능력을 충분히 전수하지 못하는 한계가 있다.
Qwen 3B를 교사, Qwen 0.5B를 학생으로 사용하여 영어 Dolly-15k, 스페인어 Dolly-15k, 코드 BugNet 및 PyTorrent 데이터셋에서 지식 증류를 수행한다. 또한 코드 작업을 위해 Codeforces 데이터에 사고사슬 주석을 추가하고 Group Relative Policy Optimization을 적용한 강화학습을 통합하여 추론 일관성과 정답률을 향상시킨다. 이후 4비트 가중치 양자화로 메모리와 추론 지연 시간을 추가 감소시킨다.
영어 작업에서 교사 대비 70~91% 성능 유지, 스페인어에서 최대 95%, 코드에서 Rouge-L 기준 최대 93.5%를 달성했다. 사고사슬 강화학습을 결합한 코드 작업은 지식 증류만 사용한 경우보다 더 나은 추론 일관성과 정답률을 보였다. 제안된 프레임워크는 자원 제약 환경에서도 실용적인 소형 모델을 제공한다.