ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
Xin Men, Mingyu Xu, Qingyu Zhang, Bingning Wang, Hongyu Lin, Yaojie Lu, Xianpei Han, Weipeng Chen
LLM의 많은 층이 중복되어 BI 점수 기반 층 제거만으로도 효과적인 모델 경량화가 가능함을 보인 연구.
LLM의 크기가 급격히 증가하면서 추론 비용과 메모리 요구량이 커졌다. 기존 가지치기 방법은 복잡한 구조나 미세 조정이 필요하며, 층 단위의 중복성에 대한 체계적 분석이 부족했다.
여러 LLM의 층 간 유사성을 분석하여 많은 층이 유사하고 일부 층은 영향력이 거의 없음을 발견했다. Block Influence(BI) 지표를 정의하여 각 층의 중요도를 측정하고, BI 점수가 낮은 층을 순차적으로 제거하는 ShortGPT를 제안했다. 추가 학습이나 복잡한 재구성 없이 단순 제거만 수행한다.
ShortGPT는 LLaMA, OPT 등 다양한 LLM에서 기존 SOTA 가지치기 방법보다 우수한 성능을 보였다. 양자화와 직교하여 적용 가능하며, 단순 층 제거가 복잡한 방법보다 효과적임을 입증하여 LLM 아키텍처의 높은 중복성을 시사한다.