Sparsely gated tiny linear experts
Simon Schug
각 전문가를 단일 선형 뉴런으로 구성하고 희소 게이팅을 적용한 sgatlin 층이 트랜스포머 피드포워드 층을 대체하여 계산 효율성과 해석성을 동시에 향상시킨다.
기존 MoE 모델은 전문가가 여전히 크고 밀집되어 있어 희소성 증가의 이점을 충분히 활용하지 못하며, 비선형성으로 인해 해석이 어렵다.
각 전문가를 단일 뉴런(선형 변환)으로 축소하고, 수많은 전문가 중 극히 일부만 선택하는 희소 게이팅을 적용한다. 비선형 활성화 함수를 제거하여 전체 피드포워드 네트워크를 선형 결합으로 만든다.
동일 계산량 비교에서 sgatlin이 기존 트랜스포머 피드포워드 층보다 언어 모델 혼란도를 개선했다. 또한 선형성 덕분에 추가 모델 학습 없이도 피드포워드 회로를 해석할 수 있었으며, 의미적으로 구조화된 클러스터와 사실 회상에 인과적 역할을 확인했다.