Massive Activations in Large Language Models
Mingjie Sun, Xinlei Chen, J. Kolter, Zhuang Liu
LLM의 일부 활성화 값이 다른 값보다 수만 배 크며, 이는 입력과 무관하게 일정한 편향으로 작용한다.
LLM의 내부 동작 원리를 이해하는 것은 여전히 어려운 문제다. 특히, 특정 뉴런이 극단적으로 큰 값을 가지는 현상이 관찰되었지만, 그 원인과 역할이 명확히 밝혀지지 않았다.
다양한 LLM(Llama, Mistral, GPT 등)에서 활성화 값을 분석하여 극단적으로 큰 값을 가지는 뉴런(대규모 활성화)을 식별하고, 이들의 위치와 특성을 조사했다. 또한, 이 값이 입력에 따라 변하는지, 그리고 어텐션 메커니즘에 어떤 영향을 미치는지 실험했다.
대규모 활성화는 대부분의 LLM에서 존재하며, 주로 특정 레이어의 특정 위치에 집중된다. 이 값은 입력과 무관하게 거의 일정하며, 편향으로 작용하여 어텐션 확률을 특정 토큰에 집중시키는 효과가 있다. 또한, 비전 트랜스포머에서도 유사한 현상을 확인했다. 이 발견은 LLM의 내부 메커니즘을 이해하는 데 중요한 통찰을 제공한다.