Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
Weixu Zhang, Ye Yuan, Chang-Gyoung Han, Yuxing Tian, Zipeng Sun, Linfeng Du, Jikun Kang, Hong Kang 외
LLM의 주의집중 헤드 중 사용자 선호를 담당하는 '선호 헤드'를 식별하고, 이를 활용해 훈련 없이 추론 시점에서 개인화를 제어하는 방법(DPS)을 제안한다.
기존 LLM 개인화 방법은 프롬프트 엔지니어링이나 파인튜닝에 의존하여 블랙박스처럼 동작하며, 개인화가 모델 내부에서 어떻게 일어나는지에 대한 이해가 부족하다. 또한, 계산 비용이 크거나 해석 가능성이 낮다.
저자는 LLM 내부에 사용자별 스타일 및 주제 선호를 인코딩하는 희소한 주의집중 헤드 집합(Preference Heads)이 존재한다고 가정한다. DPS는 (1) 인과적 마스킹 분석을 통해 선호 헤드를 식별하고, (2) 디코딩 시 선호 헤드의 유무에 따른 예측 차이를 증폭하여 선호에 맞는 출력을 강화한다. 각 헤드의 선호 기여도(PCS)를 계산하여 개인화에 미치는 인과적 영향을 측정한다.
여러 LLM과 개인화 벤치마크에서 DPS는 개인화 충실도를 일관되게 향상시켰으며, 내용 일관성과 낮은 계산 오버헤드를 유지했다. 또한, 트랜스포머 아키텍처 내에서 개인화가 어디서 어떻게 발생하는지에 대한 메커니즘적 설명을 제공하여 해석 가능성을 높였다.