Explaining Attention with Program Synthesis
Amiri Hayes, Belinda Li, Jacob Andreas
트랜스포머 언어 모델의 어텐션 헤드를 파이썬 프로그램으로 합성하여 해석하는 방법을 제안한다.
딥러닝 모델의 내부 동작을 이해하기 어렵다. 특히 트랜스포머의 어텐션 헤드는 중요하지만 해석이 어렵다.
1) 각 어텐션 헤드에 대해 입력 문장과 어텐션 행렬을 수집한다. 2) 사전 학습된 언어 모델에 이 정보를 요약하여 입력하고, 어텐션 패턴을 재현하는 파이썬 프로그램을 생성하도록 프롬프트한다. 3) 생성된 프로그램 중 검증 데이터에서 가장 잘 동작하는 프로그램을 선택한다.
GPT-2, TinyLlama-1.1B, Llama-3B에서 1000개 미만의 프로그램으로 어텐션 패턴을 75% 이상의 IoU로 재현했다. 25%의 헤드를 프로그램으로 대체해도 perplexity 증가가 16%에 불과하고, QA 벤치마크 성능도 유지되었다.