Gaze Heads: How VLMs Look at What They Describe
Rohit Gandikota, David Bau
VLM이 이미지를 설명할 때 언어 모델 백본의 소수 주의 집중 헤드(gaze heads)가 현재 설명 중인 이미지 영역을 추적하며, 이 헤드들을 조작하면 설명 대상을 원하는 영역으로 강제로 전환할 수 있다.
VLM이 이미지를 설명할 때 내부적으로 어떤 메커니즘으로 이미지 영역과 언어 생성을 연결하는지 알려져 있지 않다. 또한, 학습 없이 추론 시 모델의 주의를 원하는 영역으로 제어할 수 있는 방법이 필요하다.
만화 스트립(comic strips)을 통제된 테스트베드로 사용하여, VLM의 언어 모델 백본에서 주의 집중 헤드의 패턴을 분석한다. 간단한 상관 점수(correlation score)로 소수의 gaze heads를 식별하고, 이 헤드들의 주의를 원하는 영역으로 리디렉션하는 단일 주의 마스크 개입(attention-mask intervention)을 수행한다.
상위 100개 gaze heads(전체 헤드의 9% 미만)에 대한 개입으로 만화 패널 선택 정확도 83.1% 달성. 무작위 헤드 개입은 실패하고 모든 헤드 개입은 생성을 망가뜨림. 생성 중간에 gaze target을 전환하면 몇 토큰 내에 설명이 전환됨. COCO 자연 이미지에서도 동작하며, 2B~32B 모델 및 다른 VLM 아키텍처에서도 재현됨. 메커니즘 분석을 통한 표적 개입이 재학습 없이 멀티모달 모델 행동 제어에 실용적임을 보임.