RATS! Patches Talk Through Registers: Emergent Parts in Register Attention Transformers
Timing Yang, Predrag Neskovic, Jansen Seheult, Wenchao Han, Anand Bhattad, Alan Yuille, Feng Wang
RATS는 레지스터 토큰과 3단계 주의 메커니즘을 도입하여, 별도의 지도 없이도 각 레지스터가 객체의 의미 있는 부위를 자발적으로 학습하는 비전 트랜스포머 모델이다.
기존 비전 트랜스포머는 분류 토큰 하나로 전체 이미지를 표현하여 객체의 부위별 구조를 학습하지 못하고, 해석 가능성이 부족하다. 객체의 구성적 구조(부위)를 자발적으로 발견할 수 있는 방법이 필요하다.
분류 토큰을 N개의 학습 가능한 레지스터 토큰으로 대체하고, L→N→N→L의 병목 구조를 통해 패치 정보를 압축-통신-방송한다. N개의 레지스터는 H개의 어텐션 헤드에 분할되어, 다른 헤드의 레지스터끼리는 상호작용하지 않는다. 별도의 손실 함수나 부위 주석 없이도 각 레지스터가 특정 객체 부위에 특화되도록 유도한다.
다섯 개의 분할 벤치마크에서 평균 +12 mIoU로 모든 베이스라인을 능가했으며, ADE20K에서 +1.11 mIoU, COCO에서 +0.2 AP^m의 일관된 성능 향상을 보였다. 레지스터 사전은 부위 수준의 일관성과 관련 카테고리 간 의미적 근접성을 나타내어, 구조화되고 해석 가능한 시각적 표현 학습을 위한 유용한 아키텍처 사전을 제공한다.