Towards Robustness against Typographic Attack with Training-free Concept Localization
Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang
CLIP 모델의 서체 공격 취약성을 메커니즘적으로 해석하고, 학습 없이 특정 회로를 개입하여 강건성을 크게 향상시키는 방법을 제안합니다.
CLIP과 같은 비전-언어 모델은 이미지 내의 불필요한 텍스트에 의해 시각적 표현이 텍스트의 어휘적 의미로 왜곡되는 '서체 공격(Typographic Attack)'에 취약합니다. 이 문제는 자율주행 등 안전이 중요한 응용 분야에서 심각한 위험을 초래할 수 있으며, 기존 방어 방법들은 해석 가능성이나 효과성 측면에서 한계가 있었습니다.
제안된 방법은 학습이 필요 없는 메커니즘 해석 기반 접근법입니다. 먼저, 샘플링 기반 해석을 통해 숨겨진 상태 표현을 분석하고, 각 어텐션 헤드가 의미적 초점과 어휘적 초점 중 어느 쪽에 더 기여하는지 정량적으로 귀속합니다. 확률적 분석과 회로 마이닝을 통해 어휘 정보를 과도하게 인코딩하는 비전 트랜스포머(ViT)의 특정 구성 요소를 격리합니다. 마지막으로, 이 Identified된 회로에 어텐션 가중치 선택적 조정과 같은 간단한 개입을 적용하여 방어를 수행합니다.
실험 결과, 제안된 개입은 추가 학습 없이도 객체 분류 과제에서 서체 공격에 대한 강건성을 크게 향상시켰습니다. 또한, 지도 학습 기반 및 학습 없는 기존 방어 방법들보다 우수한 성능을 보였습니다. RIO-Bench에서 최신 대형 비전 언어 모델(LVLMs)의 비전 인코더에 해당 개입을 적용했을 때, 서체 공격 간섭 하에서 시각적 질문 답변(VQA) 정확도가 크게 향상되어 방법의 효과성과 일반화 가능성을 입증했습니다.