한줄 요약
희소 오토인코더의 해석 가능성을 인간 주석 기반으로 정량 평가하는 프레임워크와 벤치마크를 제안합니다.
풀어야 하는 문제
희소 오토인코더(SAE)는 비전 및 비전-언어 모델에서 해석 가능한 개념을 추출하는 데 널리 사용되지만, 기존의 평가 방법은 주로 대리 지표나 정성적 검토에 의존하여 의미적 대응을 직접 측정하지 못합니다.
접근 방법
human-grounded evaluation framework: SAE 잠재 변수와 인간 주석 개념 간의 정렬을 정량화하는 프레임워크를 제시합니다.
synCUB 및 synCOCO 벤치마크: 정확히 하나의 속성이 다른 쌍 이미지로 구성된 합성 벤치마크를 구축하여 개입 스타일의 평가를 가능하게 합니다.
Fully-Binary Matching Pursuit (FBMP): SAE 잠재 변수와 주석된 개념 간의 many-to-one 매핑을 지원하는 연합 기반 매칭 절차를 도입합니다.
Targeted Attribute Perturbation Alignment Score (TAPAScore): 매칭된 개념이 이미지 수준의 속성 개입 하에서 선택적으로 그리고 예상 방향으로 반응하는지 테스트하는 기능적 검증 점수를 제안합니다.
결과·기여
FBMP는 one-to-one 기반선보다 일관되게 성능이 뛰어납니다.
TAPAScore와 매칭 절차는 훈련된 SAE와 훈련되지 않은 SAE를 신뢰성 있게 구별하는 유일한 평가 지표입니다.
CLIP 및 DINOv2 임베딩으로 훈련된 SAE들에서, 과도한 완전성(overcompleteness) 증가가 개입 정렬을 감소시켜 해석 가능성을 저하시킬 수 있음을 발견했습니다.
연구 결과, 적당한 사전 크기가 최상의 균형을 제공하여 가장 해석 가능한 SAE를 산출합니다.