S$^2$COPE: Self-Supervised Concept Discovery via Preference Learning
Shilong Xiang, Zirui Zhang, Chengzhi Mao
레이블 없이 VLLM이 스스로 시각 개념을 가설·검증·강화하는 자기지도 학습 프레임워크.
자기지도 학습은 대규모 데이터에 확장 가능하지만 특징이 불투명하고, 해석 가능한 모델은 인간 주석에 의존해야 한다. 레이블 없이 해석 가능한 개념을 발견하는 방법이 필요하다.
VLLM을 정적 특징 추출기가 아닌 능동적 참여자로 활용하여, 원시 이미지에서 후보 시각 속성을 자율적으로 가설화하고 검증하며 강화하는 자기지도 선호 최적화 루프를 설계했다. 개념 발견을 VLLM 백본에 직접 분산시키는 자기지도 선호 목적 함수를 사용한다.
자연, 의학, 물리 도메인에서 표준 VLLM이 생성하지 못하는 도메인 특화 개념을 성공적으로 추출했다. 미분류 데이터에 대한 하위 분류 정확도에서 최대 24포인트 절대 향상을 달성했다. 해석 가능성이 인간 감독 없이 모델의 자율적 상호작용을 통해 출현할 수 있음을 보였다.