FaceMoE: Mixture of Experts for Low-Resolution Face Recognition
Kartik Narayan, Vishal M. Patel
저해상도 얼굴 인식의 도메인 간 격차와 재앙적 망각 문제를 해결하기 위해 전문가 혼합(MoE) 아키텍처를 처음으로 도입한 연구이다.
저해상도 얼굴 인식은 블러, 가림, 저대비 등 열화로 인해 특징 추출과 집계가 어렵다. 또한 고해상도 갤러리 이미지와 저해상도 프로브 이미지 간의 도메인 격차가 크며, 단일 특징 인코더는 저해상도 데이터셋으로 미세 조정 시 두 도메인에 걸쳐 효과적으로 일반화하기 어렵고 재앙적 망각 문제가 발생한다.
저해상도 얼굴 인식을 위해 MoE 트랜스포머 아키텍처를 도입한다. 여러 전문가 피드포워드 네트워크(FFN)와 상위-k 라우터를 사용하여 토큰을 적절한 전문가에 동적으로 할당한다. 이 설계는 얼굴의 다양한 의미 영역에 걸쳐 전문가들의 특화를 촉진하여 해상도 인식 특징 추출을 가능하게 한다. 또한 상위-k 라우터는 희소 전문가 활성화를 촉진하여 저해상도 데이터셋 미세 조정 시 사전 학습된 지식을 보존하면서 계산 오버헤드 없이 모델 용량을 증가시킨다. 모델은 얼굴 인식 손실, 라우터 z-손실 및 로드 밸런싱 손실의 결합으로 훈련되어 전문가 특화와 안정적인 훈련을 보장한다.
11개 데이터셋(고해상도, 혼합 품질, 저해상도 벤치마크 포함)에 대한 광범위한 실험에서 FaceMoE는 기존 최신 방법들을 크게 능가한다. 본 연구는 저해상도 얼굴 인식에 MoE를 활용한 최초의 연구로, 도메인 간 격차와 재앙적 망각 문제를 효과적으로 해결하는 새로운 아키텍처를 제안한다.