Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation
Jingyi Lu, Kai Han
단안 영상만으로 입체 영상을 학습할 수 있는 자기 지도 학습 프레임워크를 제안하며, 핵심은 훈련 시와 테스트 시의 결측 영역 마스크 계산을 동일하게 만드는 기하학적 상호작용 정리(GRT)이다.
모노cular-to-스테레오 변환에서 가장 큰 병목은 시야 차이로 인해 발생하는 결측 영역(disocclusion)을 메우는 인페인팅이다. 기존 훈련 기반 방법은 희소한 입체 영상 쌍이나 도메인 갭이 있는 합성 데이터에 의존해야 한다.
가장 가까운 이웃 DIBR 공식화 하에서, 목표 뷰를 합성할 때의 결측 영역 마스크가 목표에서 소스로 워핑할 때 손실되는 픽셀 마스크와 동일함을 증명하는 기하학적 상호작용 정리(GRT)를 도출했다. 이를 통해 단안 영상만으로 테스트 시 결측 영역 마스크를 해석적으로 계산할 수 있으며, 순환 일관성을 이용해 자기 지도 학습을 수행한다.
훈련 없이 학습한 방법이나 지도 학습 기반 최신 기법들보다 상당한 성능 향상을 달성했다. 단안 영상이라는 무제한 소스를 활용할 수 있게 되어, 입체 영상 합성의 데이터 제약 문제를 근본적으로 해결한다.