Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization
Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park 외
확산 기반 립싱크 모델의 느린 추론 속도를 극복하기 위해 자기회귀 확산 방법(Lip Forcing)을 제안, 14B 교사 모델을 증류하여 2단계 디노이징만으로 실시간 립싱크를 가능하게 함.
기존 확산 기반 립싱크 모델은 전체 시퀀스 양방향 어텐션과 많은 디노이징 스텝으로 인해 실시간 추론이 불가능함.
14B 규모의 오디오 조건부 양방향 비디오 확산 교사 모델을 인과적 학생 모델로 증류하고, 립싱크 특화 교사 궤적 분석을 통해 CFG 없이 2단계 추론 스케줄과 SyncNet 보상을 활용하는 Sync-Window DMD를 설계.
1.3B 학생 모델은 31FPS로 실시간 스트리밍 가능, 동일 규모 양방향 모델 대비 17.6배 빠름. 14B 학생 모델은 교사 대비 39.8배 빠르며, 최초 프레임까지 지연 시간이 서브밀리초 수준.