Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors
Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski 외
자연어 장면 묘사와 여러 목소리 레퍼런스를 사용하여 사실적인 다중 화자 대화 오디오를 생성하는 방법을 제안한다.
기존 다중 화자 대화 시스템은 화자를 구조화된 태그나 임베딩으로 묶어 스튜디오 밖의 자연스러운 오디오를 생성하지 못한다. 특히 텍스트 프롬프트 대신 음향 유사성으로 화자를 선택하는 '레퍼런스 단축' 문제도 발생한다.
대규모 야생 데이터로 사전 학습된 텍스트-투-오디오 모델을 여러 레퍼런스 목소리와 자유 형식 텍스트 프롬프트로 조건화한다. 레퍼런스 레이턴트를 모델 토큰 시퀀스에 연결하고 정체성 인식 위치 인코딩을 추가하며, 고소음 시간 단계 분포를 사용하여 모델이 텍스트 프롬프트에 의존하도록 유도한다.
CoVoMix2-Dialogue 벤치마크에서 기존 시스템을 능가하는 화자 바인딩 성능을 보여주며, 대화 겹침과 감정적 발성 등 풍부한 오디오 장면을 성공적으로 생성한다. 구조화된 스크립트 대신 자유 형식 묘사를 사용하는 일반 오디오 모델의 이점을 실증한다.