WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS
Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu
LLM 기반 TTS에서 단어 수준의 음향 특성(지속 시간, 경계, 에너지, 피치, 톤)을 명시적이고 해석적으로 제어할 수 있는 프레임워크를 제안합니다.
최신 LLM 기반 TTS는 자연스러움이 뛰어나지만, 오디오북 내레이션과 더빙 등에서 요구되는 정밀한 스타일링과 시간 정렬을 위한 단어 수준의 명시적 제어가 부족합니다. 이는 세밀하게 주석이 달린 데이터셋의 부족과 이산적 자기회귀 생성에 다차원 제어 신호를 통합하는 아키텍처적 난제로 인해 심화됩니다.
실험 결과, 제안된 방법은 제로샷 합성 안정성을 유지하면서 여러 음향 차원에 대해 우수하고 해석적인 제어를 달성합니다. 대규모 단어 수준 주석 데이터셋을 공개하고, LLM TTS에서의 정밀한 제어라는 새로운 패러다임을 제시한 점이 주요 기여입니다.