한줄 요약
MOSS-TTS Family는 고충실도·고표현력 음성 및 음향 생성을 위한 오픈소스 모델군으로, 장문 음성, 다화자 대화, 음성/캐릭터 디자인, 환경 음향 효과, 실시간 스트리밍 TTS 등 다양한 실제 시나리오를 지원합니다.
핵심 기능
고품질 음성 합성: 안정적인 장문 음성 생성, 다화자 대화 지원, 음성 복제 및 캐릭터 디자인.
환경 음향 생성: MOSS-SoundEffect-v2.0은 DiT 백본과 Flow Matching 목적 함수를 사용하여 48kHz, 최대 30초의 이중 언어 음향 효과 생성.
실시간 스트리밍 TTS: MOSS-TTS-Realtime 및 MOSS-TTS-Nano(약 1억 파라미터)는 CPU 4코어에서도 스트리밍 출력 가능.
다국어 지원: 언어 태그를 통한 다국어 합성, 구두점 기반 운율 조절, 명시적 일시 정지 제어([pause X.Ys]).
오픈소스 및 확장성: Hugging Face, ModelScope, GitHub에서 모델 및 코드 공개, API 문서 제공.
언제 쓰나
고품질 음성 합성이 필요한 애플리케이션(예: 오디오북, 가상 어시스턴트, 게임 NPC).
다화자 대화나 음성 캐릭터 디자인이 필요한 시나리오.
환경 음향 효과 생성(예: 게임, 영화, VR).
실시간 음성 합성이 필요한 서비스(예: 실시간 통역, 스트리밍 방송).