한줄 요약
VoxCPM2는 확산 자동회귀 아키텍처를 통해 토크나이저 없이 연속 음성 표현을 직접 생성하는 2B 파라미터 다국어 TTS 모델로, 음성 디자인과 제어 가능한 음성 복제를 지원한다.
핵심 기능
30개 언어 다국어 합성: 언어 태그 없이 입력 텍스트를 직접 합성
음성 디자인: 자연어 설명만으로 새로운 음성 생성 (성별, 나이, 톤, 감정, 속도 등)
제어 가능한 음성 복제: 짧은 참조 음성 클립으로 음성 복제, 스타일 가이드로 감정/속도/표현 조절 가능
궁극의 복제: 참조 음성과 대본을 제공하면 모든 발성 뉘앙스(음색, 리듬, 감정, 스타일)를 충실히 재현
48kHz 고품질 오디오: 16kHz 참조 음성 입력으로 48kHz 스튜디오 품질 출력 (AudioVAE V2 비대칭 인코딩/디코딩)
실시간 스트리밍: RTX 4090에서 RTF ~0.3, Nano-vLLM/vLLM-Omni 가속 시 ~0.13
완전 오픈소스 및 상용 가능: Apache-2.0 라이선스
언제 쓰나
다국어 음성 합성 시스템 구축 시 (30개 언어 지원)
자연어 설명만으로 새로운 음성을 디자인해야 할 때 (음성 디자인)
짧은 참조 음성으로 특정 화자의 음성을 복제하되 스타일을 제어해야 할 때
고품질(48kHz) 음성 출력이 필요한 TTS 응용 프로그램