한줄 요약
마이크로소프트가 공개한 최첨단 오픈소스 음성 AI 프레임워크로, 장문 TTS, 실시간 TTS, 다국어 ASR 모델을 포함한다.
핵심 기능
VibeVoice-TTS: 최대 90분, 4명 화자 지원 장문 다화자 텍스트 음성 변환
VibeVoice-Realtime-0.5B: 스트리밍 입력 지원 실시간 TTS, 다국어 및 다양한 스타일 음성 제공
VibeVoice-ASR: 60분 단일 처리, 화자/시간/내용 구조화 전사, 50개 이상 언어 지원, Transformers 및 vLLM 호환
미세 조정 코드 및 Colab 데모 제공
언제 쓰나
장문 오디오북, 팟캐스트, 다화자 대화 생성이 필요할 때
실시간 음성 합성 애플리케이션(챗봇, 음성 비서)에 활용
다국어 장문 음성 인식 및 화자 분할 전사가 필요한 연구 및 서비스에 적합