한줄 요약
오픈소스 모델을 활용해 로컬 환경에서 저지연 음성 에이전트를 구축할 수 있는 모듈형 파이프라인 프레임워크.
핵심 기능
모듈형 파이프라인: VAD, STT, LLM, TTS 등 4단계를 각각 독립 스레드에서 구동하며, 모든 구성 요소를 자유롭게 교체 가능.
OpenAI Realtime 호환 API: OpenAI Realtime 클라이언트와 바로 연동되는 WebSocket API 제공.
완전 로컬 실행 지원: Parakeet TDT(STT), Qwen3-TTS(TTS) 등 오픈소스 모델과 llama.cpp를 통한 로컬 LLM 서빙 지원.
유연한 LLM 백엔드: OpenAI 호환 프로토콜을 사용하여 호스팅 제공업체, Hugging Face Inference Providers, 또는 자체 하드웨어의 vLLM/llama.cpp 서버를 지정 가능.
언제 쓰나
로컬 환경에서 데이터 프라이버시를 유지하며 음성 비서나 대화형 에이전트를 구축할 때.
OpenAI Realtime API와 호환되는 자체 음성 인터페이스를 구현할 때.
기존 로봇(예: Reachy Mini)이나 IoT 기기에 음성 대화 기능을 통합할 때.