TRADE: Transducer-Augmented Decoder for Speech LLM
Yun Tang, Shanil Puri, Shinji Watanabe, Subhabrata Mukherjee
TRADE는 멀티모달 LLM에 트랜스듀서 분기를 추가하여 프레임 동기 정렬과 LLM의 언어 추론을 결합, 단일 모델로 오프라인과 스트리밍 음성 인식을 모두 지원하는 방법이다.
기존 음성 LLM은 레이블 동기 생성 방식으로 음향 프레임과의 정렬이 없어 실시간 디코딩과 발화 종료 감지가 어렵다. 또한 긴 발화 처리 시 KV 캐시 메모리가 선형적으로 증가하는 문제가 있다.
TRADE는 세 가지 설계 선택을 통해 문제를 해결한다. (1) LLM 어휘에서 파생된 작은 트랜스듀서 어휘를 사용하여 점수 융합을 제로 비용으로 수행한다. (2) 청크 동기 스트리밍 학습과 그래디언트 스토핑으로 학습-추론 불일치를 제거한다. (3) 지역화된 디코더 오디오 어텐션(LDAA)으로 인과적 슬라이딩 윈도우를 적용해 KV 캐시 메모리를 발화 길이와 무관하게 제한한다.
단일 TRADE 체크포인트로 오프라인(Open ASR 리더보드 평균 6.71% WER)과 스트리밍(960ms 청크에서 8.40% WER) 인식을 지원한다. 긴 발화에서 TED-LIUM 3.64%, Earnings-22 10.88% WER을 달성했으며, 문장 끝 구두점 타임스탬프를 제공하여 VAD 기반 발화 종료 감지 F1을 0.03 향상시켰다.