Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs
Zhenyu Liu, Yunxin Li, Xuanyu Zhang, Qixun Teng, Shenyuan Jiang, Haolan Chen, Minjun Zhao, Fanbo Meng 외
풀더플 스피치 언어 모델의 핵심 성능 저하 원인인 모달리티 간섭을 규명하고, 이를 해결하는 계층적 파라미터 분리 기반의 새로운 엔드투엔드 프레임워크를 제안했습니다.
최신 풀더플 스피치 언어 모델(SLM)은 음향과 의미 모달리티를 동일한 깊은 파라미터 공간에서 공유할 때 발생하는 심각한 모달리티 간섭으로 인해 지식이 저하되고 의미적 무결성이 훼손되어, 자연스럽지 않고 지능적이지 못한 성능을 보입니다.
모델 최적화 역학에 대한 정밀한 분석을 통해 모달리티 간섭의 근본 원인이 음향 및 의미 모델링 간의 고유한 그래디언트 충돌임을 발견했습니다. 이를 기반으로, 충돌하는 모달리티를 깊은 층에서 분리하되 전용 의미 정렬 채널을 통해 교차 모달리티 응집력을 유지하는 계층적 파라미터 분리 전략을 제안했습니다.
여러 풀더플 벤치마크에서 실험한 결과, 스피치 지능(+7.4% Spoken QA)과 풀더플 상호작용 유연성(+28.5% FullDuplexBench 1.5) 모두에서 기존 최고 성능을 크게 향상시키면서 추론 효율성을 저해하지 않았습니다. 본 연구는 풀더플 SLM의 모달리티 간섭 원인을 규명하고, 이를 해결하기 위한 실용적인 계층적 모델을 설계한 최초의 사례로 기여합니다.